2 điểm bởi GN⁺ 2024-07-16 | 1 bình luận | Chia sẻ qua WhatsApp
  • Kevin Bankston cho rằng khi ông mở tài liệu cá nhân trong Google Drive/Docs, Gemini đã tóm tắt mà không được yêu cầu, làm dấy lên tranh cãi về hành vi mặc định của các tính năng AI trong Workspace và phạm vi đồng ý của người dùng
  • Vụ việc bắt đầu từ trường hợp PDF tờ khai thuế của Bankston, sau đó trọng tâm vấn đề được thu hẹp vào hành vi của tệp được mở trong Google Drive hơn là bản thân Google Docs
  • Ngay cả khi kiểm tra các cài đặt liên quan, nút bật/tắt tóm tắt bằng Gemini trong Gmail, Drive và Docs vốn đã tắt; vị trí cài đặt mà Gemini hướng dẫn cũng không khớp với thực tế, khiến người dùng khó nắm được trạng thái kiểm soát
  • Bankston quan sát thấy một mẫu hành vi: sau khi nhấn nút Gemini cho một tài liệu trong Drive, khi mở các tài liệu cùng định dạng tệp, Gemini dường như tự động chạy
  • Google phản bác rằng dữ liệu Workspace không được dùng để huấn luyện và không được lưu trữ, nhưng mối liên hệ giữa trạng thái bảng bên Gemini trong Drive và cài đặt tóm tắt vẫn là vấn đề người dùng phải tự kiểm tra

Tranh cãi tự động tóm tắt bằng Gemini bắt đầu từ tài liệu cá nhân

  • Kevin Bankston đăng trên X rằng khi ông mở tờ khai thuế của mình trong Google Docs, Gemini đã tóm tắt mà không được yêu cầu
  • Ông đặt vấn đề liệu Gemini có đang tự động xử lý tài liệu cá nhân được mở trong Google Docs hay không, và lo ngại về tình huống người dùng phải tìm rồi tắt một cài đặt mà họ không biết
  • Sau đó, ngữ cảnh được xác định là gần với tài liệu được mở trong Google Drive hơn là bản thân Google Docs
    • Loại tài liệu là PDF
    • Vẫn còn khả năng điều này cũng có thể áp dụng cho Docs

Nút bật/tắt tóm tắt đã tắt và hướng dẫn cài đặt không khớp

  • Bankston cho biết ông đã cố tìm cài đặt quyền riêng tư mà Gemini hướng dẫn, nhưng không thấy cài đặt đó ở vị trí thực tế
  • Sau đó, khi kiểm tra các nút bật/tắt liên quan, Gemini summaries in Gmail, Drive, and Docs vốn đã bị vô hiệu hóa
  • Vị trí cài đặt cũng khác với hai trang web mà bot Gemini ban đầu chỉ dẫn
  • Trải nghiệm này làm gia tăng lo ngại về thiếu quyền kiểm soát của người dùng đối với thông tin cá nhân nhạy cảm

Mẫu tự động chạy theo định dạng tệp được quan sát trong Drive

  • Vấn đề xuất hiện với Bankston dường như chỉ giới hạn trong Google Drive
  • Quan sát cho thấy sau khi nhấn nút Gemini trên ít nhất một tài liệu, việc mở tài liệu cùng định dạng tệp sau đó sẽ khiến Gemini tự động chạy
    • Định dạng tệp trong trường hợp này là PDF
    • Sau đó, các tệp cùng định dạng mở trong Google Drive trở thành đối tượng tự động kích hoạt
  • Bankston cũng nêu khả năng Google Workspace Labs mà ông bật vào năm 2023 đã ghi đè lên các cài đặt Gemini AI như dự định

Phản bác của Google và giải thích về bảo vệ dữ liệu

  • Người phát ngôn của Google giải thích rằng các tính năng AI tạo sinh được thiết kế để cung cấp lựa chọn cho người dùng và quyền kiểm soát dữ liệu
  • Lập trường của Google là việc dùng Gemini in Google Workspace cần người dùng chủ động kích hoạt trước
  • Nếu người dùng đã kích hoạt, nội dung sẽ được sử dụng theo cách bảo vệ quyền riêng tư để tạo phản hồi hữu ích cho prompt, và không được lưu riêng nếu không có sự cho phép
  • Google giải thích qua bài viết blog về bảo vệ dữ liệu Workspace rằng dữ liệu Workspace không bị thu thập hoặc dùng để huấn luyện
  • Google nói thêm rằng nếu tính năng được bật, nó có thể tóm tắt nội dung của tài liệu đang mở, nhưng nội dung đó sẽ không được lưu giữ

Giải pháp bảng bên và gánh nặng kiểm tra còn lại cho người dùng

  • Google cho rằng Bankston có thể đã sử dụng bảng bên Gemini trong Drive, và việc đóng bảng này có thể giải quyết vấn đề
  • Trong trải nghiệm của Bankston, vì cài đặt tóm tắt liên quan vốn đã tắt, vẫn còn khoảng cách giữa trạng thái vô hiệu hóa mà người dùng kỳ vọng và hành vi thực tế
  • Khi mở tài liệu nhạy cảm được lưu trong Google Drive, người dùng phải tự kiểm tra trạng thái kích hoạt của tính năng Gemini, trạng thái bảng bên và hành vi theo từng định dạng tệp

1 bình luận

 
GN⁺ 2024-07-16
Ý kiến trên Hacker News
  • Một lần nữa cho thấy dữ liệu đưa lên nhà cung cấp đám mây rốt cuộc không được kiểm soát như tài sản của chính mình
    Lần này đã có tín hiệu rõ ràng, nhưng tôi cho rằng hệ thống của Google từ lâu đã đọc và tổng hợp dữ liệu bên trong các tài liệu riêng tư
    Mối lo này đã xuất hiện từ 20 năm trước khi Gmail ra đời; khi đó mọi người ngạc nhiên trước ý nghĩ “Google đọc email để hiển thị quảng cáo”, nhưng hộp thư đến 1GB và giao diện mới khá thuyết phục
    Sau đó, ở những dịch vụ như Google Drive, họ đã học cách khiến điều này trông bớt đáng sợ hoặc bớt lộ liễu hơn; có lẽ một phần cũng vì họ muốn tiền từ khách hàng doanh nghiệp

    • Việc Google đọc và tổng hợp dữ liệu trong tài liệu riêng tư là điều hiển nhiên
      Nếu không thì họ cung cấp tìm kiếm tài liệu bằng cách nào?
    • Với dữ liệu nằm ở nhà cung cấp đám mây, tôi tin ProtonDrive hơn
      Vì dữ liệu được mã hóa cả khi truyền lẫn khi lưu trữ
      Apple hiện cũng mã hóa phần lớn dữ liệu khi truyền và khi lưu trữ, đồng thời ghi rõ dữ liệu nào được bảo vệ
      Tuy nhiên tôi không chắc Apple trong tương lai có muốn dùng dữ liệu của tôi để huấn luyện mô hình công khai hay không
      Thiết kế gắn một lớp tinh chỉnh có thể thay thế, dựa trên học cục bộ, lên mô hình ngôn ngữ lớn lõi đã được tiền huấn luyện của Apple trông có vẻ ổn về mặt quyền riêng tư, nhưng thực tế thì tôi không biết rõ
      Tôi ít tin Google Drive hơn vì đã cấp quyền truy cập Drive cho Colab Pro và một số bên thứ ba; nếu bài này là thật thì mức độ tin cậy còn giảm nữa
      So sánh với Gmail thời đầu là phù hợp
      Tôi từng dùng Gmail theo lời mời riêng từ Peter Norvig 3 năm trước khi Gmail được công bố, và khi đó tôi thích các quảng cáo có mức liên quan cao bên cạnh Gmail
      Tôi cũng đã cấp cho dịch vụ 20 USD/tháng gì đó tên Google AI Plus hay tương tự quyền truy cập vào toàn bộ tài sản Google của mình, vì muốn thử nghiệm mức hữu ích của các mô hình ngôn ngữ lớn được tích hợp vào môi trường như Workplace
      Rốt cuộc, tôi đã tự nguyện từ bỏ quyền riêng tư của mình trong các dịch vụ Google
    • Nói rằng “hệ thống của Google từ lâu đã đọc và tổng hợp dữ liệu bên trong tài liệu riêng tư” là đúng, vì đó là cách tìm kiếm hoạt động
      Nhưng nếu ám chỉ rằng dữ liệu riêng tư của mọi người đã bị cào và đưa vào mô hình ngôn ngữ lớn, thì đó rõ ràng là thuyết âm mưu
      Thật đáng ngạc nhiên khi tin rằng Google đã thuyết phục được hàng chục nghìn kỹ sư âm thầm che giấu một âm mưu khổng lồ nhằm lạm dụng dữ liệu riêng tư của mọi người
    • Khi tôi đặt chỗ trên Expedia, email lịch trình được gửi tới Gmail, và vài phút sau trên màn hình chính Android xuất hiện một nút kêu gọi hành động dạng native yêu cầu thiết lập sản phẩm du lịch của Google
      Sau đó tôi đã bỏ Android, nhưng bỏ Gmail thì khó hơn nhiều
  • Mọi AI, cả việc huấn luyện lẫn quét, đều phải cần đồng ý rõ ràng
    Người dùng phải tự chọn ô “Tôi muốn sử dụng tính năng AI”, và phần mô tả ý nghĩa của nó cũng phải thật rõ ràng
    Điều này cần được bắt buộc hóa và cưỡng chế thực thi; các công ty không tuân thủ phải chịu tiền phạt nghiêm khắc

    • Tôi hiểu chuyện huấn luyện, nhưng không rõ vì sao cả việc quét cũng là vấn đề
      Về nghĩa đen, đó chỉ là chạy thuật toán trên dữ liệu của tôi và hiển thị kết quả cho tôi
      Về cơ bản, nó không khác kiểm tra chính tả hay tự động tạo mục lục từ kiểu tiêu đề
      Nếu kết quả chỉ được giữ riêng tư cho tôi, như trong trường hợp này, thì tôi không hiểu phải lo điều gì
      Việc thuật toán dựa trên mô hình ngôn ngữ lớn không liên quan đến quyền riêng tư hay bảo mật
    • AI đang trở thành mạng xã hội mới
      Người dùng không phải khách hàng mà là sản phẩm
      Thay vì tạo dữ liệu cho công ty mạng xã hội bán quảng cáo, giờ đây người dùng tạo dữ liệu để huấn luyện AI và đổi lại được dùng dịch vụ miễn phí
    • Tôi thắc mắc “quét” chính xác nghĩa là gì
      Có vẻ như không phải để huấn luyện, mà là tạm thời đọc tài liệu rồi cung cấp bản tóm tắt; tôi không rõ vì sao việc đó cần bị quản lý
    • Cũng cần có phần mở rộng robots.txt để có thể loại các tệp truy cập công khai khỏi tập dữ liệu huấn luyện AI
      Tôi nhớ từng có một nỗ lực ban đầu tên là ai.txt, nhưng chưa rõ hiện có ai tuân theo hay không
    • Tôi thắc mắc tác động chính xác của việc huấn luyện AI đối với quyền riêng tư là gì
  • Gác sang một bên việc bài này rõ ràng được viết theo cách dễ gây hiểu lầm, đây là phần tổng hợp các liên kết được chia sẻ trong chuỗi tweet mà bài nhắc tới
    Quản lý hoạt động Gemini: https://myactivity.google.com/product/gemini
    Trang có hầu hết câu trả lời về việc opt-out khỏi Google Workspace và nhiều ứng dụng Google: https://support.google.com/docs/answer/13447104#:~:text=Turn...

  • Tiêu đề khiến vấn đề này hơi thiếu rõ ràng
    Nếu yêu cầu Gemini tóm tắt tài liệu thì việc nó tóm tắt không có gì đáng ngạc nhiên
    Ở đây từ “quét” đang bị dùng quá mức, và tiêu đề ám chỉ như thể Google đang dùng tài liệu riêng tư để huấn luyện Gemini
    Vấn đề thực sự là Gemini đã chạy với tài liệu riêng tư làm đầu vào và tóm tắt nó trong khi người dùng tưởng rằng mình đã tắt tính năng này một cách rõ ràng
    Dù vậy, việc cài đặt không được tuân thủ là một lỗi đáng kể trong hạ tầng của Google, và với những ai hoàn toàn phản đối việc sử dụng thế hệ AI mới, nó đủ để khiến họ xem lại chiến lược thoát khỏi hệ sinh thái

    • Khi yêu cầu Gemini tóm tắt một tệp PDF, việc nó tóm tắt tệp PDF đó không có gì đáng ngạc nhiên
      Nhưng nếu chỉ vì một lần yêu cầu tóm tắt một tệp PDF mà Gemini tóm tắt mọi tệp PDF trong Drive, thì đó là chuyện đáng ngạc nhiên
  • Tôi nghĩ tiêu đề có thể gây hiểu lầm
    Tôi tưởng nội dung là Google đã quét để huấn luyện hoặc kiểm thử, nhưng hóa ra đó là tính năng tóm tắt bài viết mà người dùng đang xem
    Vì vậy cách dùng từ “caught” là không trung thực
    Ta không nói là “bắt quả tang” một người khi họ đang làm đúng việc mà họ đã thông báo là sẽ làm

    • Vì quyền đã bị tắt, nên dù họ làm gì với tài liệu thì đó cũng là làm mà không được phép
      Tiêu đề là đúng
  • Chỉ là vấn đề thời gian trước khi ai đó trích xuất được thứ gì đó có giá trị từ các mô hình của Google
    Có thể là mật khẩu ngân hàng hoặc khóa tiền mã hóa
    Vụ pizza keo dán cho thấy họ chỉ đang đẩy bừa mọi thứ ra

  • Tương tự cuộc tranh giành dữ liệu y tế trong thời kỳ COVID
    Nhiều nhóm đã lợi dụng khủng hoảng để cố vắt dữ liệu ra khỏi ống một lần, và một số đã thành công
    Vì cái giá phải chịu khi bị khiển trách thì thấp, còn giá trị của việc lấy được dữ liệu lại lớn
    Về bản chất, đây là một vụ cưỡng đoạt kiểu quan liêu
    Với những người từng làm trong lĩnh vực quyền riêng tư, chuyện này đáng thất vọng nhưng có thể dự đoán được, và phần lớn mọi người sẽ giả vờ ngạc nhiên rồi bỏ qua
    Bởi sự nghiệp của họ phụ thuộc vào khả năng tiếp tục duy trì câu chuyện “ý định tốt” một cách phi lý
    Các tin nhắn SMS bị hack ở AT&T rất có thể sẽ là thứ tiếp theo; và nếu các lần gõ phím trên điện thoại bị lộ, hoặc một bản cập nhật OS của nền tảng thương mại thêm tác nhân thu thập để huấn luyện mô hình, tất cả cũng sẽ ngạc nhiên y như vậy
    Tất nhiên sẽ kèm theo lớp vỏ bọc là tăng cường quyền riêng tư để làm hài lòng người dùng
    Nếu không lấy các product manager và kỹ sư đã tạo ra chuyện này làm gương răn đe, lần sau nó sẽ lặp lại tệ hơn và ở quy mô lớn hơn

  • Tweet gốc và bài viết này cố tình trộn lẫn thuật ngữ để gây hiểu nhầm
    Chúng muốn làm cho việc một mô hình ngôn ngữ lớn tiếp xúc với tài liệu theo cách nào đó trông giống như việc tài liệu đó được đưa vào tập dữ liệu huấn luyện của mô hình
    Đây là điểm câu view của bài viết và tweet gốc, nhưng cuối cùng thread trên tweet cũng thừa nhận sự khác biệt rồi chuyển hướng sang tức giận với chính sự tồn tại của tính năng AI
    Câu chuyện này không có nội dung thực chất nào ngoài việc một người dùng Twitter tức giận với popup AI đã viết một thread kích động phẫn nộ và đóng gói nó như thể có chuyện gì đó nham hiểm hơn nhiều

  • Thật ngạc nhiên là ngay cả trên HN cũng có nhiều người bị đánh lạc hướng thành công đến vậy về chuyện thực sự đang diễn ra
    Không biết còn ai đọc bài rồi mới đăng không nữa

  • Có gì đáng ngạc nhiên khi Google chưa đi đủ xa về quyền riêng tư và quyền truy cập dữ liệu không
    Họ nói thì có, nhưng sẽ tuyệt đối không đi xa đến mức dịch vụ của chính họ không thể truy cập dữ liệu
    Mọi dữ liệu được lưu trữ từ xa phải đạt đến mức máy chủ không thể giải mã và chỉ được giải mã trên thiết bị của chúng ta
    Nếu không, tức là ta đang cho phép công ty khai thác dữ liệu tùy ý họ muốn, và chúng ta hoàn toàn không có cách nào biết họ đang làm gì
    Tất nhiên vẫn còn vấn đề là phải tin rằng họ thực sự không thể giải mã, và không có giải pháp tốt cho chuyện đó
    Việc AI truy cập dữ liệu cá nhân phải được xử lý ngay trên thiết bị; nếu cần xử lý trên máy chủ, thì dù hy vọng đó chỉ là vấn đề ngắn hạn, cũng phải có thông báo rõ ràng rằng dữ liệu sẽ được truyền ra khỏi thiết bị
    Ngay cả nếu hiện tại dữ liệu không được dùng để huấn luyện mô hình, cũng không vô lý khi nghĩ rằng dữ liệu đi qua Gemini hoặc một máy chủ từ xa nào đó có thể bị ghi log rồi sau này được dùng để huấn luyện bổ sung, nằm trong log dạng plaintext, hoặc bị tester xem được

    • Cuối cùng, mọi thứ sụp đổ ở chính điểm này
      Đến cuối cùng, cấu trúc vẫn là công ty nói “hãy tin chúng tôi”, và rõ ràng các công ty không đáng tin để giao phó những việc kiểu này