- Kevin Bankston cho rằng khi ông mở tài liệu cá nhân trong Google Drive/Docs, Gemini đã tóm tắt mà không được yêu cầu, làm dấy lên tranh cãi về hành vi mặc định của các tính năng AI trong Workspace và phạm vi đồng ý của người dùng
- Vụ việc bắt đầu từ trường hợp PDF tờ khai thuế của Bankston, sau đó trọng tâm vấn đề được thu hẹp vào hành vi của tệp được mở trong Google Drive hơn là bản thân Google Docs
- Ngay cả khi kiểm tra các cài đặt liên quan, nút bật/tắt tóm tắt bằng Gemini trong Gmail, Drive và Docs vốn đã tắt; vị trí cài đặt mà Gemini hướng dẫn cũng không khớp với thực tế, khiến người dùng khó nắm được trạng thái kiểm soát
- Bankston quan sát thấy một mẫu hành vi: sau khi nhấn nút Gemini cho một tài liệu trong Drive, khi mở các tài liệu cùng định dạng tệp, Gemini dường như tự động chạy
- Google phản bác rằng dữ liệu Workspace không được dùng để huấn luyện và không được lưu trữ, nhưng mối liên hệ giữa trạng thái bảng bên Gemini trong Drive và cài đặt tóm tắt vẫn là vấn đề người dùng phải tự kiểm tra
Tranh cãi tự động tóm tắt bằng Gemini bắt đầu từ tài liệu cá nhân
- Kevin Bankston đăng trên X rằng khi ông mở tờ khai thuế của mình trong Google Docs, Gemini đã tóm tắt mà không được yêu cầu
- Ông đặt vấn đề liệu Gemini có đang tự động xử lý tài liệu cá nhân được mở trong Google Docs hay không, và lo ngại về tình huống người dùng phải tìm rồi tắt một cài đặt mà họ không biết
- Sau đó, ngữ cảnh được xác định là gần với tài liệu được mở trong Google Drive hơn là bản thân Google Docs
- Loại tài liệu là PDF
- Vẫn còn khả năng điều này cũng có thể áp dụng cho Docs
Nút bật/tắt tóm tắt đã tắt và hướng dẫn cài đặt không khớp
- Bankston cho biết ông đã cố tìm cài đặt quyền riêng tư mà Gemini hướng dẫn, nhưng không thấy cài đặt đó ở vị trí thực tế
- Sau đó, khi kiểm tra các nút bật/tắt liên quan, Gemini summaries in Gmail, Drive, and Docs vốn đã bị vô hiệu hóa
- Vị trí cài đặt cũng khác với hai trang web mà bot Gemini ban đầu chỉ dẫn
- Trải nghiệm này làm gia tăng lo ngại về thiếu quyền kiểm soát của người dùng đối với thông tin cá nhân nhạy cảm
Mẫu tự động chạy theo định dạng tệp được quan sát trong Drive
- Vấn đề xuất hiện với Bankston dường như chỉ giới hạn trong Google Drive
- Quan sát cho thấy sau khi nhấn nút Gemini trên ít nhất một tài liệu, việc mở tài liệu cùng định dạng tệp sau đó sẽ khiến Gemini tự động chạy
- Định dạng tệp trong trường hợp này là PDF
- Sau đó, các tệp cùng định dạng mở trong Google Drive trở thành đối tượng tự động kích hoạt
- Bankston cũng nêu khả năng Google Workspace Labs mà ông bật vào năm 2023 đã ghi đè lên các cài đặt Gemini AI như dự định
Phản bác của Google và giải thích về bảo vệ dữ liệu
- Người phát ngôn của Google giải thích rằng các tính năng AI tạo sinh được thiết kế để cung cấp lựa chọn cho người dùng và quyền kiểm soát dữ liệu
- Lập trường của Google là việc dùng Gemini in Google Workspace cần người dùng chủ động kích hoạt trước
- Nếu người dùng đã kích hoạt, nội dung sẽ được sử dụng theo cách bảo vệ quyền riêng tư để tạo phản hồi hữu ích cho prompt, và không được lưu riêng nếu không có sự cho phép
- Google giải thích qua bài viết blog về bảo vệ dữ liệu Workspace rằng dữ liệu Workspace không bị thu thập hoặc dùng để huấn luyện
- Google nói thêm rằng nếu tính năng được bật, nó có thể tóm tắt nội dung của tài liệu đang mở, nhưng nội dung đó sẽ không được lưu giữ
Giải pháp bảng bên và gánh nặng kiểm tra còn lại cho người dùng
- Google cho rằng Bankston có thể đã sử dụng bảng bên Gemini trong Drive, và việc đóng bảng này có thể giải quyết vấn đề
- Trong trải nghiệm của Bankston, vì cài đặt tóm tắt liên quan vốn đã tắt, vẫn còn khoảng cách giữa trạng thái vô hiệu hóa mà người dùng kỳ vọng và hành vi thực tế
- Khi mở tài liệu nhạy cảm được lưu trong Google Drive, người dùng phải tự kiểm tra trạng thái kích hoạt của tính năng Gemini, trạng thái bảng bên và hành vi theo từng định dạng tệp
1 bình luận
Ý kiến trên Hacker News
Một lần nữa cho thấy dữ liệu đưa lên nhà cung cấp đám mây rốt cuộc không được kiểm soát như tài sản của chính mình
Lần này đã có tín hiệu rõ ràng, nhưng tôi cho rằng hệ thống của Google từ lâu đã đọc và tổng hợp dữ liệu bên trong các tài liệu riêng tư
Mối lo này đã xuất hiện từ 20 năm trước khi Gmail ra đời; khi đó mọi người ngạc nhiên trước ý nghĩ “Google đọc email để hiển thị quảng cáo”, nhưng hộp thư đến 1GB và giao diện mới khá thuyết phục
Sau đó, ở những dịch vụ như Google Drive, họ đã học cách khiến điều này trông bớt đáng sợ hoặc bớt lộ liễu hơn; có lẽ một phần cũng vì họ muốn tiền từ khách hàng doanh nghiệp
Nếu không thì họ cung cấp tìm kiếm tài liệu bằng cách nào?
Vì dữ liệu được mã hóa cả khi truyền lẫn khi lưu trữ
Apple hiện cũng mã hóa phần lớn dữ liệu khi truyền và khi lưu trữ, đồng thời ghi rõ dữ liệu nào được bảo vệ
Tuy nhiên tôi không chắc Apple trong tương lai có muốn dùng dữ liệu của tôi để huấn luyện mô hình công khai hay không
Thiết kế gắn một lớp tinh chỉnh có thể thay thế, dựa trên học cục bộ, lên mô hình ngôn ngữ lớn lõi đã được tiền huấn luyện của Apple trông có vẻ ổn về mặt quyền riêng tư, nhưng thực tế thì tôi không biết rõ
Tôi ít tin Google Drive hơn vì đã cấp quyền truy cập Drive cho Colab Pro và một số bên thứ ba; nếu bài này là thật thì mức độ tin cậy còn giảm nữa
So sánh với Gmail thời đầu là phù hợp
Tôi từng dùng Gmail theo lời mời riêng từ Peter Norvig 3 năm trước khi Gmail được công bố, và khi đó tôi thích các quảng cáo có mức liên quan cao bên cạnh Gmail
Tôi cũng đã cấp cho dịch vụ 20 USD/tháng gì đó tên Google AI Plus hay tương tự quyền truy cập vào toàn bộ tài sản Google của mình, vì muốn thử nghiệm mức hữu ích của các mô hình ngôn ngữ lớn được tích hợp vào môi trường như Workplace
Rốt cuộc, tôi đã tự nguyện từ bỏ quyền riêng tư của mình trong các dịch vụ Google
Nhưng nếu ám chỉ rằng dữ liệu riêng tư của mọi người đã bị cào và đưa vào mô hình ngôn ngữ lớn, thì đó rõ ràng là thuyết âm mưu
Thật đáng ngạc nhiên khi tin rằng Google đã thuyết phục được hàng chục nghìn kỹ sư âm thầm che giấu một âm mưu khổng lồ nhằm lạm dụng dữ liệu riêng tư của mọi người
Sau đó tôi đã bỏ Android, nhưng bỏ Gmail thì khó hơn nhiều
Mọi AI, cả việc huấn luyện lẫn quét, đều phải cần đồng ý rõ ràng
Người dùng phải tự chọn ô “Tôi muốn sử dụng tính năng AI”, và phần mô tả ý nghĩa của nó cũng phải thật rõ ràng
Điều này cần được bắt buộc hóa và cưỡng chế thực thi; các công ty không tuân thủ phải chịu tiền phạt nghiêm khắc
Về nghĩa đen, đó chỉ là chạy thuật toán trên dữ liệu của tôi và hiển thị kết quả cho tôi
Về cơ bản, nó không khác kiểm tra chính tả hay tự động tạo mục lục từ kiểu tiêu đề
Nếu kết quả chỉ được giữ riêng tư cho tôi, như trong trường hợp này, thì tôi không hiểu phải lo điều gì
Việc thuật toán dựa trên mô hình ngôn ngữ lớn không liên quan đến quyền riêng tư hay bảo mật
Người dùng không phải khách hàng mà là sản phẩm
Thay vì tạo dữ liệu cho công ty mạng xã hội bán quảng cáo, giờ đây người dùng tạo dữ liệu để huấn luyện AI và đổi lại được dùng dịch vụ miễn phí
Có vẻ như không phải để huấn luyện, mà là tạm thời đọc tài liệu rồi cung cấp bản tóm tắt; tôi không rõ vì sao việc đó cần bị quản lý
Tôi nhớ từng có một nỗ lực ban đầu tên là ai.txt, nhưng chưa rõ hiện có ai tuân theo hay không
Gác sang một bên việc bài này rõ ràng được viết theo cách dễ gây hiểu lầm, đây là phần tổng hợp các liên kết được chia sẻ trong chuỗi tweet mà bài nhắc tới
Quản lý hoạt động Gemini: https://myactivity.google.com/product/gemini
Trang có hầu hết câu trả lời về việc opt-out khỏi Google Workspace và nhiều ứng dụng Google: https://support.google.com/docs/answer/13447104#:~:text=Turn...
Tiêu đề khiến vấn đề này hơi thiếu rõ ràng
Nếu yêu cầu Gemini tóm tắt tài liệu thì việc nó tóm tắt không có gì đáng ngạc nhiên
Ở đây từ “quét” đang bị dùng quá mức, và tiêu đề ám chỉ như thể Google đang dùng tài liệu riêng tư để huấn luyện Gemini
Vấn đề thực sự là Gemini đã chạy với tài liệu riêng tư làm đầu vào và tóm tắt nó trong khi người dùng tưởng rằng mình đã tắt tính năng này một cách rõ ràng
Dù vậy, việc cài đặt không được tuân thủ là một lỗi đáng kể trong hạ tầng của Google, và với những ai hoàn toàn phản đối việc sử dụng thế hệ AI mới, nó đủ để khiến họ xem lại chiến lược thoát khỏi hệ sinh thái
Nhưng nếu chỉ vì một lần yêu cầu tóm tắt một tệp PDF mà Gemini tóm tắt mọi tệp PDF trong Drive, thì đó là chuyện đáng ngạc nhiên
Tôi nghĩ tiêu đề có thể gây hiểu lầm
Tôi tưởng nội dung là Google đã quét để huấn luyện hoặc kiểm thử, nhưng hóa ra đó là tính năng tóm tắt bài viết mà người dùng đang xem
Vì vậy cách dùng từ “caught” là không trung thực
Ta không nói là “bắt quả tang” một người khi họ đang làm đúng việc mà họ đã thông báo là sẽ làm
Tiêu đề là đúng
Chỉ là vấn đề thời gian trước khi ai đó trích xuất được thứ gì đó có giá trị từ các mô hình của Google
Có thể là mật khẩu ngân hàng hoặc khóa tiền mã hóa
Vụ pizza keo dán cho thấy họ chỉ đang đẩy bừa mọi thứ ra
Tương tự cuộc tranh giành dữ liệu y tế trong thời kỳ COVID
Nhiều nhóm đã lợi dụng khủng hoảng để cố vắt dữ liệu ra khỏi ống một lần, và một số đã thành công
Vì cái giá phải chịu khi bị khiển trách thì thấp, còn giá trị của việc lấy được dữ liệu lại lớn
Về bản chất, đây là một vụ cưỡng đoạt kiểu quan liêu
Với những người từng làm trong lĩnh vực quyền riêng tư, chuyện này đáng thất vọng nhưng có thể dự đoán được, và phần lớn mọi người sẽ giả vờ ngạc nhiên rồi bỏ qua
Bởi sự nghiệp của họ phụ thuộc vào khả năng tiếp tục duy trì câu chuyện “ý định tốt” một cách phi lý
Các tin nhắn SMS bị hack ở AT&T rất có thể sẽ là thứ tiếp theo; và nếu các lần gõ phím trên điện thoại bị lộ, hoặc một bản cập nhật OS của nền tảng thương mại thêm tác nhân thu thập để huấn luyện mô hình, tất cả cũng sẽ ngạc nhiên y như vậy
Tất nhiên sẽ kèm theo lớp vỏ bọc là tăng cường quyền riêng tư để làm hài lòng người dùng
Nếu không lấy các product manager và kỹ sư đã tạo ra chuyện này làm gương răn đe, lần sau nó sẽ lặp lại tệ hơn và ở quy mô lớn hơn
Tweet gốc và bài viết này cố tình trộn lẫn thuật ngữ để gây hiểu nhầm
Chúng muốn làm cho việc một mô hình ngôn ngữ lớn tiếp xúc với tài liệu theo cách nào đó trông giống như việc tài liệu đó được đưa vào tập dữ liệu huấn luyện của mô hình
Đây là điểm câu view của bài viết và tweet gốc, nhưng cuối cùng thread trên tweet cũng thừa nhận sự khác biệt rồi chuyển hướng sang tức giận với chính sự tồn tại của tính năng AI
Câu chuyện này không có nội dung thực chất nào ngoài việc một người dùng Twitter tức giận với popup AI đã viết một thread kích động phẫn nộ và đóng gói nó như thể có chuyện gì đó nham hiểm hơn nhiều
Thật ngạc nhiên là ngay cả trên HN cũng có nhiều người bị đánh lạc hướng thành công đến vậy về chuyện thực sự đang diễn ra
Không biết còn ai đọc bài rồi mới đăng không nữa
Có gì đáng ngạc nhiên khi Google chưa đi đủ xa về quyền riêng tư và quyền truy cập dữ liệu không
Họ nói thì có, nhưng sẽ tuyệt đối không đi xa đến mức dịch vụ của chính họ không thể truy cập dữ liệu
Mọi dữ liệu được lưu trữ từ xa phải đạt đến mức máy chủ không thể giải mã và chỉ được giải mã trên thiết bị của chúng ta
Nếu không, tức là ta đang cho phép công ty khai thác dữ liệu tùy ý họ muốn, và chúng ta hoàn toàn không có cách nào biết họ đang làm gì
Tất nhiên vẫn còn vấn đề là phải tin rằng họ thực sự không thể giải mã, và không có giải pháp tốt cho chuyện đó
Việc AI truy cập dữ liệu cá nhân phải được xử lý ngay trên thiết bị; nếu cần xử lý trên máy chủ, thì dù hy vọng đó chỉ là vấn đề ngắn hạn, cũng phải có thông báo rõ ràng rằng dữ liệu sẽ được truyền ra khỏi thiết bị
Ngay cả nếu hiện tại dữ liệu không được dùng để huấn luyện mô hình, cũng không vô lý khi nghĩ rằng dữ liệu đi qua Gemini hoặc một máy chủ từ xa nào đó có thể bị ghi log rồi sau này được dùng để huấn luyện bổ sung, nằm trong log dạng plaintext, hoặc bị tester xem được
Đến cuối cùng, cấu trúc vẫn là công ty nói “hãy tin chúng tôi”, và rõ ràng các công ty không đáng tin để giao phó những việc kiểu này