- Slack không phát triển các mô hình AI tạo sinh bằng dữ liệu khách hàng, nhưng với các mô hình dự đoán như gợi ý emoji hoặc gợi ý kênh, tin nhắn, nội dung, tệp và thông tin sử dụng có thể được phân tích
- Các mô hình toàn cục được thiết kế để không tái hiện bất kỳ phần nào của dữ liệu khách hàng, đồng thời có các biện pháp kiểm soát để nhân viên không thể truy cập vào nội dung nền tảng trong quá trình phát triển AI/ML hoặc phân tích
- Khách hàng có thể yêu cầu loại trừ dữ liệu của workspace hoặc tổ chức khỏi việc huấn luyện mô hình toàn cục của Slack, và sau khi loại trừ vẫn có thể tiếp tục sử dụng lợi ích từ các mô hình ML học toàn cục
- Gợi ý kênh, kết quả tìm kiếm, tự động hoàn thành và gợi ý emoji hoạt động theo cách tận dụng mô hình bên ngoài, điểm số số học, số lần tương tác trước đây và các cụm từ công khai phổ biến để giảm việc lộ dữ liệu khách hàng
- Các tính năng AI tạo sinh của Slack sử dụng LLM bên thứ ba, nhưng dữ liệu khách hàng vẫn nằm trong ranh giới tin cậy của Slack và sẽ không được dùng để huấn luyện mô hình AI tạo sinh nếu không có lựa chọn tham gia rõ ràng
Nguyên tắc sử dụng dữ liệu cho AI/ML của Slack
- Nguyên tắc phát triển sản phẩm của Slack đặt quyền riêng tư và bảo mật dữ liệu khách hàng làm trung tâm
- ML và AI được sử dụng như công cụ để cải thiện sản phẩm Slack
- Không phát triển mô hình AI tạo sinh bằng dữ liệu khách hàng
- Việc phát triển các mô hình dự đoán như gợi ý emoji và gợi ý kênh có thể phân tích các dữ liệu sau
- Dữ liệu khách hàng được gửi lên Slack: tin nhắn, nội dung, tệp, v.v.
- Thông tin khác được định nghĩa trong chính sách quyền riêng tư và hợp đồng khách hàng: bao gồm thông tin sử dụng
Mô hình toàn cục và kiểm soát truy cập
- Slack không xây dựng hoặc huấn luyện các mô hình được dùng rộng rãi cho toàn bộ khách hàng theo cách có thể tái hiện bất kỳ phần nào của dữ liệu khách hàng
- Trong quá trình phát triển mô hình AI/ML hoặc phân tích dữ liệu khách hàng, nhân viên Slack không thể truy cập nội dung nền tảng
- Slack áp dụng nhiều biện pháp kỹ thuật để bảo vệ tính bảo mật và an toàn của dữ liệu khách hàng
- Khách hàng có thể opt-out để dữ liệu khách hàng của mình không bị dùng cho việc huấn luyện mô hình toàn cục của Slack
- Dữ liệu khách hàng của workspace đã opt-out chỉ được dùng để cải thiện trải nghiệm của chính workspace đó
- Vẫn có thể tiếp tục hưởng lợi từ các mô hình ML học toàn cục
- Chủ sở hữu Org hoặc Workspace, hoặc Primary Owner, phải gửi email đến
feedback@slack.comkèm URL Workspace/Org và tiêu đềSlack Global model opt-out request - Slack sẽ phản hồi khi đã xử lý xong yêu cầu
Cải thiện dịch vụ bằng dữ liệu khách hàng và thông tin khác
- Các nhóm sản phẩm và phân tích của Slack có thể sử dụng dữ liệu khách hàng và thông tin khác để phát triển, cập nhật và cải thiện dịch vụ
- Việc cá nhân hóa và cải thiện này trở nên khả thi thông qua quá trình nghiên cứu và hiểu cách người dùng tương tác với Slack
- Nghĩa vụ bảo mật trong hợp đồng khách hàng và Privacy Policy của Slack được áp dụng cho từng kịch bản
- Khách hàng sở hữu dữ liệu khách hàng của mình
- Slack tổng hợp và tách biệt dữ liệu khách hàng để, ngay cả khi dùng dữ liệu khách hàng cho cập nhật dịch vụ, bên thứ ba cũng không thể xác định khách hàng hoặc cá nhân cụ thể nào là nguồn của sự cải thiện
- Ngoại lệ bao gồm các công ty liên kết hoặc bên xử lý phụ của Slack
Cách bảo vệ dữ liệu theo từng tính năng dự đoán
-
Gợi ý kênh
- Có thể đề xuất tham gia các kênh công khai mới trong công ty
- Gợi ý dựa trên thành viên của kênh, hoạt động và mức độ trùng lặp chủ đề
- Mô hình học từ các gợi ý trước đây và việc người dùng có tham gia kênh hay không
- Một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack sẽ đánh giá độ tương đồng chủ đề và xuất ra điểm số số học
- Mô hình toàn cục chỉ dùng điểm số số học này và dữ liệu không phải dữ liệu khách hàng để đưa ra gợi ý
-
Kết quả tìm kiếm
- Mô hình ML cho tìm kiếm xác định các kết quả phù hợp với truy vấn cụ thể để giúp người dùng tìm thông tin mong muốn
- Dựa trên các kết quả tìm kiếm trước đây và lịch sử tương tác trước đó
- Được thiết kế để mô hình không thể tái hiện truy vấn tìm kiếm hoặc kết quả
-
Tự động hoàn thành
- Có thể tự động hoàn thành truy vấn tìm kiếm hoặc văn bản khác
- Ví dụ, khi người dùng nhập vài ký tự đầu của
Customer Support, hệ thống sẽ hoàn thành cụm từ đó - Các đề xuất được thực hiện cục bộ và lấy từ các cụm từ trong tin nhắn công khai phổ biến trong workspace của người dùng
- Thuật toán chọn đề xuất tiềm năng học trên phạm vi toàn cục từ các trường hợp hoàn thành đã từng được đề xuất và chấp nhận
- Sử dụng các quy tắc chấm điểm độ tương đồng giữa văn bản đầu vào và đề xuất, và thuật toán chỉ nhận điểm số số học và số lần tương tác trước đây
-
Gợi ý emoji
- Có thể đề xuất emoji phản ứng dựa trên nội dung và cảm xúc của tin nhắn, lịch sử sử dụng emoji, cũng như tần suất một emoji được dùng trong nhóm ở ngữ cảnh cụ thể
- Nếu trong một kênh nhất định, 🎉 thường được dùng cho các tin nhắn chúc mừng, thì với một tin nhắn mới có sắc thái tích cực tương tự, hệ thống có thể gợi ý phản ứng 🎉
- Một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack có thể phân loại cảm xúc của tin nhắn
- Mô hình của Slack chỉ xem xét tần suất mà các tin nhắn có cảm xúc nhất định và một emoji cụ thể được liên kết với nhau trong workspace đó để gợi ý emoji
Xử lý dữ liệu khách hàng trong AI tạo sinh
- AI tạo sinh là một nhóm hệ thống AI có thể tạo nội dung như văn bản để phản hồi các prompt do người dùng nhập vào
- Nhóm này bao gồm mô hình ngôn ngữ lớn (LLM)
- AI in Slack sử dụng AI tạo sinh và tận dụng LLM của bên thứ ba
- Trừ khi khách hàng chủ động opt-in một cách rõ ràng, dữ liệu khách hàng sẽ không được dùng để huấn luyện các mô hình AI tạo sinh
- AI in Slack dùng các LLM dựng sẵn, và các mô hình này không được cập nhật bằng dữ liệu khách hàng sau yêu cầu và cũng không lưu giữ dữ liệu khách hàng theo cách khác
- Các mô hình đó được lưu trữ trên hạ tầng của nhà cung cấp đám mây như AWS
- Dữ liệu khách hàng vẫn nằm trong ranh giới tin cậy của Slack, và nhà cung cấp LLM không thể truy cập dữ liệu khách hàng
- Có thể nhận thông báo thay đổi về bên xử lý phụ tại Trust and Compliance webpage
Nguồn của câu trả lời tìm kiếm trong Slack AI
- Tính năng tìm kiếm của AI in Slack lấy nguồn câu trả lời từ các tính năng nội bộ của Slack và các tài liệu được kết nối
- Nguồn tìm kiếm bao gồm:
- Tính năng của Slack: canvas, huddles canvas notes, clip transcripts, text snippets
- Tệp được tải lên Slack: PDF, email, docx, pptx, Keynote
- Tài liệu được kết nối từ Google Drive: Docs, Slides
- Tài liệu từ Sharepoint/OnDrive: Word, Powerpoint
- Ứng dụng đối tác lưu trữ tệp như Box: nếu đã được cài đặt
- Người dùng phải được xác thực thông qua tích hợp với Slack thì mới có thể truy cập các tệp đó
- Quản trị viên có thể tắt toàn bộ kết quả tệp hoặc cấu hình để không dùng các tệp được lưu trữ bên ngoài làm nguồn
- Có thể xem hướng dẫn liên quan tại Help Center
1 bình luận
Ý kiến trên Hacker News
Đã liên hệ đội hỗ trợ để opt-out, và nhận được phản hồi rằng yêu cầu đã được hoàn tất
Slack giải thích rằng họ có các mô hình machine learning ở cấp nền tảng như gợi ý kênh/emoji và kết quả tìm kiếm, nhưng không xây dựng hay huấn luyện chúng theo cách có thể học, ghi nhớ hoặc tái tạo dữ liệu khách hàng
Slack AI là một add-on mua riêng, và không huấn luyện LLM bằng dữ liệu khách hàng; thay vào đó họ dùng LLM được lưu trữ trong hạ tầng AWS của Slack nên dữ liệu không bị chia sẻ với nhà cung cấp LLM bên ngoài
Liên kết chính sách: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...
Chắc cũng chỉ đúng cho tới lần cập nhật điều khoản sử dụng tiếp theo
Chắc bạn đã làm vậy rồi nhỉ?
Nếu cấu trúc là “bạn có thể opt-out để dữ liệu khách hàng không bị dùng cho việc huấn luyện mô hình toàn cục của Slack; kể cả khi opt-out thì dữ liệu workspace vẫn chỉ được dùng để cải thiện trải nghiệm của chính workspace đó, và bạn vẫn tiếp tục hưởng lợi từ mô hình huấn luyện toàn cục”, thì thật khó hiểu vì sao lại có ai không opt-out
Trừ trường hợp họ không biết mình phải opt-out, còn lại trông như một lựa chọn chỉ có thiệt mà thôi
Người dùng cá nhân dường như không có tiếng nói về cách dữ liệu của mình được sử dụng, mà phải liên hệ Workspace Owner
Nếu phải liên hệ như vậy thì tôi sẽ tiện thể đề nghị họ xem xét nền tảng thay thế luôn
Rốt cuộc nó thành kiểu trò đập chuột opt-out, cách làm lại là gửi yêu cầu chung chung, và ngay cả khi opt-out thì có vẻ họ vẫn tiếp tục huấn luyện
Có khi họ chỉ giấu một gợi ý tí hon ở chỗ khó thấy nhất đâu đó quanh trang 300 của điều khoản
Nếu xem việc không opt-out là “giúp tạo ra sản phẩm tốt hơn”, thì đây vốn đã là sản phẩm trả phí, và nếu không cần bỏ thêm thời gian mà vẫn có thể khiến bản phát hành sau tốt hơn, thì tại sao lại không làm?
Bạn nhận được sản phẩm tốt hơn với cùng một mức giá, còn công ty thì có sản phẩm dễ bán hơn
Có thể đây là một giao dịch mà công ty hưởng lợi nhiều hơn, nhưng một bên thắng nhiều hơn không có nghĩa bên kia thua
Nếu bạn đặc biệt coi trọng quyền riêng tư dữ liệu, hoặc tin rằng việc cho phép huấn luyện thực sự tạo ra rủi ro lộ thông tin riêng tư, thì câu chuyện sẽ khác; khi đó đã có lựa chọn dừng lại, và mỗi người chỉ cần tự cân giữa “sản phẩm tốt hơn” và “rủi ro suy đoán về việc lộ thông tin riêng tư”
Câu “các mô hình được sử dụng rộng rãi cho mọi khách hàng không được xây dựng hay huấn luyện theo cách có thể học, ghi nhớ hoặc tái tạo một phần dữ liệu khách hàng” chứa quá nhiều ám chỉ tinh vi và ngôn ngữ miễn trừ trách nhiệm đến mức làm tăng nghi ngờ hơn là tạo niềm tin
Nó chỉ áp dụng cho các mô hình được dùng “rộng rãi cho mọi khách hàng”, nên nếu một mô hình không được dùng rộng rãi hoặc chỉ áp dụng cho một số khách hàng thì toàn bộ câu đó không còn áp dụng nữa
Về mặt logic, điều đó nghe như đang ngầm nói rằng trong các trường hợp như vậy dữ liệu có thể bị rò rỉ, nên khá tệ
Câu chữ này cần phải sửa, và người viết ra nó là một rủi ro
Tức là dữ liệu khách hàng không được dùng để huấn luyện “các mô hình được dùng rộng rãi cho mọi khách hàng theo cách đó”, nhưng lại vẫn góp phần vào việc huấn luyện mô hình toàn cục
Chỉ là vấn đề ấy gây hại cho chúng ta nhiều hơn cho họ
Nếu ai đó đặt câu hỏi như đang thảo luận một tình huống cực kỳ cụ thể, thì có vẻ dữ liệu mật vẫn có thể lộ ra ngoài, dù không bị gắn với tên khách hàng
Đâu phải không thể hỏi LLM xem một công ty cụ thể hoặc bất kỳ trong một ngành cụ thể sẽ thiết kế thứ gì đó như thế nào
Mô hình gợi ý kênh học từ các đề xuất trước đó và việc người dùng có tham gia kênh được gợi ý hay không, nhưng tách dữ liệu khách hàng khỏi mô hình để bảo vệ quyền riêng tư
Họ nói dùng một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack để đánh giá độ tương đồng chủ đề và tạo ra điểm số dạng số, còn mô hình toàn cục chỉ dùng các điểm số đó cùng dữ liệu không phải dữ liệu khách hàng để đưa ra gợi ý
Với tìm kiếm cũng vậy, họ không huấn luyện trên chính truy vấn hay nội dung văn bản của kết quả, mà học các thông tin ngữ cảnh theo từng team như số lần một tin nhắn được nhấp từ tìm kiếm hoặc mức độ trùng lặp từ ngữ giữa truy vấn và tin nhắn được gợi ý
Các gợi ý tự động hoàn thành được lấy từ những cụm từ phổ biến trong tin nhắn công khai của workspace; còn ở cấp toàn cục thì họ học dựa trên các kết quả hoàn thành từng được gợi ý và chấp nhận trước đó, nhưng nói rằng thuật toán chỉ dùng điểm số và số đếm tương tác trong quá khứ
Gợi ý emoji cũng tương tự: họ phân loại cảm xúc bằng một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack, rồi chỉ xét tần suất mà các tin nhắn mang cảm xúc đó và một emoji cụ thể được dùng cùng nhau trong workspace đó
Tóm lại, nếu muốn loại dữ liệu khỏi mô hình toàn cục thì phải opt-out.
Đồng thời lại nói mơ hồ rằng “dữ liệu không bị rò rỉ giữa các workspace”, nên rất dễ gây bối rối.
Không nên dùng công cụ chỉ là “sẽ không rò rỉ”, mà phải dùng công cụ “không thể rò rỉ”.
Câu “khi phát triển mô hình AI/ML hoặc phân tích dữ liệu khách hàng, Slack không thể truy cập nội dung nền tảng. Có nhiều biện pháp kỹ thuật để ngăn điều này” khá gây khó hiểu.
“Không thể” là cách diễn đạt rất mạnh, nhưng tôi thắc mắc làm sao mô hình AI có thể truy cập dữ liệu còn chính Slack, Inc thì lại không thể.
Nếu tôi không bỏ sót gì thì đây có vẻ gần với “không làm” hơn là “không thể làm”.
Có lẽ họ muốn nói là “nhân viên Slack”, nhưng “Slack” có thể bao gồm toàn bộ tài sản, đại diện, hệ thống, máy tính, máy chủ, mô hình AI... của công ty.
Ngay cả khi Signal nói “chúng tôi không thể truy cập nội dung người dùng” thì đó vẫn nghe như một cách diễn đạt thiếu ổn định và quá lạc quan.
Khi nghe “không thể”, người ta sẽ hiểu là không một ai trong công ty có thể làm việc đó trong phạm vi hợp pháp.
Nhân viên Slack có thể tắt các biện pháp kỹ thuật đó, và nhân viên Signal cũng có thể phát hành bản cập nhật ứng dụng để chuyển tiếp mọi tin nhắn qua máy chủ khác.
Cách diễn đạt tốt hơn là “nhân viên Slack không truy cập nội dung nền tảng”.
Như vậy thì rất rõ ràng là có thể truy cập.
Ví dụ, một batch job huấn luyện mô hình có thể chạy dưới tư cách người dùng hệ thống được phép truy cập dữ liệu có gắn nhãn là “interaction”, nhưng không có quyền truy cập dữ liệu “content” như nội dung tin nhắn hay văn bản truy vấn của người dùng.
Nếu job huấn luyện gửi một RPC để lấy loại nội dung đó thì sẽ bị từ chối, giống như khi cố truy cập DM của người khác mà không đăng nhập.
Ở các công ty lớn, kỹ sư hay quản lý sản phẩm không thể tự ý đặt ACL theo ý mình; họ phải yêu cầu quyền truy cập cho batch job từ một hệ thống nào đó, và những người vận hành hệ thống đó cũng tuân theo chính sách công ty.
Nó hơi giống việc nhân viên ngân hàng xử lý số tài khoản nhưng không thể lén chuyển tiền vào tài khoản cá nhân, hoặc nếu làm thì sẽ bị phát hiện.
Câu này gần như có nghĩa là trên phương diện hệ thống, một PM nào đó của Slack không thể phớt lờ chính sách rồi lén huấn luyện bằng dữ liệu khách hàng mà đội khác không dùng chỉ để cải thiện OKR của nhóm mình.
Dĩ nhiên phép so sánh này không hoàn hảo.
Nhân viên ngân hàng có lẽ gần hơn với bộ phận hỗ trợ khách hàng của Slack, những người có thể xem tin nhắn thay mặt khách hàng khi có sự đồng ý; còn khả năng chuyển quyền truy cập hạn chế được cấp cho cá nhân sang một job huấn luyện mô hình thực tế có lẽ là không có.
Ở một công ty trưởng thành, cũng phải có cơ chế ngăn nhân viên dùng quyền truy cập dữ liệu cá nhân để huấn luyện mô hình trên laptop cá nhân rồi triển khai mô hình đó lên production.
Startup thì có thể vận hành như vậy thật.
Telegram hay WhatsApp cũng vậy.
Tôi nghĩ sẽ hữu ích nếu có một danh sách các công ty làm chuyện này để còn tránh.
Nếu biết công ty nào khác cũng huấn luyện bằng dữ liệu khách hàng mà không có công tắc opt-out dễ thấy và dễ dùng, mong mọi người chia sẻ bên dưới.
Trước đây họ nói thông tin thu được từ yêu cầu hỗ trợ kỹ thuật chỉ được dùng để giải quyết sự cố, và sau khi loại bỏ dữ liệu cá nhân thì có thể dùng một số chi tiết kỹ thuật để tạo bug report.
Trong câu chữ mới, họ nói sau khi loại bỏ dữ liệu cá nhân, một số thông tin kỹ thuật nhất định có thể được dùng để tạo bug report, và thông tin kỹ thuật đã ẩn danh có thể được gửi tới Microsoft Azure để tận dụng dịch vụ OpenAI nhằm cải thiện trải nghiệm hỗ trợ kỹ thuật.
Họ nói sẽ loại trừ thông tin nhận dạng cá nhân như tên, số điện thoại, địa chỉ, email, địa chỉ IP và số sê-ri sản phẩm.
Trước đây tôi thường xóa luôn email cập nhật chính sách quyền riêng tư, nhưng giờ đã hình thành thói quen xem diff để kiểm tra xem có bị nhét thêm kiểu câu chữ này không.
Động cơ quá mạnh nên rất khó cưỡng lại.
https://twitter.com/kepano/status/1688610782509211648
https://twitter.com/kepano/status/1682829662370557952
Danh sách đó trống rỗng.
Tôi không hiểu chuyện này có thể tương thích với luật quyền được lãng quên của châu Âu như thế nào
Thật ra tôi cũng nghi ngờ liệu có mô hình AI nào có thể bảo vệ được quyền đó không
Nếu người dùng yêu cầu xóa, họ sẽ huấn luyện lại toàn bộ mô hình sao? Có lẽ là không
Bản quyền giờ coi như không còn, không phải ăn cắp mà là chuyển đổi, rồi còn bảo phải opt-out trước khi mô hình được huấn luyện trên toàn bộ internet, mà ngay cả vậy có lẽ họ cũng chẳng làm
Họ nói việc làm sẽ hoàn toàn không giảm, trong khi mọi công ty lập tức sa thải 15% nhân sự và ép quay lại văn phòng để moi thêm cả dữ liệu xe cộ
Họ bán giấc mơ rằng bạn sẽ thành lập trình viên năng suất nhất nhờ “một bí quyết kỳ lạ”, nhưng lại có vẻ muốn bán cho cá nhân thay vì tự làm ra một sản phẩm có lãi
Điều nghiêm trọng và nguy hiểm nhất là thông tin bị kiểm duyệt ở tầng thấp nhất trước cả khi đến được đầu ngón tay hay trước mắt con người
[0] https://ai.stanford.edu/~kzliu/blog/unlearning
Theo tôi hiểu, nếu mô hình đã được huấn luyện rồi thì không cần xóa chỉ vì có yêu cầu về quyền được lãng quên, nhưng sự bất định pháp lý là rất lớn
Xét theo các phán quyết GDPR gần đây, do đây là opt-out chứ không phải opt-in, nên nhiều khả năng vẫn là vi phạm
Có lẽ họ đang lọc bỏ toàn bộ dữ liệu được tạo ra trong EEA
Với nhắn tin cho nhóm, thực sự nên dùng các giải pháp tự lưu trữ như Matrix/Element
Không muốn đặt thiết bị riêng trong công ty thì cũng không sao, nhưng giải pháp nên là vận hành một hệ thống được mã hóa đầu-cuối để nhà cung cấp dịch vụ lưu trữ không thể truy cập dữ liệu
cryptpad.fr cũng là phần mềm rất tuyệt
Bạn nhận mã nguồn (Ruby on Rails) và triển khai ở bất cứ đâu mình muốn; chúng tôi đang chạy nó trên một DigitalOcean droplet
Slack, Google, Microsoft và mọi nhà cung cấp công cụ SaaS đều có động cơ cực lớn để làm chuyện này
Nếu doanh nghiệp muốn tránh bị hàng hóa hóa trước các vendor, thì rốt cuộc họ phải kiểm soát dữ liệu và chiến lược AI của chính mình
Điều đó có lẽ đồng nghĩa với việc tắt các tính năng nhỏ, đắt đỏ và có thể phá hỏng doanh nghiệp, rồi xây dựng một kho tri thức tập trung với kiểm soát truy cập và governance tốt, sau đó cắm vào bất kỳ LLM mã nguồn mở hoặc hộp đen nào của nhà cung cấp mà họ muốn
Đó là lý do tôi muốn công ty dùng Mattermost tự lưu trữ thay vì Slack
Nhân tiện, Windows 11 đồng bộ tệp lên máy chủ Microsoft theo mặc định
Kiểu như “chúng tôi chỉ dùng nó để chọn emoji thôi, và thêm một chút cho công cụ gợi ý cổ phiếu vui vẻ chỉ dùng nội bộ nữa”
Ý là một công cụ gợi ý những mã cổ phiếu thú vị đáng mua dựa trên tiếng lòng ẩn danh theo thời gian thực của hàng trăm nghìn công ty công nghệ