1 điểm bởi GN⁺ 2024-05-17 | 1 bình luận | Chia sẻ qua WhatsApp
  • Slack không phát triển các mô hình AI tạo sinh bằng dữ liệu khách hàng, nhưng với các mô hình dự đoán như gợi ý emoji hoặc gợi ý kênh, tin nhắn, nội dung, tệp và thông tin sử dụng có thể được phân tích
  • Các mô hình toàn cục được thiết kế để không tái hiện bất kỳ phần nào của dữ liệu khách hàng, đồng thời có các biện pháp kiểm soát để nhân viên không thể truy cập vào nội dung nền tảng trong quá trình phát triển AI/ML hoặc phân tích
  • Khách hàng có thể yêu cầu loại trừ dữ liệu của workspace hoặc tổ chức khỏi việc huấn luyện mô hình toàn cục của Slack, và sau khi loại trừ vẫn có thể tiếp tục sử dụng lợi ích từ các mô hình ML học toàn cục
  • Gợi ý kênh, kết quả tìm kiếm, tự động hoàn thành và gợi ý emoji hoạt động theo cách tận dụng mô hình bên ngoài, điểm số số học, số lần tương tác trước đây và các cụm từ công khai phổ biến để giảm việc lộ dữ liệu khách hàng
  • Các tính năng AI tạo sinh của Slack sử dụng LLM bên thứ ba, nhưng dữ liệu khách hàng vẫn nằm trong ranh giới tin cậy của Slack và sẽ không được dùng để huấn luyện mô hình AI tạo sinh nếu không có lựa chọn tham gia rõ ràng

Nguyên tắc sử dụng dữ liệu cho AI/ML của Slack

  • Nguyên tắc phát triển sản phẩm của Slack đặt quyền riêng tư và bảo mật dữ liệu khách hàng làm trung tâm
  • ML và AI được sử dụng như công cụ để cải thiện sản phẩm Slack
  • Không phát triển mô hình AI tạo sinh bằng dữ liệu khách hàng
  • Việc phát triển các mô hình dự đoán như gợi ý emoji và gợi ý kênh có thể phân tích các dữ liệu sau
    • Dữ liệu khách hàng được gửi lên Slack: tin nhắn, nội dung, tệp, v.v.
    • Thông tin khác được định nghĩa trong chính sách quyền riêng tư và hợp đồng khách hàng: bao gồm thông tin sử dụng

Mô hình toàn cục và kiểm soát truy cập

  • Slack không xây dựng hoặc huấn luyện các mô hình được dùng rộng rãi cho toàn bộ khách hàng theo cách có thể tái hiện bất kỳ phần nào của dữ liệu khách hàng
  • Trong quá trình phát triển mô hình AI/ML hoặc phân tích dữ liệu khách hàng, nhân viên Slack không thể truy cập nội dung nền tảng
  • Slack áp dụng nhiều biện pháp kỹ thuật để bảo vệ tính bảo mật và an toàn của dữ liệu khách hàng
  • Khách hàng có thể opt-out để dữ liệu khách hàng của mình không bị dùng cho việc huấn luyện mô hình toàn cục của Slack
    • Dữ liệu khách hàng của workspace đã opt-out chỉ được dùng để cải thiện trải nghiệm của chính workspace đó
    • Vẫn có thể tiếp tục hưởng lợi từ các mô hình ML học toàn cục
    • Chủ sở hữu Org hoặc Workspace, hoặc Primary Owner, phải gửi email đến feedback@slack.com kèm URL Workspace/Org và tiêu đề Slack Global model opt-out request
    • Slack sẽ phản hồi khi đã xử lý xong yêu cầu

Cải thiện dịch vụ bằng dữ liệu khách hàng và thông tin khác

  • Các nhóm sản phẩm và phân tích của Slack có thể sử dụng dữ liệu khách hàng và thông tin khác để phát triển, cập nhật và cải thiện dịch vụ
  • Việc cá nhân hóa và cải thiện này trở nên khả thi thông qua quá trình nghiên cứu và hiểu cách người dùng tương tác với Slack
  • Nghĩa vụ bảo mật trong hợp đồng khách hàng và Privacy Policy của Slack được áp dụng cho từng kịch bản
  • Khách hàng sở hữu dữ liệu khách hàng của mình
  • Slack tổng hợp và tách biệt dữ liệu khách hàng để, ngay cả khi dùng dữ liệu khách hàng cho cập nhật dịch vụ, bên thứ ba cũng không thể xác định khách hàng hoặc cá nhân cụ thể nào là nguồn của sự cải thiện
    • Ngoại lệ bao gồm các công ty liên kết hoặc bên xử lý phụ của Slack

Cách bảo vệ dữ liệu theo từng tính năng dự đoán

  • Gợi ý kênh

    • Có thể đề xuất tham gia các kênh công khai mới trong công ty
    • Gợi ý dựa trên thành viên của kênh, hoạt động và mức độ trùng lặp chủ đề
    • Mô hình học từ các gợi ý trước đây và việc người dùng có tham gia kênh hay không
    • Một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack sẽ đánh giá độ tương đồng chủ đề và xuất ra điểm số số học
    • Mô hình toàn cục chỉ dùng điểm số số học này và dữ liệu không phải dữ liệu khách hàng để đưa ra gợi ý
  • Kết quả tìm kiếm

    • Mô hình ML cho tìm kiếm xác định các kết quả phù hợp với truy vấn cụ thể để giúp người dùng tìm thông tin mong muốn
    • Dựa trên các kết quả tìm kiếm trước đây và lịch sử tương tác trước đó
    • Được thiết kế để mô hình không thể tái hiện truy vấn tìm kiếm hoặc kết quả
  • Tự động hoàn thành

    • Có thể tự động hoàn thành truy vấn tìm kiếm hoặc văn bản khác
    • Ví dụ, khi người dùng nhập vài ký tự đầu của Customer Support, hệ thống sẽ hoàn thành cụm từ đó
    • Các đề xuất được thực hiện cục bộ và lấy từ các cụm từ trong tin nhắn công khai phổ biến trong workspace của người dùng
    • Thuật toán chọn đề xuất tiềm năng học trên phạm vi toàn cục từ các trường hợp hoàn thành đã từng được đề xuất và chấp nhận
    • Sử dụng các quy tắc chấm điểm độ tương đồng giữa văn bản đầu vào và đề xuất, và thuật toán chỉ nhận điểm số số học và số lần tương tác trước đây
  • Gợi ý emoji

    • Có thể đề xuất emoji phản ứng dựa trên nội dung và cảm xúc của tin nhắn, lịch sử sử dụng emoji, cũng như tần suất một emoji được dùng trong nhóm ở ngữ cảnh cụ thể
    • Nếu trong một kênh nhất định, 🎉 thường được dùng cho các tin nhắn chúc mừng, thì với một tin nhắn mới có sắc thái tích cực tương tự, hệ thống có thể gợi ý phản ứng 🎉
    • Một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack có thể phân loại cảm xúc của tin nhắn
    • Mô hình của Slack chỉ xem xét tần suất mà các tin nhắn có cảm xúc nhất định và một emoji cụ thể được liên kết với nhau trong workspace đó để gợi ý emoji

Xử lý dữ liệu khách hàng trong AI tạo sinh

  • AI tạo sinh là một nhóm hệ thống AI có thể tạo nội dung như văn bản để phản hồi các prompt do người dùng nhập vào
  • Nhóm này bao gồm mô hình ngôn ngữ lớn (LLM)
  • AI in Slack sử dụng AI tạo sinh và tận dụng LLM của bên thứ ba
  • Trừ khi khách hàng chủ động opt-in một cách rõ ràng, dữ liệu khách hàng sẽ không được dùng để huấn luyện các mô hình AI tạo sinh
  • AI in Slack dùng các LLM dựng sẵn, và các mô hình này không được cập nhật bằng dữ liệu khách hàng sau yêu cầu và cũng không lưu giữ dữ liệu khách hàng theo cách khác
  • Các mô hình đó được lưu trữ trên hạ tầng của nhà cung cấp đám mây như AWS
  • Dữ liệu khách hàng vẫn nằm trong ranh giới tin cậy của Slack, và nhà cung cấp LLM không thể truy cập dữ liệu khách hàng
  • Có thể nhận thông báo thay đổi về bên xử lý phụ tại Trust and Compliance webpage

Nguồn của câu trả lời tìm kiếm trong Slack AI

  • Tính năng tìm kiếm của AI in Slack lấy nguồn câu trả lời từ các tính năng nội bộ của Slack và các tài liệu được kết nối
  • Nguồn tìm kiếm bao gồm:
    • Tính năng của Slack: canvas, huddles canvas notes, clip transcripts, text snippets
    • Tệp được tải lên Slack: PDF, email, docx, pptx, Keynote
    • Tài liệu được kết nối từ Google Drive: Docs, Slides
    • Tài liệu từ Sharepoint/OnDrive: Word, Powerpoint
    • Ứng dụng đối tác lưu trữ tệp như Box: nếu đã được cài đặt
  • Người dùng phải được xác thực thông qua tích hợp với Slack thì mới có thể truy cập các tệp đó
  • Quản trị viên có thể tắt toàn bộ kết quả tệp hoặc cấu hình để không dùng các tệp được lưu trữ bên ngoài làm nguồn
  • Có thể xem hướng dẫn liên quan tại Help Center

1 bình luận

 
GN⁺ 2024-05-17
Ý kiến trên Hacker News
  • Đã liên hệ đội hỗ trợ để opt-out, và nhận được phản hồi rằng yêu cầu đã được hoàn tất
    Slack giải thích rằng họ có các mô hình machine learning ở cấp nền tảng như gợi ý kênh/emoji và kết quả tìm kiếm, nhưng không xây dựng hay huấn luyện chúng theo cách có thể học, ghi nhớ hoặc tái tạo dữ liệu khách hàng
    Slack AI là một add-on mua riêng, và không huấn luyện LLM bằng dữ liệu khách hàng; thay vào đó họ dùng LLM được lưu trữ trong hạ tầng AWS của Slack nên dữ liệu không bị chia sẻ với nhà cung cấp LLM bên ngoài
    Liên kết chính sách: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...

    • Rốt cuộc thì nghe như kiểu “chúng tôi cho AI của mình ăn dữ liệu của bạn, nhưng không chia sẻ với người khác”
      Chắc cũng chỉ đúng cho tới lần cập nhật điều khoản sử dụng tiếp theo
    • Lặng lẽ bật mặc định theo kiểu tham gia sẵn, lại còn không đưa tùy chọn opt-out dễ thấy vào bảng quản trị Slack, mà vẫn tỏ ra quan tâm đến quyền riêng tư của khách hàng thì trông hoàn toàn thiếu thiện chí
    • Có vẻ quy trình là “nếu muốn loại dữ liệu khách hàng khỏi mô hình toàn cục của Slack thì Org/Workspace Owner hoặc Primary Owner phải gửi email tới feedback@slack.com kèm Workspace/Org URL và tiêu đề ‘Slack Global model opt-out request’”
      Chắc bạn đã làm vậy rồi nhỉ?
    • Tôi cũng nhận được cùng một câu trả lời mẫu, và khi hỏi thêm chi tiết thì không nhận được phản hồi nào
  • Nếu cấu trúc là “bạn có thể opt-out để dữ liệu khách hàng không bị dùng cho việc huấn luyện mô hình toàn cục của Slack; kể cả khi opt-out thì dữ liệu workspace vẫn chỉ được dùng để cải thiện trải nghiệm của chính workspace đó, và bạn vẫn tiếp tục hưởng lợi từ mô hình huấn luyện toàn cục”, thì thật khó hiểu vì sao lại có ai không opt-out
    Trừ trường hợp họ không biết mình phải opt-out, còn lại trông như một lựa chọn chỉ có thiệt mà thôi

    • Tôi không hiểu nổi vì sao các công ty lại nghĩ rằng chỉ cần gắn mác AI vào thông cáo báo chí là khách hàng sẽ chấp nhận việc dữ liệu giao tiếp riêng tư trong dịch vụ trả phí bị cào quét và kiếm tiền ở quy mô công nghiệp mà không cần xin phép
    • Có vẻ họ chẳng hề định làm cho việc này trở nên dễ dàng
      Người dùng cá nhân dường như không có tiếng nói về cách dữ liệu của mình được sử dụng, mà phải liên hệ Workspace Owner
      Nếu phải liên hệ như vậy thì tôi sẽ tiện thể đề nghị họ xem xét nền tảng thay thế luôn
    • Quyền riêng tư trên internet nhìn chung vẫn như thế này; nếu dễ thì ai cũng đã opt-out rồi
      Rốt cuộc nó thành kiểu trò đập chuột opt-out, cách làm lại là gửi yêu cầu chung chung, và ngay cả khi opt-out thì có vẻ họ vẫn tiếp tục huấn luyện
    • Cụm từ “trao cho khách hàng quyền lựa chọn” khiến tôi nhớ tới một câu đùa kiểu The Hitchhiker’s Guide to the Galaxy
      Có khi họ chỉ giấu một gợi ý tí hon ở chỗ khó thấy nhất đâu đó quanh trang 300 của điều khoản
    • Có thể bạn thực sự muốn mô hình toàn cục tốt nhất
      Nếu xem việc không opt-out là “giúp tạo ra sản phẩm tốt hơn”, thì đây vốn đã là sản phẩm trả phí, và nếu không cần bỏ thêm thời gian mà vẫn có thể khiến bản phát hành sau tốt hơn, thì tại sao lại không làm?
      Bạn nhận được sản phẩm tốt hơn với cùng một mức giá, còn công ty thì có sản phẩm dễ bán hơn
      Có thể đây là một giao dịch mà công ty hưởng lợi nhiều hơn, nhưng một bên thắng nhiều hơn không có nghĩa bên kia thua
      Nếu bạn đặc biệt coi trọng quyền riêng tư dữ liệu, hoặc tin rằng việc cho phép huấn luyện thực sự tạo ra rủi ro lộ thông tin riêng tư, thì câu chuyện sẽ khác; khi đó đã có lựa chọn dừng lại, và mỗi người chỉ cần tự cân giữa “sản phẩm tốt hơn” và “rủi ro suy đoán về việc lộ thông tin riêng tư”
  • Câu “các mô hình được sử dụng rộng rãi cho mọi khách hàng không được xây dựng hay huấn luyện theo cách có thể học, ghi nhớ hoặc tái tạo một phần dữ liệu khách hàng” chứa quá nhiều ám chỉ tinh vi và ngôn ngữ miễn trừ trách nhiệm đến mức làm tăng nghi ngờ hơn là tạo niềm tin
    Nó chỉ áp dụng cho các mô hình được dùng “rộng rãi cho mọi khách hàng”, nên nếu một mô hình không được dùng rộng rãi hoặc chỉ áp dụng cho một số khách hàng thì toàn bộ câu đó không còn áp dụng nữa
    Về mặt logic, điều đó nghe như đang ngầm nói rằng trong các trường hợp như vậy dữ liệu có thể bị rò rỉ, nên khá tệ
    Câu chữ này cần phải sửa, và người viết ra nó là một rủi ro

    • Thay vì “người viết là rủi ro”, nghe có vẻ như họ cố tình viết như vậy để né trách nhiệm hơn
    • Càng kỳ lạ hơn khi vài đoạn bên dưới lại nói rằng “bạn có thể opt-out để dữ liệu khách hàng không bị dùng cho việc huấn luyện mô hình toàn cục của Slack”
      Tức là dữ liệu khách hàng không được dùng để huấn luyện “các mô hình được dùng rộng rãi cho mọi khách hàng theo cách đó”, nhưng lại vẫn góp phần vào việc huấn luyện mô hình toàn cục
    • Vấn đề nằm ở người đã quyết định tạo ra thực tế nơi đội pháp lý có thể nhảy múa quanh câu miễn trừ đó
      Chỉ là vấn đề ấy gây hại cho chúng ta nhiều hơn cho họ
    • Trong các kênh Slack doanh nghiệp hoặc tin nhắn riêng có những thông tin không tồn tại ở bất kỳ đâu trên internet, và điều đó khiến người ta tưởng tượng chúng sẽ đi vào mô hình
      Nếu ai đó đặt câu hỏi như đang thảo luận một tình huống cực kỳ cụ thể, thì có vẻ dữ liệu mật vẫn có thể lộ ra ngoài, dù không bị gắn với tên khách hàng
      Đâu phải không thể hỏi LLM xem một công ty cụ thể hoặc bất kỳ trong một ngành cụ thể sẽ thiết kế thứ gì đó như thế nào
    • Câu chữ có vẻ rõ ràng nhất có thể, và tôi cho rằng các bullet point bên dưới đã đưa ra ví dụ chi tiết hơn
      Mô hình gợi ý kênh học từ các đề xuất trước đó và việc người dùng có tham gia kênh được gợi ý hay không, nhưng tách dữ liệu khách hàng khỏi mô hình để bảo vệ quyền riêng tư
      Họ nói dùng một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack để đánh giá độ tương đồng chủ đề và tạo ra điểm số dạng số, còn mô hình toàn cục chỉ dùng các điểm số đó cùng dữ liệu không phải dữ liệu khách hàng để đưa ra gợi ý
      Với tìm kiếm cũng vậy, họ không huấn luyện trên chính truy vấn hay nội dung văn bản của kết quả, mà học các thông tin ngữ cảnh theo từng team như số lần một tin nhắn được nhấp từ tìm kiếm hoặc mức độ trùng lặp từ ngữ giữa truy vấn và tin nhắn được gợi ý
      Các gợi ý tự động hoàn thành được lấy từ những cụm từ phổ biến trong tin nhắn công khai của workspace; còn ở cấp toàn cục thì họ học dựa trên các kết quả hoàn thành từng được gợi ý và chấp nhận trước đó, nhưng nói rằng thuật toán chỉ dùng điểm số và số đếm tương tác trong quá khứ
      Gợi ý emoji cũng tương tự: họ phân loại cảm xúc bằng một mô hình bên ngoài không được huấn luyện bằng tin nhắn Slack, rồi chỉ xét tần suất mà các tin nhắn mang cảm xúc đó và một emoji cụ thể được dùng cùng nhau trong workspace đó
  • Tóm lại, nếu muốn loại dữ liệu khỏi mô hình toàn cục thì phải opt-out.
    Đồng thời lại nói mơ hồ rằng “dữ liệu không bị rò rỉ giữa các workspace”, nên rất dễ gây bối rối.
    Không nên dùng công cụ chỉ là “sẽ không rò rỉ”, mà phải dùng công cụ “không thể rò rỉ”.

    • Về bản chất, chẳng phải mọi công cụ đều ở trạng thái chỉ cần một lệnh gọi API là dữ liệu có thể rò rỉ sao?
    • Hầu hết SaaS đều là multi-tenant, nên suốt hàng chục năm nay chúng ta vốn đã sống trong một thế giới “có thể rò rỉ, nhưng sẽ không rò rỉ”.
    • Tôi tò mò trong câu chữ pháp lý thì “will not” và “cannot” khác nhau thế nào.
  • Câu “khi phát triển mô hình AI/ML hoặc phân tích dữ liệu khách hàng, Slack không thể truy cập nội dung nền tảng. Có nhiều biện pháp kỹ thuật để ngăn điều này” khá gây khó hiểu.
    “Không thể” là cách diễn đạt rất mạnh, nhưng tôi thắc mắc làm sao mô hình AI có thể truy cập dữ liệu còn chính Slack, Inc thì lại không thể.
    Nếu tôi không bỏ sót gì thì đây có vẻ gần với “không làm” hơn là “không thể làm”.

    • Từ “Slack” ở đây khá thú vị.
      Có lẽ họ muốn nói là “nhân viên Slack”, nhưng “Slack” có thể bao gồm toàn bộ tài sản, đại diện, hệ thống, máy tính, máy chủ, mô hình AI... của công ty.
      Ngay cả khi Signal nói “chúng tôi không thể truy cập nội dung người dùng” thì đó vẫn nghe như một cách diễn đạt thiếu ổn định và quá lạc quan.
      Khi nghe “không thể”, người ta sẽ hiểu là không một ai trong công ty có thể làm việc đó trong phạm vi hợp pháp.
      Nhân viên Slack có thể tắt các biện pháp kỹ thuật đó, và nhân viên Signal cũng có thể phát hành bản cập nhật ứng dụng để chuyển tiếp mọi tin nhắn qua máy chủ khác.
      Cách diễn đạt tốt hơn là “nhân viên Slack không truy cập nội dung nền tảng”.
    • Trong whitepaper được liên kết ở cùng bình luận đó, họ nói quyền truy cập được cấp phát theo nguyên tắc đặc quyền tối thiểu và quyền hạn dựa trên vai trò, để chỉ có thể xử lý dữ liệu hợp lý cần thiết cho công việc hiện tại, và mọi quyền truy cập production đều được rà soát ít nhất mỗi quý.
      Như vậy thì rất rõ ràng là có thể truy cập.
    • Từ góc nhìn của một kỹ sư từng xây dựng hệ thống xử lý dữ liệu nhạy cảm, câu này nghe như đang nói về danh sách kiểm soát truy cập, hệ thống cấp phát danh sách đó, và chính sách mà hệ thống ấy tuân theo.
      Ví dụ, một batch job huấn luyện mô hình có thể chạy dưới tư cách người dùng hệ thống được phép truy cập dữ liệu có gắn nhãn là “interaction”, nhưng không có quyền truy cập dữ liệu “content” như nội dung tin nhắn hay văn bản truy vấn của người dùng.
      Nếu job huấn luyện gửi một RPC để lấy loại nội dung đó thì sẽ bị từ chối, giống như khi cố truy cập DM của người khác mà không đăng nhập.
      Ở các công ty lớn, kỹ sư hay quản lý sản phẩm không thể tự ý đặt ACL theo ý mình; họ phải yêu cầu quyền truy cập cho batch job từ một hệ thống nào đó, và những người vận hành hệ thống đó cũng tuân theo chính sách công ty.
      Nó hơi giống việc nhân viên ngân hàng xử lý số tài khoản nhưng không thể lén chuyển tiền vào tài khoản cá nhân, hoặc nếu làm thì sẽ bị phát hiện.
      Câu này gần như có nghĩa là trên phương diện hệ thống, một PM nào đó của Slack không thể phớt lờ chính sách rồi lén huấn luyện bằng dữ liệu khách hàng mà đội khác không dùng chỉ để cải thiện OKR của nhóm mình.
      Dĩ nhiên phép so sánh này không hoàn hảo.
      Nhân viên ngân hàng có lẽ gần hơn với bộ phận hỗ trợ khách hàng của Slack, những người có thể xem tin nhắn thay mặt khách hàng khi có sự đồng ý; còn khả năng chuyển quyền truy cập hạn chế được cấp cho cá nhân sang một job huấn luyện mô hình thực tế có lẽ là không có.
      Ở một công ty trưởng thành, cũng phải có cơ chế ngăn nhân viên dùng quyền truy cập dữ liệu cá nhân để huấn luyện mô hình trên laptop cá nhân rồi triển khai mô hình đó lên production.
      Startup thì có thể vận hành như vậy thật.
    • Mọi công ty hứa hẹn “mã hóa đầu cuối” rốt cuộc cũng chỉ như móc ngoéo ngón út mà thôi.
      Telegram hay WhatsApp cũng vậy.
  • Tôi nghĩ sẽ hữu ích nếu có một danh sách các công ty làm chuyện này để còn tránh.
    Nếu biết công ty nào khác cũng huấn luyện bằng dữ liệu khách hàng mà không có công tắc opt-out dễ thấy và dễ dùng, mong mọi người chia sẻ bên dưới.

    • Synology đã cập nhật chính sách này vào tháng 3.
      Trước đây họ nói thông tin thu được từ yêu cầu hỗ trợ kỹ thuật chỉ được dùng để giải quyết sự cố, và sau khi loại bỏ dữ liệu cá nhân thì có thể dùng một số chi tiết kỹ thuật để tạo bug report.
      Trong câu chữ mới, họ nói sau khi loại bỏ dữ liệu cá nhân, một số thông tin kỹ thuật nhất định có thể được dùng để tạo bug report, và thông tin kỹ thuật đã ẩn danh có thể được gửi tới Microsoft Azure để tận dụng dịch vụ OpenAI nhằm cải thiện trải nghiệm hỗ trợ kỹ thuật.
      Họ nói sẽ loại trừ thông tin nhận dạng cá nhân như tên, số điện thoại, địa chỉ, email, địa chỉ IP và số sê-ri sản phẩm.
      Trước đây tôi thường xóa luôn email cập nhật chính sách quyền riêng tư, nhưng giờ đã hình thành thói quen xem diff để kiểm tra xem có bị nhét thêm kiểu câu chữ này không.
    • Nếu dữ liệu được lưu trong cơ sở dữ liệu mà công ty có thể tự do đọc và truy cập, tức là không phải mã hóa đầu cuối, thì sớm muộn gì công ty đó cũng sẽ sửa điều khoản sử dụng để có thể dùng dữ liệu cho huấn luyện AI.
      Động cơ quá mạnh nên rất khó cưỡng lại.
      https://twitter.com/kepano/status/1688610782509211648
      https://twitter.com/kepano/status/1682829662370557952
    • Có lẽ lập danh sách các công ty không làm chuyện này còn dễ hơn.
      Danh sách đó trống rỗng.
    • Cho đến khi có các biện pháp bảo vệ phù hợp và mỗi người có thể tự quyết dữ liệu của mình được dùng ra sao, có được trả công hay không, thì có thể phản kháng bằng cách không đăng nội dung hữu ích hoặc chính xác lên internet.
  • Tôi không hiểu chuyện này có thể tương thích với luật quyền được lãng quên của châu Âu như thế nào
    Thật ra tôi cũng nghi ngờ liệu có mô hình AI nào có thể bảo vệ được quyền đó không
    Nếu người dùng yêu cầu xóa, họ sẽ huấn luyện lại toàn bộ mô hình sao? Có lẽ là không

    • Trò lừa “AI” đang diễn ra lúc này trông như một quy trình tối hậu đầy phức tạp để che giấu vô số công đoạn thủ công
      Bản quyền giờ coi như không còn, không phải ăn cắp mà là chuyển đổi, rồi còn bảo phải opt-out trước khi mô hình được huấn luyện trên toàn bộ internet, mà ngay cả vậy có lẽ họ cũng chẳng làm
      Họ nói việc làm sẽ hoàn toàn không giảm, trong khi mọi công ty lập tức sa thải 15% nhân sự và ép quay lại văn phòng để moi thêm cả dữ liệu xe cộ
      Họ bán giấc mơ rằng bạn sẽ thành lập trình viên năng suất nhất nhờ “một bí quyết kỳ lạ”, nhưng lại có vẻ muốn bán cho cá nhân thay vì tự làm ra một sản phẩm có lãi
      Điều nghiêm trọng và nguy hiểm nhất là thông tin bị kiểm duyệt ở tầng thấp nhất trước cả khi đến được đầu ngón tay hay trước mắt con người
    • Machine unlearning là một lĩnh vực có thật, và có thể xem [0] như tài liệu nhập môn
      [0] https://ai.stanford.edu/~kzliu/blog/unlearning
    • Tôi không nghĩ cách diễn giải hiện tại của GDPR và các quy định tương tự là như vậy
      Theo tôi hiểu, nếu mô hình đã được huấn luyện rồi thì không cần xóa chỉ vì có yêu cầu về quyền được lãng quên, nhưng sự bất định pháp lý là rất lớn
      Xét theo các phán quyết GDPR gần đây, do đây là opt-out chứ không phải opt-in, nên nhiều khả năng vẫn là vi phạm
      Có lẽ họ đang lọc bỏ toàn bộ dữ liệu được tạo ra trong EEA
  • Với nhắn tin cho nhóm, thực sự nên dùng các giải pháp tự lưu trữ như Matrix/Element
    Không muốn đặt thiết bị riêng trong công ty thì cũng không sao, nhưng giải pháp nên là vận hành một hệ thống được mã hóa đầu-cuối để nhà cung cấp dịch vụ lưu trữ không thể truy cập dữ liệu
    cryptpad.fr cũng là phần mềm rất tuyệt

    • Có thể xem thử Campfire
      Bạn nhận mã nguồn (Ruby on Rails) và triển khai ở bất cứ đâu mình muốn; chúng tôi đang chạy nó trên một DigitalOcean droplet
    • Zulip(https://zulip.com/) có vẻ là một giải pháp thay thế tự lưu trữ dựa trên Python rất tốt cho Slack/Teams
  • Slack, Google, Microsoft và mọi nhà cung cấp công cụ SaaS đều có động cơ cực lớn để làm chuyện này
    Nếu doanh nghiệp muốn tránh bị hàng hóa hóa trước các vendor, thì rốt cuộc họ phải kiểm soát dữ liệu và chiến lược AI của chính mình
    Điều đó có lẽ đồng nghĩa với việc tắt các tính năng nhỏ, đắt đỏ và có thể phá hỏng doanh nghiệp, rồi xây dựng một kho tri thức tập trung với kiểm soát truy cập và governance tốt, sau đó cắm vào bất kỳ LLM mã nguồn mở hoặc hộp đen nào của nhà cung cấp mà họ muốn

    • “Bị hàng hóa hóa trước vendor” đúng là cụm từ tôi đang tìm
      Đó là lý do tôi muốn công ty dùng Mattermost tự lưu trữ thay vì Slack
    • Rõ ràng đây vừa là moral hazard vừa là cơ hội
      Nhân tiện, Windows 11 đồng bộ tệp lên máy chủ Microsoft theo mặc định
  • Kiểu như “chúng tôi chỉ dùng nó để chọn emoji thôi, và thêm một chút cho công cụ gợi ý cổ phiếu vui vẻ chỉ dùng nội bộ nữa”
    Ý là một công cụ gợi ý những mã cổ phiếu thú vị đáng mua dựa trên tiếng lòng ẩn danh theo thời gian thực của hàng trăm nghìn công ty công nghệ