1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Khi API suy luận giấu suy luận được mã hóa, kết quả tìm kiếm, trạng thái nén, tin nhắn sub-agent bên trong nhà cung cấp, lịch sử hội thoại mà người dùng giữ được không còn là một phiên hoàn chỉnh mà chỉ là một bản sao nhìn thấy được một phần
  • Tính di động của phiên không có nghĩa là tái tạo cùng một đầu ra trên mô hình khác, mà là có được một bản ghi hoàn chỉnh về mặt ngữ nghĩa để có thể kiểm tra, xuất, phát lại, kiểm toán, xóa mà không cần tra cứu ID hay giải mã từ nhà cung cấp cũ
  • Phản hồi được lưu trữ và suy luận riêng tư, tìm kiếm được lưu trữ trên hạ tầng nhà cung cấp, cùng cơ chế nén mờ đục của OpenAI, Anthropic và Google giúp tăng tính liên tục trong cùng một hệ sinh thái, nhưng cũng tích lũy trạng thái bị niêm phong bởi nhà cung cấp mà bên khác không thể tiếp nhận
  • Trong hệ thống đa tác tử, cả nội dung ủy quyền và tin nhắn giữa các tác tử cũng bị mã hóa, kết hợp với nén tự động và chỉ dẫn ẩn, nên ngay cả khi sửa nhầm tệp hoặc làm lộ bí mật thì cũng rất khó kiểm toán xem đã được giao việc gì
  • API có thể di chuyển nên lấy nhật ký sự kiện cục bộ làm bản ghi chuẩn, cho phép người dùng chủ động chọn lưu trữ, đồng thời cho phép truy cập bản ghi đầy đủ có thể đọc được của tìm kiếm, nén, giao tiếp giữa tác tử, hiện vật đầu ra và cả distillation dưới sự kiểm soát của người dùng

Quyền sở hữu phiên đang bị API suy luận thay đổi ra sao

  • Lời hứa ban đầu của API suy luận là chỉ cần gửi đầu vào, nhận đầu ra rồi lưu cả hai lại, người dùng có thể kiểm tra, lưu trữ, phát lại cuộc hội thoại hoặc chuyển nó sang mô hình khác
  • Nhưng ngay từ đầu, lớp trừu tượng này đã không hoàn chỉnh
    • Prompt cache tồn tại trên GPU của nhà cung cấp
    • Mỗi mô hình có cách token hóa khác nhau và việc lấy mẫu cũng cố ý không được tái hiện chính xác
  • Dù vậy, bản ghi ngữ nghĩa chứa chỉ dẫn, tin nhắn, lời gọi công cụ và kết quả vẫn có thể thuộc về người dùng, và một mô hình khác đủ năng lực vẫn có thể hiểu công việc trước đó để tiếp tục
  • Các API gần đây trả về cả văn bản lẫn trạng thái phụ thuộc nhà cung cấp
    • Token suy luận bị tính phí nhưng chỉ được trả về dưới dạng mật mã mờ đục hoặc bản tóm tắt hạn chế
    • Tìm kiếm web mà máy khách không nhận được nguyên văn nội dung mô hình đã thấy
    • Ngữ cảnh nén mà chỉ nhà cung cấp ban đầu mới giải mã được
    • Chỉ dẫn và tin nhắn của sub-agent mà ứng dụng không nhìn thấy được
    • Tham chiếu tới tệp, vector store, container, cache không thể diễn giải ở môi trường khác
    • Trạng thái phản hồi và hội thoại chỉ truy cập được bằng ID lưu trên máy chủ của nhà cung cấp
  • Mỗi thứ đều có lý do riêng về tiện dụng hay chất lượng cho người dùng, nhưng khi gộp lại thì bản ghi cục bộ không còn là toàn bộ phiên mà chỉ là góc nhìn một phần của phiên mà trạng thái vận hành do nhà cung cấp sở hữu

Năm tiêu chí để nhận biết tính di động của phiên

  • Có thể di chuyển không có nghĩa là đổi mô hình mà token tiếp theo vẫn phải giống hệt
    • Mỗi mô hình khác nhau về năng lực, xu hướng đã học, cửa sổ ngữ cảnh, cách dùng công cụ, và cả đầu ra cũng vốn không tất định
  • Bản ghi được xuất ra phải chứa đủ thông tin để mô hình mới hiểu và tiếp tục công việc, mà không cần nhà cung cấp cũ tra cứu ID, giải mã mật văn hay khôi phục kết quả tìm kiếm và tóm tắt
  • Kiểm tra (Inspection): người dùng phải nhìn thấy thông tin mô hình đã thấy, công cụ đã làm gì, và các tác tử đã trao đổi gì với nhau
  • Xuất (Export): ngoài các hiện vật riêng lẻ có thể tải xuống riêng, bản thân phiên phải tự hoàn chỉnh
  • Phát lại (Replay): một hệ triển khai khác phải có thể tái dựng ngữ cảnh tương đương về mặt ngữ nghĩa
  • Kiểm toán (Audit): con người phải có thể giải thích sau này vì sao hệ thống đã có hành vi cụ thể
  • Xóa (Deletion): phải xác định và loại bỏ được mọi bản sao phía máy chủ mà phiên đang phụ thuộc vào
  • ID phản hồi đóng vai trò khóa của dữ liệu máy chủ không phải là lịch sử hội thoại, và mật văn mà người dùng không thể mở cũng không phải là trạng thái nằm trong quyền kiểm soát của người dùng
  • Chỉ một danh sách URL trích dẫn không thể thay thế tư liệu chứng cứ thực sự đã được đưa vào ngữ cảnh mô hình trong quá trình tìm kiếm

Mã hóa mà người dùng không thể giải

  • Cái tên encrypted_content nghe giống một tính năng bảo vệ quyền riêng tư do người dùng kiểm soát, nhưng trên thực tế thường là một capsule mà máy khách không đọc được và chỉ nhà cung cấp mới mở được
  • Vì nhà cung cấp chọn khóa, giải mã cho chính mô hình của họ và quyết định có thể phát lại ở môi trường nào, nên tên chính xác hơn là trạng thái bị niêm phong bởi nhà cung cấp (provider-sealed state)
  • Niêm phong bởi nhà cung cấp có thể đem lại lợi ích riêng tư thực sự
    • OpenAI trả về suy luận được mã hóa cho máy khách khi store: false, và ở yêu cầu tiếp theo có thể giải mã trong bộ nhớ mà không lưu trạng thái trung gian
    • Đặc biệt với khách hàng Zero Data Retention, cách này tốt hơn phương án buộc phải lưu hội thoại phía máy chủ
  • Tuy nhiên, kiểu mã hóa này không giấu dữ liệu khỏi nhà cung cấp suy luận mà chỉ giấu khỏi người dùng

Cách hội thoại được lưu trữ biến bản ghi thành con trỏ

  • Responses API của OpenAI mặc định lưu phản hồi, và theo tài liệu sẽ giữ đối tượng phản hồi ít nhất 30 ngày
  • Dùng store: false thì dữ liệu không được lưu trên máy chủ OpenAI, gần hơn với cách completions truyền thống
  • Gemini Interactions API cũng mặc định store: true
    • Gói trả phí giữ tương tác trong 55 ngày
    • Gói miễn phí giữ trong 1 ngày
  • Lưu phía máy chủ giúp ứng dụng giảm lượng dữ liệu phải gửi, duy trì suy luận ẩn và trạng thái công cụ, đồng thời dễ định tuyến cache hơn
  • Nhưng nếu ứng dụng cục bộ chỉ ghi lại tin nhắn của người dùng và văn bản cuối cùng, thì ID phản hồi dùng trong previousResponseId sẽ trở thành một khóa ngoại tới cơ sở dữ liệu bên ngoài mà người dùng không kiểm soát được

Nhật ký suy luận không được công khai

  • Các phòng thí nghiệm AI lớn cho rằng có lý do để không công khai raw chain of thought, nên token suy luận của mô hình trọng số đóng thường không được lộ ra qua API
  • Ở OpenAI, suy luận trước đó của phản hồi được lưu có thể được khôi phục bằng previous_response_id
    • Với store: false, máy khách phải giữ encrypted_content rồi gửi lại ở yêu cầu kế tiếp
    • Dù có thể dùng cho lần sinh sau với reasoning.context: "all_turns", phần suy luận được lưu vẫn tiếp tục mờ đục
  • Anthropic trả về toàn bộ thinking đã mã hóa trong trường signature
    • Phần thinking có thể bật để đọc được không phải raw chain of thought mà là bản tóm tắt do mô hình khác tạo ra
    • Ở lượt dùng công cụ, khối thinking phải được trả lại nguyên trạng không sửa đổi
    • Vì khối thinking bị gắn với mô hình đã tạo ra nó nên khi đổi mô hình phải bỏ đi, cho thấy ngay trong nội bộ Anthropic cũng không hướng tới khả năng di chuyển
  • Cách làm này đem lại tính liên tục trong cùng một hệ sinh thái, nhưng không tạo ra lịch sử hội thoại có thể di chuyển để mô hình của nhà cung cấp khác diễn giải được

Lỗ hổng trong bản ghi do tìm kiếm được lưu trữ trên hạ tầng nhà cung cấp để lại

  • Công cụ tìm kiếm phía máy khách có thể ghi lại truy vấn, thời điểm tìm kiếm, URL và tiêu đề kết quả, cùng các đoạn trích xuất
    • Người dùng có thể kiểm tra thứ hạng và đoạn trích, tải lại trang hoặc lưu bản sao để chuyển cùng một bằng chứng sang mô hình khác
  • Với tìm kiếm được lưu trữ trên hạ tầng nhà cung cấp, nhà cung cấp chạy vòng lặp công cụ riêng tư
    • OpenAI, Google và Anthropic cung cấp hành vi tìm kiếm, trích dẫn, và đôi khi là URL nguồn, nhưng không cung cấp toàn bộ ngữ cảnh văn bản đã được dùng để tạo câu trả lời
    • Nội dung URL có thể thay đổi, và mô hình có thể chỉ nhận các đoạn ngắn hơn, nên đây không phải bản ghi phát lại ổn định
  • Ngay cả khi mô hình tiếp theo muốn so sánh nguồn cụ thể hay kiểm chứng lại một số liệu gây tranh cãi, nó cũng không có được thứ hạng kết quả, đoạn trích xuất, tài liệu đã lọc và bằng chứng chính xác mà mô hình trước đã thấy
  • Dù tải lại các trang được trích dẫn, cũng không thể tái hiện chính xác dữ liệu đã dùng khi đó, nên kể cả sau khi yêu cầu tiếp theo đã chuyển nơi khác thì nhà cung cấp cũ vẫn còn nằm trong phiên như một phần thiết yếu
  • Tìm kiếm được lưu trữ trên hạ tầng nhà cung cấp cần có bản xuất toàn bộ độ trung thực, gồm truy vấn, metadata kết quả, đoạn tìm kiếm, timestamp và nội dung đã được lưu, chứ trích dẫn ngắn gọn không được là hồ sơ duy nhất

Nén ngữ cảnh mờ đục

  • Phiên tác tử dài cần đến nén, và bản tóm tắt có thể đọc được do máy khách kiểm soát dù có mất mát vẫn có thể kiểm tra, chỉnh sửa và chuyển đi
  • Cơ chế nén phía máy chủ của OpenAI trả về các mục compaction đã mã hóa, không được tạo ra để con người diễn giải
    • /responses/compact trả về canonical next context window mà máy khách phải gửi lại nguyên xi
    • OpenAI có thể tiếp tục ý nghĩa đã nén, nhưng nhà cung cấp khác chỉ nhận được mật văn cùng một phần ngữ cảnh gần đây
  • Nén mờ đục không phải là điều bắt buộc về mặt kỹ thuật
    • Cơ chế nén phía máy chủ của Anthropic trả về khối compaction có trường content đọc được
    • Máy khách có thể cung cấp chỉ dẫn tóm tắt tùy chỉnh, kiểm tra kết quả hoặc chuyển nó sang mô hình khác
    • Nén phía máy khách cũng có thể thực hiện với mọi nhà cung cấp
  • Hiện vật bị niêm phong của OpenAI có thể giữ được trạng thái đặc thù của mô hình tốt hơn tóm tắt thông thường nên cho hiệu năng cao hơn trên chính mô hình gốc, nhưng nên được cung cấp như tối ưu hóa tùy chọn, đồng thời có cả bản tóm tắt bàn giao có thể đọc được

Ủy quyền và liên lạc ẩn trong hệ đa tác tử

  • Trong hệ thống đa tác tử, vấn đề di chuyển còn lớn hơn vì ở đó không chỉ có một bản ghi mà là một cây phiên và luồng tin nhắn giữa các tác tử
  • Bản beta OpenAI Responses Multi-agent bổ sung các mục multi_agent_call, multi_agent_call_output, agent_message
    • Đối số message trong ví dụ spawn_agent được mã hóa
    • Tin nhắn giữa các tác tử chỉ chứa encrypted_content
    • Khi bật multi-agent, mọi tác tử đều bị áp dụng nén tự động phía máy chủ, kể cả khi máy khách không yêu cầu
    • Không hỗ trợ tóm tắt suy luận, đồng thời còn chèn chỉ dẫn cho root agent và sub-agent mà nhà phát triển không thể chỉnh sửa hoặc xóa
  • Kết quả là ủy quyền và tin nhắn bị niêm phong, ngữ cảnh được nén tự động riêng lẻ, suy luận ẩn, và điều phối do nhà cung cấp lưu trữ trên hạ tầng của họ hợp lại thành một gói trạng thái không thể chuyển đi
  • Tháng 6/2026, mã nguồn mở Codex client áp dụng thay đổi Encrypt multi-agent v2 message payloads
    • Responses API mã hóa đối số công cụ của mô hình cha
    • Khi Codex chuyển tiếp mật văn, API sẽ giải mã nội bộ cho mô hình con
    • InterAgentCommunication.content của Codex để trống, nên chỉ dẫn công việc chính xác không xuất hiện trong nhật ký chạy hay lịch sử ở dạng có thể đọc được
  • Khi tác tử con sửa nhầm tệp, làm lộ bí mật, lặp lại công việc khác hoặc làm theo giả định sai, người dùng cũng không thể kiểm tra được nó đã được giao việc gì
  • Issue công khai của Codex yêu cầu ngoài việc truyền mã hóa còn phải giữ một bản sao kiểm toán có thể đọc được
    • Đây mới chỉ là thiết kế tối thiểu; mặc định nên là tin nhắn plaintext giữa các tác tử

Vì sao cần quyền tự do chuyển phiên

  • Dù phần lớn người dùng không đổi mô hình giữa chừng, khả năng chuyển đi vẫn thay đổi mối quan hệ giữa người dùng và nhà cung cấp
  • Những lúc cần chuyển phiên gồm có mô hình bị khai tử, dịch vụ gặp sự cố, thay đổi giá, chính sách chặn yêu cầu tiếp theo, chạy cục bộ ở giai đoạn bí mật, hoặc việc tái dựng sau này cho mục đích kiểm toán
  • Khi tác tử làm phiên kéo dài hơn, các phiên code và nghiên cứu có thể tích lũy quyết định cùng bằng chứng trong nhiều ngày, còn trợ lý cá nhân có thể tích lũy lịch sử suốt nhiều năm
  • Nếu người dùng có thể tiếp tục ở nơi khác, các nhà cung cấp buộc phải cạnh tranh về chất lượng mô hình, giá, độ tin cậy và sự đáng tin
  • Nếu chỉ một nhà cung cấp có thể diễn giải toàn bộ ngữ cảnh tích lũy, sẽ hình thành cấu trúc khuyến khích bất lợi khiến người dùng khó rời đi

Nguyên tắc của API suy luận có thể di chuyển

  • Nhật ký sự kiện cục bộ phải là bản ghi chuẩn
    • Lưu trữ phía máy chủ có thể sao chép hoặc tăng tốc cho nó, nhưng máy khách phải tái dựng được phiên mà không cần tra cứu ID trên máy chủ
  • Lưu trữ phải là lựa chọn rõ ràng
    • store: false cần dễ dùng, được tài liệu hóa và tốt nhất nên là mặc định
    • Các tính năng cần lưu giữ dữ liệu phải thông báo rõ tại thời điểm sử dụng
  • Mục mờ đục không được độc chiếm ý nghĩa

    • Suy luận được mã hóa, nén, chữ ký công cụ có thể được kèm theo để nâng chất lượng trong cùng nhà cung cấp, nhưng phải có thêm biểu diễn bàn giao trung lập với nhà cung cấp và có thể đọc được
    • Công cụ được lưu trữ trên hạ tầng nhà cung cấp phải có nhật ký đầy đủ độ trung thực
      • Cần ghi lại đầu vào và đầu ra chính xác, bằng chứng, bộ lọc, nguồn, timestamp và content hash
    • Giao tiếp giữa sub-agent phải có thể kiểm toán
      • Cần lưu ở dạng đọc được công việc chính xác, tin nhắn, kết quả, phả hệ, mô hình và quyền công cụ của từng tác tử
    • Nén phải có thể kiểm tra
      • Cần trả về bản tóm tắt đọc được, chỉ dẫn đã dùng để tạo tóm tắt, và phả hệ giúp hiểu những gì đã bị lược bỏ
  • Hiện vật đầu ra phải có thể xuất ra

    • Tệp, đầu ra container, snapshot tìm kiếm, media được tạo phải tải xuống được thành kho lưu trữ cục bộ theo địa chỉ nội dung

Distillation và sự phụ thuộc của tầng mô hình

  • Một số phòng thí nghiệm trọng số đóng lớn ở Mỹ đang thể hiện thái độ ngày càng thù địch với distillation từ bên ngoài
  • Anthropic trong bài đăng tháng 2/2026 gọi hoạt động của DeepSeek, Moonshot, MiniMax là distillation attacks
    • Điều khoản thương mại quy định khách hàng sở hữu đầu ra nhưng cấm dùng đầu ra của dịch vụ để huấn luyện mô hình AI cạnh tranh
    • Trong khi đó, chính bài viết của họ lại thừa nhận rằng các phòng thí nghiệm dẫn đầu vẫn xem distillation là phương pháp huấn luyện hợp pháp và được dùng rộng rãi khi áp dụng cho mô hình của chính họ
  • Anthropic từng dùng bot để thu thập dữ liệu web công khai và cắt sách để quét phục vụ phát triển mô hình; OpenAI cũng nói họ huấn luyện trên nội dung công khai trên internet có thể truy cập tự do và từ lâu cho rằng đó là fair use
  • Cả hai công ty đều xem distillation là phương pháp thông thường khi tạo ra mô hình nhỏ hơn trong nội bộ
  • Có một sự bất đối xứng đạo đức: họ đòi máy móc phải được phép học từ lượng công việc khổng lồ con người đưa lên internet, nhưng lại không muốn máy khác học từ đầu ra do chính phòng thí nghiệm tạo ra
  • Distillation có thể chuyển năng lực của mô hình frontier đắt đỏ sang mô hình nhỏ hơn, rẻ hơn và nhanh hơn
    • Có thể chạy cục bộ, ngoại tuyến, trên phần cứng hạn chế hoặc trong môi trường do người dùng kiểm soát
    • Giúp tăng cạnh tranh, giữ lại năng lực ngay cả khi API biến mất, đồng thời giảm chi phí tính toán và năng lượng cho các tác vụ phổ thông

Những quyền tự do tối thiểu người dùng cần được đảm bảo

  • Người dùng phải có thể lưu giữ phiên sau khi đóng tài khoản và chuyển nó sang mô hình khác
  • Mô hình mới có thể đưa ra đánh giá khác, hỏi lại, hoặc hoạt động kém hơn, nhưng nó không nên chỉ nhận được mật văn thay vì lịch sử người dùng, bằng chứng, kế hoạch và công việc được ủy quyền mà mô hình trước đã thấy
  • Vấn đề không nằm ở bản thân API lưu giữ trạng thái, mà ở chỗ hiệu năng tốt hơn lại đi kèm với sự suy giảm quyền kiểm soát của người dùng
  • Lưu trữ phía máy chủ phải là tùy chọn, công cụ được lưu trữ trên hạ tầng nhà cung cấp phải có thể quan sát, nén phải đọc được và giao tiếp giữa các tác tử phải có thể kiểm toán
  • Ngay cả với suy luận riêng tư cũng cần ít nhất một bản ghi bàn giao có thể di chuyển, và distillation không nên là điều cấm kỵ để biện minh cho các rào cản cao hơn, mà nên là con đường giúp năng lực được phổ cập rộng hơn

1 bình luận

 
Ý kiến trên Hacker News
  • Bài này cho thấy tình hình thực ra đã nghiêm trọng hơn tưởng tượng. Chỉ khi thực sự sử dụng quyền tự do thì mối quan hệ với nhà cung cấp mới thay đổi, nên điều quan trọng là không bị phụ thuộc vào một hệ sinh thái cụ thể
    Tôi đã cố chấp nhận Codex dù nó che giấu quá trình suy luận vì hiệu năng tốt, nhưng không thể kiểm toán đã là một vấn đề lớn đến mức khiến tôi phải nghĩ lại về gói thuê bao cá nhân. Vì thế tôi cũng đang làm một ứng dụng điện thoại cho OpenCode

    • Nghĩ đến vấn đề các cuộc trò chuyện phiên tác tử có giá trị bị biến mất, tôi đã tạo https://www.agentkanban.io. Nó lưu ngữ cảnh vào các công việc trên bảng và có thể gọi lại trong một phiên tác tử mới sau này, hiện hỗ trợ Claude trong VS Code và Github CoPilot
      Lịch sử sử dụng công cụ độc quyền cố ý bị loại trừ vì nó phá vỡ tính di chuyển của phiên
    • Tôi lạc quan rằng dark pattern chỉ là chiến lược thắng lợi ngắn hạn, và về lâu dài sẽ bị những cách làm tôn trọng người dùng và hướng đến lợi ích công cộng lấn át. Để chuẩn bị cho khả năng xu hướng đổi chiều nhanh chóng, có lẽ đã đến lúc tập trung vào các mô hình có trọng số mở và vận hành được về mặt kinh tế
    • Trong lúc chờ giá giảm, tôi định thu thập càng nhiều dữ liệu phiên từ Claude và Codex càng tốt để sau này dùng cho việc fine-tune mô hình mở. Vì việc này tôi cũng đã tự làm parser phiên và công cụ lưu trữ
    • Tôi thậm chí đã chuẩn bị tới 96GB VRAM để chạy mô hình cục bộ, nhưng vẫn chưa có mô hình nào tiến gần Codex dựa trên GPT. Laguna S2.1 NVFP4 đã tiến khá sát trong mảng code, nhưng để mô hình cục bộ trở thành lựa chọn đa dụng nghiêm túc thì có vẻ vẫn còn rất xa
    • https://indieweb.org/POSSE là lời giải
  • Đây là bài viết tổng hợp rất tốt một vấn đề mà phần lớn người dùng AI gần như không đánh giá đúng mức. Các nhà cung cấp suy luận tiên tiến thường đóng gói những chức năng không phải LLM như tìm kiếm web và thực thi code như thể chỉ là công cụ đơn giản, nhưng thực tế chúng tạo ra sự gắn kết và rào cản gia nhập rất mạnh
    Về lý thuyết có thể tách chúng khỏi API suy luận và đưa ra ngoài bằng máy chủ MCP, nhưng hiếm khi nhà cung cấp làm vậy và chức năng từ các bên thay thế nhìn chung khá yếu. Khi làm nền tảng chat on-premise, độc lập nhà cung cấp https://github.com/EratoLab/erato, tôi thấy ngay cả các tính năng tưởng đơn giản như tạo ảnh trong chat cũng khó triển khai, và một nguyên nhân là MCP vẫn chưa có đặc tả truyền tệp cơ bản: https://github.com/modelcontextprotocol/modelcontextprotocol...
    Tôi hy vọng khi sự quan tâm với các mô hình có trọng số mở tăng lên, sẽ có thêm nhiều hiện thực thay thế dễ hoán đổi hơn

    • Việc khiến người ta chạy cục bộ những tác tử mà hoàn toàn không thể xem prompt, như thông điệp tác tử con được mã hóa, là vô trách nhiệm về mặt căn bản. Tuy vậy, bản thân việc nhà cung cấp cung cấp công cụ được host thì tôi không xem là vấn đề, nó giống hàng mua ngẫu hứng ở quầy thanh toán hơn
      Không nên triển khai tạo ảnh bằng MCP, cứ tự viết công cụ riêng là được. Đã có đủ các nhà cung cấp suy luận ảnh và media như Fal, cùng các nhà cung cấp tìm kiếm web và nghiên cứu chuyên sâu
  • Có lẽ cần một tiêu chuẩn mở hoặc định dạng tệp cho ngữ cảnh. Tôi tự hỏi liệu có thể làm nó dựa trên SQLite để các mô hình mở cùng tuân theo một định dạng vì tính di chuyển, và để các chương trình khác cũng có thể truy vấn hay không

  • Trên thực tế, hội thoại thường có nhiều nhiễu nên nhiều khi tốt hơn là loại nó khỏi ngữ cảnh. Tôi cho AI ghi lại những gì đã học, việc đã hoàn thành và việc còn lại trong các tệp Markdown trong thư mục memo của kho lưu trữ, rồi để mô hình khác tiếp nối ở cuộc trò chuyện sau
    Nếu cần tôi cũng có thể tự sửa memo trước

    • Vì thế tôi ngày càng dùng agent coding nhiều hơn. Tôi giao việc, yêu cầu vượt qua test và lint nghiêm ngặt, rồi bỏ qua quá trình mô hình thao thao bất tuyệt
      Chỉ cần nó quay lại khi đã vượt qua mọi kiểm tra, nên tôi đỡ bị quấy rầy bởi những cuộc đối thoại thừa trong giao diện chat
    • Nếu bỏ phiên thì sẽ mất các chức năng kiểm tra, xuất ra, chạy lại, kiểm toán. Các nhà cung cấp mô hình lớn không hề có rào cản gia nhập thực chất nào, còn OpenAI và Anthropic thì biên lợi nhuận hoạt động đang âm nặng và cũng không có nguồn vốn như các đại công ty công nghệ
      Vì thế các nhà cung cấp đang cố tình tạo ra sự phụ thuộc, và về bản chất đây là đối tượng của luật chống độc quyền. Nhưng hiện tại ở Mỹ, FTC đã suy yếu nên điều đó đang bị dung thứ
    • Phải có khả năng đổi mô hình dễ dàng mà không tổn thất thì cạnh tranh thị trường mới tạo ra AI tốt hơn và rẻ hơn. Nếu việc chuyển đổi trở nên đau đớn vì mất một phần ngữ cảnh, nhà cung cấp có thể tạo vendor lock-in, làm xấu trải nghiệm người dùng và tăng giá
      Dù hiện giờ vẫn có cách lách, động cơ khiến việc di chuyển tự do khó hơn là hoàn toàn đủ lớn, nên thật đáng lo khi các công ty AI bắt đầu đặt nền móng cho sự xuống cấp dịch vụ
    • Phiên dài thường hay bỏ sót tiến độ, và mô hình càng dài dòng thì tỷ lệ tín hiệu trên nhiễu càng thấp. Thứ có giá trị không phải nguyên văn phiên mà là kết quả như thay đổi code hay kế hoạch, tóm tắt
  • Cần phân biệt hai hiện tượng. Thứ nhất là sự gia tăng của trạng thái ẩn mà người dùng không thể kiểm tra hoặc di chuyển, điều này rõ ràng là xấu. Thứ hai là việc cách hiện thực tính năng và API bị chia tách theo từng nhà cung cấp, đây không phải là không thể di chuyển mà là trở nên khó hơn
    Kỷ nguyên OpenAI Completions API được dùng như một chuẩn phổ quát đang dần khép lại, và nếu bỏ qua phần đóng thì Responses API mới có thể còn tốt hơn. Không nhất thiết sản phẩm, thư viện hay SDK phải tiếp tục theo đuổi một lớp trừu tượng hợp nhất gom mọi nhà cung cấp lại thành một
    Cũng như với cơ sở dữ liệu, các lớp trừu tượng hợp nhất đã bị rò rỉ và cuối cùng phải chấp nhận cách triển khai riêng theo từng công nghệ, các nhà cung cấp mô hình rồi cũng sẽ như vậy; chỉ cần một phần của phiên có thể di chuyển được là đủ

    • Bài này chỉ đang nói đến trạng thái ẩn trong hai hiện tượng đó
  • Tôi đang phát triển https://github.com/pantoniou/fyai, dù còn thô nhưng nó tự lưu dữ liệu phiên và quản lý bằng mô hình giống git

    • Công cụ này không thể giải quyết vấn đề mà bài viết đề cập, và về mặt cấu trúc cũng không thể giải quyết được
  • Một thỏa thuận cho phép lưu giữ phiên và chuyển sang mô hình khác ngay cả khi đóng tài khoản là hợp lý. Lý tưởng nhất là cũng phải dễ tìm ra những mô hình có đặc tính embedding tương tự
    Khi GPT-4o lần đầu bị ngừng, đã có người đem các cuộc trò chuyện đã xuất ra để tìm một mô hình có giọng điệu và tính cách tương tự nhằm lấy lại một người bạn cũ, nhưng các mô hình OpenAI khác không cho cảm giác đó. Điểm mạnh của mô hình có trọng số mở là có thể lưu giữ vĩnh viễn, nên người hướng dẫn, bạn bè hay người tư vấn sẽ không thể bị các tập đoàn lớn đơn phương tước mất

  • Tôi tò mò không biết cần điều gì để đưa cuộc thảo luận này vượt lên trên mức chủ đề cho blog HN

  • Các mô hình hiện tại có cửa sổ ngữ cảnh hạn chế, nên đến một thời điểm nào đó chúng sẽ quên nội dung, vì vậy giá trị của phiên không cao đến thế. Nếu trong tương lai mô hình thực sự học và thay đổi qua tương tác, thì những thay đổi đó sẽ không thể chuyển sang mô hình khác, nên tôi cho rằng vấn đề này không quá có ý nghĩa lớn

  • Đọc cùng bài này với https://gwern.net/complement sẽ là tài liệu bổ sung rất hay

    • Cần có lý do vì sao nó là tài liệu bổ sung