Nếu là một doanh nghiệp lớn chi hàng triệu USD mỗi tháng cho suy luận, việc tự mua một rack GB300 khoảng 6 triệu USD là đáng cân nhắc
Chỉ cần chưa tới 10% trong 20,7TB bộ nhớ để nạp toàn bộ mô hình MXFP4, và tổng băng thông HBM là 576TB/s, nên có thể chạy song song hơn 6.000 tác vụ agent với ngữ cảnh trung bình 100.000 token ở khoảng 30 token/giây
Nếu tính khấu hao hằng năm và tiền điện là 1,5 triệu USD, mức sử dụng trung bình 50%, thì chi phí dưới 0,6 USD cho mỗi 1 triệu token đầu ra; dữ liệu cũng vẫn nằm trong nội bộ và rẻ hơn dịch vụ hosting hơn 10 lần
Với các công ty tin rằng mô hình trọng số mở sẽ tiếp tục tiến bộ và AI sẽ còn tồn tại lâu dài, lần đầu tiên đã có cơ sở rõ ràng để quyết định mua rack trực tiếp
Đang chạy Kimi 2.8 trên một máy chủ 107.000 USD, xử lý hơn khoảng 50.000 token/giây trong hầu hết tác vụ
Khoản tiết kiệm đã vượt chi phí token từng chi cho Claude và Gemini trong năm ngoái
Nếu thuê 2–3 nhân sự DevOps để vận hành thì sẽ tốn thêm 400.000–700.000 USD, và mọi sự cố cũng như bảo trì đều do công ty chịu trách nhiệm
Dù vậy, với dữ liệu cần giữ bí mật thì vẫn không tin tưởng LLM được hosting
Cũng cần không gian có làm mát bằng chất lỏng và hạ tầng điện siêu mật độ cao, nên các cơ sở colocation thông thường hoặc phòng máy chủ nội bộ khó gánh nổi
Nếu là công ty có thể mua rack 6 triệu USD và hạ tầng đi kèm, còn phải xét đến điều khoản giấy phép thương mại áp dụng, nên phép tính không hề đơn giản
Tôi lại từng xem đó là hành động làm chậm tiến bộ
Lý do là các phòng lab khác có thể bắt kịp bằng cách chưng cất mô hình của phòng lab tuyến đầu, đồng thời lấy đi một phần doanh thu mà phòng lab đó có thể tái đầu tư cho thế hệ tiếp theo
Tôi từng nghĩ rằng nếu muốn tăng tốc hoàn toàn thì nên quốc hữu hóa hai phòng lab hàng đầu và đóng kín như Manhattan Project cho đến khi đạt được tự cải thiện đệ quy (RSI), nhưng các phản biện trong phần trả lời đã khiến quan điểm của tôi thay đổi đáng kể
Có thể xem giấy phép Kimi-K3 tại https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Các nhà cung cấp Model as a Service có doanh thu cộng gộp của các công ty liên kết vượt 20 triệu USD trong 12 tháng liên tiếp phải ký hợp đồng riêng với Moonshot AI trước khi sử dụng thương mại
Điều khoản hiện có cũng quy định nếu có từ 100 triệu người dùng hoạt động hằng tháng trở lên hoặc doanh thu sản phẩm thương mại vượt 20 triệu USD thì phải hiển thị tên Kimi
Ngay từ đầu đã thắc mắc giấy phép này áp dụng cho thứ gì
Cũng không rõ trọng số mô hình có bản quyền hay không
Ở Mỹ, có thể diễn giải rằng trọng số của mô hình học máy là sản phẩm của quá trình tối ưu hóa tự động như stochastic gradient descent, expectation maximization hay thuật toán di truyền, nên không thuộc đối tượng bản quyền
Điều này vẫn chưa được kiểm chứng đầy đủ tại tòa, và chi phí kiện tụng cũng lớn, nên nhà tuyển dụng thường sẽ chọn tuân thủ giấy phép cho an toàn
Vụ Thaler v. Perlmutter đã xác nhận bản quyền cần có tác giả là con người, và hướng dẫn của Văn phòng Bản quyền Mỹ cũng nêu rõ tác phẩm do máy tự động tạo ra mà không có sự can thiệp sáng tạo của con người thì không thể đăng ký
Các điều khoản tiếp theo cũng loại trừ nguyên lý toán học, công thức, thuật toán và phương trình khỏi đối tượng bản quyền, nên nếu xem mô hình là thuật toán thì kết luận tương đối rõ ràng
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Việc có thể tải xuống là tốt hơn, nhưng với các điều kiện này thì thật đáng tiếc vì khó gọi là trọng số mở hay mã nguồn mở thực sự
Cũng không rõ họ sẽ tìm ra người vi phạm giấy phép và đưa họ thành đối tượng kiện tụng bằng cách nào
Cách tiếp cận dùng đồ thị tri thức phân cấp tự tiến hóa, trong đó agent liên tục mở rộng khi khám phá các lĩnh vực giàu tri thức và mảng lập trình ở quy mô web, khá thú vị
Nhìn việc hàm kích hoạt quay lại tanh khiến người ta có cảm giác xu hướng kỹ thuật đang vận động theo chu kỳ
Theo trang 6 của bài báo, họ không dùng nguyên xi tanh mà dùng f_gate(b,x) = b * tanh(x / b) * sigmoid(x) và f_up(b,x) = b * tanh(x / b)
Nhìn trên đồ thị, có vẻ đây là thiết kế nhằm kết hợp ưu điểm của GLU là biểu đạt tốt hơn khi x lớn hơn khoảng 5 với ưu điểm của SwiGLU là giá trị vọt lên ngay trước 0
Tổng hợp tác vụ dựa trên đồ thị tri thức là một cách tiếp cận phù hợp với bài toán lâu nay: làm sao bao quát đầy đủ nhiều loại tác vụ khác nhau
Có vẻ nó cũng có thể dẫn tới nghiên cứu lý thuyết về tốc độ tạo ra tri thức mới và các phương thức tạo sinh của con người lẫn máy móc
Tôi đang băn khoăn giữa LoRA+DPO, GRPO thì hiện tại phương án nào là tốt nhất để tinh chỉnh cho các tác vụ agent riêng
Trước mắt LoRA+SFT là phù hợp, nhưng do mô hình lớn nên chi phí sẽ là gánh nặng đáng kể
Có lẽ nên chờ API tinh chỉnh của nhà cung cấp; không nhất thiết phải đi thẳng từ đầu sang học tăng cường hoặc dạng giống học tăng cường off-policy như DPO
Tôi tò mò mô hình giáo viên trong chưng cất on-policy đa giáo viên là gì
Với các lĩnh vực có thể kiểm chứng như toán học, lập trình thì dễ hiểu, nhưng vì có cả sinh học nên không rõ liệu đây có phải là cấu trúc chưng cất từ một mô hình lớn hơn hay không
Họ trích dẫn https://thinkingmachines.ai/blog/on-policy-distillation/
Tôi hiểu đây là một phương pháp chưng cất trong đó mô hình giáo viên chấm điểm từng token của mô hình học sinh đang giải bài toán bằng xác suất sinh ở mỗi bước, rồi dùng điểm đó làm phần thưởng hoặc hàm mất mát để học tăng cường
Đa giáo viên có vẻ nghĩa là chưng cất từ nhiều mô hình, và cũng có thể bao gồm các mô hình đóng tiên tiến nhất
Tuy nhiên cần xác suất log; OpenAI API cho phép điều này, còn Anthropic thì không cung cấp, nên có thể có cách ước lượng từ bên ngoài
Phương pháp này có thể áp dụng cho bất kỳ lĩnh vực nào mà giáo viên biết, bao gồm cả sinh học
Giáo viên là các mô hình khác
Tôi tò mò liệu việc giá suy luận của nhiều nhà cung cấp đều giống nhau có phải do hợp đồng cấp phép với Moonshot hay không
Tôi tò mò cần những gì để tạo ra một mô hình mở của Mỹ có thể cạnh tranh với Kimi
Mô hình công khai quy mô lớn gần đây của các phòng thí nghiệm lớn tại Mỹ có lẽ là GPT-OSS-120b vào mùa hè 2025, khoảng một năm trước
Có vẻ khó trông chờ họ tự nguyện tung ra, nên có lẽ cần gây sức ép công khai theo một hình thức nào đó
Gần đây tôi đã kỳ vọng Gemma sẽ ra mắt ở mức tối thiểu 100B, nhưng có vẻ Google chỉ giữ mô hình quy mô đó nội bộ
MSL hoặc SpaceXAI có vẻ có khả năng cao sẽ công bố mã nguồn mở một trong các mô hình lớn tiếp theo
Cả hai đều thân thiện với mã nguồn mở và sẽ cạnh tranh cho vị trí Kimi của Mỹ
Nếu quan niệm phổ biến rằng Trung Quốc chỉ cần chưng cất mô hình rồi sao chép trong 2 tuần là đúng, thì Mỹ cũng phải có thể tung ra một mô hình sao chép trong vòng 2 tuần
Inkling cũng nằm trong phạm vi có thể cạnh tranh ở mức đại khái
1 bình luận
Các ý kiến trên Hacker News
Nếu là một doanh nghiệp lớn chi hàng triệu USD mỗi tháng cho suy luận, việc tự mua một rack GB300 khoảng 6 triệu USD là đáng cân nhắc
Chỉ cần chưa tới 10% trong 20,7TB bộ nhớ để nạp toàn bộ mô hình MXFP4, và tổng băng thông HBM là 576TB/s, nên có thể chạy song song hơn 6.000 tác vụ agent với ngữ cảnh trung bình 100.000 token ở khoảng 30 token/giây
Nếu tính khấu hao hằng năm và tiền điện là 1,5 triệu USD, mức sử dụng trung bình 50%, thì chi phí dưới 0,6 USD cho mỗi 1 triệu token đầu ra; dữ liệu cũng vẫn nằm trong nội bộ và rẻ hơn dịch vụ hosting hơn 10 lần
Với các công ty tin rằng mô hình trọng số mở sẽ tiếp tục tiến bộ và AI sẽ còn tồn tại lâu dài, lần đầu tiên đã có cơ sở rõ ràng để quyết định mua rack trực tiếp
Khoản tiết kiệm đã vượt chi phí token từng chi cho Claude và Gemini trong năm ngoái
Dù vậy, với dữ liệu cần giữ bí mật thì vẫn không tin tưởng LLM được hosting
Cùng với mô hình, họ cũng công bố nhiều hạ tầng dựa trên mã nguồn mở
https://github.com/MoonshotAI/MoonEP
https://github.com/kvcache-ai/AgentEnv
https://github.com/MoonshotAI/FlashKDA
Khó chấp nhận quan điểm xem mô hình mã nguồn mở và trọng số mở là hành động làm chậm tiến bộ AI
Lý do là các phòng lab khác có thể bắt kịp bằng cách chưng cất mô hình của phòng lab tuyến đầu, đồng thời lấy đi một phần doanh thu mà phòng lab đó có thể tái đầu tư cho thế hệ tiếp theo
Tôi từng nghĩ rằng nếu muốn tăng tốc hoàn toàn thì nên quốc hữu hóa hai phòng lab hàng đầu và đóng kín như Manhattan Project cho đến khi đạt được tự cải thiện đệ quy (RSI), nhưng các phản biện trong phần trả lời đã khiến quan điểm của tôi thay đổi đáng kể
Có thể xem giấy phép Kimi-K3 tại https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Các nhà cung cấp Model as a Service có doanh thu cộng gộp của các công ty liên kết vượt 20 triệu USD trong 12 tháng liên tiếp phải ký hợp đồng riêng với Moonshot AI trước khi sử dụng thương mại
Điều khoản hiện có cũng quy định nếu có từ 100 triệu người dùng hoạt động hằng tháng trở lên hoặc doanh thu sản phẩm thương mại vượt 20 triệu USD thì phải hiển thị tên Kimi
Các mô hình công bố năm 2025 dùng giấy phép MIT gọn gàng, nhưng từ moonshotai/Kimi-K2-Thinking vào tháng 1/2026, họ bắt đầu dùng giấy phép MIT đã sửa đổi
Cũng không rõ trọng số mô hình có bản quyền hay không
Điều này vẫn chưa được kiểm chứng đầy đủ tại tòa, và chi phí kiện tụng cũng lớn, nên nhà tuyển dụng thường sẽ chọn tuân thủ giấy phép cho an toàn
Vụ Thaler v. Perlmutter đã xác nhận bản quyền cần có tác giả là con người, và hướng dẫn của Văn phòng Bản quyền Mỹ cũng nêu rõ tác phẩm do máy tự động tạo ra mà không có sự can thiệp sáng tạo của con người thì không thể đăng ký
Các điều khoản tiếp theo cũng loại trừ nguyên lý toán học, công thức, thuật toán và phương trình khỏi đối tượng bản quyền, nên nếu xem mô hình là thuật toán thì kết luận tương đối rõ ràng
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Cách tiếp cận dùng đồ thị tri thức phân cấp tự tiến hóa, trong đó agent liên tục mở rộng khi khám phá các lĩnh vực giàu tri thức và mảng lập trình ở quy mô web, khá thú vị
Nhìn việc hàm kích hoạt quay lại tanh khiến người ta có cảm giác xu hướng kỹ thuật đang vận động theo chu kỳ
f_gate(b,x) = b * tanh(x / b) * sigmoid(x)vàf_up(b,x) = b * tanh(x / b)Nhìn trên đồ thị, có vẻ đây là thiết kế nhằm kết hợp ưu điểm của GLU là biểu đạt tốt hơn khi x lớn hơn khoảng 5 với ưu điểm của SwiGLU là giá trị vọt lên ngay trước 0
Tổng hợp tác vụ dựa trên đồ thị tri thức là một cách tiếp cận phù hợp với bài toán lâu nay: làm sao bao quát đầy đủ nhiều loại tác vụ khác nhau
Có vẻ nó cũng có thể dẫn tới nghiên cứu lý thuyết về tốc độ tạo ra tri thức mới và các phương thức tạo sinh của con người lẫn máy móc
Tôi đang băn khoăn giữa LoRA+DPO, GRPO thì hiện tại phương án nào là tốt nhất để tinh chỉnh cho các tác vụ agent riêng
Có lẽ nên chờ API tinh chỉnh của nhà cung cấp; không nhất thiết phải đi thẳng từ đầu sang học tăng cường hoặc dạng giống học tăng cường off-policy như DPO
Tôi tò mò mô hình giáo viên trong chưng cất on-policy đa giáo viên là gì
Với các lĩnh vực có thể kiểm chứng như toán học, lập trình thì dễ hiểu, nhưng vì có cả sinh học nên không rõ liệu đây có phải là cấu trúc chưng cất từ một mô hình lớn hơn hay không
Tôi hiểu đây là một phương pháp chưng cất trong đó mô hình giáo viên chấm điểm từng token của mô hình học sinh đang giải bài toán bằng xác suất sinh ở mỗi bước, rồi dùng điểm đó làm phần thưởng hoặc hàm mất mát để học tăng cường
Đa giáo viên có vẻ nghĩa là chưng cất từ nhiều mô hình, và cũng có thể bao gồm các mô hình đóng tiên tiến nhất
Tuy nhiên cần xác suất log; OpenAI API cho phép điều này, còn Anthropic thì không cung cấp, nên có thể có cách ước lượng từ bên ngoài
Phương pháp này có thể áp dụng cho bất kỳ lĩnh vực nào mà giáo viên biết, bao gồm cả sinh học
Tôi tò mò liệu việc giá suy luận của nhiều nhà cung cấp đều giống nhau có phải do hợp đồng cấp phép với Moonshot hay không
Tôi tò mò cần những gì để tạo ra một mô hình mở của Mỹ có thể cạnh tranh với Kimi
Có vẻ khó trông chờ họ tự nguyện tung ra, nên có lẽ cần gây sức ép công khai theo một hình thức nào đó
Gần đây tôi đã kỳ vọng Gemma sẽ ra mắt ở mức tối thiểu 100B, nhưng có vẻ Google chỉ giữ mô hình quy mô đó nội bộ
Cả hai đều thân thiện với mã nguồn mở và sẽ cạnh tranh cho vị trí Kimi của Mỹ