- Khi dùng song song Kimi K3 và Claude trong các tác vụ lập trình hằng ngày, gần như khó phân biệt khác biệt thực tế về chất lượng đầu ra và số token cần cho câu trả lời
- API Kimi K3 có giá $3 cho đầu vào và $15 cho đầu ra trên mỗi 1 triệu token, rẻ hơn đáng kể so với model cao cấp nhất của Claude lần lượt là $10 và $50
- Kimi bắt đầu từ $19/tháng, và gói coding $39/tháng cũng khá dư dả, trong khi Claude nhanh chóng dùng hết hạn mức trong các tác vụ agent và thậm chí không duy trì được quyền truy cập Fable ở gói $20/tháng
- Trong benchmark an ninh mạng của Semgrep, khi Claude bị giới hạn từ chối một số tác vụ thì GLM 5.2 đã thực hiện được và vượt lên; model này được phát hành theo giấy phép MIT và rẻ hơn Opus mới nhất
- Các hạn chế chỉ áp dụng cho model Mỹ chỉ làm giảm lựa chọn của khách hàng Mỹ, chứ không ngăn được cạnh tranh từ các model mở ở nước ngoài; với Kimi K3 có chất lượng tương đương và giá thấp hơn, lý do tiếp tục trả tiền cho Claude ngày càng ít đi
So sánh chất lượng và giá của Kimi K3 với Claude
- Khi dùng Kimi K3 cùng Claude trong các công việc lập trình thông thường, model này cho thấy cùng tác vụ và chất lượng đầu ra, với lượng token sử dụng gần như tương đương
- Điều này trái với kỳ vọng rằng model mở sẽ cho kết quả cẩu thả hơn hoặc cần nhiều token hơn để có cùng câu trả lời
- Giá API của Kimi K3 là $3 cho 1 triệu token đầu vào và $15 cho 1 triệu token đầu ra
- Model cao cấp nhất của Claude có giá lần lượt là $10 và $50 cho cùng đơn vị
- Gói trả phí của Kimi bắt đầu từ $19/tháng, còn gói coding $39/tháng có hạn mức sử dụng rộng rãi hơn so với sản phẩm Claude ở mức giá tương tự
- Gói Claude có giới hạn sử dụng nghiêm ngặt, đến mức trong một ngày làm việc agent bình thường có thể hết hạn mức trước giờ ăn trưa
- Claude không duy trì được quyền truy cập Fable ở gói $20/tháng nên đã tắt tính năng này và chuyển sang Opus, nhưng các gói Kimi không có điều kiện tương tự
Chính sách AI của Mỹ và cạnh tranh từ model mở
- Trong khi chính phủ Mỹ làm chậm việc phát hành Fable và cả model cuối cùng cũng bị áp các hạn chế từ chối nhiều nhóm tác vụ, các model mở cấp frontier từ phòng thí nghiệm Trung Quốc có thể tải xuống, nằm ngoài phạm vi quản lý của chính phủ Mỹ
- Trong benchmark an ninh mạng của Semgrep, GLM 5.2 đã vượt Claude
- Model bị giới hạn đã từ chối tác vụ, còn model mở thì thực hiện được; khác biệt này ảnh hưởng đến kết quả
- GLM 5.2 được phát hành theo giấy phép MIT, và dù không tự quảng bá là model frontier, nó vẫn cho kết quả tốt hơn Opus mới nhất trong công việc thực tế, với chi phí thấp hơn nhiều
- GPT-5.6 của OpenAI cũng đã trải qua quy trình hạn chế của chính phủ, nhưng OpenAI có nhiều dư địa hơn Anthropic vì có thể cung cấp model chủ lực trong gói $20/tháng
- Trong tương lai, chính phủ Mỹ có thể áp dụng cách làm trợ cấp, cứu trợ tài chính và thuế quan bảo hộ từng dùng cho ngành ô tô vào AI và mã nguồn mở
- Thông qua hợp tác công-tư, họ có thể hỗ trợ các model nội địa chỉ được dùng trong nước Mỹ và không thể cạnh tranh quốc tế
- Kết quả là người dùng Mỹ có thể buộc phải mua model nội địa thay vì model chất lượng tốt nhất hoặc giá thấp nhất, và không thể dùng model tốt nhất với mức giá tốt nhất
1 bình luận
Ý kiến trên Hacker News
Dù đạt hiệu năng cùng hạng nhờ chưng cất hay tự phát triển độc lập ngay từ đầu, kết cục của các phòng thí nghiệm tuyến đầu ở Mỹ vốn đã được định sẵn từ đầu. Chưng cất không phải là tấn công, và các phòng thí nghiệm tuyến đầu cũng đã chưng cất tri thức do nhân loại viết vào mô hình, nên việc các phòng thí nghiệm đi sau nén nó thành mô hình rẻ hơn là một bước đi tự nhiên
Cũng không có cách thực tế nào để ngăn việc lưu lại hội thoại rồi dùng chúng để huấn luyện mô hình riêng, nên có vẻ đầu tư vào các công ty phần cứng hơn là công ty mô hình sẽ tốt hơn
Chỉ 6 tháng trước thôi, vẫn còn nhiều dự đoán rằng nếu dùng đầu ra của mô hình làm dữ liệu huấn luyện thì thảm họa học lặp vòng sẽ khiến mọi mô hình thất bại, nên không nên nói như thể điều đó đã rõ ràng ngay từ đầu
Chưng cất qua API chỉ hữu ích để nhanh chóng vượt qua cold start trong học tăng cường ở những lĩnh vực mới, còn điều thực sự quan trọng hơn là chất lượng và độ đa dạng của môi trường học tăng cường mà mô hình được huấn luyện trong đó
Mỹ vẫn chưa chọn kiểu kiểm soát đất hiếm như Trung Quốc, nhưng nếu chưng cất lan rộng thì ngay cả phía không làm vậy cũng có khả năng phải gánh chi phí quản lý như chặn truy cập hoặc kiểm soát quá mức. Cũng như việc người ta dễ dãi với sao chép âm nhạc nhưng lại nổi giận với nghệ thuật thị giác, cuối cùng việc xem đây là trộm cắp hay hoạt động kinh doanh thông thường vẫn phụ thuộc vào đồng thuận xã hội, và nếu không có đột phá lớn thì khoảng cách sẽ thu hẹp
Chúng ta đã đến điểm này nhanh hơn rất nhiều so với dự đoán. Tôi tự hỏi thế giới sẽ ra sao nếu chính phủ phương Tây coi việc tiếp cận mô hình tuyến đầu trọng số mở là rủi ro an ninh quốc gia và xếp việc sử dụng chúng vào hành vi khủng bố
Kimi K3 có thể trở thành kiểu Napster mà ai cũng dùng dù biết là bất hợp pháp, hoặc cũng có thể xuất hiện một thị trường ngầm kiểu cần sa nơi ai đó trong khu phố cho thuê theo công-tơ dàn máy 8×5090 đặt ở tầng hầm được lắp từ linh kiện mua trên eBay. Ngược lại, nếu việc kiểm soát thành công, lựa chọn công khai có thể chỉ còn Cohere·Mistral đã bị làm yếu đi, và người ta có thể phải trả giá đắt cho các mô hình ‘American Frontier’ của Anthropic·OpenAI đang tụt lại sau Trung Quốc
Giống như Kindle Fire từng được trợ giá bằng quảng cáo, cũng có thể xuất hiện Kindle AI bán ảnh hưởng cho người trả giá cao nhất, để tuyên truyền của các công ty thuốc lá đi vào pipeline huấn luyện và LLM nói rằng hút thuốc có lợi cho sức khỏe
Gần đây chính phủ Mỹ đã tuyên bố các hạn chế với hợp tác khoa học của NSF tương tự Wolf Amendment và chuyển thẩm quyền sang phía quân sự, đồng thời lôi kéo nhiều quốc gia vào một Pax Silica nhằm loại trừ Trung Quốc, trong khi lại định ép các nước đồng minh dùng sản phẩm nội địa bị hạn chế tính năng. Có thể vẫn sẽ còn những khu vực trung lập như Thụy Sĩ hay Singapore, nơi người dùng Mỹ·EU có thể sử dụng bên kia bức màn mà không chịu bất lợi pháp lý
https://nitter.net/RnaudBertrand/status/2069574934972797089
Khi giao cho Kimi K3 tác vụ mà tôi thường thử với mọi mô hình, nó suy nghĩ lâu hơn rất nhiều và gần như dùng hết lượng sử dụng trong 5 giờ của gói 19 đô la. Làm cùng tác vụ đó trên gói 20 đô la của OpenAI chỉ mất vài phút và mức sử dụng hầu như không giảm.
Giới hạn thuê bao khó đo lường vì không cung cấp con số có thể so sánh như token, nhưng đây là lần đầu tôi thấy một gói thuê bao tầm 20 đô la chặt đến mức chỉ một tác vụ nhỏ đã ăn mất lượng sử dụng dành cho công việc thực tế. Dù chậm và chi phí trên mỗi tác vụ có vẻ cao, nó vẫn tìm ra lỗi mà Gemini 3.5 Flash tự ý tạo ra
Khi tôi bảo GLM 5.2 chuyển khoảng 50 dòng JavaScript sang Python, nó cũng lặp lại việc tìm kiếm web và rà soát lại, tiêu tốn 0,25 đô la phí API; lần chạy đầu thất bại nhưng lần thứ hai thì hoạt động. Claude Code/Fable nhanh hơn nhiều nhưng mắc cùng lỗi, và tôi hy vọng việc tự rà soát quá mức của các mô hình mở sẽ giảm bớt hoặc cách viết prompt sẽ được cải thiện
Các mô hình Trung Quốc vẫn chưa đạt tiêu chuẩn này và dường như tập trung tối đa hóa điểm benchmark hơn là hiệu quả
max, nhưng sẽ sớm cung cấp các mức khác. Trong lịch sử theo dõi benchmark có rất nhiều lần quay lại và sự bất định kiểu “khoan đã, nhưng…”, và GPT 5.6 cùngxhigh·maxcủa Fable cũng có hiện tượng tương tự dù ở mức nhẹ hơn.Nếu hỗ trợ cường độ suy luận thấp hơn, khả năng cao tình trạng kém hiệu quả về token sẽ được cải thiện
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-reviewtrong một phiên sạch ở terminal riêng, vậy mà mức sử dụng tăng vọt lên 99% dù không có thay đổi mã nào, và với 1% còn lại nó thậm chí không viết nổireview.md.Bình thường việc review dùng 10~20%, nhưng đôi khi 65~69% biến mất chỉ trong 15 phút, tức là độ biến động mức sử dụng là cực lớn
Ở gói trả phí của Kimi, độ dài ngữ cảnh 1 triệu token chỉ có từ mức 79 đô la/tháng trở lên; các mức thấp hơn bị giới hạn ở 256 nghìn token. Gói thấp nhất hiện tại là 15 đô la/tháng theo giá giảm khi thanh toán hằng năm thì không hỗ trợ chính K3.
https://www.kimi.com/code/docs/en/kimi-code/models.html
Tôi lại nghĩ là ngược lại. Kimi K3 có 2,8 nghìn tỷ tham số; quy mô của ChatGPT 5.6 hay Opus 4.8 chưa được công bố nhưng có thể tương tự, còn Fable·Mythos thì có tin đồn là khoảng 10 nghìn tỷ.
Giá input/output trên mỗi triệu token của K3 là 3 đô la·15 đô la, ChatGPT 5.6 Sol là 5 đô la·30 đô la, Opus 4.8 là 5 đô la·25 đô la, nên chênh lệch không lớn. Đây giống mức hội tụ về cùng hiệu năng rồi bán rẻ hơn đôi chút hơn là một bước ngoặt lịch sử. Trọng số K3 hiện cũng chưa công khai nên có vẻ tình hình sẽ không thay đổi
Ngay cả trong thread này, hiệu dụng thực tế của Kimi cũng gây chia rẽ. Cá nhân tôi thấy nó kém hơn Fable và 5.6 Sol, nhưng trọng tâm của cuộc thảo luận dường như gần với phản ứng trước động thái quản lý của chính phủ Mỹ hơn là hiệu năng.
Có vẻ vì sự giận dữ và thất vọng với tình hình hiện tại nên cũng tồn tại tâm lý mong muốn Kimi phải tốt hơn
Điều này phụ thuộc rất lớn vào loại tác vụ và cách sử dụng, nhưng nhận định rằng K3 không cùng đẳng cấp với các mô hình tiên tiến nhất của Mỹ thì không khớp với trải nghiệm sử dụng của tôi
Ở đây cần làm rõ ‘Claude’ là Opus hay Fable, và cường độ suy luận đang ở mức nào
Cách diễn đạt ban đầu không chính xác, và tôi cũng không dùng Fable hay K3 trong phần lớn thời gian; thường tôi chỉ để chúng xử lý các tác vụ có phạm vi nhỏ rồi tự mình rà soát
Chính sách xử lý dữ liệu cá nhân cũng không phải vấn đề nhỏ. Họ nói rằng nếu dùng gói đăng ký Kimi thì các tương tác sẽ được dùng để huấn luyện mô hình, còn chỉ khi dùng API trực tiếp với mức giá API thì mới không dùng. Có tin điều đó hay không lại là chuyện khác
Tôi định chờ đến khi có nhà cung cấp khác xuất hiện trên OpenRouter rồi mới đánh giá mức độ đáng tin. Dù không quá tin họ, nếu là nhà cung cấp không trực tiếp huấn luyện mô hình thì khả năng dữ liệu bị dùng để huấn luyện cũng sẽ thấp hơn
99% người dùng không xử lý tài sản trí tuệ đặc biệt nào đáng phải lo
Rốt cuộc cho đến giờ thì tất cả vẫn chỉ là chưng cất. Như Suhail đã nói, phải đưa lợi nhuận của mô hình AI về gần như 0
Vì chúng được huấn luyện trên dữ liệu của nhân loại, nên chúng phải là món quà dành lại cho chính nhân loại, và chỉ như vậy mới ngăn được việc thiểu số kiểm soát nhân loại
Các mô hình mã nguồn mở đã đạt tới cấp độ của những mô hình thương mại tốt nhất. Nút thắt cuối cùng là phần cứng, nhưng ngưỡng đó cũng đang giảm rất nhanh
Việc chạy Kimi K3 tại nhà vẫn cực kỳ tốn kém, nhưng đã có nhiều mô hình miễn phí đủ năng lực có thể chạy trên phần cứng vừa phải, và xu hướng này sẽ tiếp tục