- So sánh Kimi K3 và Fable 5 trên khoảng 1.030 tác vụ agent cho thấy định tuyến theo từng tác vụ đạt chất lượng cao hơn từng mô hình riêng lẻ với độ chính xác 93%
- Hiệu năng tổng thể trên các tác vụ SWE, terminal, thuật toán, đa ngôn ngữ và pháp lý là tương đương, nhưng những mảng tác vụ mà hai mô hình thể hiện thế mạnh lại khác nhau
- Định tuyến oracle đã gán 72~96% tác vụ cho K3, và K3 có hiệu quả chi phí tốt hơn Fable ở cả 5 nhóm tác vụ
- Trong các vòng lặp agent dài, K3 cho thấy hiệu quả chi phí cao hơn tới khoảng 50 lần so với chỉ dùng Fable, nhưng số bước thực thi nhiều hơn có thể làm thời gian xử lý kéo dài
- Router tùy biến theo workload với mô hình mở giá rẻ làm mặc định và chuyển các tác vụ khó sang mô hình khác có thể đồng thời cải thiện chất lượng lẫn chi phí
Đo lường bằng các tác vụ agent thực tế
- Kimi K3 và Fable 5 được chạy trên cùng một harness để thực hiện khoảng 1.030 tác vụ theo dạng vòng lặp agent thực tế
- SWE: 460 tác vụ tương tự sửa lỗi trong kho mã thực tế
- Terminal: 89 tác vụ agent dài hạn về bảo mật, mật mã học, reverse engineering, quản trị hệ thống, v.v.
- Thuật toán: 100 bài toán kiểu LeetCode·AtCoder
- Đa ngôn ngữ: 225 tác vụ triển khai bằng 6 ngôn ngữ
- Pháp lý: 120 tác vụ agent pháp lý được luật sư chấm điểm
- Kết quả benchmark trên nhiều loại tác vụ được lấy trung bình để so sánh hai mô hình
Ý nghĩa và giới hạn của định tuyến oracle
- Định tuyến oracle là cách đo lường mang tính lý thuyết: chạy từng tác vụ trên tất cả mô hình rồi chọn mô hình rẻ nhất trong số những lựa chọn cho ra đáp án đúng
- Router thực tế không thể chạy trước tác vụ trên nhiều mô hình, nên phải dự đoán trước mô hình có cân bằng tốt nhất giữa chi phí và chất lượng
- Theo cách này, 72~96% tổng số tác vụ được chọn cho K3
- Có thể xây dựng router để phân biệt giữa các tác vụ thường ngày và những tác vụ đuôi dài cần mô hình hàng đầu
- Để khẳng định điều này, cần thêm dữ liệu định tuyến ở quy mô gấp 10 lần thay vì chỉ mức một chữ số, cùng với kiểm chứng hiệu năng trong môi trường thực tế
Hiệu năng tổng thể tương đương nhưng thế mạnh khác nhau
- Kết quả SWE tiêu biểu gần như ngang nhau: K3 92,4%, Fable 92,6%
- Trên cả 5 loại tác vụ, chênh lệch giữa hai mô hình chủ yếu chỉ trong vài điểm phần trăm, và Fable nhỉnh hơn đôi chút ở mảng lập trình đa ngôn ngữ
- Dù điểm tổng thể tương tự, ở các tác vụ chi tiết mỗi mô hình lại cho thấy những mảng vượt trội rất rõ
Khác biệt theo từng mảng tác vụ
- Khi chia SWE theo nhóm bài toán, K3 vượt trội ở toán ký hiệu và công cụ phát triển, còn Fable tốt hơn ở web và trực quan hóa dữ liệu
- Trong các tác vụ đa ngôn ngữ, Fable dẫn trước ở Java·Python·C++, còn K3 ngang ngửa ở JavaScript·Rust
- Với các tác vụ terminal dài hạn phải thao tác shell hàng chục lần, K3 thể hiện thế mạnh
- K3 giải được các bài về hash 7z, phân tích mật mã FEAL, bí mật bị rò rỉ, lỗ hổng thực tế và tác vụ bất đồng bộ mất kiểm soát mà Fable không giải được
- Khi so sánh đồng thời độ chính xác và chi phí, Fable dẫn ở đa ngôn ngữ, K3 dẫn ở terminal và pháp lý, còn các mảng khác nhìn chung tương đương
Cấu trúc tạo ra chênh lệch chi phí
- Lợi thế chi phí của K3 đến từ giá token, prompt caching và lượng tài nguyên đưa vào cho từng tác vụ
- Với mỗi tác vụ SWE, K3 dùng khoảng 55 lượt và 1,3 triệu token, trong khi Fable dùng khoảng 21 lượt và 130 nghìn token
- Ở các tác vụ terminal dài, ngược lại Fable dùng tới khoảng 64 lượt và 1,5 triệu token, đôi khi còn chạm timeout
- Dù K3 đọc nhiều token hơn 10 lần trong SWE, cache hit của prompt giúp chi phí chạy vẫn thấp hơn Fable
- Khi số bước thực thi tăng lên, thời gian xử lý thực tế có thể dài hơn
- Với các tác vụ cần trả lời trong vòng 2 giây, độ trễ là yếu tố quan trọng
- Với agent nền quy mô lớn, hóa đơn chi phí thấp hơn lại quan trọng hơn
Kết quả khi kết hợp hai mô hình
- Nếu chuyển từng tác vụ sang mô hình phù hợp hơn, có thể đạt hiệu năng cao hơn từng mô hình đơn lẻ chứ không chỉ ở mức trung gian giữa hai mô hình
- Định tuyến oracle theo tác vụ luôn cho hiệu năng cao hơn chạy từng mô hình riêng lẻ, và độ chính xác tổng thể đạt 93%
- Dù gửi 72~96% lưu lượng sang K3 là mô hình tối ưu về chi phí, chất lượng tổng thể vẫn cao hơn từng mô hình, còn chi phí thì gần với chỉ dùng K3
- K3 có hiệu quả chi phí tốt hơn Fable ở cả 5 nhóm tác vụ, và trong các vòng lặp agent dài đã ghi nhận hiệu quả chi phí cao hơn tới khoảng 50 lần
Định tuyến theo workload thay vì một mô hình duy nhất
- Định tuyến Kimi K3 và Fable cùng nhau có thể tận dụng các thế mạnh khác nhau đồng thời giảm chi phí
- Vì mỗi mô hình có mức giá và lĩnh vực chuyên môn khác nhau, AI chất lượng cao nhất có thể đến từ sự kết hợp của nhiều mô hình thay vì một nhà cung cấp duy nhất
- Có thể dùng mô hình mở như K3 làm lựa chọn mặc định, khi chi phí thấp hơn tới 50 lần và oracle phân phần lớn lưu lượng cho nó
- Router cần được thiết kế theo workload thực tế và phải liên tục học mối quan hệ phù hợp giữa tác vụ và mô hình
1 bình luận
Ý kiến trên Hacker News
Nếu trực tiếp chạy và thử nghiệm thì tất cả các mô hình này đều overfit vào benchmark. Dù có tiệm cận các mô hình hàng đầu ở một vài chỉ số, chúng vẫn sụp đổ trong công việc thực tế và hiệu quả token cũng thấp đến vô lý
Fireworks kiếm được lợi lớn từ việc host K3, không giống các mô hình đóng, nên có động cơ rất lớn để đặt tiêu đề như vậy
Dù vậy, chúng vẫn gần tương đương với các mô hình hàng đầu của thế hệ trước là Opus 4.8 và GPT 5.5, và cũng có thể so sánh tại https://senko.net/vibecode-bench/
Tôi đã dùng API chính thức và công cụ lập trình tương ứng của từng mô hình để yêu cầu chúng xây một web app đơn giản nhưng không hề dễ chỉ từ đặc tả chi tiết; kết quả của K3, Qwen 3.8 và Fable gần như ngang nhau trong thử nghiệm người dùng, và trong phần review code của Sol thì cả ba đều đạt yêu cầu, với Fable nhỉnh hơn đôi chút
Trong công việc thực tế tôi vẫn ưu tiên Opus 4.8 và Sol, nhưng nếu cần phương án thay thế thì K3 và Qwen 3.8 cũng hoàn toàn dùng được
Tôi chủ yếu đánh giá năng lực lập trình trong môi trường đa tác nhân mở, nơi các agent ảnh hưởng lẫn nhau và không có bộ đáp án chuẩn; tại đó, các mô hình Trung Quốc thường cho kết quả thấp hơn các mô hình Mỹ so với những gì model card quảng bá
Kimi K3 là ngoại lệ vì thật sự khá gần nhóm dẫn đầu, nhưng rất chậm. Muse Spark 1.1 mạnh chỉ sau Fable và Sol, đồng thời có hiệu quả chi phí cao nhất, tạo nên cú lật ngược lớn kể từ Llama 4. Dữ liệu ở https://gertlabs.com/rankings
Chất lượng code ngang với mức tôi tự viết, và ở những mảng tôi không quen thì còn tốt hơn. Nó cũng làm đều đặn các việc mà con người hay trì hoãn hoặc thấy chán như refactor, kiểm thử tích hợp/hồi quy, kiểm tra audit log và cảnh báo lỗi, nên nâng mặt bằng kỹ thuật phần mềm tổng thể lên
Đây là một dịch vụ Rails chạy production tương đối phức tạp dùng PostgreSQL; với gói Max 200 USD/tháng, ngân sách token không thành vấn đề và chi phí hoàn toàn xứng đáng
Việc họ thử Kimi K3 và Fable trên khoảng 1.000 tác vụ chia thành 5 lĩnh vực như kỹ thuật phần mềm và pháp lý khá thú vị
Họ đặt phía trước một mô hình router để dự đoán mô hình nào sẽ rẻ hơn trong việc đưa ra đáp án đúng, và cuối cùng thì có lẽ phải tiếp tục huấn luyện nó trên chính workload của từng bên
Router đã chọn Kimi cho 72~96% tác vụ tùy lĩnh vực, và đạt mức tiết kiệm chi phí từ 1,5 đến 50 lần tùy mảng
Đây chỉ là giả định của Fireworks rằng có thể tiết kiệm chi phí nếu tồn tại một router dự đoán trước được cùng kết quả đó, và chính sự tồn tại của router này là tiền đề lớn
Nếu là mô hình trò chuyện như con người, tôi sẵn sàng chấp nhận giảm 5% điểm benchmark
LOLkhông chỉ buồn cười mà còn có hạiVí dụ, nó đã xuất một hướng dẫn dài cho bài báo dưới dạng một dòng dày đặc gồm các mệnh lệnh rời rạc như “giờ hãy lướt qua một lượt và đọc Part II rồi tham khảo lại”, kèm từ khóa in đậm và mũi tên nối chằng chịt
Anthropic trông như Đế chế La Mã đang được tua nhanh, dường như đã qua đỉnh và bước vào giai đoạn suy tàn trước cả khi IPO
Tôi muốn biết quản trị dữ liệu và bảo vệ quyền riêng tư được áp dụng thế nào khi đăng ký gói lập trình Kimi K3. Tôi muốn chuyển từ Anthropic
Không giống Claude, không có quyền chọn từ chối sử dụng cho việc huấn luyện mô hình, và theo điều khoản thì Kimi có thể dùng mã của khách hàng để huấn luyện
Nếu không muốn làm việc trực tiếp với công ty Trung Quốc, AtlasCode 20 USD/tháng, OpenCode Go 10 USD/tháng, và Cline Pass 10 USD/tháng cung cấp mức sử dụng cao hơn 2~6 lần trên một số mô hình trọng số mở phổ biến
Cá nhân tôi đăng ký Z.ai với giá 17 USD/tháng và trả phí API trực tiếp cho từng nhà cung cấp gốc của MiMo v2.5, Hy3, Qwen 3.7 Plus và DeepSeek v4
Tôi tự hỏi liệu người ta có thể được trả tiền để viết những bài như thế này nhằm quảng bá mô hình mở hay không, và nếu có thì mục đích là gì
Theo kinh nghiệm làm với FastAPI·Python và Spring Boot·Java trong các sản phẩm SaaS hiện đại, mô hình mở vừa giỏi vừa hiệu quả duy nhất là Qwen 3.7 Max
GLM 5.2 và Kimi thường lục lọi codebase suốt gần 70.000~80.000 token trước khi viết mã rồi cuối cùng vẫn làm hỏng mã. Chúng chỉ làm tốt nếu được cung cấp đặc tả cực kỳ chi tiết như cách đây 1 năm, còn Qwen 3.7 thì hoàn thành công việc mà không cần tốn nhiều công sức
Tôi tự hỏi ở đây Kimi có điểm gì thật sự nổi trội hay không. Tôi biết giá của nó tương đương Sonnet 5, nên thắc mắc điều gì xảy ra nếu dùng Sonnet 5 và Fable hoặc dùng Grok 4.5 rẻ hơn
Tôi rất thích các mô hình Trung Quốc và chỉ dùng DeepSeek, giờ còn dùng Kimi K3 như một trợ lý lập kế hoạch rất tốt cho các tác vụ lập trình nâng cao
DeepSeek v4 Flash rất nhanh và xử lý gần như mọi việc tôi giao trong Rust, PostgreSQL, Angular và Terraform
Tôi tự host Bifrost làm cổng LLM, nhưng mong các hãng thay vì nạp tiền trước và tự động nạp lại thì sẽ tự động tính phí theo mức sử dụng thực tế hằng tháng hoặc hằng ngày như VPS. Tôi muốn chỉ trả đúng lượng dùng thay vì phải duy trì số dư tối thiểu không hoàn lại ở nhiều nhà cung cấp
OpenRouter có ích, nhưng tôi không thích chính dịch vụ này và các khoản phí cộng thêm
Kimi k2.5/6 chậm hơn, hiệu năng cũng kém hơn, lại hay gặp lỗi
engine overloaded; còn k3 suy nghĩ rất lâu nhưng kết quả không cải thiện rõ rệt. Tôi cho rằng có thể họ đã tạm thời lượng tử hóa mô hình vì áp lực tài nguyên tính toánGần đây tôi chủ yếu dùng DeepSeek v4 Pro và dùng GPT 5.5 khi cần mô hình mạnh. GLM 5.2 tốt ở một số việc nhưng rất tệ ở việc khác, còn các mô hình của Google hay Anthropic thì vẫn chưa gây ấn tượng
OpenRouter cung cấp gần như mọi mô hình ngay từ ngày phát hành, nhưng điểm hấp dẫn của Bifrost là nếu sau này rời OpenRouter thì không cần đụng vào phần còn lại của hệ thống kỹ thuật. Khi tự host trở nên khả thi, có thể giảm phụ thuộc vào OpenAI·Anthropic·OpenRouter, đồng thời giảm rủi ro mô hình mình phụ thuộc đột ngột bị khai tử
Đây là tình huống một công ty host mô hình mở nói rằng mô hình mở rất tuyệt
Đang tìm công cụ định tuyến hoặc nền tảng định tuyến tốt khác có thể dùng cùng Claude Code như bài viết đã mô tả. Biết rằng bộ định tuyến trong bài này theo kiểu oracle
Mỗi vai trò đều có bảng xếp hạng LLM được khuyến nghị từ nhiều nhà cung cấp; ví dụ dùng
Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5)làm bộ điều phối chính