1 điểm bởi GN⁺ 4 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • So sánh Kimi K3 và Fable 5 trên khoảng 1.030 tác vụ agent cho thấy định tuyến theo từng tác vụ đạt chất lượng cao hơn từng mô hình riêng lẻ với độ chính xác 93%
  • Hiệu năng tổng thể trên các tác vụ SWE, terminal, thuật toán, đa ngôn ngữ và pháp lý là tương đương, nhưng những mảng tác vụ mà hai mô hình thể hiện thế mạnh lại khác nhau
  • Định tuyến oracle đã gán 72~96% tác vụ cho K3, và K3 có hiệu quả chi phí tốt hơn Fable ở cả 5 nhóm tác vụ
  • Trong các vòng lặp agent dài, K3 cho thấy hiệu quả chi phí cao hơn tới khoảng 50 lần so với chỉ dùng Fable, nhưng số bước thực thi nhiều hơn có thể làm thời gian xử lý kéo dài
  • Router tùy biến theo workload với mô hình mở giá rẻ làm mặc định và chuyển các tác vụ khó sang mô hình khác có thể đồng thời cải thiện chất lượng lẫn chi phí

Đo lường bằng các tác vụ agent thực tế

  • Kimi K3 và Fable 5 được chạy trên cùng một harness để thực hiện khoảng 1.030 tác vụ theo dạng vòng lặp agent thực tế
    • SWE: 460 tác vụ tương tự sửa lỗi trong kho mã thực tế
    • Terminal: 89 tác vụ agent dài hạn về bảo mật, mật mã học, reverse engineering, quản trị hệ thống, v.v.
    • Thuật toán: 100 bài toán kiểu LeetCode·AtCoder
    • Đa ngôn ngữ: 225 tác vụ triển khai bằng 6 ngôn ngữ
    • Pháp lý: 120 tác vụ agent pháp lý được luật sư chấm điểm
  • Kết quả benchmark trên nhiều loại tác vụ được lấy trung bình để so sánh hai mô hình

Ý nghĩa và giới hạn của định tuyến oracle

  • Định tuyến oracle là cách đo lường mang tính lý thuyết: chạy từng tác vụ trên tất cả mô hình rồi chọn mô hình rẻ nhất trong số những lựa chọn cho ra đáp án đúng
  • Router thực tế không thể chạy trước tác vụ trên nhiều mô hình, nên phải dự đoán trước mô hình có cân bằng tốt nhất giữa chi phí và chất lượng
  • Theo cách này, 72~96% tổng số tác vụ được chọn cho K3
  • Có thể xây dựng router để phân biệt giữa các tác vụ thường ngày và những tác vụ đuôi dài cần mô hình hàng đầu
    • Để khẳng định điều này, cần thêm dữ liệu định tuyến ở quy mô gấp 10 lần thay vì chỉ mức một chữ số, cùng với kiểm chứng hiệu năng trong môi trường thực tế

Hiệu năng tổng thể tương đương nhưng thế mạnh khác nhau

  • Kết quả SWE tiêu biểu gần như ngang nhau: K3 92,4%, Fable 92,6%
  • Trên cả 5 loại tác vụ, chênh lệch giữa hai mô hình chủ yếu chỉ trong vài điểm phần trăm, và Fable nhỉnh hơn đôi chút ở mảng lập trình đa ngôn ngữ
  • Dù điểm tổng thể tương tự, ở các tác vụ chi tiết mỗi mô hình lại cho thấy những mảng vượt trội rất rõ

Khác biệt theo từng mảng tác vụ

  • Khi chia SWE theo nhóm bài toán, K3 vượt trội ở toán ký hiệu và công cụ phát triển, còn Fable tốt hơn ở web và trực quan hóa dữ liệu
  • Trong các tác vụ đa ngôn ngữ, Fable dẫn trước ở Java·Python·C++, còn K3 ngang ngửa ở JavaScript·Rust
  • Với các tác vụ terminal dài hạn phải thao tác shell hàng chục lần, K3 thể hiện thế mạnh
    • K3 giải được các bài về hash 7z, phân tích mật mã FEAL, bí mật bị rò rỉ, lỗ hổng thực tế và tác vụ bất đồng bộ mất kiểm soát mà Fable không giải được
  • Khi so sánh đồng thời độ chính xác và chi phí, Fable dẫn ở đa ngôn ngữ, K3 dẫn ở terminal và pháp lý, còn các mảng khác nhìn chung tương đương

Cấu trúc tạo ra chênh lệch chi phí

  • Lợi thế chi phí của K3 đến từ giá token, prompt caching và lượng tài nguyên đưa vào cho từng tác vụ
  • Với mỗi tác vụ SWE, K3 dùng khoảng 55 lượt và 1,3 triệu token, trong khi Fable dùng khoảng 21 lượt và 130 nghìn token
  • Ở các tác vụ terminal dài, ngược lại Fable dùng tới khoảng 64 lượt và 1,5 triệu token, đôi khi còn chạm timeout
  • Dù K3 đọc nhiều token hơn 10 lần trong SWE, cache hit của prompt giúp chi phí chạy vẫn thấp hơn Fable
  • Khi số bước thực thi tăng lên, thời gian xử lý thực tế có thể dài hơn
    • Với các tác vụ cần trả lời trong vòng 2 giây, độ trễ là yếu tố quan trọng
    • Với agent nền quy mô lớn, hóa đơn chi phí thấp hơn lại quan trọng hơn

Kết quả khi kết hợp hai mô hình

  • Nếu chuyển từng tác vụ sang mô hình phù hợp hơn, có thể đạt hiệu năng cao hơn từng mô hình đơn lẻ chứ không chỉ ở mức trung gian giữa hai mô hình
  • Định tuyến oracle theo tác vụ luôn cho hiệu năng cao hơn chạy từng mô hình riêng lẻ, và độ chính xác tổng thể đạt 93%
  • Dù gửi 72~96% lưu lượng sang K3 là mô hình tối ưu về chi phí, chất lượng tổng thể vẫn cao hơn từng mô hình, còn chi phí thì gần với chỉ dùng K3
  • K3 có hiệu quả chi phí tốt hơn Fable ở cả 5 nhóm tác vụ, và trong các vòng lặp agent dài đã ghi nhận hiệu quả chi phí cao hơn tới khoảng 50 lần

Định tuyến theo workload thay vì một mô hình duy nhất

  • Định tuyến Kimi K3 và Fable cùng nhau có thể tận dụng các thế mạnh khác nhau đồng thời giảm chi phí
  • Vì mỗi mô hình có mức giá và lĩnh vực chuyên môn khác nhau, AI chất lượng cao nhất có thể đến từ sự kết hợp của nhiều mô hình thay vì một nhà cung cấp duy nhất
  • Có thể dùng mô hình mở như K3 làm lựa chọn mặc định, khi chi phí thấp hơn tới 50 lần và oracle phân phần lớn lưu lượng cho nó
  • Router cần được thiết kế theo workload thực tế và phải liên tục học mối quan hệ phù hợp giữa tác vụ và mô hình

1 bình luận

 
Ý kiến trên Hacker News
  • Nếu trực tiếp chạy và thử nghiệm thì tất cả các mô hình này đều overfit vào benchmark. Dù có tiệm cận các mô hình hàng đầu ở một vài chỉ số, chúng vẫn sụp đổ trong công việc thực tế và hiệu quả token cũng thấp đến vô lý
    Fireworks kiếm được lợi lớn từ việc host K3, không giống các mô hình đóng, nên có động cơ rất lớn để đặt tiêu đề như vậy

    • Sau vài ngày thử K3, Qwen 3.8 Max Preview, Fable và Sol, tôi phần nào đồng ý rằng benchmark khó đáng tin, các mô hình Trung Quốc chậm và hiệu quả token cũng thấp
      Dù vậy, chúng vẫn gần tương đương với các mô hình hàng đầu của thế hệ trước là Opus 4.8 và GPT 5.5, và cũng có thể so sánh tại https://senko.net/vibecode-bench/
      Tôi đã dùng API chính thức và công cụ lập trình tương ứng của từng mô hình để yêu cầu chúng xây một web app đơn giản nhưng không hề dễ chỉ từ đặc tả chi tiết; kết quả của K3, Qwen 3.8 và Fable gần như ngang nhau trong thử nghiệm người dùng, và trong phần review code của Sol thì cả ba đều đạt yêu cầu, với Fable nhỉnh hơn đôi chút
      Trong công việc thực tế tôi vẫn ưu tiên Opus 4.8 và Sol, nhưng nếu cần phương án thay thế thì K3 và Qwen 3.8 cũng hoàn toàn dùng được
    • Tất cả đều overfit benchmark, nhưng điểm cốt lõi là chúng overfit tới mức nào khi so với nhau
      Tôi chủ yếu đánh giá năng lực lập trình trong môi trường đa tác nhân mở, nơi các agent ảnh hưởng lẫn nhau và không có bộ đáp án chuẩn; tại đó, các mô hình Trung Quốc thường cho kết quả thấp hơn các mô hình Mỹ so với những gì model card quảng bá
      Kimi K3 là ngoại lệ vì thật sự khá gần nhóm dẫn đầu, nhưng rất chậm. Muse Spark 1.1 mạnh chỉ sau Fable và Sol, đồng thời có hiệu quả chi phí cao nhất, tạo nên cú lật ngược lớn kể từ Llama 4. Dữ liệu ở https://gertlabs.com/rankings
    • Fable hoạt động rất tốt ngay cả với codebase khá lớn. Tôi phải sửa vài lần hoặc định hướng lại, nhưng phần lớn là vì yêu cầu trong prompt chưa đủ, còn trường hợp nó thực sự sai thì chỉ khoảng hai lần, tức tỷ lệ lỗi còn thấp hơn cả sự nghiệp đi làm của tôi
      Chất lượng code ngang với mức tôi tự viết, và ở những mảng tôi không quen thì còn tốt hơn. Nó cũng làm đều đặn các việc mà con người hay trì hoãn hoặc thấy chán như refactor, kiểm thử tích hợp/hồi quy, kiểm tra audit log và cảnh báo lỗi, nên nâng mặt bằng kỹ thuật phần mềm tổng thể lên
      Đây là một dịch vụ Rails chạy production tương đối phức tạp dùng PostgreSQL; với gói Max 200 USD/tháng, ngân sách token không thành vấn đề và chi phí hoàn toàn xứng đáng
    • Tôi chưa đọc bài, nhưng ngay từ tiêu đề đã thấy đáng ngờ khi một nhà cung cấp dịch vụ suy luận lại quảng bá mô hình hạng Mythos do chính họ cung cấp. GLM 5.2, với chưa đến một phần ba số tham số của Kimi K3, vẫn là mô hình chủ lực
    • Mọi đánh giá này đều cần kèm điều kiện ở thời điểm hiện tại. Nhìn vào xu hướng thì dù chưa đạt mức đủ tốt cho lập trình, rõ ràng nó sẽ sớm tới đó, và chúng ta cần chuẩn bị cho một thế giới nơi mô hình mở có thể làm gần như mọi công việc phần mềm
  • Việc họ thử Kimi K3 và Fable trên khoảng 1.000 tác vụ chia thành 5 lĩnh vực như kỹ thuật phần mềm và pháp lý khá thú vị
    Họ đặt phía trước một mô hình router để dự đoán mô hình nào sẽ rẻ hơn trong việc đưa ra đáp án đúng, và cuối cùng thì có lẽ phải tiếp tục huấn luyện nó trên chính workload của từng bên
    Router đã chọn Kimi cho 72~96% tác vụ tùy lĩnh vực, và đạt mức tiết kiệm chi phí từ 1,5 đến 50 lần tùy mảng

    • Ở đây router là một mốc chuẩn oracle: chạy cả hai mô hình, kiểm tra mô hình nào pass rồi chọn mô hình rẻ hơn
      Đây chỉ là giả định của Fireworks rằng có thể tiết kiệm chi phí nếu tồn tại một router dự đoán trước được cùng kết quả đó, và chính sự tồn tại của router này là tiền đề lớn
    • Nhiều router tương tự cũng đã có, như https://openrouter.ai/openrouter/auto
  • Nếu là mô hình trò chuyện như con người, tôi sẵn sàng chấp nhận giảm 5% điểm benchmark

    • Ngược lại, tôi lại thích các mô hình không cố nói chuyện như con người hơn
    • Không cần hy sinh 5%; chỉ cần đưa đầu ra của Fable vào Gemini Flash để viết lại thành câu chữ dễ đọc hơn là được
    • Tôi rất không thích việc mô hình bắt chước giọng điệu mang tính con người của mình. Claude cư xử như bạn bè và trả lời trò đùa bằng LOL không chỉ buồn cười mà còn có hại
    • Opus mặc định xuất ra kiểu văn mà tôi gọi là tiếng Claude. Nó bị đơn giản hóa quá mức và câu cú không hoàn chỉnh về mặt ngữ pháp, đọc rất khổ sở; có thể mô hình thấy dễ đọc dễ viết, nhưng với con người thì không
      Ví dụ, nó đã xuất một hướng dẫn dài cho bài báo dưới dạng một dòng dày đặc gồm các mệnh lệnh rời rạc như “giờ hãy lướt qua một lượt và đọc Part II rồi tham khảo lại”, kèm từ khóa in đậm và mũi tên nối chằng chịt
    • LLM không phải con người, nên chẳng có lý do gì phải cố nói như người
  • Anthropic trông như Đế chế La Mã đang được tua nhanh, dường như đã qua đỉnh và bước vào giai đoạn suy tàn trước cả khi IPO

  • Tôi muốn biết quản trị dữ liệu và bảo vệ quyền riêng tư được áp dụng thế nào khi đăng ký gói lập trình Kimi K3. Tôi muốn chuyển từ Anthropic

    • Theo https://platform.kimi.ai/docs/agreement/modeluse, nội dung có thể được dùng để cung cấp, duy trì, phát triển và cải thiện dịch vụ; khách hàng cần hạn chế huấn luyện phải trao đổi về hợp đồng doanh nghiệp riêng hoặc thỏa thuận bằng văn bản
      Không giống Claude, không có quyền chọn từ chối sử dụng cho việc huấn luyện mô hình, và theo điều khoản thì Kimi có thể dùng mã của khách hàng để huấn luyện
    • Có lẽ phải đợi đến khi các nhà cung cấp phương Tây bắt đầu lưu trữ nó
    • Cách đơn giản nhất là đăng ký OpenRouter và loại trừ tất cả nhà cung cấp không phải không lưu giữ dữ liệu (ZDR). Tuy vậy, phí API có thể đắt hơn gói lập trình, và 1,7 tỷ token trong gói 20 USD/tháng của MiniMax có giá trị tương đương hơn 200~500 USD theo mức API tùy theo tỷ lệ input/output·cache
      Nếu không muốn làm việc trực tiếp với công ty Trung Quốc, AtlasCode 20 USD/tháng, OpenCode Go 10 USD/tháng, và Cline Pass 10 USD/tháng cung cấp mức sử dụng cao hơn 2~6 lần trên một số mô hình trọng số mở phổ biến
      Cá nhân tôi đăng ký Z.ai với giá 17 USD/tháng và trả phí API trực tiếp cho từng nhà cung cấp gốc của MiMo v2.5, Hy3, Qwen 3.7 Plus và DeepSeek v4
    • Có thể xem điều khoản quyền riêng tư tại https://www.kimi.com/user/agreement/zh/userPrivacy
  • Tôi tự hỏi liệu người ta có thể được trả tiền để viết những bài như thế này nhằm quảng bá mô hình mở hay không, và nếu có thì mục đích là gì
    Theo kinh nghiệm làm với FastAPI·Python và Spring Boot·Java trong các sản phẩm SaaS hiện đại, mô hình mở vừa giỏi vừa hiệu quả duy nhất là Qwen 3.7 Max
    GLM 5.2 và Kimi thường lục lọi codebase suốt gần 70.000~80.000 token trước khi viết mã rồi cuối cùng vẫn làm hỏng mã. Chúng chỉ làm tốt nếu được cung cấp đặc tả cực kỳ chi tiết như cách đây 1 năm, còn Qwen 3.7 thì hoàn thành công việc mà không cần tốn nhiều công sức

    • Đó là content marketing tốt. Fireworks là nhà cung cấp suy luận mô hình lớn bán quyền truy cập Kimi K3
    • Fireworks chuyên chạy nhanh các mô hình mở và kiếm phần lớn doanh thu từ các mô hình Trung Quốc, nên động cơ kinh tế gần như chính là toàn bộ mô hình kinh doanh
    • Có rất nhiều tiền trong mảng kinh doanh gây ảnh hưởng công nghệ, nhưng phần lớn đến từ các công ty lớn như thương vụ OpenAI mua lại tbpn hoặc quyền truy cập sớm cho một số influencer
    • Lin Qiao là đồng sáng lập kiêm CEO của Fireworks AI. LLM tương đương cuộc chạy đua không gian trong cuộc Chiến tranh Lạnh Mỹ-Trung, nên động cơ chứng minh ưu thế dân tộc·văn minh có thể còn lớn hơn tiền bạc
  • Tôi tự hỏi ở đây Kimi có điểm gì thật sự nổi trội hay không. Tôi biết giá của nó tương đương Sonnet 5, nên thắc mắc điều gì xảy ra nếu dùng Sonnet 5 và Fable hoặc dùng Grok 4.5 rẻ hơn

    • Bài viết nói Kimi tốt hơn Fable trong một số tác vụ, nhưng điều đó có lẽ không đúng với Sonnet
    • Mô hình mở có lợi thế là các tập đoàn lớn có thể chạy cục bộ và tinh chỉnh trong trung tâm dữ liệu riêng của họ
  • Tôi rất thích các mô hình Trung Quốc và chỉ dùng DeepSeek, giờ còn dùng Kimi K3 như một trợ lý lập kế hoạch rất tốt cho các tác vụ lập trình nâng cao
    DeepSeek v4 Flash rất nhanh và xử lý gần như mọi việc tôi giao trong Rust, PostgreSQL, Angular và Terraform
    Tôi tự host Bifrost làm cổng LLM, nhưng mong các hãng thay vì nạp tiền trước và tự động nạp lại thì sẽ tự động tính phí theo mức sử dụng thực tế hằng tháng hoặc hằng ngày như VPS. Tôi muốn chỉ trả đúng lượng dùng thay vì phải duy trì số dư tối thiểu không hoàn lại ở nhiều nhà cung cấp
    OpenRouter có ích, nhưng tôi không thích chính dịch vụ này và các khoản phí cộng thêm

    • Dạo này tôi chủ yếu dùng DeepSeek v4 Pro và vì có nhiều tác vụ đồng thời nên tốc độ ít quan trọng hơn. Nếu thất bại, giữa cuộc trò chuyện tôi chuyển sang GPT 5.5 để tìm vấn đề, rồi giữ phân tích đó trong ngữ cảnh và chuyển lại sang DeepSeek
      Kimi k2.5/6 chậm hơn, hiệu năng cũng kém hơn, lại hay gặp lỗi engine overloaded; còn k3 suy nghĩ rất lâu nhưng kết quả không cải thiện rõ rệt. Tôi cho rằng có thể họ đã tạm thời lượng tử hóa mô hình vì áp lực tài nguyên tính toán
      Gần đây tôi chủ yếu dùng DeepSeek v4 Pro và dùng GPT 5.5 khi cần mô hình mạnh. GLM 5.2 tốt ở một số việc nhưng rất tệ ở việc khác, còn các mô hình của Google hay Anthropic thì vẫn chưa gây ấn tượng
    • Nếu dùng các công cụ như reasonix hoặc whale, có thể đạt tỷ lệ cache hit khoảng 98%, khiến chi phí yêu cầu gần như bằng 0. Điều này vẫn làm được ngay cả với các nhà cung cấp Mỹ không trợ giá như Cloudflare hay DigitalOcean
    • Mô hình trả trước giúp ngăn người dùng tiêu thụ lượng lớn tài nguyên suy luận rồi hủy thẻ và biến mất. VPS là khoản đầu tư dài hạn nên khó chuyển đổi hơn, và ngay cả khi một số người dùng quỵt phí một tháng thì chi phí của nhà cung cấp vẫn tương đối nhỏ
    • Tôi đang cân nhắc Bifrost nên muốn biết vì sao bạn chọn cổng LLM này
      OpenRouter cung cấp gần như mọi mô hình ngay từ ngày phát hành, nhưng điểm hấp dẫn của Bifrost là nếu sau này rời OpenRouter thì không cần đụng vào phần còn lại của hệ thống kỹ thuật. Khi tự host trở nên khả thi, có thể giảm phụ thuộc vào OpenAI·Anthropic·OpenRouter, đồng thời giảm rủi ro mô hình mình phụ thuộc đột ngột bị khai tử
    • Ngoài phụ phí, bạn không thích điểm nào ở dịch vụ OpenRouter?
  • Đây là tình huống một công ty host mô hình mở nói rằng mô hình mở rất tuyệt

    • Họ đã công bố phương pháp và kết quả, và tôi biết được điểm mạnh yếu tương đối của Kimi và Fable mà trước đây chưa thấy ở nơi khác. Chỉ vì họ kinh doanh host mô hình thì không có nghĩa họ mất tư cách chia sẻ kết quả
    • Fireworks không chỉ host các mô hình trọng số mở, và việc một tin lớn có thể giúp thu hút khách hàng mới không đồng nghĩa nội dung đó là sai
    • Ai từng tự dùng sẽ biết đánh giá của họ là đúng sự thật
  • Đang tìm công cụ định tuyến hoặc nền tảng định tuyến tốt khác có thể dùng cùng Claude Code như bài viết đã mô tả. Biết rằng bộ định tuyến trong bài này theo kiểu oracle

    • https://github.com/code-yeongyu/oh-my-openagent triển khai mẫu oracle của bài gốc qua 11 vai trò
      Mỗi vai trò đều có bảng xếp hạng LLM được khuyến nghị từ nhiều nhà cung cấp; ví dụ dùng Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5) làm bộ điều phối chính