- Kimi K3 là mô hình agent đa phương thức gốc với trọng số mở, có 2,8 nghìn tỷ tham số và ngữ cảnh 1.048.576 token, hỗ trợ coding dài hạn, công việc tri thức và suy luận
- Kết hợp Kimi Delta Attention (KDA), Attention Residuals và Stable LatentMoE, kích hoạt 16 chuyên gia cho mỗi token trong tổng số 896 chuyên gia, với hiệu quả scaling tổng thể cao hơn khoảng 2,5 lần so với Kimi K2
- Trong các đánh giá công khai, mô hình đạt GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1, nhưng cần cân nhắc cả sự khác biệt về harness, thiết lập suy luận và phần cứng giữa các mô hình
- Mô hình được huấn luyện nhận biết lượng tử hóa với trọng số MXFP4 và activation MXFP8, có thể chạy qua Transformers, vLLM, SGLang, Docker và API tương thích OpenAI·Anthropic
- Với hội thoại nhiều lượt và gọi công cụ, cần gửi lại nguyên vẹn toàn bộ thông điệp assistant mà API trả về, bao gồm
reasoning_contentvàtool_calls; mã nguồn và trọng số được phát hành theo Kimi K3 License
Kiến trúc và quy mô mô hình
- Kimi K3 là mô hình agent đa phương thức gốc với trọng số mở, được thiết kế cho coding dài hạn, công việc tri thức và suy luận
- Tổng số tham số là 2.8T, tham số hoạt động là 104B và gồm 93 lớp
- Sử dụng 1 lớp Dense, 69 lớp KDA và 24 lớp Gated MLA
- Attention hidden dimension là 7.168, có 96 attention head
- Stable LatentMoE chọn 16 chuyên gia cho mỗi token trong tổng số 896 chuyên gia và dùng 2 chuyên gia chia sẻ
- Latent MoE dimension là 3.584, MoE hidden dimension cho mỗi chuyên gia là 3.072
- So với Kimi K2, hiệu quả scaling tổng thể được cải thiện khoảng 2,5 lần
- Kích thước từ vựng là 160K, độ dài ngữ cảnh là 1.048.576 token, hàm kích hoạt là SiTU-GLU
- Dùng MoonViT-V2 với 401M tham số làm vision encoder
- Các tính năng chính gồm hiểu văn bản, hình ảnh và video, nhưng ở mục modality trong bảng tóm tắt mô hình chỉ ghi Text và Image
Coding dài hạn và công việc tri thức
- Có thể duy trì các phiên kỹ thuật dài với mức giám sát tối thiểu của con người, đồng thời khám phá kho mã lớn và điều phối công cụ terminal
- Hỗ trợ tối ưu hóa GPU kernel và phát triển compiler
- Cũng nhắm tới phát triển game có dùng thị giác, CAD và thiết kế chip
- Trong công việc tri thức dạng agent, mô hình tạo trực quan hóa tương tác, widget và dashboard cùng với nghiên cứu chuyên sâu
- Motion design và chỉnh sửa video cũng nằm trong phạm vi hỗ trợ
- Khuyến nghị dùng Kimi Code CLI làm framework agent coding; có thể chọn Kimi K3 bằng lệnh
/modeltrong terminal
Kết quả đánh giá
- Tất cả kết quả của Kimi K3 đều được đo với
reasoning_effort="max", temperature 1.0- Các tác vụ một bước như GPQA Diamond, HLE-Full, hay đánh giá thị giác không dùng công cụ dùng top-p 0.95
- Các tác vụ agent dùng top-p 1.0
- Trong đánh giá suy luận và tri thức, mô hình đạt GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7
- HLE-Full là 43.5 khi không dùng công cụ và 56.0 khi có dùng công cụ
- Trong đánh giá coding, mô hình đạt ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2
- DeepSWE là 67.5 trên harness Kimi Code và 67.3 trên harness mini-SWE-agent
- SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9
- Trong đánh giá agent, mô hình đạt BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8
- Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2
- Trong đánh giá thị giác, mô hình đạt OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1
- MMMU-Pro là 81.6 khi không dùng công cụ và 83.4 khi có dùng công cụ
- MathVision tăng từ 94.3 lên 97.8 khi dùng Python
- ZeroBench pass@5 tăng từ 23.0 lên 41.0 khi dùng công cụ
Điều kiện đánh giá và hạn chế khi so sánh
- Các mô hình được đem so sánh gồm Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2, nhưng harness đánh giá có thể khác nhau giữa từng mô hình
- Kimi K3 chủ yếu dùng Kimi Code hoặc Claude Code
- Dòng GPT chủ yếu dùng Codex, còn các mô hình Claude·GLM khác dùng Claude Code hoặc Terminus 2 v.v.
- SWE-Marathon được đánh giá trên một nhánh đã hiệu chỉnh theo H20, dựa trên các tác vụ tính đến ngày 9/7/2026 trước bản v1.1 cuối cùng
- Docker image, chuẩn hiệu năng GPU và oracle tham chiếu đã được hiệu chỉnh lại cho H20, nhưng không thay đổi bộ kiểm tra độ chính xác và chống gian lận
- Claude Fable 5 có fallback ở 35% tác vụ nên có thể bị ảnh hưởng bất lợi về hiệu năng đo được
- PostTrainBench là trung bình của 3 lần chạy với nỗ lực suy luận tối đa trên GPU H20 thay vì H100 của môi trường chính thức
- Kimi Code Bench 2.0 gồm cả các tác vụ an ninh mạng và an toàn
- Claude Fable 5 có 13 lần fallback và 1 lần từ chối trên 80 tác vụ
- GPT-5.6 Sol từ chối 10 tác vụ, GPT-5.5 từ chối 3 tác vụ
- BrowseComp 91.2 là kết quả dùng chiến lược nén ngữ cảnh hoạt động ở 300K token
- Nếu dùng toàn bộ cửa sổ 1M token mà không quản lý ngữ cảnh riêng thì đạt 90.4
- Các đánh giá đa phương thức, trừ ZeroBench, đều dùng trung bình của 3 lần chạy
- ZeroBench được chạy 5 lần theo thiết lập chính thức
- PerceptionBench là benchmark nội bộ đo khả năng nhận thức thị giác ở mức nguyên tử
Lượng tử hóa gốc
- Áp dụng huấn luyện nhận biết lượng tử hóa ngay từ giai đoạn SFT
- Dùng trọng số MXFP4 và activation MXFP8 nhằm hướng tới khả năng tương thích phần cứng rộng rãi
Cách triển khai và chạy
- Có thể truy cập Kimi API bằng cách chọn
kimi-k3; API này tương thích OpenAI·Anthropic - Trong Hugging Face Transformers, có thể tải bằng
pipeline("image-text-to-text", ...)hoặcAutoModel.from_pretrained(...)- Nếu muốn dùng mã mô hình tùy biến thì cần
trust_remote_code=True
- Nếu muốn dùng mã mô hình tùy biến thì cần
- Hỗ trợ phục vụ cục bộ bằng vLLM và SGLang
- Cả hai engine đều có thể xử lý yêu cầu văn bản và hình ảnh tại endpoint tương thích OpenAI
/v1/chat/completions
- Cả hai engine đều có thể xử lý yêu cầu văn bản và hình ảnh tại endpoint tương thích OpenAI
- Trong Docker Model Runner, chạy bằng
docker model run hf.co/moonshotai/Kimi-K3 - Mô hình cũng có thể được dùng trên HuggingChat, Google Colab và Kaggle
Cách dùng API để giữ trạng thái suy luận
- Kimi K3 có thinking mode luôn bật và trả về
reasoning_content - Trường yêu cầu cấp cao nhất
reasoning_efforthỗ trợ"low","high","max", mặc định là"max" - Hội thoại nhiều lượt và gọi công cụ phải tuân theo cách bảo toàn lịch sử suy nghĩ
- Cần gửi lại nguyên vẹn thông điệp assistant mà API trả về vào
messages - Không chỉ
contentmà cảreasoning_contentvàtool_callscũng phải được gồm vào
- Cần gửi lại nguyên vẹn thông điệp assistant mà API trả về vào
- Có thể xem thêm về đầu vào thị giác, structured output, partial mode, chọn công cụ, nạp công cụ động và context caching tại Kimi K3 Quickstart và Thinking Effort
Giấy phép
- Cả kho mã nguồn và trọng số mô hình đều được phát hành theo Kimi K3 License
2 bình luận
Mong là sẽ có nhà cung cấp trong nước cung cấp dịch vụ này.
Ý kiến trên Hacker News
Khi mức giá trung gian từ bên thứ ba cho mô hình 3 nghìn tỷ tham số được xác lập, ta sẽ có thể ước lượng chi phí phục vụ thực tế và liệu phòng lab có trợ giá token API hay không
Vì là MXFP4 native nên cần khoảng 1,5TB VRAM, sát giới hạn của 8×B200; nếu tính cả tối ưu độ dài ngữ cảnh và thông lượng thì thực tế có vẻ cần 16 card
Trên benchmark AISI về an ninh mạng, mô hình này cao hơn GLM 5.2 nhưng vẫn còn khoảng cách lớn so với các mô hình đóng tối tân, nên có thể cần tinh chỉnh. Cũng tò mò liệu Cursor có huấn luyện lại để so sánh trực tiếp với dòng Composer, vốn là bản tinh chỉnh Kimi 2.6/2.7, và Grok 4.5 hay không
Cũng đáng kỳ vọng khả năng tạo mô hình nhỏ bằng chưng cất tri thức đúng nghĩa, học toàn bộ phân phối xác suất. Đặc biệt DSV4-Kimi với chi phí phục vụ thấp có vẻ đầy hứa hẹn
Nếu cấu hình 3TB RAM bằng máy chủ 4U cũ và 32 thanh ECC DIMM 64GB thì dưới 30.000 USD, chênh lệch giá rất lớn so với dàn GPU thực thụ. Hiện chưa có trọng số full precision hay bản lượng tử hóa Q8/Q8-XL của Unsloth, nhưng để dùng cả ngữ cảnh rộng rãi thì có vẻ cần vượt 1.536GB, lên 2TB, và nếu được là 2,5~3TB
Q4 và Q6 nhiều khả năng là thỏa hiệp tệ nhất: vừa mất tri thức và độ chính xác, vừa chậm và khó tin cậy; nếu muốn chạy một mô hình thông minh nhưng chậm trên thiết bị ngân sách thấp thì tôi nghĩ cần Q8
Tôi đã làm proof of concept tại https://github.com/woct0rdho/transformers5-qwen3.5-recipe, trong đó có thể tinh chỉnh Qwen3.5-35B-A3B với 16GiB VRAM và DeepSeek-V4-Flash 284B-A13B với 90GiB VRAM mà không cần offload sang CPU. Nó cũng hoạt động tốt trên các hệ thống bộ nhớ hợp nhất như Strix Halo
Dù vậy, mô hình cỡ Kimi-K3 vẫn cần nhiều GPU và node, nên có nhiều vấn đề phải giải quyết hơn hẳn so với huấn luyện trên một GPU đơn
Phần thú vị hơn nhiều so với giá trong lần công bố này là khả năng tùy biến. Startup cũng có thể tải trọng số về, sửa đổi và tinh chỉnh; lợi thế thật sự nằm ở hiệu năng trên dữ liệu của chính họ và chủ quyền sở hữu trí tuệ, hơn là chi phí. Đây là thành quả lớn của đội Kimi
Tôi cảm thấy phần cứng để cá nhân chạy LLM đang được cấu hình không đúng với nhu cầu. Hoặc phải chịu 5~10 token/giây trên bộ nhớ hợp nhất, hoặc phải dùng card trung tâm dữ liệu tiêu thụ hàng trăm GB VRAM và hơn 1kW
Không có GPU bán chuyên với TDP 180~250W và VRAM 128GB hoặc 256GB; chỉ cần hai card như vậy cùng kết nối phổ biến cỡ NVLink thôi cũng đã khá hữu ích. Chạy Kimi K3 cục bộ sẽ cần homelab khổng lồ và rất tốn kém, nhưng sẽ thật tốt nếu có thể chạy GLM 5.2 khoảng 100 token/giây trong một phiên đơn, và khoảng 60 token/giây khi dùng nhiều sub-agent
Các số đo dự kiến khi chạy
llama-servermới nhất với--no-mmaplà DeepSeek-V4-Flash Q4_K_XL 178.175MiB, Q8_K_XL 184.636MiB, Laguna-S-2.1 Q8_K_X 172.860MiB, Qwen3.5-122B-A10B Q8_K_XL 170.038MiBĐiều này trái ngược với công việc desktop: chúng cũng gián đoạn, nhưng năng lực tính toán cần thiết đã đủ rẻ để ta có thể đặt trên bàn một dàn máy dư thừa đến mức quá mức khi nhàn rỗi
gpt-oss, khiến việc chạy mô hình mở trở nên khó khăn trong khi vẫn nói về dân chủ hóa, nên trông đặc biệt bất côngNếu có thể mua GPU vài nghìn USD, tôi sẽ mua với tư cách một người mê công nghệ có tiền, nhưng phải thừa nhận đó là món xa xỉ cực kỳ kém hiệu quả như xe thể thao. Điều thật sự đáng buồn là chúng ta không có công nghệ điện toán hay thể chế chính trị-xã hội để vận hành phần cứng chia sẻ theo cách đáng tin cậy
Theo giấy phép, nếu bên giữ giấy phép hoặc công ty liên kết vận hành mảng kinh doanh mô hình dạng dịch vụ và doanh thu cộng dồn trong 12 tháng liên tiếp vượt 20 triệu USD, họ phải ký hợp đồng riêng với Moonshot AI trước khi sử dụng phần mềm hoặc sản phẩm phái sinh cho mục đích thương mại
Có thể dùng tại https://app.fireworks.ai/models/fireworks/kimi-k3, giá là 3 USD cho mỗi 1 triệu token đầu vào không cache, 0,30 USD cho đầu vào cache và 15 USD cho đầu ra
Hiện độ trễ thấp hơn Moonshot đáng kể, nhưng lưu lượng sử dụng cũng thấp hơn nhiều nên còn phải xem có duy trì được không. Dù vậy, việc triển khai ngay trong ngày là rất ấn tượng
Do cạnh tranh, giá GLM 5.2 đã giảm khoảng 45% chỉ sau khoảng 1,5 tháng kể từ khi ra mắt ngày 16/6, và các nhà cung cấp mới vẫn đang cạnh tranh giá: https://openrouter.ai/z-ai/glm-5.2#providers
Về mặt kinh tế học, giá không phải là không được thấp hơn tổng chi phí, mà là không được thấp hơn chi phí biên; với một trung tâm dữ liệu có tỷ lệ sử dụng GPU thấp, con số này gần tương đương tiền điện. Tôi đoán do tình trạng dư thừa hạ tầng ở các trung tâm dữ liệu nhỏ và cạnh tranh, chẳng mấy chốc sẽ có nơi bán token thấp hơn cả mức cộng giữa tiền điện và khấu hao GPU
Khi hỏi “Tell me about yourself” trên Hugging Face, Kimi K3 trả lời rằng nó là Claude do Anthropic tạo ra, khá thú vị
Khuyến nghị nên tải xuống để lưu trữ các mô hình tuyến đầu. Dù là 1,5TB, để vào ổ đĩa rẻ tiền rồi seed torrent còn hữu ích hơn
Giống như trước đây từng cố kiểm soát các thuật toán mã hóa, mô hình cũng có thể bị chặn bằng quy định; phần mềm công khai phải được phân phối rộng rãi thì mới sống sót. Theo thời gian, nhờ đầu tư khổng lồ vào kỹ thuật và sản xuất phần cứng, việc chạy thực tế sẽ trở nên khả thi; sẽ thật đáng tiếc nếu đến lúc đó việc phân phối đã thành bất hợp pháp và phải trả chi phí do bị thao túng bởi quy định
Địa chỉ magnet là
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2FannounceSau khi xem xét giấy phép và thử trên phần cứng thực tế, có vẻ nhà cung cấp khó có thể đưa ra mức giá rẻ hơn Moonshot 60–70%. Có thể giảm nhẹ, nhưng nếu không hy sinh đáng kể tốc độ xử lý thì khó có mức chiết khấu như GLM
Biên lợi nhuận của Kimi được ước tính khoảng 40–50% ngay cả khi giả định họ thuê GPU với giá cao, và có thể cao hơn nếu dùng thiết bị tự sở hữu. Nhưng vẫn không đạt mức biên lợi nhuận trên 90% của Anthropic như một số người ước tính, và ngay cả biên lợi nhuận API 80% của Anthropic cũng đáng nghi
Nếu chỉ tính tiền điện là giá vốn thì 80–90% cũng có thể, nhưng nhìn vào số token mỗi giây hiện được cung cấp thì không dễ. Tôi chỉ thử trên B200 và không kiếm được B300; đây vốn đã là mô hình lượng tử hóa, cũng không dùng ngữ cảnh 1 triệu token, nên có vẻ không còn nhiều dư địa tối ưu bộ nhớ tức thì. Sẽ tốt nếu ai đó có quyền truy cập R100 có thể xác minh chi phí
Các nhà cung cấp lớn phải ký hợp đồng với Kimi, nên khó kỳ vọng mức giảm giá mạnh trong lúc Kimi còn là mô hình mở hàng đầu
Liên kết gốc trả về 404, nên tôi tò mò không biết nó đã bị chặn hay tự kiểm duyệt
Có lẽ sẽ có nhu cầu lưu trữ để phòng khả năng nó đột ngột biến mất do kiểm soát của chính phủ. Gần đây Trung Quốc cũng bắt đầu thảo luận về kiểm soát xuất khẩu mô hình, và giờ khi họ bắt đầu tung ra các mô hình tiên tiến nhất chứ không phải các mô hình tụt hậu, tình hình đã khác