- Kimi K3-256k là mô hình dùng cho lập trình hằng ngày, duy trì chất lượng kết quả của K3 trong ngữ cảnh 256k, đồng thời chỉ tiêu thụ khoảng một nửa hạn mức so với
k3ngữ cảnh 1M - Kimi Code cung cấp K3 và K2.7 Code dưới 4 model ID;
k3hỗ trợ 2,8T tham số và ngữ cảnh tối đa 1M, cònkimi-for-coding-highspeeddùng hạn mức gấp 3 lần để đổi lấy tốc độ xuất ra nhanh hơn khoảng 5–6 lần - Khi chuyển từ
k3sangk3-256k, nếu ngữ cảnh hiện có vượt quá 256k hoặc có chứa video, trước tiên cần chạy compact để giữ lại thông tin cốt lõi đồng thời duy trì khả năng tương thích - Việc đổi mô hình hoặc
reasoning_effortsẽ làm vô hiệu hóa cache ngữ cảnh hiện có, nên phải prefill lại và có thể làm tăng mức sử dụng; nên chuyển đổi trong phiên mới - Các mô hình và ngữ cảnh khả dụng khác nhau tùy gói giá; nếu vượt quá quyền hạn, hệ thống sẽ trả về
401. Với công cụ bên thứ ba, cần tự đặt model ID chính xác, kích thước ngữ cảnh và cường độ suy luận
Cấu hình mô hình của Kimi Code
- Kimi Code cung cấp Kimi K3 và Kimi K2.7 Code dưới 4 model ID
k3: mô hình lập trình flagship với 2,8T tham số, hỗ trợ ngữ cảnh tối đa 1M ở các gói cao cấpk3-256k: phiên bản ngữ cảnh 256k của Kimi K3, tập trung vào việc giảm mức tiêu thụkimi-for-coding: Kimi K2.7 Code phù hợp cho hoàn thành mã và các tác vụ phát triển hằng ngàykimi-for-coding-highspeed: K2.7 Code HighSpeed cung cấp tốc độ xuất ra nhanh hơn khoảng 5–6 lần với cùng năng lực lập trình
- Thông số và điều kiện sử dụng theo từng mô hình như sau
k3- Hoạt động ở tốc độ thông thường, cung cấp ngữ cảnh tối đa 1M cho thành viên gói cao cấp
reasoning_efforthỗ trợlow,high,max, mặc định làhigh- Khả dụng từ Moderato trở lên; ngữ cảnh 1M được cung cấp từ Allegretto trở lên
- Có thể nhập hình ảnh và video
k3-256k- Hoạt động ở tốc độ thông thường và ngữ cảnh được cố định ở 256k
reasoning_efforthỗ trợlow,high,max, mặc định làhigh- Khả dụng cho thành viên Moderato trở lên
- Chỉ có thể nhập hình ảnh, không hỗ trợ video
kimi-for-coding- Cung cấp tốc độ thông thường và ngữ cảnh 256k, mọi thành viên đều có thể dùng
- Hoạt động với
Thinking:ONvà hỗ trợ hình ảnh, video
kimi-for-coding-highspeed- Xuất ra nhanh hơn khoảng 6 lần trong ngữ cảnh 256k nhưng dùng hạn mức gấp 3 lần
- Khả dụng từ Allegretto trở lên, hỗ trợ
Thinking:ONvà đầu vào hình ảnh, video
Mục đích sử dụng K3-256k và chuyển đổi mô hình
k3-256kcung cấp kết quả tương tựk3trong phạm vi ngữ cảnh 256k, đồng thời chỉ tiêu thụ khoảng một nửa hạn mức so với phiên bản 1M- Phù hợp cho hỏi đáp hằng ngày, hoàn thành mã, phát triển tính năng thông thường, chỉnh sửa một tệp hoặc các tệp quy mô nhỏ, nhưng không hỗ trợ đầu vào video
-
Chuyển từ K3 sang K3-256k
- Nếu ngữ cảnh phiên hiện tại vượt quá 256k, một số công cụ như Kimi Code CLI và Claude Code sẽ tự thực hiện compact
- Vì mỗi công cụ agent xử lý khác nhau, nên trước khi chuyển đổi, bạn nên chạy compact thủ công một lần để nén ngữ cảnh xuống trong phạm vi 256k
- Nhờ đó có thể duy trì phiên trong khi vẫn giữ lại nội dung cốt lõi của công việc
- Sau khi chuyển đổi, hạn mức có thể dùng được lâu hơn
- Nếu lịch sử trò chuyện có tệp video, không thể chuyển trực tiếp sang
k3-256k, nên trước tiên cần chạy compact
-
Chuyển từ K3-256k sang K3
- Nếu
k3-256kgần đạt giới hạn 256k và muốn tránh mất thông tin do compact, có thể chuyển trực tiếp sangk31M - Ở phiên bản hiện tại, việc chuyển từ 256k lên 1M không ảnh hưởng đến cache
- Nếu
Quản lý cache và mức sử dụng
- Khi đổi mô hình, cache ngữ cảnh đã xây dựng ở mô hình trước sẽ không hit, nên cần prefill lại ngữ cảnh đó
- Vì vậy ngay sau khi chuyển đổi, mức sử dụng có thể trông như tăng lên. Khi dùng mô hình mới, bắt đầu phiên mới sẽ có lợi hơn cho kết quả tốt hơn và mức tiêu thụ thấp hơn
-
Chi phí chuyển đổi cường độ suy luận
- Ngay cả khi đổi
reasoning_effort, cache ngữ cảnh hiện có cũng bị vô hiệu hóa và phải prefill lại - Nên chọn cường độ suy luận phù hợp với tác vụ rồi giữ nhất quán trong cùng một phiên
- Nếu thực sự cần cường độ suy luận khác, tốt hơn là bắt đầu phiên mới thay vì chuyển đổi lặp lại trong một phiên dài
- Ngay cả khi đổi
Quyền theo gói giá và lỗi 401
- Ngay cả khi dùng đúng model ID, nếu tính năng được yêu cầu vượt quá quyền của gói, máy chủ sẽ trả về
401- Không có quyền truy cập K3: các gói dưới Moderato không thể gọi
k3vàk3-256k - Không có quyền truy cập 1M: ở Moderato,
k3chỉ hỗ trợ tối đa 256k; tối đa 1M khả dụng từ Allegretto trở lên - Giới hạn ngữ cảnh của
k3-256kđược cố định ở 256k bất kể gói giá - Không có quyền truy cập HighSpeed:
kimi-for-coding-highspeedyêu cầu Allegretto trở lên
- Không có quyền truy cập K3: các gói dưới Moderato không thể gọi
- Có thể xem toàn bộ thông báo lỗi và cách xử lý trong Error Reference
Vì sao HighSpeed không có cảm giác nhanh
- Model ID HighSpeed phải chính xác là
kimi-for-coding-highspeed- Nếu nhập sai, hệ thống sẽ thay thế bằng
kimi-for-codingtiêu chuẩn mà không báo lỗi, nên sẽ không thấy tốc độ cải thiện
- Nếu nhập sai, hệ thống sẽ thay thế bằng
- HighSpeed chỉ tăng tốc phần mô hình xuất ra
- Đọc/ghi tệp, gọi lệnh và chạy script sẽ không nhanh hơn
- Nếu trong một lượt tác vụ, tỷ trọng thực thi công cụ hoặc script cao, mức cải thiện tốc độ tổng thể có thể chỉ cảm nhận được rất ít
Chuyển đổi mô hình trong client
- Đổi model ID sẽ làm vô hiệu hóa cache ngữ cảnh. Để tránh tiêu thụ thêm token và có trải nghiệm sử dụng tối ưu, nên bắt đầu phiên mới
- Khi gọi, cần nhập một trong các model ID sau, không phải tên phiên bản mô hình
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
- Nếu nhập tên phiên bản như
Kimi K3hoặcK2.7 Code, lệnh gọi sẽ thất bại - Nếu tắt Thinking ở K3 hoặc K2.7, yêu cầu sẽ được route sang K2.6, nên để dùng K3 hoặc K2.7 Code, cần bật Thinking
-
Client chính thức
- Trong Kimi Code CLI, có thể nhập
/modelđể đổi mô hình mà không cần thay đổi cài đặt - Nếu mô hình mới nhất không có trong danh sách, cần
/logoutrồi/loginđể đăng nhập lại - Trong Kimi Code for VS Code, chọn mô hình từ menu thả xuống ở ô nhập
- Nếu mô hình không hiển thị, cần khởi động lại VS Code hoặc cài đặt lại extension
- Trong Kimi Code CLI, có thể nhập
Thiết lập công cụ bên thứ ba
- Sau khi tạo API Key trong Kimi Code Console, nhập Base URL và model ID vào công cụ
- Kimi Code API hỗ trợ cả giao thức tương thích OpenAI và giao thức tương thích Anthropic
- Base URL tương thích OpenAI:
https://api.kimi.com/coding/v1 - Base URL tương thích Anthropic:
https://api.kimi.com/coding/
- Base URL tương thích OpenAI:
- Cách thiết lập theo từng công cụ có thể xem trong các tài liệu sau
- Claude Code: trợ lý lập trình dòng lệnh của Anthropic
- OpenCode: agent lập trình trên terminal
- Codex: agent lập trình của OpenAI
-
Thiết lập ngữ cảnh K3
- Ngữ cảnh mặc định của một số công cụ bên thứ ba nhỏ hơn mức tối đa 1M của K3
- Để dùng ngữ cảnh tối đa 1M, cần tự đặt trường
context-windowthành1048576
-
Ánh xạ cường độ suy luận của K3
- K3 hỗ trợ
low,high,max, và giá trị công cụ gửi lên được ánh xạ như sau nullhoặcundefined: mặc địnhhigh- Giá trị khác không xác định: lỗi HTTP
400 ultra,max,xhigh:maxhigh,medium: mức khuyến nghịhighlow,minimum,light:lownone:thinking.typebị tắt
- K3 hỗ trợ
1 bình luận
Ý kiến Hacker News
Codex tận dụng ngữ cảnh 256k rất tốt. 1M thì dư dả nhưng vẫn đắt và có vẻ không cần thiết làm mặc định
LLM đang nhanh chóng trở thành hàng hóa phổ thông, và hào lũy của các viện nghiên cứu AI Mỹ như OpenAI đang suy yếu. Cuối cùng, bên thắng có lẽ sẽ là các hyperscaler và chủ sở hữu trung tâm dữ liệu có thể bán token rẻ
k3-256kđã được phát hành và cho kết quả y hệt trong phạm vi ngữ cảnh 256k.k3 (1M)tiêu tốn hạn mức gần gấp đôi so vớik3-256kĐây là thay đổi khá ổn. Tôi thường cố giữ ngữ cảnh dưới 200k
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
Vậy có phải mọi người dùng sẽ đột nhiên dùng Kimi với giá bằng một nửa cho tới khi ngữ cảnh chạm 256k không nhỉ. Nếu đúng thì là thay đổi cực lớn
k3-256krồi chuyển sang mô hình 1M ở mốc 256k thì cache sẽ bị vô hiệu hóa, và ngay cả 256k token trước đó cũng sẽ phải trả lại theo giá mô hình 1MNhưng điều này là sai, và khi gần tới giới hạn ngữ cảnh thì có thể chuyển sang mô hình 1M mà không làm mất cache. Ở phiên bản hiện tại, đổi từ
k3-256ksangk3 (1M)không ảnh hưởng đến cacheBài này được đăng 38 phút trước, và từ 20 phút trước thì nhiều dịch vụ của Anthropic đang hiển thị trạng thái sự cố diện rộng. Chắc không liên quan đâu, nhưng cũng hơi buồn cười
Có vẻ chính mô hình thì vẫn như cũ và đây chỉ là thay đổi ở cấp độ API
Về mặt chức năng thì khá giống cách OpenAI đổi bậc giá khi vượt một độ dài ngữ cảnh nhất định. Mốc đó cũng vào khoảng 272k, tức
2^18hoặc gần 256kKhi ngữ cảnh hoạt động lớn hơn, chi phí tính toán trên mỗi token đầu ra và số byte phải đọc cũng tăng lên, nên việc chuyển chi phí đó cho người dùng là hợp lý. Tuy vậy, tôi ngạc nhiên vì họ không dùng đường cong giá mềm hơn thay vì ngưỡng bậc thang
Cấu hình ngữ cảnh ngắn có ít node chỉ dành cho prefill hơn trên mỗi instance, không cần hỗ trợ KV cache lớn, nên cũng có thể giảm tổng số node. Nếu dùng suy luận tách rời, tỷ lệ tính toán phân cho prefill và decoding cũng có thể điều chỉnh riêng
Hy vọng thay đổi này sẽ giảm gánh nặng hạ tầng. Các mô hình gần đây đều chậm đi thấy rõ, nhưng đội hỗ trợ thì không phản hồi. Tôi nghi ngờ họ đang xử lý phần lớn yêu cầu bằng mô hình lượng tử hóa
Tôi tự hỏi có phải họ không dùng mô hình lượng tử hóa, mà chỉ đơn giản là giảm cửa sổ ngữ cảnh xuống 256k hay không