1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Kimi K3-256k là mô hình dùng cho lập trình hằng ngày, duy trì chất lượng kết quả của K3 trong ngữ cảnh 256k, đồng thời chỉ tiêu thụ khoảng một nửa hạn mức so với k3 ngữ cảnh 1M
  • Kimi Code cung cấp K3 và K2.7 Code dưới 4 model ID; k3 hỗ trợ 2,8T tham số và ngữ cảnh tối đa 1M, còn kimi-for-coding-highspeed dùng hạn mức gấp 3 lần để đổi lấy tốc độ xuất ra nhanh hơn khoảng 5–6 lần
  • Khi chuyển từ k3 sang k3-256k, nếu ngữ cảnh hiện có vượt quá 256k hoặc có chứa video, trước tiên cần chạy compact để giữ lại thông tin cốt lõi đồng thời duy trì khả năng tương thích
  • Việc đổi mô hình hoặc reasoning_effort sẽ làm vô hiệu hóa cache ngữ cảnh hiện có, nên phải prefill lại và có thể làm tăng mức sử dụng; nên chuyển đổi trong phiên mới
  • Các mô hình và ngữ cảnh khả dụng khác nhau tùy gói giá; nếu vượt quá quyền hạn, hệ thống sẽ trả về 401. Với công cụ bên thứ ba, cần tự đặt model ID chính xác, kích thước ngữ cảnh và cường độ suy luận

Cấu hình mô hình của Kimi Code

  • Kimi Code cung cấp Kimi K3Kimi K2.7 Code dưới 4 model ID
    • k3: mô hình lập trình flagship với 2,8T tham số, hỗ trợ ngữ cảnh tối đa 1M ở các gói cao cấp
    • k3-256k: phiên bản ngữ cảnh 256k của Kimi K3, tập trung vào việc giảm mức tiêu thụ
    • kimi-for-coding: Kimi K2.7 Code phù hợp cho hoàn thành mã và các tác vụ phát triển hằng ngày
    • kimi-for-coding-highspeed: K2.7 Code HighSpeed cung cấp tốc độ xuất ra nhanh hơn khoảng 5–6 lần với cùng năng lực lập trình
  • Thông số và điều kiện sử dụng theo từng mô hình như sau
    • k3
      • Hoạt động ở tốc độ thông thường, cung cấp ngữ cảnh tối đa 1M cho thành viên gói cao cấp
      • reasoning_effort hỗ trợ low, high, max, mặc định là high
      • Khả dụng từ Moderato trở lên; ngữ cảnh 1M được cung cấp từ Allegretto trở lên
      • Có thể nhập hình ảnh và video
    • k3-256k
      • Hoạt động ở tốc độ thông thường và ngữ cảnh được cố định ở 256k
      • reasoning_effort hỗ trợ low, high, max, mặc định là high
      • Khả dụng cho thành viên Moderato trở lên
      • Chỉ có thể nhập hình ảnh, không hỗ trợ video
    • kimi-for-coding
      • Cung cấp tốc độ thông thường và ngữ cảnh 256k, mọi thành viên đều có thể dùng
      • Hoạt động với Thinking:ON và hỗ trợ hình ảnh, video
    • kimi-for-coding-highspeed
      • Xuất ra nhanh hơn khoảng 6 lần trong ngữ cảnh 256k nhưng dùng hạn mức gấp 3 lần
      • Khả dụng từ Allegretto trở lên, hỗ trợ Thinking:ON và đầu vào hình ảnh, video

Mục đích sử dụng K3-256k và chuyển đổi mô hình

  • k3-256k cung cấp kết quả tương tự k3 trong phạm vi ngữ cảnh 256k, đồng thời chỉ tiêu thụ khoảng một nửa hạn mức so với phiên bản 1M
  • Phù hợp cho hỏi đáp hằng ngày, hoàn thành mã, phát triển tính năng thông thường, chỉnh sửa một tệp hoặc các tệp quy mô nhỏ, nhưng không hỗ trợ đầu vào video
  • Chuyển từ K3 sang K3-256k

    • Nếu ngữ cảnh phiên hiện tại vượt quá 256k, một số công cụ như Kimi Code CLI và Claude Code sẽ tự thực hiện compact
    • Vì mỗi công cụ agent xử lý khác nhau, nên trước khi chuyển đổi, bạn nên chạy compact thủ công một lần để nén ngữ cảnh xuống trong phạm vi 256k
    • Nhờ đó có thể duy trì phiên trong khi vẫn giữ lại nội dung cốt lõi của công việc
    • Sau khi chuyển đổi, hạn mức có thể dùng được lâu hơn
    • Nếu lịch sử trò chuyện có tệp video, không thể chuyển trực tiếp sang k3-256k, nên trước tiên cần chạy compact
  • Chuyển từ K3-256k sang K3

    • Nếu k3-256k gần đạt giới hạn 256k và muốn tránh mất thông tin do compact, có thể chuyển trực tiếp sang k3 1M
    • Ở phiên bản hiện tại, việc chuyển từ 256k lên 1M không ảnh hưởng đến cache

Quản lý cache và mức sử dụng

  • Khi đổi mô hình, cache ngữ cảnh đã xây dựng ở mô hình trước sẽ không hit, nên cần prefill lại ngữ cảnh đó
  • Vì vậy ngay sau khi chuyển đổi, mức sử dụng có thể trông như tăng lên. Khi dùng mô hình mới, bắt đầu phiên mới sẽ có lợi hơn cho kết quả tốt hơn và mức tiêu thụ thấp hơn
  • Chi phí chuyển đổi cường độ suy luận

    • Ngay cả khi đổi reasoning_effort, cache ngữ cảnh hiện có cũng bị vô hiệu hóa và phải prefill lại
    • Nên chọn cường độ suy luận phù hợp với tác vụ rồi giữ nhất quán trong cùng một phiên
    • Nếu thực sự cần cường độ suy luận khác, tốt hơn là bắt đầu phiên mới thay vì chuyển đổi lặp lại trong một phiên dài

Quyền theo gói giá và lỗi 401

  • Ngay cả khi dùng đúng model ID, nếu tính năng được yêu cầu vượt quá quyền của gói, máy chủ sẽ trả về 401
    • Không có quyền truy cập K3: các gói dưới Moderato không thể gọi k3k3-256k
    • Không có quyền truy cập 1M: ở Moderato, k3 chỉ hỗ trợ tối đa 256k; tối đa 1M khả dụng từ Allegretto trở lên
    • Giới hạn ngữ cảnh của k3-256k được cố định ở 256k bất kể gói giá
    • Không có quyền truy cập HighSpeed: kimi-for-coding-highspeed yêu cầu Allegretto trở lên
  • Có thể xem toàn bộ thông báo lỗi và cách xử lý trong Error Reference

Vì sao HighSpeed không có cảm giác nhanh

  • Model ID HighSpeed phải chính xác là kimi-for-coding-highspeed
    • Nếu nhập sai, hệ thống sẽ thay thế bằng kimi-for-coding tiêu chuẩn mà không báo lỗi, nên sẽ không thấy tốc độ cải thiện
  • HighSpeed chỉ tăng tốc phần mô hình xuất ra
    • Đọc/ghi tệp, gọi lệnh và chạy script sẽ không nhanh hơn
    • Nếu trong một lượt tác vụ, tỷ trọng thực thi công cụ hoặc script cao, mức cải thiện tốc độ tổng thể có thể chỉ cảm nhận được rất ít

Chuyển đổi mô hình trong client

  • Đổi model ID sẽ làm vô hiệu hóa cache ngữ cảnh. Để tránh tiêu thụ thêm token và có trải nghiệm sử dụng tối ưu, nên bắt đầu phiên mới
  • Khi gọi, cần nhập một trong các model ID sau, không phải tên phiên bản mô hình
    • k3
    • k3-256k
    • kimi-for-coding
    • kimi-for-coding-highspeed
  • Nếu nhập tên phiên bản như Kimi K3 hoặc K2.7 Code, lệnh gọi sẽ thất bại
  • Nếu tắt Thinking ở K3 hoặc K2.7, yêu cầu sẽ được route sang K2.6, nên để dùng K3 hoặc K2.7 Code, cần bật Thinking
  • Client chính thức

    • Trong Kimi Code CLI, có thể nhập /model để đổi mô hình mà không cần thay đổi cài đặt
    • Nếu mô hình mới nhất không có trong danh sách, cần /logout rồi /login để đăng nhập lại
    • Trong Kimi Code for VS Code, chọn mô hình từ menu thả xuống ở ô nhập
    • Nếu mô hình không hiển thị, cần khởi động lại VS Code hoặc cài đặt lại extension

Thiết lập công cụ bên thứ ba

  • Sau khi tạo API Key trong Kimi Code Console, nhập Base URL và model ID vào công cụ
  • Kimi Code API hỗ trợ cả giao thức tương thích OpenAIgiao thức tương thích Anthropic
  • Cách thiết lập theo từng công cụ có thể xem trong các tài liệu sau
    • Claude Code: trợ lý lập trình dòng lệnh của Anthropic
    • OpenCode: agent lập trình trên terminal
    • Codex: agent lập trình của OpenAI
  • Thiết lập ngữ cảnh K3

    • Ngữ cảnh mặc định của một số công cụ bên thứ ba nhỏ hơn mức tối đa 1M của K3
    • Để dùng ngữ cảnh tối đa 1M, cần tự đặt trường context-window thành 1048576
  • Ánh xạ cường độ suy luận của K3

    • K3 hỗ trợ low, high, max, và giá trị công cụ gửi lên được ánh xạ như sau
    • null hoặc undefined: mặc định high
    • Giá trị khác không xác định: lỗi HTTP 400
    • ultra, max, xhigh: max
    • high, medium: mức khuyến nghị high
    • low, minimum, light: low
    • none: thinking.type bị tắt

1 bình luận

 
Ý kiến Hacker News
  • Codex tận dụng ngữ cảnh 256k rất tốt. 1M thì dư dả nhưng vẫn đắt và có vẻ không cần thiết làm mặc định

  • LLM đang nhanh chóng trở thành hàng hóa phổ thông, và hào lũy của các viện nghiên cứu AI Mỹ như OpenAI đang suy yếu. Cuối cùng, bên thắng có lẽ sẽ là các hyperscaler và chủ sở hữu trung tâm dữ liệu có thể bán token rẻ

    • Tôi chưa dùng nhiều sản phẩm khác, nhưng Codex harness hấp dẫn đến mức khó chuyển đi. Không biết còn nơi nào khác cung cấp harness chất lượng cỡ này không
    • Tôi vô cùng biết ơn các công ty AI frontier đã đổ lượng vốn khổng lồ cùng R&D phức tạp vào từng mô hình. Đến mức giờ đây người ta dễ quên mất đã tốn kém thế nào để đi tới điểm này
  • k3-256k đã được phát hành và cho kết quả y hệt trong phạm vi ngữ cảnh 256k. k3 (1M) tiêu tốn hạn mức gần gấp đôi so với k3-256k

  • Đây là thay đổi khá ổn. Tôi thường cố giữ ngữ cảnh dưới 200k

    • Câu y hệt cũng là bình luận đứng đầu trong thread Reddit về tin này
      https://www.reddit.com/r/kimi/s/BFa1TR9vNg
    • Còn tùy phạm vi công việc, nhưng tôi cho rằng điểm hợp lý là dưới 500k. Với Claude, 500 nghìn token là đủ để xây một dự án khá lớn mà vẫn giữ toàn bộ ngữ cảnh từ đầu đến hiện tại
    • "256k là quá đủ cho tất cả mọi người"
  • Vậy có phải mọi người dùng sẽ đột nhiên dùng Kimi với giá bằng một nửa cho tới khi ngữ cảnh chạm 256k không nhỉ. Nếu đúng thì là thay đổi cực lớn

    • Vì đây là mô hình riêng, tôi đã nghĩ rằng nếu dùng k3-256k rồi chuyển sang mô hình 1M ở mốc 256k thì cache sẽ bị vô hiệu hóa, và ngay cả 256k token trước đó cũng sẽ phải trả lại theo giá mô hình 1M
      Nhưng điều này là sai, và khi gần tới giới hạn ngữ cảnh thì có thể chuyển sang mô hình 1M mà không làm mất cache. Ở phiên bản hiện tại, đổi từ k3-256k sang k3 (1M) không ảnh hưởng đến cache
    • Tôi hiểu là không phải vậy. Có vẻ ý ở đây là cửa sổ ngữ cảnh nhỏ hơn thì số token đầu vào tích lũy theo thời gian cũng ít hơn nên nhìn chung rẻ hơn
  • Bài này được đăng 38 phút trước, và từ 20 phút trước thì nhiều dịch vụ của Anthropic đang hiển thị trạng thái sự cố diện rộng. Chắc không liên quan đâu, nhưng cũng hơi buồn cười

  • Có vẻ chính mô hình thì vẫn như cũ và đây chỉ là thay đổi ở cấp độ API

  • Về mặt chức năng thì khá giống cách OpenAI đổi bậc giá khi vượt một độ dài ngữ cảnh nhất định. Mốc đó cũng vào khoảng 272k, tức 2^18 hoặc gần 256k
    Khi ngữ cảnh hoạt động lớn hơn, chi phí tính toán trên mỗi token đầu ra và số byte phải đọc cũng tăng lên, nên việc chuyển chi phí đó cho người dùng là hợp lý. Tuy vậy, tôi ngạc nhiên vì họ không dùng đường cong giá mềm hơn thay vì ngưỡng bậc thang

    • Nhiều khả năng họ vận hành hai cấu hình hạ tầng theo độ dài chuỗi tối đa, nên việc có ngưỡng bậc thang cũng không có gì lạ
      Cấu hình ngữ cảnh ngắn có ít node chỉ dành cho prefill hơn trên mỗi instance, không cần hỗ trợ KV cache lớn, nên cũng có thể giảm tổng số node. Nếu dùng suy luận tách rời, tỷ lệ tính toán phân cho prefill và decoding cũng có thể điều chỉnh riêng
  • Hy vọng thay đổi này sẽ giảm gánh nặng hạ tầng. Các mô hình gần đây đều chậm đi thấy rõ, nhưng đội hỗ trợ thì không phản hồi. Tôi nghi ngờ họ đang xử lý phần lớn yêu cầu bằng mô hình lượng tử hóa

    • Thuyết âm mưu vô căn cứ như vậy có thể hợp với Reddit, chứ không hợp với HN
  • Tôi tự hỏi có phải họ không dùng mô hình lượng tử hóa, mà chỉ đơn giản là giảm cửa sổ ngữ cảnh xuống 256k hay không

    • Cửa sổ ngữ cảnh 256k và việc có lượng tử hóa hay không là hai chuyện khác nhau. Từ bên ngoài rất khó xác minh trực tiếp, nên cũng không thể loại trừ khả năng thực sự đã bị lượng tử hóa