- Nhu cầu Kimi K3 tăng mạnh hơn dự kiến, khiến mức sử dụng GPU trong 48 giờ gần đây tiệm cận giới hạn công suất hiện tại
- Để bảo vệ trải nghiệm sử dụng của các thuê bao hiện có, công ty tạm dừng đăng ký mới và ưu tiên phân bổ tài nguyên tính toán cho thành viên hiện tại
- Các thuê bao trả phí hiện có không bị ảnh hưởng, và Moonshot AI đang đẩy nhanh việc mở rộng công suất hạ tầng
- Khi có thêm công suất, công ty sẽ mở lại đăng ký mới theo từng đợt
- Ngoài ra, tùy theo mục đích sử dụng, công ty dự kiến chia gói thành viên thành hai gói chuyên biệt
- Kimi Membership: dành cho Kimi Web, App, Work
- Kimi Code Membership: dành cho quy trình làm việc lập trình
- Đây là biện pháp nhằm phân bổ tài nguyên tính toán chính xác hơn theo nhu cầu của từng dịch vụ và duy trì trải nghiệm sử dụng ổn định
1 bình luận
Ý kiến trên Hacker News
Câu nói rằng trong 48 giờ qua, khi nhu cầu tiến sát giới hạn năng lực hiện tại, họ đã tạm dừng đăng ký mới và ưu tiên phân bổ tài nguyên tính toán cho thành viên hiện tại để bảo vệ trải nghiệm của người dùng đã đăng ký thật sự rất đáng khen
Đây là công ty ưu tiên sự hài lòng của khách hàng hiện tại hơn tăng trưởng nhanh
Hôm qua tôi dùng hết hạn mức Claude nên đã trả tiền cho gói 20 USD để thử Kimi. Trong Kimi Code, tôi chọn K3 và yêu cầu nó tìm toàn bộ thiết lập đầu vào liên quan đến phần cứng, I/O, điều khiển luồng và mạng trong repository rồi viết báo cáo; sau 12 phút suy nghĩ, nó trả lời rằng tôi đã dùng hết hạn mức hằng ngày
Hôm sau Fable làm xong cùng việc đó trong 3 phút, nên nếu muốn dùng K3 thì tốt nhất đừng mua gói 20 USD
Trên giao diện web, nó cũng đã dùng tới 23% mức sử dụng hằng tuần; trong khi với Cursor 20 USD/tháng, dù làm nhiều việc hơn hẳn tôi chưa từng nhận nổi một cảnh báo. Ban đầu tôi nghĩ là vấn đề của OpenCode, nhưng nếu Kimi Code cũng như vậy thì có vẻ không phải
Điều đặc biệt thú vị ở Kimi là nó có số tầng RNN/linear attention nhiều gấp 3 lần so với tầng attention đầy đủ. Tôi chưa dùng thử, nhưng đây có vẻ là kiến trúc rất hợp lý cho tác vụ ngữ cảnh dài
Lý do số tham số lớn có vẻ giống với lý do các xLSTM tối ưu tính toán có nhiều tham số; nhìn vào thành công của model này, tôi thấy tiếc vì ở châu Âu không phát triển được một dòng model xLSTM khổng lồ. Vì đây là một đội thực dụng chọn thứ hoạt động tốt trong đánh giá nội bộ nên họ cũng giữ lại các tầng attention thông thường, và không thể đảm bảo phần triển khai là lý tưởng, nhưng Kimi cho thấy điều gì có thể xảy ra nếu cấp một siêu máy tính huấn luyện LLM quy mô lớn cho đúng nhà nghiên cứu. Rốt cuộc, phần lớn vẫn là RNN, lĩnh vực của Hochreiter
Tôi đã dùng Kimi cho công việc coding khoảng 6 tháng và hài lòng đến mức không quay lại model khác. Thỉnh thoảng tôi chỉ thử cùng tác vụ với Claude để xem mình có bỏ lỡ gì không
Tôi dùng OpenRouter, và phạm vi sử dụng LLM của tôi khá hẹp nên chênh lệch chi phí theo bên nào cũng không đáng kể
Thật mới mẻ khi họ dừng đăng ký mới thay vì âm thầm hạ hạn mức như Google, rồi hy vọng người dùng không nhận ra giá trị thuê bao đã giảm
Gemini Apps ghi rõ rằng họ có thể thay đổi hạn mức mà không báo trước để duy trì chất lượng khi bị giới hạn năng lực hoặc lượng hoạt động tăng vọt: https://support.google.com/gemini/answer/16275805
Trong các đánh giá coding game đa tác nhân, model Trung Quốc thường yếu ở suy luận một lượt, nhưng bù lại bằng việc dùng công cụ và cải tiến lặp. Kimi K3 cũng chỉ đứng thứ 19 ở coding một lượt, nhưng trong agentic coding, khi được cung cấp môi trường chạy và công cụ rồi gọi nhiều lần, nó đứng thứ 3; tính theo bài nộp trung bình thì chỉ Sol và Fable đứng trên
Với kỹ sư phần mềm, agentic coding là thứ liên quan nhất, nhưng tốc độ cũng quan trọng, và hiện tại với Kimi đây là một vấn đề về khả năng sử dụng thực tế. Các nhà cung cấp inference bên ngoài như Fireworks từng thu hẹp khoảng cách này với các model trước. Xu hướng model frontier có trọng số mở trở thành tiêu chuẩn thật thú vị, và việc cạnh tranh chỉ bằng sở hữu model frontier sẽ ngày càng khó hơn
Dữ liệu: https://gertlabs.com/rankings?mode=agentic_coding
Chất lượng của model này vượt kỳ vọng, đặc biệt làm rất tốt code review và PR review. Tuy nhiên do nhu cầu quá cao và kích thước model lớn, hiện giờ nó quá chậm, ngay cả một code review tương đối đơn giản cũng mất rất lâu
Tôi tự hỏi cơn sốt Kimi lần này là mức tăng ròng theo nghịch lý Jevons, khi nguồn cung dồi dào kéo theo tiêu thụ nhiều hơn, hay chỉ đơn giản là người dùng chuyển sang model rẻ hơn
Tôi cũng tò mò liệu có nguồn dữ liệu tốt nào để xem tổng lượng token tiêu thụ trên nhiều lab và OpenRouter không
Tôi tự hỏi liệu Anthropic và OpenAI có tiếp tục giữ sức cạnh tranh chỉ vì trong ngắn hạn họ là những bên duy nhất chịu được nhu cầu cỡ này không. Khi chi phí vốn đã lớn, nếu sự cố làm lãng phí thời gian nhân viên thì khách hàng doanh nghiệp sẽ không vui
Có vẻ họ đã dừng thuê bao vì nhận định rằng có thể không bảo đảm được chất lượng dịch vụ tối thiểu cho khách hàng