1 điểm bởi GN⁺ 19 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Nhu cầu Kimi K3 tăng mạnh hơn dự kiến, khiến mức sử dụng GPU trong 48 giờ gần đây tiệm cận giới hạn công suất hiện tại
  • Để bảo vệ trải nghiệm sử dụng của các thuê bao hiện có, công ty tạm dừng đăng ký mới và ưu tiên phân bổ tài nguyên tính toán cho thành viên hiện tại
  • Các thuê bao trả phí hiện có không bị ảnh hưởng, và Moonshot AI đang đẩy nhanh việc mở rộng công suất hạ tầng
  • Khi có thêm công suất, công ty sẽ mở lại đăng ký mới theo từng đợt
  • Ngoài ra, tùy theo mục đích sử dụng, công ty dự kiến chia gói thành viên thành hai gói chuyên biệt
    • Kimi Membership: dành cho Kimi Web, App, Work
    • Kimi Code Membership: dành cho quy trình làm việc lập trình
  • Đây là biện pháp nhằm phân bổ tài nguyên tính toán chính xác hơn theo nhu cầu của từng dịch vụ và duy trì trải nghiệm sử dụng ổn định

1 bình luận

 
Ý kiến trên Hacker News
  • Câu nói rằng trong 48 giờ qua, khi nhu cầu tiến sát giới hạn năng lực hiện tại, họ đã tạm dừng đăng ký mới và ưu tiên phân bổ tài nguyên tính toán cho thành viên hiện tại để bảo vệ trải nghiệm của người dùng đã đăng ký thật sự rất đáng khen
    Đây là công ty ưu tiên sự hài lòng của khách hàng hiện tại hơn tăng trưởng nhanh

    • Khi GitHub từng làm đúng như vậy, rất nhiều người đã nổi giận, nhưng khi đó cũng như bây giờ, đó là quyết định đúng đắn
    • Tôi luôn không thích việc trên bất kỳ website nào, nút “Login” lại nhỏ hơn “Sign Up”
    • Vậy Hetzner cũng lẽ ra nên ngừng đăng ký mới thay vì tăng giá để điều tiết cung cầu chăng?
    • Không cần quá phấn khích. Các quỹ VC đang đổ rất nhiều tiền vào AI, nên cũng có thể OpenAI hoặc Anthropic đang tài trợ cho một cỗ máy tiêu thụ token để chưng cất dataset
  • Hôm qua tôi dùng hết hạn mức Claude nên đã trả tiền cho gói 20 USD để thử Kimi. Trong Kimi Code, tôi chọn K3 và yêu cầu nó tìm toàn bộ thiết lập đầu vào liên quan đến phần cứng, I/O, điều khiển luồng và mạng trong repository rồi viết báo cáo; sau 12 phút suy nghĩ, nó trả lời rằng tôi đã dùng hết hạn mức hằng ngày
    Hôm sau Fable làm xong cùng việc đó trong 3 phút, nên nếu muốn dùng K3 thì tốt nhất đừng mua gói 20 USD

    • Codex dù chạm giới hạn vẫn tiếp tục suy luận rồi trả lời yêu cầu
    • Có thể môi trường của tôi khác vì chỉ dùng model tự host hoàn toàn, nhưng tôi tự hỏi trong workflow thực tế, việc phải chờ 12 phút không có bất kỳ phản hồi nào có phổ biến không. Tôi thường liên tục theo dõi hướng đi của model và nếu nó lao vào ngõ cụt thì dừng lại hoặc chỉnh hướng
    • Tôi cũng gặp đúng chuyện tương tự. Tôi thanh toán hằng năm gói 20 USD/tháng trên Kimi.com và gửi một yêu cầu đơn giản tới Kimi K2.7 qua API trong OpenCode, thế là dùng hết toàn bộ hạn mức 5 giờ, trong khi Cursor hoàn tất cùng yêu cầu đó chỉ trong vài phút
      Trên giao diện web, nó cũng đã dùng tới 23% mức sử dụng hằng tuần; trong khi với Cursor 20 USD/tháng, dù làm nhiều việc hơn hẳn tôi chưa từng nhận nổi một cảnh báo. Ban đầu tôi nghĩ là vấn đề của OpenCode, nhưng nếu Kimi Code cũng như vậy thì có vẻ không phải
    • Vài ngày trước, với Claude, một tác vụ khá đơn giản cũng đã tiêu tốn toàn bộ hạn mức 5 giờ mà không đưa ra được câu trả lời, cảm giác như hoàn toàn lãng phí thời gian
    • Tôi tò mò quy mô của ứng dụng mục tiêu là gì. Điều đó còn tùy nó là một app todo Node.js dùng file text như database, hay là 1 triệu dòng mã spaghetti COBOL viết từ năm 1971
  • Điều đặc biệt thú vị ở Kimi là nó có số tầng RNN/linear attention nhiều gấp 3 lần so với tầng attention đầy đủ. Tôi chưa dùng thử, nhưng đây có vẻ là kiến trúc rất hợp lý cho tác vụ ngữ cảnh dài
    Lý do số tham số lớn có vẻ giống với lý do các xLSTM tối ưu tính toán có nhiều tham số; nhìn vào thành công của model này, tôi thấy tiếc vì ở châu Âu không phát triển được một dòng model xLSTM khổng lồ. Vì đây là một đội thực dụng chọn thứ hoạt động tốt trong đánh giá nội bộ nên họ cũng giữ lại các tầng attention thông thường, và không thể đảm bảo phần triển khai là lý tưởng, nhưng Kimi cho thấy điều gì có thể xảy ra nếu cấp một siêu máy tính huấn luyện LLM quy mô lớn cho đúng nhà nghiên cứu. Rốt cuộc, phần lớn vẫn là RNN, lĩnh vực của Hochreiter

    • Chẳng phải một trong những mục tiêu ban đầu của kiến trúc Transformer là loại bỏ RNN vốn không thể song song hóa sao? Tôi không phải chuyên gia, chỉ đọc vài bài báo vài năm trước thôi
    • Khoảng một năm rưỡi trước, tôi đã nói với Hochreiter rằng không nên dừng ở các thử nghiệm vài tỷ tham số mà cần mở rộng xLSTM lên quy mô LLM, nhưng có vẻ ông ấy nghĩ đã quá muộn để thu hút đầu tư và sự quan tâm. Thật tiếc khi tham vọng của châu Âu chỉ đến mức đó
    • Tôi từng thắc mắc nó là RNN, model không gian trạng thái như Qwen hay Mamba, hay gần với RWKV hơn; kiểm tra thì thấy nó tương tự Linear DeltaNet mà Qwen dùng
  • Tôi đã dùng Kimi cho công việc coding khoảng 6 tháng và hài lòng đến mức không quay lại model khác. Thỉnh thoảng tôi chỉ thử cùng tác vụ với Claude để xem mình có bỏ lỡ gì không
    Tôi dùng OpenRouter, và phạm vi sử dụng LLM của tôi khá hẹp nên chênh lệch chi phí theo bên nào cũng không đáng kể

    • Tôi tò mò bạn dùng gói nào. Theo trải nghiệm của tôi, cả gói 20 USD/tháng của Kimi lẫn gói 30 USD/tháng của Qwen đều quá thiếu để làm công cụ chính, nhưng vì K3 tôi muốn thử gói 49 hoặc 99 USD/tháng
  • Thật mới mẻ khi họ dừng đăng ký mới thay vì âm thầm hạ hạn mức như Google, rồi hy vọng người dùng không nhận ra giá trị thuê bao đã giảm
    Gemini Apps ghi rõ rằng họ có thể thay đổi hạn mức mà không báo trước để duy trì chất lượng khi bị giới hạn năng lực hoặc lượng hoạt động tăng vọt: https://support.google.com/gemini/answer/16275805

  • Trong các đánh giá coding game đa tác nhân, model Trung Quốc thường yếu ở suy luận một lượt, nhưng bù lại bằng việc dùng công cụ và cải tiến lặp. Kimi K3 cũng chỉ đứng thứ 19 ở coding một lượt, nhưng trong agentic coding, khi được cung cấp môi trường chạy và công cụ rồi gọi nhiều lần, nó đứng thứ 3; tính theo bài nộp trung bình thì chỉ Sol và Fable đứng trên
    Với kỹ sư phần mềm, agentic coding là thứ liên quan nhất, nhưng tốc độ cũng quan trọng, và hiện tại với Kimi đây là một vấn đề về khả năng sử dụng thực tế. Các nhà cung cấp inference bên ngoài như Fireworks từng thu hẹp khoảng cách này với các model trước. Xu hướng model frontier có trọng số mở trở thành tiêu chuẩn thật thú vị, và việc cạnh tranh chỉ bằng sở hữu model frontier sẽ ngày càng khó hơn
    Dữ liệu: https://gertlabs.com/rankings?mode=agentic_coding

  • Chất lượng của model này vượt kỳ vọng, đặc biệt làm rất tốt code review và PR review. Tuy nhiên do nhu cầu quá cao và kích thước model lớn, hiện giờ nó quá chậm, ngay cả một code review tương đối đơn giản cũng mất rất lâu

    • Kimi K3 hiện đã xuất hiện trong bảng giá opencode-go, nên có vẻ là dùng được, nhưng tôi chưa kiểm chứng. Trên Zen thì chưa có
    • Có thể đáng thử qua đường OpenRouter: https://openrouter.ai/moonshotai/kimi-k3
  • Tôi tự hỏi cơn sốt Kimi lần này là mức tăng ròng theo nghịch lý Jevons, khi nguồn cung dồi dào kéo theo tiêu thụ nhiều hơn, hay chỉ đơn giản là người dùng chuyển sang model rẻ hơn
    Tôi cũng tò mò liệu có nguồn dữ liệu tốt nào để xem tổng lượng token tiêu thụ trên nhiều lab và OpenRouter không

    • Nếu là dòng người chuyển sang model rẻ hơn thì họ đã sang DeepSeek v4 Flash rồi. Kimi mới nhất đắt hơn hầu hết các model Trung Quốc khác, nên có vẻ gần với hiệu ứng chạy theo trào lưu kiểu “model mới này thật sự tốt, hãy thử đi”. Vấn đề là nó chịu được kiểm chứng kỹ đến đâu, và các lab Mỹ hẳn đang khá căng thẳng
  • Tôi tự hỏi liệu Anthropic và OpenAI có tiếp tục giữ sức cạnh tranh chỉ vì trong ngắn hạn họ là những bên duy nhất chịu được nhu cầu cỡ này không. Khi chi phí vốn đã lớn, nếu sự cố làm lãng phí thời gian nhân viên thì khách hàng doanh nghiệp sẽ không vui

    • Ở nơi làm việc cũng có xu hướng tương tự. Bản thân phần mềm thì rẻ, nhưng vì chuyên môn hosting và trách nhiệm uptime, triển khai thực tế vẫn tập trung vào một vài nhà cung cấp. Tuy vậy, cũng đang có nhiều công cụ năng suất vibe coding chạy trên laptop cá nhân
    • Anthropic cũng chỉ vài tháng trước còn gặp vấn đề nhu cầu, gây khó chịu cho người dùng bằng cách phân biệt mức sử dụng giờ cao điểm và thấp điểm, và cũng thường xuyên sự cố. Sau khi ký hợp đồng với xAI, nhìn chung đã ổn định hơn; Moonshot hiện cũng đang xúc tiến hợp đồng tài nguyên tính toán
    • Một phần đáng kể tài nguyên tính toán của OpenAI và Anthropic thực ra thuộc sở hữu của các hyperscaler. Họ có thể cộng biên lợi nhuận lên quyền truy cập tài nguyên đã bảo đảm bằng hợp đồng dài hạn, nhưng có lẽ không bền lâu vì hyperscaler có thể đưa ra giá thấp hơn
    • Vì Kimi là model trọng số mở, các nhà cung cấp hosting ngoài Moonshot sẽ nhanh chóng xuất hiện, và vấn đề lần này sẽ không phải rào cản lớn với việc áp dụng trọng số mở
    • Tôi đang dùng Synthetic và được biết họ có kế hoạch host Kimi3. Model mở có thể phân tán inference
  • Có vẻ họ đã dừng thuê bao vì nhận định rằng có thể không bảo đảm được chất lượng dịch vụ tối thiểu cho khách hàng

    • Chính xác hơn là họ chỉ tạm dừng đăng ký mới và ưu tiên phân bổ tài nguyên tính toán cho thành viên hiện tại