1 điểm bởi GN⁺ 3 giờ trước | 2 bình luận | Chia sẻ qua WhatsApp
  • Kimi K3 là mô hình agent đa phương thức gốc với trọng số mở, có 2,8 nghìn tỷ tham số và ngữ cảnh 1.048.576 token, hỗ trợ coding dài hạn, công việc tri thức và suy luận
  • Kết hợp Kimi Delta Attention (KDA), Attention Residuals và Stable LatentMoE, kích hoạt 16 chuyên gia cho mỗi token trong tổng số 896 chuyên gia, với hiệu quả scaling tổng thể cao hơn khoảng 2,5 lần so với Kimi K2
  • Trong các đánh giá công khai, mô hình đạt GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1, nhưng cần cân nhắc cả sự khác biệt về harness, thiết lập suy luận và phần cứng giữa các mô hình
  • Mô hình được huấn luyện nhận biết lượng tử hóa với trọng số MXFP4 và activation MXFP8, có thể chạy qua Transformers, vLLM, SGLang, Docker và API tương thích OpenAI·Anthropic
  • Với hội thoại nhiều lượt và gọi công cụ, cần gửi lại nguyên vẹn toàn bộ thông điệp assistant mà API trả về, bao gồm reasoning_contenttool_calls; mã nguồn và trọng số được phát hành theo Kimi K3 License

Kiến trúc và quy mô mô hình

  • Kimi K3 là mô hình agent đa phương thức gốc với trọng số mở, được thiết kế cho coding dài hạn, công việc tri thức và suy luận
  • Tổng số tham số là 2.8T, tham số hoạt động là 104B và gồm 93 lớp
    • Sử dụng 1 lớp Dense, 69 lớp KDA và 24 lớp Gated MLA
    • Attention hidden dimension là 7.168, có 96 attention head
  • Stable LatentMoE chọn 16 chuyên gia cho mỗi token trong tổng số 896 chuyên gia và dùng 2 chuyên gia chia sẻ
    • Latent MoE dimension là 3.584, MoE hidden dimension cho mỗi chuyên gia là 3.072
    • So với Kimi K2, hiệu quả scaling tổng thể được cải thiện khoảng 2,5 lần
  • Kích thước từ vựng là 160K, độ dài ngữ cảnh là 1.048.576 token, hàm kích hoạt là SiTU-GLU
  • Dùng MoonViT-V2 với 401M tham số làm vision encoder
  • Các tính năng chính gồm hiểu văn bản, hình ảnh và video, nhưng ở mục modality trong bảng tóm tắt mô hình chỉ ghi Text và Image

Coding dài hạn và công việc tri thức

  • Có thể duy trì các phiên kỹ thuật dài với mức giám sát tối thiểu của con người, đồng thời khám phá kho mã lớn và điều phối công cụ terminal
    • Hỗ trợ tối ưu hóa GPU kernel và phát triển compiler
    • Cũng nhắm tới phát triển game có dùng thị giác, CAD và thiết kế chip
  • Trong công việc tri thức dạng agent, mô hình tạo trực quan hóa tương tác, widget và dashboard cùng với nghiên cứu chuyên sâu
    • Motion design và chỉnh sửa video cũng nằm trong phạm vi hỗ trợ
  • Khuyến nghị dùng Kimi Code CLI làm framework agent coding; có thể chọn Kimi K3 bằng lệnh /model trong terminal

Kết quả đánh giá

  • Tất cả kết quả của Kimi K3 đều được đo với reasoning_effort="max", temperature 1.0
    • Các tác vụ một bước như GPQA Diamond, HLE-Full, hay đánh giá thị giác không dùng công cụ dùng top-p 0.95
    • Các tác vụ agent dùng top-p 1.0
  • Trong đánh giá suy luận và tri thức, mô hình đạt GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7
    • HLE-Full là 43.5 khi không dùng công cụ và 56.0 khi có dùng công cụ
  • Trong đánh giá coding, mô hình đạt ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2
    • DeepSWE là 67.5 trên harness Kimi Code và 67.3 trên harness mini-SWE-agent
    • SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9
  • Trong đánh giá agent, mô hình đạt BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2
    • MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8
    • Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2
  • Trong đánh giá thị giác, mô hình đạt OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1
    • MMMU-Pro là 81.6 khi không dùng công cụ và 83.4 khi có dùng công cụ
    • MathVision tăng từ 94.3 lên 97.8 khi dùng Python
    • ZeroBench pass@5 tăng từ 23.0 lên 41.0 khi dùng công cụ

Điều kiện đánh giá và hạn chế khi so sánh

  • Các mô hình được đem so sánh gồm Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2, nhưng harness đánh giá có thể khác nhau giữa từng mô hình
    • Kimi K3 chủ yếu dùng Kimi Code hoặc Claude Code
    • Dòng GPT chủ yếu dùng Codex, còn các mô hình Claude·GLM khác dùng Claude Code hoặc Terminus 2 v.v.
  • SWE-Marathon được đánh giá trên một nhánh đã hiệu chỉnh theo H20, dựa trên các tác vụ tính đến ngày 9/7/2026 trước bản v1.1 cuối cùng
    • Docker image, chuẩn hiệu năng GPU và oracle tham chiếu đã được hiệu chỉnh lại cho H20, nhưng không thay đổi bộ kiểm tra độ chính xác và chống gian lận
    • Claude Fable 5 có fallback ở 35% tác vụ nên có thể bị ảnh hưởng bất lợi về hiệu năng đo được
  • PostTrainBench là trung bình của 3 lần chạy với nỗ lực suy luận tối đa trên GPU H20 thay vì H100 của môi trường chính thức
  • Kimi Code Bench 2.0 gồm cả các tác vụ an ninh mạng và an toàn
    • Claude Fable 5 có 13 lần fallback và 1 lần từ chối trên 80 tác vụ
    • GPT-5.6 Sol từ chối 10 tác vụ, GPT-5.5 từ chối 3 tác vụ
  • BrowseComp 91.2 là kết quả dùng chiến lược nén ngữ cảnh hoạt động ở 300K token
    • Nếu dùng toàn bộ cửa sổ 1M token mà không quản lý ngữ cảnh riêng thì đạt 90.4
  • Các đánh giá đa phương thức, trừ ZeroBench, đều dùng trung bình của 3 lần chạy
    • ZeroBench được chạy 5 lần theo thiết lập chính thức
    • PerceptionBench là benchmark nội bộ đo khả năng nhận thức thị giác ở mức nguyên tử

Lượng tử hóa gốc

  • Áp dụng huấn luyện nhận biết lượng tử hóa ngay từ giai đoạn SFT
  • Dùng trọng số MXFP4 và activation MXFP8 nhằm hướng tới khả năng tương thích phần cứng rộng rãi

Cách triển khai và chạy

  • Có thể truy cập Kimi API bằng cách chọn kimi-k3; API này tương thích OpenAI·Anthropic
  • Trong Hugging Face Transformers, có thể tải bằng pipeline("image-text-to-text", ...) hoặc AutoModel.from_pretrained(...)
    • Nếu muốn dùng mã mô hình tùy biến thì cần trust_remote_code=True
  • Hỗ trợ phục vụ cục bộ bằng vLLMSGLang
    • Cả hai engine đều có thể xử lý yêu cầu văn bản và hình ảnh tại endpoint tương thích OpenAI /v1/chat/completions
  • Trong Docker Model Runner, chạy bằng docker model run hf.co/moonshotai/Kimi-K3
  • Mô hình cũng có thể được dùng trên HuggingChat, Google Colab và Kaggle

Cách dùng API để giữ trạng thái suy luận

  • Kimi K3 có thinking mode luôn bật và trả về reasoning_content
  • Trường yêu cầu cấp cao nhất reasoning_effort hỗ trợ "low", "high", "max", mặc định là "max"
  • Hội thoại nhiều lượt và gọi công cụ phải tuân theo cách bảo toàn lịch sử suy nghĩ
    • Cần gửi lại nguyên vẹn thông điệp assistant mà API trả về vào messages
    • Không chỉ content mà cả reasoning_contenttool_calls cũng phải được gồm vào
  • Có thể xem thêm về đầu vào thị giác, structured output, partial mode, chọn công cụ, nạp công cụ động và context caching tại Kimi K3 QuickstartThinking Effort

Giấy phép

  • Cả kho mã nguồn và trọng số mô hình đều được phát hành theo Kimi K3 License

2 bình luận

 
treestae 1 giờ trước

Mong là sẽ có nhà cung cấp trong nước cung cấp dịch vụ này.

 
Ý kiến trên Hacker News
  • Khi mức giá trung gian từ bên thứ ba cho mô hình 3 nghìn tỷ tham số được xác lập, ta sẽ có thể ước lượng chi phí phục vụ thực tế và liệu phòng lab có trợ giá token API hay không
    Vì là MXFP4 native nên cần khoảng 1,5TB VRAM, sát giới hạn của 8×B200; nếu tính cả tối ưu độ dài ngữ cảnh và thông lượng thì thực tế có vẻ cần 16 card
    Trên benchmark AISI về an ninh mạng, mô hình này cao hơn GLM 5.2 nhưng vẫn còn khoảng cách lớn so với các mô hình đóng tối tân, nên có thể cần tinh chỉnh. Cũng tò mò liệu Cursor có huấn luyện lại để so sánh trực tiếp với dòng Composer, vốn là bản tinh chỉnh Kimi 2.6/2.7, và Grok 4.5 hay không
    Cũng đáng kỳ vọng khả năng tạo mô hình nhỏ bằng chưng cất tri thức đúng nghĩa, học toàn bộ phân phối xác suất. Đặc biệt DSV4-Kimi với chi phí phục vụ thấp có vẻ đầy hứa hẹn

    • Tôi tò mò về hiệu năng suy luận tốc độ thấp có thể đạt được trên các máy chủ Xeon hai hoặc bốn socket chỉ có RAM 1,5~3TB mà không dùng GPU. Với các tác vụ dài 4~6 giờ, 5~6 token/giây cũng có thể dùng được tùy mục đích
      Nếu cấu hình 3TB RAM bằng máy chủ 4U cũ và 32 thanh ECC DIMM 64GB thì dưới 30.000 USD, chênh lệch giá rất lớn so với dàn GPU thực thụ. Hiện chưa có trọng số full precision hay bản lượng tử hóa Q8/Q8-XL của Unsloth, nhưng để dùng cả ngữ cảnh rộng rãi thì có vẻ cần vượt 1.536GB, lên 2TB, và nếu được là 2,5~3TB
      Q4 và Q6 nhiều khả năng là thỏa hiệp tệ nhất: vừa mất tri thức và độ chính xác, vừa chậm và khó tin cậy; nếu muốn chạy một mô hình thông minh nhưng chậm trên thiết bị ngân sách thấp thì tôi nghĩ cần Q8
    • Hiện nay tinh chỉnh thường áp dụng LoRA lên mô hình nền bnb 4-bit, nhưng tôi nghĩ đã đến lúc đổi định dạng nền sang GGUF. GGUF đang tích cực hỗ trợ các kiến trúc mô hình mới và lượng tử hóa mạnh tay hơn
      Tôi đã làm proof of concept tại https://github.com/woct0rdho/transformers5-qwen3.5-recipe, trong đó có thể tinh chỉnh Qwen3.5-35B-A3B với 16GiB VRAM và DeepSeek-V4-Flash 284B-A13B với 90GiB VRAM mà không cần offload sang CPU. Nó cũng hoạt động tốt trên các hệ thống bộ nhớ hợp nhất như Strix Halo
      Dù vậy, mô hình cỡ Kimi-K3 vẫn cần nhiều GPU và node, nên có nhiều vấn đề phải giải quyết hơn hẳn so với huấn luyện trên một GPU đơn
    • Anthropic và OpenAI có những đột phá tối ưu hóa mà các phòng lab Trung Quốc chưa có, vì vậy mức giá này có thể cho thấy cận trên của chi phí, nhưng không cho thấy cận dưới
    • Vì là mô hình MXFP4 native nên khía cạnh phần cứng cũng thú vị. Nó vừa vặn thoải mái trong một node 8×AMD MI355X, nên có khả năng hạ giá token hơn nữa
    • Nếu không biết chi phí huấn luyện, ta chỉ có thể suy ra chi phí biên để phục vụ một mô hình như vậy, chứ không biết phòng lab có trợ giá token API hay không. Ta cũng không biết kích thước thực của các mô hình đóng, thậm chí không biết Fable có 10 nghìn tỷ hay 1 nghìn tỷ tham số
  • Phần thú vị hơn nhiều so với giá trong lần công bố này là khả năng tùy biến. Startup cũng có thể tải trọng số về, sửa đổi và tinh chỉnh; lợi thế thật sự nằm ở hiệu năng trên dữ liệu của chính họ và chủ quyền sở hữu trí tuệ, hơn là chi phí. Đây là thành quả lớn của đội Kimi

  • Tôi cảm thấy phần cứng để cá nhân chạy LLM đang được cấu hình không đúng với nhu cầu. Hoặc phải chịu 5~10 token/giây trên bộ nhớ hợp nhất, hoặc phải dùng card trung tâm dữ liệu tiêu thụ hàng trăm GB VRAM và hơn 1kW
    Không có GPU bán chuyên với TDP 180~250W và VRAM 128GB hoặc 256GB; chỉ cần hai card như vậy cùng kết nối phổ biến cỡ NVLink thôi cũng đã khá hữu ích. Chạy Kimi K3 cục bộ sẽ cần homelab khổng lồ và rất tốn kém, nhưng sẽ thật tốt nếu có thể chạy GLM 5.2 khoảng 100 token/giây trong một phiên đơn, và khoảng 60 token/giây khi dùng nhiều sub-agent

    • Mô hình lớn Q8 mà tôi muốn không vừa trong hệ thống 3.995 USD với RAM tối đa 128GB, cũng không có đủ không gian ngữ cảnh thực dụng. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8, Laguna S 2.1 Q8 cần 170~190GB RAM bao gồm toàn bộ ngữ cảnh, nên sẽ vừa với workstation hoặc server hai socket 256GB không có GPU
      Các số đo dự kiến khi chạy llama-server mới nhất với --no-mmap là DeepSeek-V4-Flash Q4_K_XL 178.175MiB, Q8_K_XL 184.636MiB, Laguna-S-2.1 Q8_K_X 172.860MiB, Qwen3.5-122B-A10B Q8_K_XL 170.038MiB
    • Suy luận LLM cho một người dùng đặc biệt không hợp với phần cứng tiêu dùng phổ thông. Tải là gián đoạn, nhưng trọng số phải luôn nằm trong bộ nhớ; vì vậy một máy chủ nhiều người dùng giữ trọng số thường trú và chỉ thêm KV cache cho từng người dùng sẽ hiệu quả hơn nhiều, đồng thời các lõi GPU đắt tiền cũng không bị nhàn rỗi phần lớn thời gian
      Điều này trái ngược với công việc desktop: chúng cũng gián đoạn, nhưng năng lực tính toán cần thiết đã đủ rẻ để ta có thể đặt trên bàn một dàn máy dư thừa đến mức quá mức khi nhàn rỗi
    • Sau cơn sốt tiền mã hóa, các nhà sản xuất GPU bắt đầu phân khúc thị trường bằng VRAM để phân biệt giá. Nvidia hạn chế bộ nhớ trên card tiêu dùng ở mức nhỏ để ngăn các nhà vận hành cloud gom mua chúng, nhờ đó có thể bán về bản chất cùng một phần cứng cho thị trường PC và trung tâm dữ liệu với mức giá rất khác nhau, thu lợi ở cả hai phía
    • Tôi có cảm giác khi mô hình ngày càng lớn, mọi thứ đang đi theo hướng ngược lại với cuộc cách mạng PC. Các phòng lab tuyến đầu chỉ tung ra mô hình đóng, để những ngoại lệ như gpt-oss, khiến việc chạy mô hình mở trở nên khó khăn trong khi vẫn nói về dân chủ hóa, nên trông đặc biệt bất công
    • Việc chạy các LLM như thế này tại nhà khó có thể thực dụng nếu không có đột phá về thiết kế. Cách chạy hợp lý duy nhất là xử lý theo batch lớn trên phần cứng chia sẻ
      Nếu có thể mua GPU vài nghìn USD, tôi sẽ mua với tư cách một người mê công nghệ có tiền, nhưng phải thừa nhận đó là món xa xỉ cực kỳ kém hiệu quả như xe thể thao. Điều thật sự đáng buồn là chúng ta không có công nghệ điện toán hay thể chế chính trị-xã hội để vận hành phần cứng chia sẻ theo cách đáng tin cậy
  • Theo giấy phép, nếu bên giữ giấy phép hoặc công ty liên kết vận hành mảng kinh doanh mô hình dạng dịch vụ và doanh thu cộng dồn trong 12 tháng liên tiếp vượt 20 triệu USD, họ phải ký hợp đồng riêng với Moonshot AI trước khi sử dụng phần mềm hoặc sản phẩm phái sinh cho mục đích thương mại

    • Có vẻ tương tự cách Meta từng áp dụng với các mô hình Llama đời đầu. Ngoài ra, điều khoản yêu cầu hiển thị Kimi K3 một cách nổi bật trên giao diện người dùng nếu sử dụng phần mềm hoặc sản phẩm phái sinh trong sản phẩm/dịch vụ thương mại có hơn 100 triệu người dùng hoạt động hằng tháng hoặc doanh thu hằng tháng trên 20 triệu USD cũng là một chiêu marketing khôn khéo
  • Có thể dùng tại https://app.fireworks.ai/models/fireworks/kimi-k3, giá là 3 USD cho mỗi 1 triệu token đầu vào không cache, 0,30 USD cho đầu vào cache và 15 USD cho đầu ra

    • Gói ưu tiên Kimi của Fireworks cũng được cung cấp trên OpenRouter với giá 3,75 USD cho mỗi 1 triệu token: https://openrouter.ai/moonshotai/kimi-k3#providers
      Hiện độ trễ thấp hơn Moonshot đáng kể, nhưng lưu lượng sử dụng cũng thấp hơn nhiều nên còn phải xem có duy trì được không. Dù vậy, việc triển khai ngay trong ngày là rất ấn tượng
    • Claude Opus 5 có giá 5 USD cho đầu vào không cache, 0,50 USD cho đầu vào cache và 25 USD cho đầu ra; với ghi cache còn cộng thêm 25% cho mốc 5 phút và 100% cho mốc 1 giờ
    • Chỉ vài giờ sau khi Fireworks ra mắt, chúng tôi đã có thể cung cấp cho người dùng trên nền tảng của mình. Tuy nhiên, họ đã ngừng các mô hình Flux theo yêu cầu, nên giờ hơi tiếc vì không biết nên tạo ảnh ở đâu
    • Together.ai cũng có cùng giá bán, và tôi đã kiểm tra Fireworks cùng Together đầu tiên
  • Do cạnh tranh, giá GLM 5.2 đã giảm khoảng 45% chỉ sau khoảng 1,5 tháng kể từ khi ra mắt ngày 16/6, và các nhà cung cấp mới vẫn đang cạnh tranh giá: https://openrouter.ai/z-ai/glm-5.2#providers
    Về mặt kinh tế học, giá không phải là không được thấp hơn tổng chi phí, mà là không được thấp hơn chi phí biên; với một trung tâm dữ liệu có tỷ lệ sử dụng GPU thấp, con số này gần tương đương tiền điện. Tôi đoán do tình trạng dư thừa hạ tầng ở các trung tâm dữ liệu nhỏ và cạnh tranh, chẳng mấy chốc sẽ có nơi bán token thấp hơn cả mức cộng giữa tiền điện và khấu hao GPU

    • Cũng có thể là mô hình bán token rẻ rồi bán lại dữ liệu token của người dùng cho nơi khác
    • Con số giảm 45% đáng nghi. Các nhà cung cấp giá rẻ trên OpenRouter dùng FP4, khác với FP8 của Z.ai chính thức. Cũng có nhà cung cấp FP8 rẻ như Novita, nhưng trên UI trông giống giảm giá tạm thời, còn giá bình thường gần như ngang Z.ai chính thức
    • SemiAnalysis ước tính chi phí của một mô hình khoảng 2 nghìn tỷ tham số là dưới 1 USD cho mỗi 1 triệu token. Tùy vào thông lượng và lượng tử hóa, nhưng nếu giá vốn của nhà cung cấp quy mô lớn đủ thấp thì mức giá thấp nhất hiện tại của GLM 5.2 là 2,42 USD vẫn có thể đem lại lợi nhuận lớn
  • Khi hỏi “Tell me about yourself” trên Hugging Face, Kimi K3 trả lời rằng nó là Claude do Anthropic tạo ra, khá thú vị

    • Với cùng câu hỏi, nó cũng trả lời bình thường rằng mình là “Kimi do Moonshot AI phát triển”
    • Những câu trả lời kiểu này không có nhiều ý nghĩa. Nếu hỏi Opus câu tương tự bằng tiếng Trung, đôi khi nó cũng tự nhận là DeepSeek, vì dữ liệu huấn luyện bị trộn lẫn và mô hình sinh ảo giác
    • Không có gì đáng ngạc nhiên. Chưng cất tri thức là chuyện phổ biến và mọi phòng lab đều dùng, dù cố ý hay không. Sau ChatGPT, kho ngữ liệu huấn luyện luôn chứa nội dung do AI tạo ra
  • Khuyến nghị nên tải xuống để lưu trữ các mô hình tuyến đầu. Dù là 1,5TB, để vào ổ đĩa rẻ tiền rồi seed torrent còn hữu ích hơn
    Giống như trước đây từng cố kiểm soát các thuật toán mã hóa, mô hình cũng có thể bị chặn bằng quy định; phần mềm công khai phải được phân phối rộng rãi thì mới sống sót. Theo thời gian, nhờ đầu tư khổng lồ vào kỹ thuật và sản xuất phần cứng, việc chạy thực tế sẽ trở nên khả thi; sẽ thật đáng tiếc nếu đến lúc đó việc phân phối đã thành bất hợp pháp và phải trả chi phí do bị thao túng bởi quy định

    • File torrent nằm ở https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent
      Địa chỉ magnet là magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce
    • Cuối cùng, nhà chức trách sẽ bắt đầu hạn chế từ việc mua phần cứng để chạy các mô hình như vậy
    • Giờ cũng chẳng còn ổ đĩa rẻ nữa, và tôi không muốn bỏ ra vài trăm USD chỉ vì nỗi lo mơ hồ về quy định
  • Sau khi xem xét giấy phép và thử trên phần cứng thực tế, có vẻ nhà cung cấp khó có thể đưa ra mức giá rẻ hơn Moonshot 60–70%. Có thể giảm nhẹ, nhưng nếu không hy sinh đáng kể tốc độ xử lý thì khó có mức chiết khấu như GLM
    Biên lợi nhuận của Kimi được ước tính khoảng 40–50% ngay cả khi giả định họ thuê GPU với giá cao, và có thể cao hơn nếu dùng thiết bị tự sở hữu. Nhưng vẫn không đạt mức biên lợi nhuận trên 90% của Anthropic như một số người ước tính, và ngay cả biên lợi nhuận API 80% của Anthropic cũng đáng nghi
    Nếu chỉ tính tiền điện là giá vốn thì 80–90% cũng có thể, nhưng nhìn vào số token mỗi giây hiện được cung cấp thì không dễ. Tôi chỉ thử trên B200 và không kiếm được B300; đây vốn đã là mô hình lượng tử hóa, cũng không dùng ngữ cảnh 1 triệu token, nên có vẻ không còn nhiều dư địa tối ưu bộ nhớ tức thì. Sẽ tốt nếu ai đó có quyền truy cập R100 có thể xác minh chi phí
    Các nhà cung cấp lớn phải ký hợp đồng với Kimi, nên khó kỳ vọng mức giảm giá mạnh trong lúc Kimi còn là mô hình mở hàng đầu

  • Liên kết gốc trả về 404, nên tôi tò mò không biết nó đã bị chặn hay tự kiểm duyệt

    • Cho đến vài phút trước vẫn còn trang đếm ngược công bố trọng số, còn 19 phút nữa là kết thúc thì đột nhiên xuất hiện lỗi 404
    • Khả năng cao là vấn đề kỹ thuật trong quá trình chuyển đổi. Dù gần như không ai chạy được, việc rất nhiều người dùng tải xuống một mô hình nặng vài TB sẽ gây ra điều gì cho Hugging Face cũng rất đáng chú ý
      Có lẽ sẽ có nhu cầu lưu trữ để phòng khả năng nó đột ngột biến mất do kiểm soát của chính phủ. Gần đây Trung Quốc cũng bắt đầu thảo luận về kiểm soát xuất khẩu mô hình, và giờ khi họ bắt đầu tung ra các mô hình tiên tiến nhất chứ không phải các mô hình tụt hậu, tình hình đã khác
    • Nghe có thể giống thuyết âm mưu, nhưng đây là cơ hội tốt để Mỹ hoặc Trung Quốc phô trương ảnh hưởng, và có vẻ khả năng là Mỹ cao hơn