- Thiết lập suy luận tối đa đạt 50 điểm trên AAII, xếp thứ 3 sau Kimi K3 (max) và GLM-5.2 (max)
- Là mô hình MoE với chỉ 13 tỷ tham số được kích hoạt trên mỗi token trong tổng số 284 tỷ tham số, hỗ trợ nhập/xuất văn bản và ngữ cảnh 1 triệu token
- Giá API là $0.14 cho đầu vào, $0.28 cho đầu ra trên mỗi 1 triệu token, cache hit $0.003; chi phí đánh giá toàn bộ Intelligence Index là $72.02
- Trong quá trình đánh giá, mô hình dùng 210 triệu token đầu ra, dài dòng hơn nhiều so với trung vị 100 triệu của các mô hình cùng hạng; tốc độ đầu ra chưa được công bố
- Công bố trọng số mô hình và áp dụng giấy phép MIT, cho phép tự host và sử dụng thương mại; hiện có 1 nhà cung cấp API
Cấu hình mô hình và cách công bố
- DeepSeek V4 Flash 0731 là mô hình suy luận open-weight được công bố ngày 31/7/2026
- Tổng số tham số là 284 tỷ, sử dụng kiến trúc Mixture of Experts(MoE) trong đó 13 tỷ tham số được kích hoạt cho mỗi token khi suy luận
- Có thể tải trọng số mô hình về để tự host
- Áp dụng giấy phép MIT, cho phép sử dụng thương mại
- Đây là phiên bản suy luận sử dụng nỗ lực suy luận tối đa (Max Effort), và có thể tồn tại phiên bản không suy luận riêng
Đánh giá trí tuệ
- Đạt 50 điểm trong Artificial Analysis Intelligence Index v4.1
- Xếp thứ 3 sau Kimi K3 (max), GLM-5.2 (max). Kế tiếp là Kimi K3 (low), MiniMax-M3 ở vị trí 4/5
- Trung vị của các mô hình open-weight cỡ lớn cùng hạng là 25 điểm
- Artificial Analysis xếp mô hình này vào nhóm dẫn đầu về trí tuệ
- Intelligence Index v4.1 kết hợp 9 bài đánh giá sau
- GDPval-AA v2: công việc thực tế dạng agent
- 𝜏³-Banking: sử dụng công cụ dạng agent
- Terminal-Bench v2.1: lập trình/sử dụng terminal dạng agent
- SciCode: lập trình
- Humanity's Last Exam: suy luận/kiến thức
- GPQA Diamond: suy luận khoa học
- CritPt: suy luận vật lý
- AA-Omniscience: độ chính xác kiến thức và hạn chế ảo giác
- AA-LCR: suy luận ngữ cảnh dài
Phạm vi benchmark bổ sung
- Cũng cung cấp các kết quả đánh giá sau để so sánh mục đích sử dụng chi tiết theo từng mô hình
- AA-Briefcase: công việc tri thức dạng agent
- AutomationBench-AA: tự động hóa công việc SaaS
- Harvey LAB-AA: công việc agent pháp lý
- EnterpriseOps-Gym-AA: công việc vận hành doanh nghiệp
- IFBench: tuân thủ chỉ dẫn
- APEX-Agents-AA: tác vụ agent kéo dài
- ITBench-AA: phân tích nguyên nhân sự cố Kubernetes
- MMMU-Pro: suy luận thị giác
- DeepSeek V4 Flash 0731 không hỗ trợ đầu vào hình ảnh, nên là mô hình chỉ văn bản chứ không phải mô hình đa phương thức
Độ tin cậy kiến thức và đánh giá ảo giác
- AA-Omniscience Index chấm điểm cho câu trả lời chính xác, áp dụng phạt với ảo giác và không phạt khi từ chối trả lời
- Thang điểm từ -100 đến 100
- 0 điểm nghĩa là số câu đúng và sai bằng nhau
- Điểm âm nghĩa là số câu sai nhiều hơn số câu đúng
Mức dùng token và đặc tính phản hồi
- Tạo ra 210 triệu token đầu ra trong toàn bộ đánh giá Intelligence Index
- Trung vị của các mô hình open-weight cùng hạng là 100 triệu token
- Artificial Analysis xếp đây là mức rất dài dòng
- Số token đầu ra trên mỗi tác vụ được tính bằng cách áp dụng trọng số Intelligence Index cho lượng đầu ra của từng benchmark, rồi chia cho số tác vụ không tính các lần chạy lặp lại
- Tốc độ đầu ra chưa được đo, nên số token đầu ra mỗi giây chưa được công bố
Giá API và chi phí đánh giá
- Giá theo DeepSeek API như sau
- Đầu vào: $0.14 trên mỗi 1 triệu token
- Đầu ra: $0.28 trên mỗi 1 triệu token
- Cache hit: $0.003 trên mỗi 1 triệu token
- Nếu trộn cache hit/đầu vào/đầu ra theo tỷ lệ 7:2:1, giá trên mỗi 1 triệu token là $0.06
- Chi phí cho toàn bộ đánh giá Intelligence Index là $72.02
- Phần tóm tắt hiển thị trung vị các mô hình so sánh là $0.43 cho đầu vào/$1.20 cho đầu ra, còn phần FAQ hiển thị $0.58 cho đầu vào/$2.20 cho đầu ra
- Chi phí trên mỗi tác vụ được tính bằng cách lấy chi phí token cho đầu vào, cache hit, ghi cache, suy luận và câu trả lời cuối cùng chia cho số tác vụ, rồi áp dụng trọng số Index của từng benchmark
- Chi phí ghi và lưu cache có thể bị tính riêng tùy theo nhà cung cấp API
Ngữ cảnh và phạm vi cung cấp
- Cửa sổ ngữ cảnh là 1 triệu token, tương đương khoảng 1.500 trang A4 với font Arial cỡ 12
- Có thể dùng cho workflow RAG cần tìm kiếm và suy luận trên tài liệu quy mô lớn
- Chỉ hỗ trợ đầu vào văn bản và đầu ra văn bản
- Hiện có 1 doanh nghiệp cung cấp API, và giá có thể khác nhau tùy nhà cung cấp
1 bình luận
Ý kiến trên Hacker News
Trọng số mô hình vừa được công bố: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-server, đẩy tối đa lên GPU 32GB·48GB·96GB rồi đặt phần còn lại trong DRAM hệ thốnghttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Mô hình DeepSeek mới giống như quà Giáng sinh. Mô hình API giá rẻ là thứ DeepSeek làm tốt nhất, và cho đến khi giá VRAM giảm đủ để có thể chạy cục bộ thì đây có lẽ vẫn là cách tốt nhất
Mô hình thuê bao dựa vào trợ giá khó mà kéo dài lâu, còn tính phí theo API có vẻ gần với mô hình kinh doanh bền vững hơn
Địa chỉ cũ trả về 404, và URL đúng có vẻ là: https://artificialanalysis.ai/models/deepseek-v4-flash
Tôi đã thêm điểm dữ liệu DeepSeek V4 Flash 0731 vào biểu đồ OpenAI công bố hôm qua, và nó nằm trên đường biên giá-hiệu năng
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
Bản gốc: https://openai.com/index/advancing-the-price-performance-fro...
Trong benchmark công khai cho tác vụ tác nhân code, họ nói đã dùng DeepSeek Harness chế độ tối thiểu chưa phát hành, nên tôi tự hỏi liệu họ có kế hoạch công bố cả harness tác nhân lập trình đã tối ưu hóa hay không
Nếu dùng DSv4 Flash với reasonix hoặc pi thì có thể code cả ngày chỉ với vài xu mà không phải lo token. Ngược lại, dùng cùng mô hình đó trên Fireworks hay OpenRouter với ZDR thì chi phí cứ tăng lên vô cớ. Có vẻ họ đang trợ giá để thu thập dữ liệu sử dụng, và tôi đang chờ tới ngày có thể chạy cục bộ
temperature = 1.0,top_p = 0.95, và harness sẽ được công bố sauVới người dùng chỉ có một chiếc RTX PRO 6000 96GB hoặc DGX Spark 128GB, vllm-moet là một engine rất tốt nhưng ít được biết tới. Nó tự tạo các mặt phẳng 2-bit đối xứng cho suy luận, đồng thời tạo thêm bộ nhớ đệm delta 4-bit để khôi phục độ chính xác, và hỗ trợ stream trọng số lớn hơn RAM từ SSD
Bạn có thể đặt lượng VRAM cấp cho từng vùng để cân bằng giữa tốc độ và độ chính xác, và đã có trình diễn 170 token/giây trên DS V4 Flash. Nó dùng nguyên mẫu mô hình gốc, không cần mô hình chuyển đổi riêng
Trên DGX Spark cần một mẹo nhỏ để bỏ qua khác biệt giữa
sm120vàsm121, nhưng vì nó vẫn chạy được trênsm121nên đáng để bỏ vài giờ thửVới 0,28 USD cho mỗi 1 triệu token đầu ra, nó mang lại trí tuệ ở mức GLM 5.2·Gemini 3.6, và bản Pro cập nhật cũng sắp ra mắt
Bản Unsloth Q8 không mất mát là 162GB, tức kích thước thực sự đủ để chạy tại nhà
Nếu DeepSeek V4 Flash vượt cả V4 Pro, tôi tự hỏi liệu trong vài tuần tới có thể kỳ vọng V4 Pro cấp Opus 5 hay không. Nếu còn vượt Opus thì càng tốt
https://trysojourn.app
Phần thực sự thú vị là họ đạt được mức tăng hiệu năng lớn chỉ bằng tinh chỉnh bổ sung mà không thay đổi kiến trúc. Đó là kết quả của việc đổ thêm dữ liệu, tính toán và thời gian
DS V4 Flash tương đối nhỏ so với nhóm mô hình cạnh tranh, nên có vẻ rất có khả năng sẽ đạt được mức cải thiện tương tự nếu áp dụng dữ liệu chất lượng cao và pipeline huấn luyện đó cho các mô hình nhỏ khác
Về giá trên mỗi tác vụ, nó đã vượt Luna khoảng 2 lần: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
Vì vậy, sẽ công bằng hơn nếu nói Luna đắt hơn DeepSeek Flash 2~3 lần nhưng tốc độ suy luận nhanh hơn 2~5 lần. Mô hình OpenAI rẻ nhất vượt DeepSeek là Luna suy luận tối đa, với hiệu năng tương đương, đắt hơn khoảng 3 lần trước khi làm tròn, nhưng tốc độ cũng nhanh gần 3 lần
Việc Artificial Analysis dùng cùng màu xanh đậm cho cả DeepSeek và OpenAI là lựa chọn màu đặc biệt không phù hợp, nhất là vào một ngày như hôm nay