1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Thiết lập suy luận tối đa đạt 50 điểm trên AAII, xếp thứ 3 sau Kimi K3 (max) và GLM-5.2 (max)
  • Là mô hình MoE với chỉ 13 tỷ tham số được kích hoạt trên mỗi token trong tổng số 284 tỷ tham số, hỗ trợ nhập/xuất văn bản và ngữ cảnh 1 triệu token
  • Giá API là $0.14 cho đầu vào, $0.28 cho đầu ra trên mỗi 1 triệu token, cache hit $0.003; chi phí đánh giá toàn bộ Intelligence Index là $72.02
  • Trong quá trình đánh giá, mô hình dùng 210 triệu token đầu ra, dài dòng hơn nhiều so với trung vị 100 triệu của các mô hình cùng hạng; tốc độ đầu ra chưa được công bố
  • Công bố trọng số mô hình và áp dụng giấy phép MIT, cho phép tự host và sử dụng thương mại; hiện có 1 nhà cung cấp API

Cấu hình mô hình và cách công bố

  • DeepSeek V4 Flash 0731 là mô hình suy luận open-weight được công bố ngày 31/7/2026
  • Tổng số tham số là 284 tỷ, sử dụng kiến trúc Mixture of Experts(MoE) trong đó 13 tỷ tham số được kích hoạt cho mỗi token khi suy luận
  • Có thể tải trọng số mô hình về để tự host
  • Áp dụng giấy phép MIT, cho phép sử dụng thương mại
  • Đây là phiên bản suy luận sử dụng nỗ lực suy luận tối đa (Max Effort), và có thể tồn tại phiên bản không suy luận riêng

Đánh giá trí tuệ

  • Đạt 50 điểm trong Artificial Analysis Intelligence Index v4.1
    • Xếp thứ 3 sau Kimi K3 (max), GLM-5.2 (max). Kế tiếp là Kimi K3 (low), MiniMax-M3 ở vị trí 4/5
    • Trung vị của các mô hình open-weight cỡ lớn cùng hạng là 25 điểm
    • Artificial Analysis xếp mô hình này vào nhóm dẫn đầu về trí tuệ
  • Intelligence Index v4.1 kết hợp 9 bài đánh giá sau
    • GDPval-AA v2: công việc thực tế dạng agent
    • 𝜏³-Banking: sử dụng công cụ dạng agent
    • Terminal-Bench v2.1: lập trình/sử dụng terminal dạng agent
    • SciCode: lập trình
    • Humanity's Last Exam: suy luận/kiến thức
    • GPQA Diamond: suy luận khoa học
    • CritPt: suy luận vật lý
    • AA-Omniscience: độ chính xác kiến thức và hạn chế ảo giác
    • AA-LCR: suy luận ngữ cảnh dài

Phạm vi benchmark bổ sung

  • Cũng cung cấp các kết quả đánh giá sau để so sánh mục đích sử dụng chi tiết theo từng mô hình
    • AA-Briefcase: công việc tri thức dạng agent
    • AutomationBench-AA: tự động hóa công việc SaaS
    • Harvey LAB-AA: công việc agent pháp lý
    • EnterpriseOps-Gym-AA: công việc vận hành doanh nghiệp
    • IFBench: tuân thủ chỉ dẫn
    • APEX-Agents-AA: tác vụ agent kéo dài
    • ITBench-AA: phân tích nguyên nhân sự cố Kubernetes
    • MMMU-Pro: suy luận thị giác
  • DeepSeek V4 Flash 0731 không hỗ trợ đầu vào hình ảnh, nên là mô hình chỉ văn bản chứ không phải mô hình đa phương thức

Độ tin cậy kiến thức và đánh giá ảo giác

  • AA-Omniscience Index chấm điểm cho câu trả lời chính xác, áp dụng phạt với ảo giác và không phạt khi từ chối trả lời
  • Thang điểm từ -100 đến 100
    • 0 điểm nghĩa là số câu đúng và sai bằng nhau
    • Điểm âm nghĩa là số câu sai nhiều hơn số câu đúng

Mức dùng token và đặc tính phản hồi

  • Tạo ra 210 triệu token đầu ra trong toàn bộ đánh giá Intelligence Index
    • Trung vị của các mô hình open-weight cùng hạng là 100 triệu token
    • Artificial Analysis xếp đây là mức rất dài dòng
  • Số token đầu ra trên mỗi tác vụ được tính bằng cách áp dụng trọng số Intelligence Index cho lượng đầu ra của từng benchmark, rồi chia cho số tác vụ không tính các lần chạy lặp lại
  • Tốc độ đầu ra chưa được đo, nên số token đầu ra mỗi giây chưa được công bố

Giá API và chi phí đánh giá

  • Giá theo DeepSeek API như sau
    • Đầu vào: $0.14 trên mỗi 1 triệu token
    • Đầu ra: $0.28 trên mỗi 1 triệu token
    • Cache hit: $0.003 trên mỗi 1 triệu token
  • Nếu trộn cache hit/đầu vào/đầu ra theo tỷ lệ 7:2:1, giá trên mỗi 1 triệu token là $0.06
  • Chi phí cho toàn bộ đánh giá Intelligence Index là $72.02
  • Phần tóm tắt hiển thị trung vị các mô hình so sánh là $0.43 cho đầu vào/$1.20 cho đầu ra, còn phần FAQ hiển thị $0.58 cho đầu vào/$2.20 cho đầu ra
  • Chi phí trên mỗi tác vụ được tính bằng cách lấy chi phí token cho đầu vào, cache hit, ghi cache, suy luận và câu trả lời cuối cùng chia cho số tác vụ, rồi áp dụng trọng số Index của từng benchmark
  • Chi phí ghi và lưu cache có thể bị tính riêng tùy theo nhà cung cấp API

Ngữ cảnh và phạm vi cung cấp

  • Cửa sổ ngữ cảnh là 1 triệu token, tương đương khoảng 1.500 trang A4 với font Arial cỡ 12
  • Có thể dùng cho workflow RAG cần tìm kiếm và suy luận trên tài liệu quy mô lớn
  • Chỉ hỗ trợ đầu vào văn bản và đầu ra văn bản
  • Hiện có 1 doanh nghiệp cung cấp API, và giá có thể khác nhau tùy nhà cung cấp

1 bình luận

 
Ý kiến trên Hacker News
  • Trọng số mô hình vừa được công bố: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • Đang kỳ vọng bản lượng tử hóa DwarfStar. Tôi đã dùng bản xem trước DeepSeek V4 Flash làm tác nhân lập trình chính trong vài tháng trên MacBook Pro 128GB, và nó có vẻ vượt GLM 5.2 ở gần như mọi chỉ số
    • Nó nhắm tới bộ tăng tốc phần cứng có primitive nhân ma trận 128×128, nên tôi tự hỏi liệu có phải đang nói đến Warp Group Matrix Multiply Accumulate của H100 hay không
    • Nếu là Unsloth GGUF dưới 165GB thì có thể chạy trên phần lớn hệ thống chỉ dùng CPU với 256GB RAM. Cũng có thể dùng cấu hình lai với llama-server, đẩy tối đa lên GPU 32GB·48GB·96GB rồi đặt phần còn lại trong DRAM hệ thống
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Mô hình DeepSeek mới giống như quà Giáng sinh. Mô hình API giá rẻ là thứ DeepSeek làm tốt nhất, và cho đến khi giá VRAM giảm đủ để có thể chạy cục bộ thì đây có lẽ vẫn là cách tốt nhất
    Mô hình thuê bao dựa vào trợ giá khó mà kéo dài lâu, còn tính phí theo API có vẻ gần với mô hình kinh doanh bền vững hơn

    • Tôi dùng DeepSeek cho một dự án và thấy thật đáng kinh ngạc khi có thể dùng hàng chục triệu token chỉ với vài xu. Nó không phù hợp với mọi tác vụ, nhưng có những việc nó xử lý xuất sắc với chi phí gần như miễn phí
    • Tôi mong tới ngày Trung Quốc bắt kịp phần cứng bộ nhớ và tính toán để lấn át các công ty Mỹ cả về giá lẫn hiệu năng
    • Đồng nghiệp lập trình của tôi than phiền rằng họ đốt hết token Claude chỉ trong một giờ, còn tôi dùng DS Flash cả ngày. Thỉnh thoảng nếu nó sai thì lúc đó chỉ cần gọi Claude hay mô hình tương tự cho những việc khó hơn
    • Ngay cả tính theo token thì DeepSeek API cũng rất có thể hiệu quả chi phí hơn thuê bao. Tôi đã tự thử và thấy Flash cải thiện đáng kể khả năng tuân thủ chỉ dẫn, đồng thời chủ động hơn nhiều, nên hiện gần như không có đối thủ về hiệu quả chi phí
    • Nếu nhìn vào giá trực tiếp thì để ra kết quả tương đương GPT 5.6 Luna cần nhiều token gấp 5 lần và tốc độ token/giây cũng thấp hơn nhiều. Dù vậy, áp lực từ DeepSeek rõ ràng vẫn buộc các hãng hiện tại tiếp tục tối ưu hóa
  • Địa chỉ cũ trả về 404, và URL đúng có vẻ là: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Tôi đã thêm điểm dữ liệu DeepSeek V4 Flash 0731 vào biểu đồ OpenAI công bố hôm qua, và nó nằm trên đường biên giá-hiệu năng
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Bản gốc: https://openai.com/index/advancing-the-price-performance-fro...

  • Trong benchmark công khai cho tác vụ tác nhân code, họ nói đã dùng DeepSeek Harness chế độ tối thiểu chưa phát hành, nên tôi tự hỏi liệu họ có kế hoạch công bố cả harness tác nhân lập trình đã tối ưu hóa hay không
    Nếu dùng DSv4 Flash với reasonix hoặc pi thì có thể code cả ngày chỉ với vài xu mà không phải lo token. Ngược lại, dùng cùng mô hình đó trên Fireworks hay OpenRouter với ZDR thì chi phí cứ tăng lên vô cớ. Có vẻ họ đang trợ giá để thu thập dữ liệu sử dụng, và tôi đang chờ tới ngày có thể chạy cục bộ

    • Tôi tò mò nếu không mua qua OpenRouter thì bạn mua từ nhà cung cấp nào. Nếu đó là nhà cung cấp có trên OpenRouter thì theo tôi biết mua trực tiếp và qua đó giá là như nhau
    • Trong báo cáo kỹ thuật họ đã nhá hàng DeepSeek Harness rồi. Các tác vụ tác nhân code được đánh giá với chế độ tối thiểu, mức nỗ lực suy luận tối đa, temperature = 1.0, top_p = 0.95, và harness sẽ được công bố sau
  • Với người dùng chỉ có một chiếc RTX PRO 6000 96GB hoặc DGX Spark 128GB, vllm-moet là một engine rất tốt nhưng ít được biết tới. Nó tự tạo các mặt phẳng 2-bit đối xứng cho suy luận, đồng thời tạo thêm bộ nhớ đệm delta 4-bit để khôi phục độ chính xác, và hỗ trợ stream trọng số lớn hơn RAM từ SSD
    Bạn có thể đặt lượng VRAM cấp cho từng vùng để cân bằng giữa tốc độ và độ chính xác, và đã có trình diễn 170 token/giây trên DS V4 Flash. Nó dùng nguyên mẫu mô hình gốc, không cần mô hình chuyển đổi riêng
    Trên DGX Spark cần một mẹo nhỏ để bỏ qua khác biệt giữa sm120sm121, nhưng vì nó vẫn chạy được trên sm121 nên đáng để bỏ vài giờ thử

  • Với 0,28 USD cho mỗi 1 triệu token đầu ra, nó mang lại trí tuệ ở mức GLM 5.2·Gemini 3.6, và bản Pro cập nhật cũng sắp ra mắt
    Bản Unsloth Q8 không mất mát là 162GB, tức kích thước thực sự đủ để chạy tại nhà

    • Tôi muốn xem ngôi nhà nào có thể chạy thứ đó tại gia
    • Kích thước Q8 vào khoảng 151GB
  • Nếu DeepSeek V4 Flash vượt cả V4 Pro, tôi tự hỏi liệu trong vài tuần tới có thể kỳ vọng V4 Pro cấp Opus 5 hay không. Nếu còn vượt Opus thì càng tốt

    • Tôi đang dùng V4 Flash cho ứng dụng mình làm, và sau khi chuyển từ chỉ dùng GPT·Opus·Sonnet thì thật ngạc nhiên về hiệu năng và hiệu quả chi phí. Chi phí thấp đến mức tôi còn có thể cung cấp gói miễn phí khá rộng rãi cho một ứng dụng không đặt mục tiêu lợi nhuận
      https://trysojourn.app
    • Hiệu năng Opus 5 với giá của V4 Pro sẽ tuyệt vời đến mức khó tin, nhưng có lẽ gần như chỉ là mơ thôi
    • Họ từng nói bản cuối cùng của V4 Pro cập nhật sẽ sớm được công bố
  • Phần thực sự thú vị là họ đạt được mức tăng hiệu năng lớn chỉ bằng tinh chỉnh bổ sung mà không thay đổi kiến trúc. Đó là kết quả của việc đổ thêm dữ liệu, tính toán và thời gian
    DS V4 Flash tương đối nhỏ so với nhóm mô hình cạnh tranh, nên có vẻ rất có khả năng sẽ đạt được mức cải thiện tương tự nếu áp dụng dữ liệu chất lượng cao và pipeline huấn luyện đó cho các mô hình nhỏ khác

  • Về giá trên mỗi tác vụ, nó đã vượt Luna khoảng 2 lần: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Tôi cũng muốn xem nó so với Luna theo từng loại tác vụ cụ thể ra sao
    • Vì chi phí nằm trên trục X nên nói chính xác hơn là DeepSeek V4 Flash 0731 với suy luận tối đa có giá khoảng 0,03 USD mỗi tác vụ, chỉ số 50. OpenAI Luna ở mức suy luận cao là 0,03 USD·chỉ số 46, siêu cao là 0,04 USD·chỉ số 49, và tối đa là 0,07 USD·chỉ số 51
      Vì vậy, sẽ công bằng hơn nếu nói Luna đắt hơn DeepSeek Flash 2~3 lần nhưng tốc độ suy luận nhanh hơn 2~5 lần. Mô hình OpenAI rẻ nhất vượt DeepSeek là Luna suy luận tối đa, với hiệu năng tương đương, đắt hơn khoảng 3 lần trước khi làm tròn, nhưng tốc độ cũng nhanh gần 3 lần
      Việc Artificial Analysis dùng cùng màu xanh đậm cho cả DeepSeek và OpenAI là lựa chọn màu đặc biệt không phù hợp, nhất là vào một ngày như hôm nay