- Phiên bản chính thức của API DeepSeek-V4-Flash đã ra mắt bản beta công khai vào ngày 31 tháng 7 năm 2026, và có thể sử dụng bằng cách giữ nguyên cách gọi hiện tại, chỉ cần chỉ định tên mô hình là
deepseek-v4-flash - Hiệu năng tác vụ agent vượt xa V4-Pro-Preview, ghi nhận 82.7 điểm trên Terminal Bench 2.1 cùng với Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7
- Benchmark cho code agent được đo trong chế độ tối thiểu của DeepSeek Harness sắp phát hành, với điều kiện max effort,
top_p=0.95,temperature=1.0 - V4-Flash chính thức hỗ trợ mặc định định dạng Responses API, đã được tinh chỉnh cho Codex, và chỉ áp dụng huấn luyện hậu xử lý lại trên cùng kiến trúc/kích thước mô hình như Preview
- Phạm vi thay đổi chỉ giới hạn ở API V4-Flash; API V4-Pro và các mô hình APP/WEB được giữ nguyên, còn phiên bản chính thức của V4-Pro sẽ sớm ra mắt
Ra mắt beta công khai và cách dùng API
- Phiên bản chính thức của API DeepSeek-V4-Flash đã ra mắt bản beta công khai vào ngày 31 tháng 7 năm 2026
- Cách gọi hiện tại được giữ nguyên; chỉ cần đặt tham số mô hình thành
deepseek-v4-flashlà có thể dùng phiên bản mới nhất - Dòng V4 vẫn được cung cấp trên cùng
base_urlnhư trước thông qua giao diện OpenAI ChatCompletions và Anthropic- V4-Pro dùng
deepseek-v4-pro, V4-Flash dùngdeepseek-v4-flash - Các tên mô hình cũ
deepseek-chatvàdeepseek-reasonervốn dự kiến ngừng hoạt động vào ngày 24 tháng 7 năm 2026 - Trong giai đoạn chuyển đổi, hai tên này lần lượt trỏ tới chế độ không suy luận và chế độ suy luận của V4-Flash
- V4-Pro dùng
Kết quả benchmark agent
- Phiên bản chính thức của V4-Flash ghi nhận kết quả vượt trội hơn nhiều so với V4-Pro-Preview về hiệu năng agent
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench Public: 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
- Các bài toán code agent trong benchmark công khai được đo bằng chế độ tối thiểu của DeepSeek Harness sắp phát hành
- Mức effort là max, với
top_p=0.95,temperature=1.0
- Mức effort là max, với
- DSBench-FullStack là bộ test nội bộ cho phát triển full-stack, còn DSBench-Hard là bộ bài toán độ khó cao nội bộ dành cho coding agent
Tích hợp Responses API và Codex
- V4-Flash chính thức hỗ trợ mặc định định dạng Responses API và đã được tinh chỉnh cho Codex
- Có thể xem cấu hình cần thiết để tích hợp Codex trong tài liệu chính thức
Phạm vi thay đổi của mô hình
DeepSeek-V4-Flash-0731giữ cùng kiến trúc và kích thước mô hình như V4-Flash-Preview- Chỉ áp dụng huấn luyện hậu xử lý lại, không thay đổi cấu trúc của bản thân mô hình
- Bản cập nhật chỉ được áp dụng cho API DeepSeek-V4-Flash
- API DeepSeek-V4-Pro không thay đổi
- Các mô hình được cung cấp trên APP/WEB cũng được giữ nguyên
- Phiên bản chính thức của DeepSeek-V4-Pro sẽ sớm được ra mắt
1 bình luận
Ý kiến trên Hacker News
Cá nhân mình còn kỳ vọng hơn cả K3. Mô hình DSV4 có chi phí phục vụ rất thấp, nên khi hiệu năng cải thiện thì nó có thể trở thành mô hình “đủ tốt” cho nhiều tác vụ hơn
DeepSeek từ lâu đã cung cấp bản Pro với giá rất rẻ và đã tích hợp với OpenCode cùng các công cụ khác, nên rất có thể họ cũng đã thu thập được nhiều dữ liệu công việc phát triển thực tế. Nếu tận dụng việc này cho hậu huấn luyện thì vẫn có thể cải thiện thêm
Mình cũng tò mò không biết khi chưng cất K3 sang DSV4 thì sẽ tốt hơn bao nhiêu. Mô hình rẻ và nhanh đặc biệt có lợi cho cộng đồng ở chỗ hiệu năng của nó có thể tiếp tục được tận dụng mà không biến mất theo ý nhà cung cấp. Ít nhất thì Flash còn có thể chạy tại nhà với thiết bị dưới 10.000 USD, còn các mô hình lớn như GLM hay K3 thì thực tế rất khó
Mình xử lý 90% công việc bằng Flash. Không rõ vì sao nhưng nó tốt hơn Pro, lại rất rẻ và nhanh
Nếu giữ lượng thay đổi dưới 1.000 dòng và tự mình đưa ra quyết định kiến trúc thì gần như không cảm thấy khác biệt so với các mô hình hàng đầu. 10% còn lại mình dùng để tìm lỗi, vấn đề bảo mật hoặc xem xét cấu trúc tốt hơn; Flash cũng làm khá ổn nhưng mình vẫn đối chiếu chéo
Lặp lại nhanh tốt hơn nhiều so với việc chờ 5~10 phút cho những thay đổi nhỏ. Gần đây Kimi và GLM suy luận quá lâu một cách không cần thiết nên chậm. Có thể nhét vào rất nhiều dữ liệu như dependency, log, dump hiệu năng mà không phải lo giới hạn, và cả trong dịch ngược nhị phân cũng không bị vướng hạn chế bảo mật
Trong khi đó cũng có trường hợp bị từ chối cả với prompt không liên quan đến bảo mật, nên mình tò mò không biết sự khác biệt giữa từng nền tảng và từng người dùng có lớn đến vậy không
Mình chủ yếu dùng OpenCode vì nó tiêu tốn ít token hơn Claude Code, đồng thời cũng đang chờ DeepSeek phát hành coding harness riêng
Trong 30 ngày gần đây, khi dùng DeepSeek cho phần lớn tác vụ agent hằng ngày cá nhân, tổng chi phí là 4,55 USD, 3.467 yêu cầu API, và 323.183.886 token
Với tư cách là một kỹ sư dẫn dắt đội ngũ nhỏ, mình có tiêu chuẩn chất lượng cao và áp dụng tiêu chuẩn đó cả cho dự án cá nhân, nhưng với công việc lập trình và review thì hoàn toàn không hề thất vọng. Với các tác vụ khác thì mình dùng mô hình khác
Giờ mình chạy gần như mọi tác vụ trong pi bằng Flash. Chỉ cần có MCP server phù hợp, công cụ thu gọn ngữ cảnh và skill thì có thể triển khai bất kỳ tác vụ nào
Một số phiên mất hơn 30 lượt, nhưng vì nhanh và rẻ nên làm việc cả tiếng cũng chỉ tầm 0,5 USD là đủ. Tuy vậy, trong quy trình đa tác tử con thì mình vẫn dùng các mô hình đắt hơn cho vai trò lập kế hoạch, review và oracle
Mình đã không dùng gói Opus chậm chạp suốt vài tuần nay. Mình còn tự dựng cả chat OpenWebUI tự host chạy được trên điện thoại và hỗ trợ MCP cùng skill, nên đã thay thế hoàn toàn Perplexity; chi phí host và thuê bao vào khoảng 18 USD mỗi tháng
top_pvàtemperaturetrong piNếu benchmark thực sự phản ánh đúng hiệu năng thực tế thì đây là một mô hình đáng kinh ngạc. Mô hình 300B vượt hiệu năng của bản preview DS4 Pro trước đó với 1,8T tham số, và thậm chí còn có vẻ tốt hơn GPT 5.6 Luna
Nó vẫn rẻ hơn Luna sau khi giảm giá
Việc mô hình 200B cạnh tranh được với GLM-5.2 và tiệm cận Opus 4.8 là khá ấn tượng
Nếu những con số này cũng chuyển hóa thành hiệu năng đa dụng, cộng thêm khả năng caching xuất sắc của DeepSeek, thì có lẽ mức sử dụng sẽ rất lớn
Mình tò mò không hiểu vì sao họ không gọi là
v4.1-Flashđể phân biệt rõ ràng hơnNếu vẫn giữ được tốc độ và giá rẻ mà còn vượt hiệu năng của deepseek-v4-pro vốn đã đủ dùng, thì đây là hướng rất hứa hẹn
deepseek-v4-flash vốn đã là mô hình có tỷ lệ giá/hiệu năng tốt nhất, nên có vẻ khoảng cách trên thước đo trí tuệ/chi phí sẽ còn nới rộng hơn nữa. Tuy vậy, chi phí rẻ của DeepSeek API cũng đồng nghĩa đánh đổi bằng việc chuyển thông tin codebase sang Trung Quốc
Mình tò mò liệu cấu hình dùng Kimi K3 thay cho Opus ở tác vụ đắt đỏ, và DSV4 Flash thay cho Sonnet ở tác vụ thông thường có hợp lý không
Mình tò mò về các trường hợp dùng DSv4 cho agent ngoài lập trình. Đặc biệt muốn biết những người trước đây dùng GPT-5.4 mini cho phân loại, phân nhóm và các tác vụ tương tự thì hiện tận dụng DSv4 như thế nào