1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Phiên bản chính thức của API DeepSeek-V4-Flash đã ra mắt bản beta công khai vào ngày 31 tháng 7 năm 2026, và có thể sử dụng bằng cách giữ nguyên cách gọi hiện tại, chỉ cần chỉ định tên mô hình là deepseek-v4-flash
  • Hiệu năng tác vụ agent vượt xa V4-Pro-Preview, ghi nhận 82.7 điểm trên Terminal Bench 2.1 cùng với Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7
  • Benchmark cho code agent được đo trong chế độ tối thiểu của DeepSeek Harness sắp phát hành, với điều kiện max effort, top_p=0.95, temperature=1.0
  • V4-Flash chính thức hỗ trợ mặc định định dạng Responses API, đã được tinh chỉnh cho Codex, và chỉ áp dụng huấn luyện hậu xử lý lại trên cùng kiến trúc/kích thước mô hình như Preview
  • Phạm vi thay đổi chỉ giới hạn ở API V4-Flash; API V4-Pro và các mô hình APP/WEB được giữ nguyên, còn phiên bản chính thức của V4-Pro sẽ sớm ra mắt

Ra mắt beta công khai và cách dùng API

  • Phiên bản chính thức của API DeepSeek-V4-Flash đã ra mắt bản beta công khai vào ngày 31 tháng 7 năm 2026
  • Cách gọi hiện tại được giữ nguyên; chỉ cần đặt tham số mô hình thành deepseek-v4-flash là có thể dùng phiên bản mới nhất
  • Dòng V4 vẫn được cung cấp trên cùng base_url như trước thông qua giao diện OpenAI ChatCompletions và Anthropic
    • V4-Pro dùng deepseek-v4-pro, V4-Flash dùng deepseek-v4-flash
    • Các tên mô hình cũ deepseek-chatdeepseek-reasoner vốn dự kiến ngừng hoạt động vào ngày 24 tháng 7 năm 2026
    • Trong giai đoạn chuyển đổi, hai tên này lần lượt trỏ tới chế độ không suy luận và chế độ suy luận của V4-Flash

Kết quả benchmark agent

  • Phiên bản chính thức của V4-Flash ghi nhận kết quả vượt trội hơn nhiều so với V4-Pro-Preview về hiệu năng agent
    • Terminal Bench 2.1: 82.7
    • NL2Repo: 54.2
    • Cybergym: 76.7
    • DeepSWE: 54.4
    • Toolathlon verified: 70.3
    • Agent Last Exam: 25.2
    • Automation Bench Public: 25.1
    • DSBench-FullStack: 68.7
    • DSBench-Hard: 59.6
  • Các bài toán code agent trong benchmark công khai được đo bằng chế độ tối thiểu của DeepSeek Harness sắp phát hành
    • Mức effort là max, với top_p=0.95, temperature=1.0
  • DSBench-FullStack là bộ test nội bộ cho phát triển full-stack, còn DSBench-Hard là bộ bài toán độ khó cao nội bộ dành cho coding agent

Tích hợp Responses API và Codex

  • V4-Flash chính thức hỗ trợ mặc định định dạng Responses API và đã được tinh chỉnh cho Codex
  • Có thể xem cấu hình cần thiết để tích hợp Codex trong tài liệu chính thức

Phạm vi thay đổi của mô hình

  • DeepSeek-V4-Flash-0731 giữ cùng kiến trúc và kích thước mô hình như V4-Flash-Preview
  • Chỉ áp dụng huấn luyện hậu xử lý lại, không thay đổi cấu trúc của bản thân mô hình
  • Bản cập nhật chỉ được áp dụng cho API DeepSeek-V4-Flash
    • API DeepSeek-V4-Pro không thay đổi
    • Các mô hình được cung cấp trên APP/WEB cũng được giữ nguyên
  • Phiên bản chính thức của DeepSeek-V4-Pro sẽ sớm được ra mắt

1 bình luận

 
Ý kiến trên Hacker News
  • Cá nhân mình còn kỳ vọng hơn cả K3. Mô hình DSV4 có chi phí phục vụ rất thấp, nên khi hiệu năng cải thiện thì nó có thể trở thành mô hình “đủ tốt” cho nhiều tác vụ hơn
    DeepSeek từ lâu đã cung cấp bản Pro với giá rất rẻ và đã tích hợp với OpenCode cùng các công cụ khác, nên rất có thể họ cũng đã thu thập được nhiều dữ liệu công việc phát triển thực tế. Nếu tận dụng việc này cho hậu huấn luyện thì vẫn có thể cải thiện thêm
    Mình cũng tò mò không biết khi chưng cất K3 sang DSV4 thì sẽ tốt hơn bao nhiêu. Mô hình rẻ và nhanh đặc biệt có lợi cho cộng đồng ở chỗ hiệu năng của nó có thể tiếp tục được tận dụng mà không biến mất theo ý nhà cung cấp. Ít nhất thì Flash còn có thể chạy tại nhà với thiết bị dưới 10.000 USD, còn các mô hình lớn như GLM hay K3 thì thực tế rất khó

    • Nhà cung cấp duy nhất mà có thể đồng ý cho dùng dữ liệu huấn luyện là DeepSeek và Moonshot
    • Mình kỳ vọng nếu kết hợp với DwarfStar thì sẽ có AI cục bộ khá hữu dụng
  • Mình xử lý 90% công việc bằng Flash. Không rõ vì sao nhưng nó tốt hơn Pro, lại rất rẻ và nhanh
    Nếu giữ lượng thay đổi dưới 1.000 dòng và tự mình đưa ra quyết định kiến trúc thì gần như không cảm thấy khác biệt so với các mô hình hàng đầu. 10% còn lại mình dùng để tìm lỗi, vấn đề bảo mật hoặc xem xét cấu trúc tốt hơn; Flash cũng làm khá ổn nhưng mình vẫn đối chiếu chéo
    Lặp lại nhanh tốt hơn nhiều so với việc chờ 5~10 phút cho những thay đổi nhỏ. Gần đây Kimi và GLM suy luận quá lâu một cách không cần thiết nên chậm. Có thể nhét vào rất nhiều dữ liệu như dependency, log, dump hiệu năng mà không phải lo giới hạn, và cả trong dịch ngược nhị phân cũng không bị vướng hạn chế bảo mật

    • Có lẽ do cách diễn đạt prompt của mình chưa đủ mạnh, nhưng các mô hình OpenAI dùng qua Codex chưa bao giờ từ chối dịch ngược nhị phân. Ngay cả bây giờ mình vẫn đang phân tích firmware bên thứ ba bằng Codex mà chưa từng bị chặn lần nào
      Trong khi đó cũng có trường hợp bị từ chối cả với prompt không liên quan đến bảo mật, nên mình tò mò không biết sự khác biệt giữa từng nền tảng và từng người dùng có lớn đến vậy không
    • DeepSeek V4 Flash là đủ cho hầu hết công việc và phản hồi cũng nhanh. Mình chủ yếu mua token ở FireWorks.ai tại Mỹ, nhưng cũng đã trả trước số lượng lớn cho DeepSeek
      Mình chủ yếu dùng OpenCode vì nó tiêu tốn ít token hơn Claude Code, đồng thời cũng đang chờ DeepSeek phát hành coding harness riêng
    • Nhìn chung là tốt, nhưng trên OpenRouter thì giới hạn token đầu ra quá chặt. Nếu rơi vào bẫy suy luận thì nó không thể tự thoát ra trong phạm vi giới hạn đó, nhưng dù vậy mình vẫn đã thay Kimi bằng nó
  • Trong 30 ngày gần đây, khi dùng DeepSeek cho phần lớn tác vụ agent hằng ngày cá nhân, tổng chi phí là 4,55 USD, 3.467 yêu cầu API, và 323.183.886 token
    Với tư cách là một kỹ sư dẫn dắt đội ngũ nhỏ, mình có tiêu chuẩn chất lượng cao và áp dụng tiêu chuẩn đó cả cho dự án cá nhân, nhưng với công việc lập trình và review thì hoàn toàn không hề thất vọng. Với các tác vụ khác thì mình dùng mô hình khác

    • Mình tò mò khi review code bằng LLM thì bạn dùng cách nào và prompt gì. Chất lượng câu trả lời mình nhận được khá thấp, nên muốn biết có phải do cách sử dụng của mình không
    • Mình tò mò bạn dùng harness nào để đạt được mức token caching như vậy
    • Mình tò mò nó có bị ảo giác nhiều không, và nếu có thì ảnh hưởng đến quy trình làm việc thế nào
    • Chất lượng không phải là xuất sắc vượt trội, và hầu hết LLM khác cũng vậy
  • Giờ mình chạy gần như mọi tác vụ trong pi bằng Flash. Chỉ cần có MCP server phù hợp, công cụ thu gọn ngữ cảnh và skill thì có thể triển khai bất kỳ tác vụ nào
    Một số phiên mất hơn 30 lượt, nhưng vì nhanh và rẻ nên làm việc cả tiếng cũng chỉ tầm 0,5 USD là đủ. Tuy vậy, trong quy trình đa tác tử con thì mình vẫn dùng các mô hình đắt hơn cho vai trò lập kế hoạch, review và oracle
    Mình đã không dùng gói Opus chậm chạp suốt vài tuần nay. Mình còn tự dựng cả chat OpenWebUI tự host chạy được trên điện thoại và hỗ trợ MCP cùng skill, nên đã thay thế hoàn toàn Perplexity; chi phí host và thuê bao vào khoảng 18 USD mỗi tháng

    • Mình cũng dùng tổ hợp pi + DeepSeek, gắn thêm khá nhiều công cụ tùy chỉnh để theo dõi việc cần làm và tiết kiệm token, và chỉ dùng mô hình hàng đầu cho những tác vụ cực khó. Cấu hình này đáp ứng đủ mọi tính năng mình cần
    • Mình muốn được gợi ý tiện ích mở rộng đáng dùng cho pi
    • Mình tò mò không biết bản cập nhật lần này có cải thiện rõ rệt theo cảm nhận không
    • Mình muốn biết cách thiết lập top_ptemperature trong pi
  • Nếu benchmark thực sự phản ánh đúng hiệu năng thực tế thì đây là một mô hình đáng kinh ngạc. Mô hình 300B vượt hiệu năng của bản preview DS4 Pro trước đó với 1,8T tham số, và thậm chí còn có vẻ tốt hơn GPT 5.6 Luna
    Nó vẫn rẻ hơn Luna sau khi giảm giá

    • Trong DeepSWE, DeepSeek là 54,4% còn Luna là 67%
  • Việc mô hình 200B cạnh tranh được với GLM-5.2 và tiệm cận Opus 4.8 là khá ấn tượng
    Nếu những con số này cũng chuyển hóa thành hiệu năng đa dụng, cộng thêm khả năng caching xuất sắc của DeepSeek, thì có lẽ mức sử dụng sẽ rất lớn

    • Không chỉ đơn thuần là mô hình 200B, mà dung lượng của nó cũng chỉ 160GiB
  • Mình tò mò không hiểu vì sao họ không gọi là v4.1-Flash để phân biệt rõ ràng hơn

  • Nếu vẫn giữ được tốc độ và giá rẻ mà còn vượt hiệu năng của deepseek-v4-pro vốn đã đủ dùng, thì đây là hướng rất hứa hẹn
    deepseek-v4-flash vốn đã là mô hình có tỷ lệ giá/hiệu năng tốt nhất, nên có vẻ khoảng cách trên thước đo trí tuệ/chi phí sẽ còn nới rộng hơn nữa. Tuy vậy, chi phí rẻ của DeepSeek API cũng đồng nghĩa đánh đổi bằng việc chuyển thông tin codebase sang Trung Quốc

    • Ít nhất trong một benchmark thì nó được nói là tốt hơn GLM 5.2
  • Mình tò mò liệu cấu hình dùng Kimi K3 thay cho Opus ở tác vụ đắt đỏ, và DSV4 Flash thay cho Sonnet ở tác vụ thông thường có hợp lý không

    • Có vẻ sắp có phiên bản cập nhật của deepseek-v4-pro, và nhìn vào mức cải thiện lớn của DSV4 Flash thì rất có khả năng nó sẽ vượt Kimi K3 cả về trí tuệ lẫn chi phí
    • Hoàn toàn hợp lý. Mỗi lần dùng DSV4 Flash để lập trình hay kiểm tra server trong một giờ mà chi phí API thuần chỉ khoảng 0,30 USD vẫn luôn khiến mình ngạc nhiên
    • Bạn có thể dùng bộ định tuyến mô hình của mình để chuyển đổi giữa hai mô hình đó trong nền
  • Mình tò mò về các trường hợp dùng DSv4 cho agent ngoài lập trình. Đặc biệt muốn biết những người trước đây dùng GPT-5.4 mini cho phân loại, phân nhóm và các tác vụ tương tự thì hiện tận dụng DSv4 như thế nào