- OpenAI phản ánh các cải tiến về hiệu quả của mô hình, hệ thống suy luận và agent harness vào giá và tốc độ xử lý, nâng cao hiệu năng trên mỗi đô la của AI cho doanh nghiệp
- Từ ngày 30/7, giá Luna giảm 80%, giá Terra giảm 20%; với API, mỗi 1 triệu token Luna có giá đầu vào $0.20 và đầu ra $1.20, Terra có giá đầu vào $2 và đầu ra $12
- Luna cung cấp hiệu năng tương đương các mô hình tuyến đầu một năm trước với chi phí mỗi tác vụ khoảng 6% và tốc độ gần gấp 9 lần; trong Agents’ Last Exam, Luna đạt hiệu năng cao hơn Fable 5 và chi phí tác vụ ước tính thấp hơn khoảng 99%
- Fast mode của GPT‑5.6 Sol thay thế Priority Processing hiện có, giữ nguyên mức độ thông minh trong khi cung cấp tốc độ nhanh hơn Standard tới 2.5 lần với mức giá gấp 2 lần
- Doanh nghiệp có thể điều chỉnh cân bằng giữa trí tuệ, tốc độ và chi phí qua đánh giá theo từng giai đoạn, chẳng hạn dùng Sol cho lập kế hoạch và giải quyết bất định, còn Luna cho triển khai rõ ràng và kiểm thử
Giảm giá Luna·Terra và cải thiện tốc độ Sol
- Cải thiện hiệu quả thực thi của GPT‑5.6 dẫn tới việc giảm giá Luna·Terra và cải thiện tốc độ xử lý API của Sol
- Luna, mô hình nhanh nhất và rẻ nhất, rẻ hơn 80%; Terra, mô hình cân bằng cho công việc hằng ngày, rẻ hơn 20%
- Trong các gói đăng ký trả phí của Codex và ChatGPT Work, mức sử dụng hai mô hình này cũng được tính bằng ít credit hơn
- Bản thân giá đăng ký và ngân sách hạn mức không thay đổi
- Luna có thể dùng công cụ để hoàn thành các workflow nhiều bước, giúp giảm chi phí vận hành cho các tác vụ khối lượng lớn đòi hỏi chất lượng cao
- Giá Sol không thay đổi
Chọn mô hình theo kết quả công việc
- Để sử dụng AI hiệu quả, cần cân bằng trí tuệ, tốc độ, độ tin cậy và chi phí theo mức độ quan trọng, chi phí lỗi, tính cấp bách và quy mô của tác vụ
- Ngay trong cùng một workflow, điểm tối ưu cũng có thể khác nhau ở từng giai đoạn
- Luna cung cấp hiệu năng tương tự các mô hình từng ở mức tuyến đầu một năm trước với chi phí mỗi tác vụ khoảng 6% và tốc độ gần gấp 9 lần
- Trong Agents’ Last Exam, bài đánh giá các công việc chuyên môn, Luna đạt hiệu năng cao hơn Fable 5 trong khi giảm chi phí ước tính trên mỗi tác vụ khoảng 99%
- Doanh nghiệp có thể trước tiên xác định kết quả cần thiết và tiêu chuẩn chất lượng, rồi thông qua đánh giá để phân biệt những đoạn mà trí tuệ bổ sung thực sự cải thiện kết quả với những đoạn mà xử lý chi phí thấp vẫn tạo ra cùng mức chất lượng
- Trong workflow lập trình, Sol giải quyết bất định và lập kế hoạch
- Luna có thể đảm nhận việc triển khai các thay đổi đã được định nghĩa rõ, viết và chạy kiểm thử, cũng như đánh giá kết quả
- Dòng sản phẩm GPT‑5.6 mở rộng lựa chọn để áp dụng mức trí tuệ cần thiết theo từng giai đoạn và trả chi phí tương ứng với giá trị được tạo ra
Cải thiện hiệu quả xuyên suốt từ mô hình đến agent
- Cải thiện hiệu quả diễn ra đồng thời ở mô hình, hệ thống suy luận chạy mô hình, và agent harness kết nối công cụ với ngữ cảnh
- Các mô hình GPT‑5.6 xử lý tác vụ theo lộ trình trực tiếp hơn
- Routing được cải thiện giúp nâng cao mức sử dụng phần cứng
- Phần mềm production được tối ưu hóa tạo token hiệu quả hơn
- Quản lý ngữ cảnh được cải thiện giúp agent không lặp lại các công việc đã hoàn tất
- Hoàn thành nhiều công việc hữu ích hơn với cùng tài nguyên tính toán, giảm thời gian, token và chi phí trên mỗi kết quả
Tối ưu hóa bổ sung nhờ Sol hỗ trợ
- Trong quy trình do con người dẫn dắt, GPT‑5.6 Sol đã tự chủ viết lại và tối ưu hóa kernel production
- Sol thiết kế và chạy hàng trăm thí nghiệm để cải thiện việc tạo token, giám sát quá trình huấn luyện và can thiệp khi phát sinh vấn đề
- Công việc về kernel đã giúp giảm 20% chi phí đầu cuối của việc cung cấp mô hình, còn các thí nghiệm đã cải thiện hiệu quả tạo token hơn 15%
- Khi hiệu năng và mức độ tự chủ của mô hình tăng lên, một vòng lặp phản hồi hình thành, giúp tăng tốc độ tìm ra các cải thiện hiệu quả tiếp theo
- Có thể xem quy trình kỹ thuật liên quan tại giới thiệu về cải thiện hiệu quả GPT‑5.6
Chiến lược điện toán hỗ trợ khả năng mở rộng
- Để đáp ứng nhu cầu dồi dào về trí tuệ, không chỉ cần nhiều tài nguyên tính toán hơn mà còn cần điện toán có năng suất cao
- OpenAI xây dựng danh mục hạ tầng có khả năng phục hồi và đặt từng workload lên hệ thống phù hợp nhất để thực thi
- Việc giảm giá Luna và Terra cho phép vận hành các tác vụ khối lượng lớn ở quy mô lớn hơn một cách kinh tế
- Fast mode cung cấp quyền truy cập API nhanh hơn cho các tác vụ Sol mà thời gian phản hồi là quan trọng
- Tính kinh tế để vận hành rộng rãi phân tích tài liệu quy mô lớn, phân loại tương tác khách hàng và các tác vụ triển khai lặp lại được cải thiện
- Các workload Sol phức tạp có thể được xử lý nhanh hơn khi tốc độ đủ quan trọng để biện minh cho chi phí bổ sung
- Khi các mô hình mạnh hơn hỗ trợ các cải tiến tiếp theo của đội ngũ kỹ thuật, thời gian cần để nâng hiệu năng và giảm chi phí được rút ngắn
Cách hoạt động và khả năng tương thích của Fast mode
- Fast mode của API thay thế Priority Processing và tương ứng với
/fasttrong Codex - Trên GPT‑5.6 Sol, chế độ này cung cấp tốc độ nhanh hơn xử lý Standard tới 2.5 lần với mức giá gấp 2 lần mà không thay đổi mức độ thông minh
- Duy trì tương thích ngược, nên các yêu cầu API hiện có được gắn thẻ
priorityvẫn tiếp tục hoạt động
Phạm vi cung cấp và giá API
- GPT‑5.6 Terra và Luna tiếp tục được cung cấp trong ChatGPT Work, Codex, OpenAI API
- Người dùng Free·Go của ChatGPT Work và Codex có thể truy cập Terra
- Người dùng Plus·Pro·Business·Enterprise có thể chọn Terra và Luna
- Từ ngày 30/7, giá API trên mỗi 1 triệu token như sau
- Terra: đầu vào $2, đầu ra $12
- Luna: đầu vào $0.20, đầu ra $1.20
- Giá đăng ký và ngân sách hạn mức của ChatGPT và Codex được giữ nguyên, nhưng credit tiêu thụ khi dùng Terra và Luna sẽ giảm
- Trên AWS, thay đổi giá sẽ được áp dụng tuần tự từ cuối ngày 30/7
- Toàn bộ mức giá có tại thông tin giá API
1 bình luận
Ý kiến trên Hacker News
Câu nói của John Wanamaker rằng “một nửa tiền quảng cáo bị lãng phí nhưng không biết là nửa nào” dường như phù hợp hơn với việc chọn mô hình. Ta biết đa số tác vụ không cần mô hình mạnh, nhưng việc tự phân biệt tác vụ đơn giản với tác vụ khó lại là một bài toán khó giải, thậm chí có thể là bất khả quyết
HN hoàn toàn có thể vận hành như một BBS bằng phần cứng thập niên 1970, nhưng trên thực tế lại dùng CPU khoảng 10 tỷ transistor thay vì khoảng 10 nghìn transistor để làm gần như cùng một việc mà chẳng mấy ai bận tâm
Không biết nói gì khi nghe “từ hôm nay, chi phí của GPT‑5.6 Luna, mô hình nhanh nhất và rẻ nhất, sẽ giảm 80%”. Tưởng như đã bước vào giai đoạn chững lại với mức cải thiện 5~10% trong vài tháng, nhưng giờ lại xuất hiện thay đổi đột ngột như vậy, khiến người ta tự hỏi đáy giá nằm ở đâu
Cụm GPU động sẽ được dùng cho 5% còn lại và cho việc mở rộng vùng biên tiên tiến nhất, còn những công việc hiện quá khó với phần lớn lao động tri thức nên chưa được làm cũng sẽ bắt đầu được xử lý
Nếu là cải thiện hiệu suất thật thì có lẽ phải đánh đổi bằng lượng tử hóa mạnh hoặc nén KV cache làm giảm chất lượng
Khi token mỗi năm càng nhanh và rẻ hơn, những nhà máy AI mô phỏng đội ngũ chuyên gia và mức song song hóa cao hơn nhiều sẽ trở thành hiện thực
Việc biến Luna vốn đã rẻ và mạnh thành rẻ hơn 5 lần thật đáng ngạc nhiên. Ở công ty dùng Sol, ở nhà dùng Luna; khác biệt là có nhưng không áp đảo. Sau một năm giá liên tục tăng, giờ có cảm giác đang quay đầu giảm trở lại nhờ Luna, Kimi K3 và GLM 5.2
OpenAI và Anthropic cũng đã tăng giá trong vài tháng rồi phòng lab Mỹ lại giảm giá mạnh, nên có vẻ là xu hướng ngược lại
Họ nói đã giảm 20% chi phí đầu-cuối của việc cung cấp mô hình nhờ công việc ở kernel, và thông qua thử nghiệm đã tăng hiệu quả sinh token hơn 15%. Nếu chi phí cung cấp GPT-5.6 giảm 20%, không biết có phải là tiết kiệm được hàng tỷ USD mỗi tháng không
Theo tài liệu IPO của SpaceX, Anthropic đã chi 1,25 tỷ USD để thuê năng lực suy luận ở hai datacenter Colossus, nhưng nếu tính thêm năng lực hiện có ở AWS và nơi khác thì không rõ phần đó chiếm bao nhiêu trong tổng thể. Chi phí suy luận hàng tháng của OpenAI cũng rất có thể ở mức hàng tỷ USD, nên mức giảm 20% là thay đổi khổng lồ
Thay đổi lần này giống như bước chuyển từ quay số sang băng thông rộng. Trước đây đã rất khuyến nghị Luna cho nghiên cứu chuyên sâu, còn giờ chạy được nhiều gấp 5 lần với cùng chi phí thì quá lớn
Hiện tại đã chạy song song 10 agent để tạo giả thuyết, còn 50 thì khó tưởng tượng. Nếu có thể chạy cùng một prompt và mô hình hàng chục lần mà gánh nặng chi phí nhỏ, thì thống kê sẽ thú vị và mạnh hơn rất nhiều
Mức giá mới của Luna nằm ngoài dự đoán, và dường như trên thị trường không có sản phẩm nào cạnh tranh được về hiệu năng trên giá thành này
Với ứng dụng production, giờ OpenAI rõ ràng là nhà cung cấp tốt nhất. API ổn định, nhiều tính năng, và hiệu năng trên giá thành cũng rất mạnh trên toàn dải mô hình. Đã dùng các mô hình open weight như Kimi K2.5 trên Fireworks khá lâu nhưng thỉnh thoảng có vấn đề, Anthropic và Google cũng vậy. OpenAI nhanh và cho hiệu năng trên giá thành tốt hơn ở gần như mọi mức độ thông minh
Thường kiểm tra biểu đồ hiệu năng trên giá thành của OpenRouter và bật
"Show Pareto"ở bên phải. Với dự án cá nhân trước giờ vẫn dùng GLM-5.2, nhưng giờ Luna trở thành lựa chọn quá dễ dàngMức giảm giá 80% của Luna là cực kỳ quyết liệt. Với phần lớn tác vụ không cần trí tuệ hàng đầu, đây là lựa chọn áp đảo, và có lúc Luna còn sánh được với Opus 5
xhighcủa Sol vàmaxcủa Luna. Sol hiểu prompt tốt hơn, còn với Luna thì phải chỉ dẫn cụ thể và rõ ràng hơnĐã trả trước khá nhiều token DeepSeek v4 flash, và sau khi dùng hết thì muốn thử mua token Luna một thời gian. Thích các mô hình rẻ và nhanh, lại đã nghỉ hưu nên nếu thỉnh thoảng phải mất thời gian tự chuyển sang mô hình mạnh hơn thì cũng không sao
Việc Luna rẻ hơn 80% thật đáng ngạc nhiên. Chi phí tính toán đang tiếp tục giảm, nên sang năm phí dùng API của mô hình mạnh có thể còn rẻ hơn phí thuê bao