GPT-4.5, vòng đời thương mại 4,5 tháng
- GPT-4.5, mẫu đắt nhất khi ra mắt vào tháng 2/2025 (đầu vào $75/đầu ra $150 cho mỗi 1M token), đã bị gỡ khỏi API trước khi tròn 5 tháng. Đây là mẫu có tuổi thọ ngắn nhất trong lịch sử OpenAI, và các nhà phát triển xây sản phẩm trên đó bị kẹt trong vòng lặp migration
- Bài học mà thị trường rút ra là “đừng xây doanh nghiệp trên mô hình của người khác”, nhưng chủ đề của bài viết này là bài học đó chỉ đúng một nửa
Tầng mô hình đang bị hàng hóa hóa
- Theo SWE-bench Verified, 5 mô hình đứng đầu nằm trong khoảng cách 0,4 điểm, nhưng giá chênh nhau 5 lần. Trên toàn thị trường, khoảng cách giữa token rẻ nhất và token suy luận cao cấp vượt hơn 600 lần — giá không còn là chỉ báo thay thế cho hiệu năng nữa
- Khoảng cách giữa open-weight và frontier đóng trung bình khoảng 4 tháng theo benchmark công khai (8–10 tháng theo benchmark riêng tư) và đã ổn định như vậy hơn 18 tháng. Khoảng cách là có thật, nhưng hẹp, dự đoán được và không nới rộng
4 rủi ro khi phụ thuộc vào API frontier
- Biến động giá: Claude 3.5 Haiku tăng giá 4 lần rồi rút lại một phần chỉ sau một tháng, o3 giảm 80% chỉ sau một đêm. Tokenizer mới đôi khi tạo ra nhiều token hơn tới 35% trên cùng một văn bản — vấn đề không phải là hướng tăng/giảm, mà là độ phân tán
- Chu kỳ khai tử: Tháng 2/2026, GPT-4o, 4.1 và o4-mini bị ngừng hàng loạt với thông báo trước khoảng 3 tháng. Thậm chí đã xuất hiện thuật ngữ “prompt drift” để chỉ việc prompt đã tinh chỉnh suốt 1 năm hoạt động khác đi trên mô hình mới
- Bị nền tảng hấp thụ: Điểm yếu của các GPT wrapper là tính năng mà wrapper cung cấp có thể bị chính nhà cung cấp đưa vào sản phẩm của họ
- Quy định: Tháng 6/2026, Anthropic Fable 5 bị tạm dừng đồng loạt trên toàn cầu trong 19 ngày do hướng dẫn kiểm soát xuất khẩu của Mỹ — một biến số mà ngay cả nhà cung cấp cũng không thể lựa chọn
Bốn rủi ro đều bắt nguồn từ một vấn đề: phụ thuộc vào frontier do người khác hosting
- Tự chạy mã nguồn mở loại bỏ biến động giá, khai tử và tạm dừng do quy định, đồng thời giảm nhẹ rủi ro bị nền tảng hấp thụ. Weights đã nhận rồi thì không bị khai tử hay thu hồi
- Chi phí cần nhìn thẳng: Khi tự chạy trên GPU tiêu dùng, chi phí khoảng $1 cho mỗi triệu token (khấu hao 3 năm + tiền điện, mức sử dụng 30%), đắt hơn API open-weight rẻ nhất ($0.14/$0.28), nên thua về chi phí tuyệt đối
- Tính kinh tế của tự chạy không nằm ở mức trung bình mà ở độ phân tán. Ngoài ra, API rẻ nhất lưu dữ liệu đầu vào để huấn luyện — cái giá ẩn của mức giá rẻ nhất chính là dữ liệu của bạn
Cùng một chẩn đoán, đơn thuốc ngược lại
- Nhận định rằng doanh nghiệp nội dung phụ thuộc vào API frontier ở quy mô Big Tech là mong manh là đúng
- Nhưng nếu người chơi nhỏ tự chạy mã nguồn mở trong vùng good-enough, họ đã cắt bỏ chính sự phụ thuộc tạo ra điểm yếu đó — sao chép nguyên xi chẩn đoán của Big Tech cho startup nhỏ là sai
Không miễn phí (4 phanh hãm)
- Đầu vào hàng hóa tạo ra đầu ra hàng hóa — moat chỉ đến từ phân phối, dữ liệu độc quyền, tích hợp theo miền, xác minh và phán đoán, những thứ trực giao với AI
- Ngưỡng good-enough sẽ dịch chuyển lên — nếu chỉ đỗ xe ở ngưỡng đó, bạn đang đỗ trong vùng biên lợi nhuận đi xuống
- Ranh giới không nằm ở lĩnh vực mà ở độ khó của nhiệm vụ: Trong đánh giá của NIST, open-weight hàng đầu gần như ngang ngửa frontier ở toán học, nhưng kém hơn trên 30 điểm ở an ninh mạng, suy luận trừu tượng và agentic coding dài hạn
- Tự chạy trực tiếp đòi hỏi năng lực vận hành, tinh chỉnh, xác minh và trách nhiệm tuân thủ — sự phụ thuộc không biến mất, mà chuyển từ nhà cung cấp API sang năng lực của chính tôi
Kết luận: Điểm quyết định nằm ở xác minh và phán đoán
- Dù dùng cùng một mô hình mở, nếu đưa nguyên đầu ra ra ngoài thì chỉ là demo; nếu đặt sự kiện, con số, công thức và nhận dạng phía sau lớp xác minh thì đó là sản phẩm
- Điểm quyết định của AI Content là phán đoán kỹ thuật biến mô hình rẻ thành sản phẩm đáng tin cậy, và mã nguồn mở trở thành vũ khí cho người có phán đoán đó
Đây là bài viết do tôi trực tiếp viết. Rất hoan nghênh trao đổi ý kiến về thiết kế stack giữa chạy local và API.
Chưa có bình luận nào.