- Kimi K3 của Moonshot Labs và Qwen 3.8 của Alibaba được cho là đạt hiệu năng tiệm cận Fable 5 của Anthropic, và trọng số cũng sẽ được công bố trong vài tuần tới, khiến cuộc đua mô hình tiên tiến nhất mở rộng sang các mô hình mở
- Việc phát triển mô hình cần nhân lực nghiên cứu, năng lực tính toán và điện năng, nhưng sau khi triển khai, chi phí biên của suy luận chủ yếu phát sinh từ tính toán và điện năng. Nếu sở hữu trung tâm dữ liệu và cơ sở phát điện, có thể chuyển chúng thành chi phí cố định để mở rộng biên lợi nhuận khi mức sử dụng tăng lên
- Các công ty chỉ làm mô hình mà không có hạ tầng phải dựa vào hoặc hiệu năng tốt nhất, hoặc mức giá rẻ nhưng chất lượng đủ tốt. Lối đột phá vì thế thu hẹp còn tự cải thiện đệ quy, đóng thị trường bằng quy định, hoặc xây dựng sản phẩm khó sao chép
- Fable 5 của Anthropic có chi phí cho mỗi tác vụ hoàn thành cao hơn khoảng 3 lần, và các harness như Claude Code, Cowork cũng cạnh tranh với OpenCode, OpenClaw, Hermes. Mô hình, sản phẩm và cấu trúc chi phí đều đồng thời bị thách thức, làm gia tăng rủi ro bị tách gói
- Khi GLM 5.2, Kimi K3 và Qwen 3.8 lần lượt xuất hiện trong tháng 6~7/2026, khả năng nhiều phòng thí nghiệm khác bắt kịp đã được xác nhận. Điều này làm suy yếu năng lực phòng thủ của các doanh nghiệp tập trung vào mô hình như Anthropic, Moonshot Labs và Knowledge Atlas
Cuộc đua tiên tiến nhất mở rộng sang mô hình mở
- Kimi K3 ra mắt ngày 16/7/2026, còn Qwen 3.8 được công bố ngày 19/7
- Cả hai mô hình đều được cho là có hiệu năng gần với Fable 5 của Anthropic
- Trọng số mô hình dự kiến sẽ được công bố trong vài tuần tới
- GLM 5.2 của Knowledge Atlas cũng là một mô hình mở hàng đầu được phát hành vào giữa tháng 6
- Xu hướng này có phạm vi lớn hơn khoảnh khắc ‘DeepSeek moment’ đơn lẻ của năm 2025
- Nó cho thấy nhiều phòng thí nghiệm có thể đuổi kịp không chỉ các công ty nhiều vốn như Anthropic và OpenAI mà cả Grok của Meta và SpaceX
- Cạnh tranh và bám đuổi đang lặp lại liên tục, và nếu tính cả chi phí thì việc đảo ngược hiệu năng trong tương lai cũng là điều có thể
Cấu trúc chi phí của mô hình nền tảng
- Xây dựng mô hình cần nhân lực nghiên cứu, tài nguyên tính toán như chip và trung tâm dữ liệu, cùng điện năng để vận hành chúng
- Với mô hình đã hoàn thiện, chi phí lớn nhất phát sinh ở suy luận, tức quá trình để người dùng sử dụng mô hình
- Giai đoạn suy luận cũng cần nhân lực, tính toán và điện năng
- Vì không phải liên tục cập nhật mô hình nên tỷ trọng chi phí nhân sự thấp hơn huấn luyện, và phần lớn chi phí biên tập trung vào tính toán cùng điện năng
- Kinh doanh suy luận phải tối ưu chi phí điện và trung tâm dữ liệu, và càng sở hữu nhiều mắt xích trong chuỗi giá trị thì càng có thể biến chi phí biến đổi thành chi phí cố định
Phạm vi sở hữu hạ tầng quyết định biên lợi nhuận
- Anthropic, Knowledge Atlas và Moonshot Labs đều không có trung tâm dữ liệu hay nhà máy điện riêng, mà mua ngoài trung tâm dữ liệu và điện năng
- Meta và Alibaba tự xây dựng trung tâm dữ liệu nhưng mua điện từ nhà cung cấp khác
- SpaceX chọn cách sở hữu cả cơ sở phát điện lẫn trung tâm dữ liệu
- Các công ty phụ thuộc vào trung tâm dữ liệu và điện năng bên ngoài kiếm lợi bằng cách cộng biên vào chi phí suy luận của khách hàng
- Vì chi phí tăng cùng doanh thu nên ngay cả khi mức sử dụng tăng, việc mở rộng biên lợi nhuận cũng khó khăn
- Nếu sở hữu nhà máy điện hoặc trung tâm dữ liệu, phần đáng kể của chi phí suy luận sẽ trở thành chi phí cố định, nhờ đó biên lợi nhuận có thể tăng khi mức sử dụng của khách hàng tăng lên
Hạ tầng mở rộng các lựa chọn chiến lược
- Càng sở hữu nhiều hơn trong stack hạ tầng, càng có thể kiếm tiền từ chính hạ tầng đó
- Ngay cả khi mô hình nội bộ không phải tốt nhất, vẫn có thể lưu trữ các mô hình mã nguồn mở có hiệu năng tốt
- Cũng có thể cho các công ty khác thuê phần cứng đang nắm giữ
- Meta được cho là đang thảo luận hợp đồng trị giá 10 tỷ USD để cung cấp năng lực máy chủ cho Anthropic
- SpaceX đã ký hợp đồng đám mây với Google và cũng đang thảo luận phương án cung cấp năng lực tính toán cho Bộ Quốc phòng Mỹ
- Nếu không có trung tâm dữ liệu hay cơ sở phát điện, thành bại sẽ phụ thuộc vào nhu cầu đối với mô hình
- Hoặc mô hình phải có hiệu năng tốt nhất, hoặc phải rẻ nhưng đủ tốt
- Doanh nghiệp sẽ bị đặt vào cuộc cạnh tranh phải liên tục hạ giá suy luận hoặc giữ vững vị trí nhà cung cấp mô hình tốt nhất
Ba con đường sống còn của công ty chỉ làm mô hình
- Anthropic, OpenAI, DeepSeek, Moonshot Labs và Knowledge Atlas sẽ khó tồn tại trong thị trường mô hình nền tảng siêu cạnh tranh nếu không thể tiếp tục giữ vị trí dẫn đầu
- Có ba con đường để một công ty tập trung vào mô hình có thể chiến thắng
- Với đủ tài nguyên tính toán, đạt tự cải thiện đệ quy trước và bỏ xa đối thủ
- Đóng thị trường thông qua quy định
- Xây dựng sản phẩm đủ độc đáo hoặc giữ chân người dùng mạnh đến mức không thể sao chép
Chiến lược chi phí và quy định của Anthropic
- Trong số các phòng thí nghiệm mô hình tiên tiến nhất, Anthropic phụ thuộc nhiều nhất vào chiến lược quy định và tự cải thiện đệ quy
- Cách tiếp cận đặt nặng đạo đức thể hiện qua việc tự kiểm duyệt ở Fable và Mythos có liên hệ với chiến lược quy định
- Sau đó, các đợt phát hành tiếp theo cũng bị hạn chế bởi biện pháp của chính phủ Mỹ
- Dù vẫn giữ vị trí dẫn đầu về hiệu năng mô hình, giá của hãng lại cao hơn nhiều so với OpenAI và các mô hình mở
- Trong so sánh của Artificial Analysis, chi phí cho mỗi tác vụ hoàn thành của Fable 5 cao gần 3 lần
- Vẫn chưa rõ người dùng có sẵn sàng trả mức giá đó để đổi lấy mô hình tốt hơn hay không
- Một số nhà nghiên cứu và nhà sáng lập dự đoán sẽ có chiến tranh giá khi các benchmark AI trở nên bão hòa và không phản ánh được mức độ lan rộng của cạnh tranh cũng như giá cả
Cạnh tranh harness và áp lực tách gói
- Anthropic đã đầu tư vào các sản phẩm như Claude Code và Cowork, nhưng chiến lược tập trung vào agent harness đi kèm rủi ro
- OpenCode, OpenClaw, Hermes cùng nhiều startup harness đang đổi mới trong cùng lĩnh vực
- Rào cản gia nhập để xây dựng mô hình nền tảng là rất cao, nhưng rào cản để tung ra một AI harness riêng thì gần như không có
- Anthropic đang chịu áp lực tách gói theo ba hướng
- Mô hình trở thành chuẩn mực mà các đối thủ phải vượt qua
- Sản phẩm ngày càng đối mặt với thách thức mạnh hơn từ các đối thủ đóng và mã nguồn mở
- Mô hình kinh tế không sở hữu hạ tầng bất lợi về mặt chi phí
- Nếu không có can thiệp từ quy định hoặc việc thực sự phát minh ra AGI, Anthropic có thể khó giữ vị trí số 1 trong nhóm nhà cung cấp mô hình nền tảng
Chiến lược phòng thủ khác mà OpenAI lựa chọn
- Các mô hình của OpenAI đã tụt lại sau Anthropic trong vài tháng gần đây, nhưng hãng đầu tư vào sản phẩm, trải nghiệm người dùng, đăng bài trên site, giọng nói và phần cứng
- Ở những lĩnh vực này, nền tảng có tính phòng thủ rõ ràng hơn so với các sản phẩm tập trung vào harness của Anthropic
- Hãng cũng cởi mở hơn với việc sở hữu trung tâm dữ liệu và đầu tư vào cơ sở phát điện
- Có ý kiến cho rằng chiến lược này làm giảm sự tập trung, nhưng về dài hạn nó có thể tăng sức chống chịu
- Hãng có sự linh hoạt và mức chấp nhận rủi ro để thử nghiệm các sản phẩm có hiệu ứng mạng và lợi thế phòng thủ
- Hãng có thể tối ưu biên lợi nhuận dài hạn
Năng lực phòng thủ suy yếu của các doanh nghiệp tập trung vào mô hình
- Kimi K3 và Qwen 3.8 cho thấy các mô hình mở cũng có thể đạt tới vùng hiệu năng tiên tiến nhất
- Xét theo tiêu chuẩn của một mô hình kinh doanh bền vững dài hạn, các công ty chỉ cung cấp mô hình đặc biệt rủi ro
- Knowledge Atlas, Moonshot Labs và Anthropic khó xây dựng năng lực phòng thủ hơn so với OpenAI, Alibaba, SpaceX, Meta và Google, những bên sở hữu hạ tầng và các tài sản sản phẩm khác
1 bình luận
Các ý kiến trên Hacker News
Nhìn việc các mô hình trọng số mở và kiến trúc mở xuất hiện dồn dập trong vài ngày gần đây, có vẻ cuối cùng bên có khả năng đúc mô hình thành ASIC nhanh nhất sẽ có nhiều khả năng thắng
Như đã thấy trong công bố K3, bản thân LLM cũng có thể thực hiện một phần thiết kế chip, và các mô hình tiên tiến nhất hiện đã đủ tốt cho phạm vi công việc rất rộng, rồi sớm sẽ đạt mức đó với một phần đáng kể công việc phát triển phần mềm
Nếu chạy Fable 5 trên ASIC với tốc độ 9.000 token/giây thay vì 150 token/giây trên GPU Nvidia, có thể đáp ứng phần lớn nhu cầu
Doanh nghiệp cũng có thể xử lý nhiều mục đích sử dụng khác nhau an toàn hơn bằng một số ít ASIC on-premise, thay vì giao dữ liệu cho OpenAI hay Anthropic
Không muốn chấp nhận rủi ro rằng trong lúc đang điều phối các chi tiết ra mắt chip, một bài báo hoặc cách tiếp cận mới nhanh hơn gấp nhiều lần lại xuất hiện
Các nhà phát triển có mức độ trung thành với thương hiệu rất thấp và sẽ chuyển ngay sang mô hình tốt nhất, nên chừng nào mô hình tốt nhất còn chạy trên GPU lập trình được thì GPU vẫn sẽ thống trị
Tôi dùng thường xuyên, nhưng chúng hoàn toàn phá vỡ các điều kiện yêu cầu, và khoảng một nửa số điểm dừng được đề xuất không đáp ứng bộ lọc
Nếu nghe theo khách hàng đòi xây mô hình lớn hơn như thể tài nguyên là vô hạn thì trước mắt sẽ kiếm được rất nhiều tiền, nhưng có nguy cơ bị những thứ như Apple Silicon, vốn lớn mạnh nhờ hiệu quả và cải tiến liên tục, vượt qua
Một phòng thí nghiệm đã tạo sinh trên một MI300X duy nhất một mô hình 8 tỷ tham số, vốn đạt khoảng 100 token/giây trên stack phần mềm thông thường, lên tới khoảng 3.000 token/giây
Flash băng thông cao quy mô vài TB, đọc hơn 1TB mỗi giây, cũng đang được phát triển, nên vài năm nữa có thể chạy cục bộ mô hình 3 nghìn tỷ tham số trên một card có HBM 40–90GB và HBF 4TB với giá khoảng 10.000–20.000 USD
Cứ khiến tôi nhớ đến trường hợp Figma
Mike Krieger, CPO của Anthropic và đồng sáng lập Instagram, từng là thành viên hội đồng quản trị Figma nhưng đã từ chức ngay trước khi Claude Design được công bố; được cho là Figma, dù phụ thuộc vào mô hình Anthropic và tích hợp chung “Code to Canvas”, vẫn không biết trước phạm vi của Claude Design
Ngay sau công bố, cổ phiếu Figma giảm 7%, khiến luận điểm ngày tận thế của SaaS — khi các công ty mô hình nền tảng xâm lấn tầng ứng dụng của đối tác SaaS — trở thành hiện thực
Cần thận trọng khi cung cấp dữ liệu cho các công ty LLM hoặc phụ thuộc vào họ; nếu ý tưởng của một startup AI thành công, họ có thể trực tiếp cạnh tranh hoặc chi phối giá API
OpenAI thậm chí đang thiết kế phần cứng riêng để thoát khỏi sự phụ thuộc vào Apple và Android, đặt cược lớn vào một siêu thiết bị tiêu dùng
Cuộc chơi dài hạn không phải là công ty AI đấu với SaaS, mà là cạnh tranh với các thương hiệu tiêu dùng lớn như Apple·Google·Meta·Amazon; nếu ai hoàn thiện trước trợ lý số tối thượng có thể nhận bất kỳ tác vụ nào rồi lập tức tạo ra mã và giao diện, ngay cả Apple cũng có thể trở nên lỗi thời
Sản phẩm xây trên dịch vụ khác rất dễ bị mua lại hoặc bị dịch vụ nền tảng hấp thụ, và Apple cũng đã âm thầm đưa chức năng của vô số app phổ biến vào iOS
Việc làm wrapper mỏng để cạnh tranh với các phòng thí nghiệm là nguy hiểm, nhưng đây cũng là kỷ nguyên phần mềm mới, nơi nếu bạn tạo ra một sản phẩm có giá trị mà chatbot không thể sao chép ngay thì không cần phải lo
Tôi cho rằng rủi ro đã bị phóng đại
Có nhu cầu sẵn sàng trả thêm cho các mô hình tốt hơn, và giá trị tôi nhận được trong quy trình làm việc lớn hơn rất nhiều so với 200 USD/tháng trả cho một phòng thí nghiệm tiên phong, nên tôi không có ý định cắt giảm chi phí chút nào
Giá trị do môi trường thực thi như Claude Code hay Codex mang lại lớn hơn bản thân LLM thực tế; các triển khai mã nguồn mở như OpenCode vẫn còn kém xa
Excel cũng có Google Sheets, một lựa chọn gần như tương đương và cung cấp hơn 90% tính năng, nhưng giá trị mà bảng tính tạo ra lớn hơn rất nhiều so với 100 USD/năm, nên hào lũy vững chắc của Microsoft vẫn được duy trì
Hai công ty này cũng không được định giá 1 nghìn tỷ USD nhờ môi trường thực thi
Excel cho doanh nghiệp khoảng 50 USD/tháng, nhưng các phòng thí nghiệm đóng thu phí mỗi người dùng cao hơn nhiều lần; ngay cả tôi không code nhiều mà cũng dùng tối thiểu khoảng 50 USD mỗi ngày
Ở nơi tôi sống, lương tháng 200 USD không hiếm và lập trình viên cũng chỉ khoảng 1.000 USD, nên dù giá trị có lớn đến đâu, nếu không trả nổi tiền thuê nhà và ăn uống thì cũng không thể dùng
Ngay cả ở các nước phát triển, 200 USD/tháng cũng khó kham nổi với sinh viên hoặc nhà sáng lập không giàu có
Cho đến một tuần trước, Fable còn đáng để trả tiền, nhưng K3 xuất hiện khiến với tôi khoảng cách đã hẹp đến mức không thể biện minh cho chi phí nữa
Nếu kết quả thực tế tốt hơn 10% thì trả gấp 5 lần cũng được, nhưng sẽ ít người hơn nhiều chịu trả gấp 5 lần cho mức cải thiện 2%
Ngoài ra, việc bị buộc phải dùng Claude Code thay vì môi trường thực thi ưa thích không phải là lợi thế của Anthropic mà là bất lợi
Tốc độ Fable chuyển từ “mô hình thay đổi cục diện cần bị cấm” sang “cũng ổn, nhưng OpenAI cũng tương tự và còn có lựa chọn trọng số mở” thật đáng kinh ngạc
Chu kỳ thổi phồng đã ngắn lại, và lần này có thể thật sự đã chạm tới giai đoạn chững lại
Thông tin liên tục thay đổi nên mô hình phải được cập nhật, nhưng dữ liệu có thể sử dụng miễn phí sẽ ngày càng ít đi
OpenAI, giống Anthropic, về cơ bản cũng là nhà cung cấp chuyên về mô hình, nên tôi thắc mắc vì sao họ lại không dễ tổn thương theo cùng cách
Lịch sử đó cung cấp ngữ cảnh cá nhân để cải thiện sản phẩm, và cũng có thể dùng cho huấn luyện mô hình cũng như quảng cáo
Trong tương lai, khi người dùng nhập “hãy lên kế hoạch kỳ nghỉ cho tôi” và toàn bộ quá trình được điều phối, họ sẽ không dễ chuyển sang mô hình khác chỉ vì rẻ hơn hoặc tốt hơn 10%
Nếu sản phẩm thực sự ra mắt và thành công ở một mức độ nào đó, họ có thể chiếm một vị thế độc đáo khác với các phòng thí nghiệm tiên phong khác
Tuy nhiên, các điểm khác biệt này hiện còn dưới kỳ vọng, hoặc như phần cứng thì chưa hề được kiểm chứng
Tạo ra mô hình tốt và cung cấp nó nhanh chóng trong khi đáp ứng nhu cầu là hai việc khác nhau
Anthropic đã gặp vấn đề này khoảng 6 tháng trước, và Moonshot cũng không đáp ứng nổi nhu cầu nên đã dừng đăng ký gói code
Nếu trần phát triển của AI là tự cải thiện đệ quy, thì AI sẽ tạo ra mô hình tốt hơn và chủ sở hữu trung tâm dữ liệu sẽ thắng, nên Anthropic và OpenAI sẽ hết đường
Nếu đáy là sự chững lại, cuộc cạnh tranh sẽ là cung cấp hiệu năng tối đa cố định với giá rẻ nhất
Tin Google tạo chip Gemini khắc trọng số vào silicon, xét tới vòng đời chip tối thiểu 2–3 năm, có nghĩa là họ dự đoán trong 3 năm tới sẽ không có mức tiến bộ tương tự; cuối cùng đây sẽ là cuộc cạnh tranh biên lợi nhuận thấp nhất, nên hai công ty này lại bất lợi
Để sống sót, tiến bộ AI phải nằm giữa hai thái cực đó
OpenAI trông bấp bênh hơn Anthropic nhiều
Việc một bên đang thúc đẩy IPO còn bên kia tránh công khai sổ sách đã nói lên nhiều điều
Điểm cốt lõi là liệu các phòng thí nghiệm khác có thể tạo ra mô hình vượt trước Anthropic và OpenAI hay không
Việc họ phụ thuộc vào API của hai công ty này đến mức nào thông qua chưng cất, v.v. cũng quan trọng; nếu là mô hình phái sinh, tôi dự đoán phạm vi hiệu năng sẽ hẹp và khả năng tiến bộ cũng bị giới hạn
Ở các doanh nghiệp mua token, thực tế rằng trí tuệ tăng lên không dẫn tới doanh thu tăng đã bắt đầu lộ rõ, và cuối cùng bộ phận tài chính sẽ chi phối quyết định
Nếu là OpenAI hay Anthropic thì đây là tình huống cực kỳ đáng lo
Nếu Dario lại đi vòng quanh các podcast và đe dọa rằng AI của mình sẽ làm 75% việc làm biến mất, ông ấy có thể đảo chiều dòng chảy
Nếu không hiệu quả thì nâng lên 85%, vẫn không được thì cứ tăng tới 100%
Vào tháng 11 năm 2025, Anthropic Opus 4.5 và Claude Code là hệ thống duy nhất triển khai đúng ngay từ đầu một tính năng được định nghĩa rõ ràng, nhưng giờ tôi gần như hài lòng với Claude và Codex ở mức tương đương
Nếu hai công ty này gây áp lực về giá hoặc siết chính sách an toàn quá mức, có vẻ sẽ có nhiều lựa chọn để chuyển sang các mô hình trọng số công khai có năng lực và môi trường thực thi mã nguồn mở thực sự
Gemini 3.1 Pro trông có vẻ mạnh, nhưng lần cuối tôi dùng Antigravity thì nó rất kém
Việc Anthropic sống sót như một trong những đối thủ mạnh là điều tốt, nhưng vì triết lý ưu tiên an toàn, họ đang làm tăng các trường hợp từ chối và sự cố ý không biết của các mô hình mới nhất
Về lâu dài, họ có thể được nhớ đến như một công ty đã tăng tốc phát triển phần mềm để những người khác tạo ra các công cụ bớt rụt rè hơn