5 điểm bởi GN⁺ 1 ngày trước | 4 bình luận | Chia sẻ qua WhatsApp
  • Alibaba Qwen ra mắt Qwen3.8 với quy mô 2,4 nghìn tỷ tham số, và dự kiến sẽ sớm công bố open weight
  • Qwen3.8 là một mô hình vẫn đang tiếp tục tiến hóa, được cho biết là tương thích với các mô hình AI frontier hàng đầu
  • Phía Qwen đánh giá Qwen3.8 là một trong những mô hình mạnh nhất hiện nay và ở cấp độ kế tiếp sau Fable 5
  • Có thể trải nghiệm ngay Qwen3.8-Max-Preview trên Alibaba Token Plan, Qoder và QoderWork
  • Token Plan vận hành các trang giá riêng cho người dùng quốc tếngười dùng Trung Quốc
    • Bản dành cho người dùng quốc tế được cung cấp theo 3 cấp Lite/Standard/Pro, với giá khuyến mãi lần lượt là $6/$18/$68 mỗi tháng
    • Tùy theo gói, người dùng nhận được 2.500/10.000/40.000 Credits mỗi 7 ngày và 700/3.000/12.000 Credits mỗi 5 giờ
    • Số agent có thể chạy đồng thời lần lượt là 1–2/3–4/6–8, và có thể kết nối bằng API Key và Base URL từ các công cụ hỗ trợ giao thức OpenAI/Anthropic

4 bình luận

 
fanotify 1 ngày trước

Có một infographic nên tôi mang về đây: https://i.postimg.cc/63yLvz16/modelsize202607.png
(cập nhật bằng cách thêm nhẹ nội dung Qwen 3.8 lần này vào bản của Kimi)

 
cadenzah 1 giờ trước

Đừng mở liên kết đó ở nơi công cộng!

 

Trang này có rất nhiều quảng cáo.

 
Ý kiến trên Hacker News
  • Có vẻ như thông báo lần này là để đáp lại việc Moonshot AI công bố sẽ phát hành Kimi K3, một LLM open-weight 2,8 nghìn tỷ tham số, lên Hugging Face trước ngày 27 tháng 7
    Alibaba cũng đáp trả rằng sẽ sớm phát hành Qwen 3.8 open-weight 2,4 nghìn tỷ tham số, nhưng không rõ đây vốn là kế hoạch ban đầu hay là quyết định để cạnh tranh với Moonshot AI
    Dù sao thì người thắng trong cuộc cạnh tranh LLM này vẫn là người dùng

    • Khó khẳng định động cơ, nhưng có vẻ các công ty Trung Quốc đang nỗ lực biến trí tuệ thành hàng hóa phổ thông
      Đây có thể là cách hiệu quả nhất để làm giảm giá trị của các phòng thí nghiệm nghiên cứu tuyến đầu tại Mỹ, đồng thời cũng rất có lợi cho nhân loại
    • Trên mạng xã hội Trung Quốc thường có câu đùa rằng: “Chính phủ các nước khác can thiệp để ngăn hành vi phản cạnh tranh, còn chính phủ Trung Quốc can thiệp để kìm hãm cạnh tranh”
      https://www.reuters.com/business/autos-transportation/what-i...
    • Lý do công bố vào lúc này là vì World AI Conference đang diễn ra
      Trong lúc robot đấu quyền anh và các công ty AI lớn của Trung Quốc công bố những mô hình mới nhất, Xi Jinping cũng thông báo thành lập WAICO
      https://en.wikipedia.org/wiki/World_Artificial_Intelligence_...
    • Cũng có thể đây là thông báo được căn thời điểm Xi Jinping ra mắt một liên minh chính trị tại World AI Conference và nói rằng “việc phát triển AI không nên là màn độc diễn của một quốc gia, mà phải là bản giao hưởng của hợp tác quốc tế”
      Các hội nghị lớn thường đi kèm hàng loạt màn ra mắt và công bố sản phẩm mới
      https://www.cnbc.com/2026/07/17/x-china-ai-summit-risks-secu...
    • Mong là họ cũng công bố Qwen 3.7-27B·122B hoặc phiên bản 3.8 tương ứng, thay vì chỉ tập trung vào mô hình khổng lồ
      Điểm mạnh của Qwen và QwQ từ trước đến nay luôn là suy luận cục bộ hàng đầu có thể chạy tại nhà
  • Alibaba Cloud đã chặn địa chỉ email của tôi nên tôi không thể trả phí sử dụng, vì vậy lần này không thể làm bài kiểm tra Pelican
    Tôi đang chờ họ phát hành open-weight hoặc đăng ký trên OpenRouter

    • Benchmark Pelican giờ gần như là quy trình đánh giá duy nhất mà tôi còn tin tưởng
      Việc một công ty như Alibaba lại khiến chuyện trả tiền trở nên khó khăn cũng thật khó hiểu, và hẳn họ sẽ muốn các lập trình viên nổi tiếng thử nghiệm mô hình của mình
      Thường thì họ được đưa lên OpenRouter khá nhanh, nên hy vọng sớm có thể dùng được. Cũng có cách tải ứng dụng Qwen về và thử bằng công cụ MCP cho phát triển cục bộ trong giao diện chat
  • Tôi cũng muốn các mô hình nhỏ của Qwen 3.8 được phát hành
    Tôi đang dùng cục bộ mô hình 35B MoE và 27B dense, và trong đa số trường hợp thì không cần phải gọi đến Claude
    Chúng đặc biệt hữu ích cho các yêu cầu có chứa dữ liệu nhạy cảm hoặc riêng tư

    • Sẽ rất tốt nếu có một mô hình MoE tầm trung nằm giữa 35B của 3.6 và 122B của 3.5
      Nó có thể khá mạnh nhưng không quá đắt đỏ, mang lại cân bằng rất tốt giữa tốc độ và hiệu năng trên máy tính gia đình
    • Cuộc cạnh tranh lần này có vẻ nghiêng nhiều hơn về cuộc đua bá quyền AI tuyến đầu, nên tôi lo các mô hình nhỏ nhưng giỏi sẽ bị bỏ lại phía sau
      Các phòng thí nghiệm lớn không muốn trao con ngỗng đẻ trứng vàng cho người dùng cuối, và các hãng phần cứng như Nvidia cũng có thể nhảy vào thị trường này để kiếm tiền từ mọi bên liên quan
    • Tôi không rõ làm thế nào có thể thu nhỏ một mô hình 2,4 nghìn tỷ tham số xuống còn 35B mà vẫn giữ được độ chính xác
      Muốn làm vậy chắc sẽ cần một kiến trúc hoàn toàn khác
    • Tôi tò mò không biết họ đang dùng phần cứng nào
  • Tôi đã thử Qwen 3.6 27B trong LMStudio, hơi chậm một chút nhưng tốt hơn kỳ vọng
    Sau khi áp dụng mtplx, tốc độ thực sự nhanh hơn 2–3 lần chứ không hề phóng đại, rất ấn tượng
    Tôi đang cố chuyển sang dùng mô hình cục bộ nhiều nhất có thể, và nó ngày càng trở thành một lựa chọn thực tế hơn. Tuy vậy, tôi đang dùng chiếc MacBook M5 Max cấu hình tối đa trị giá 6.000 USD, nên phần cứng này vẫn còn quá đắt với đa số mọi người
    Có lẽ sắp tới xu hướng sẽ là chạy cục bộ các mô hình nhỏ được huấn luyện tập trung hơn. Rủi ro khi giao toàn bộ dữ liệu cho nhà cung cấp đám mây là quá lớn, và khi đến lúc họ phải chứng minh doanh thu, tôi đoán họ sẽ tính phí vô lý

    • Sau đợt tăng giá gần đây, chiếc laptop đó giờ có lẽ đã gần 8.000 USD
  • Sau khi dùng Qwen 3.7 Pro mỗi ngày suốt một tháng, thực tế là gần như không dùng được
    Nó lãng phí thời gian quá mức, mất phương hướng trong công việc hoặc rơi vào lặp lại vô nghĩa, và cũng không debug ra hồn
    Sự khác biệt với DeepSeek V4 Pro là rất rõ ràng, và cho tới nay Qwen trông như model tệ nhất cho kỹ thuật phần mềm. Nó đắt hơn DeepSeek rất nhiều nhưng không thể giao việc cho nó, cũng không thể dùng cho các tác vụ cấp thấp theo thời gian thực

    • Tôi đã chạy cục bộ Qwen3.6-35B và 27B được lượng tử hóa Q8 trên llama.cpp, và cũng đã thử model lượng tử hóa DS4-flash của antirez
      Tất cả đều ở mức tương tự nhau và DS4 hiệu quả hơn đôi chút, nhưng tất cả đều cho kết quả rất tốt với script Bash, debug, Python và một số tác vụ C++
      Tôi tò mò không biết Qwen đã thất bại ở ứng dụng hay ngôn ngữ nào. Mẫu chat của Qwen bị hỏng, nên tôi phải tự debug, và hiện cũng đang làm để sửa chuyện này; Gemma cũng từng tương tự
    • Theo tiêu chuẩn của tôi, Qwen 3.7 Max tốt hơn Opus nhưng nhanh hơn rất nhiều, và kém Fable một chút
      Nó vượt DeepSeek 4 Pro khá xa về tốc độ và khả năng hiểu tổng thể, và tôi chủ yếu dùng cùng với Claude Code
      Qwen 3.7 Plus cũng khá ổn cho agent phụ và tốt hơn Sonnet rất nhiều. Qwen 3.8 Max Preview hiện cũng hoạt động tốt, nhưng còn quá sớm để kết luận; nếu chỉ bằng 10% giá niêm yết thì đúng là cực kỳ đáng tiền
    • Qwen 3.7 Pro thì bình thường, nhưng 3.7 Max là model rất tốt
    • Tôi đã nạp 2 USD vào API DeepSeek và nhập key vào Void Editor để tạo một công cụ tiền mã hóa bằng HTML
      Tôi dùng file CSV mẫu dài hàng trăm dòng, code nhẹ nhàng trong một hai giờ và sửa lỗi, hết khoảng 1,8 USD
      Nếu mức chi phí này là bình thường, thì dùng cho công việc trong một tháng có vẻ sẽ còn tốn hơn cả lương; tôi tò mò liệu nhà cung cấp đám mây thực sự đắt đến vậy không
    • Anthropic lẽ ra không nên cản trở các cuộc tấn công chưng cất tri thức
  • Phiên bản cuối của DeepSeek 4 cũng sắp ra mắt
    Có lẽ sẽ ở mức Opus 4.8, và xét theo giá của DeepSeek thì đây có vẻ sẽ là một sự kiện khá lớn

    • Hiệu năng trên giá thành của DeepSeek là áp đảo
      Gần đây tôi hay dùng V4 Flash và thấy nó khá tốt
    • DeepSeek V4 rẻ hơn 10~30 lần so với đa số model khác nhưng vẫn đủ cho phần lớn tác vụ
    • Ngày mai là ngày cuối của WAIC, nên khả năng cao nhất là nó sẽ được ra mắt vào lúc đó
    • Đây là model tôi mong đợi nhất
      Trong vài tuần gần đây, khi trực tiếp dùng DeepSeek Pro, tôi ngày càng thường xuyên nhận được những câu trả lời rõ ràng là đến từ một model vượt trội hơn nhiều
      Vì hiệu năng quá tốt nên phe model đóng đã bắt đầu tung ra kiểu FUD như “định tuyến ngầm” hay “ăn cắp nguyên xi Fable”
      Ngay cả mức giá đã tăng lên cũng vẫn mang lại giá trị khổng lồ. Nếu bạn không có thời gian thử mọi model và chỉ muốn dùng cái hiện trông là tốt nhất, thì có khi tốt hơn là đừng dùng nó. Bạn sẽ nhận ra và hối tiếc khi nghĩ rằng nếu nửa đầu năm nay bạn chi 1.200 USD cho DeepSeek thay vì OpenAI thì đã làm được nhiều việc hơn đến mức nào
  • Xem trên Artificial Analysis thì có ít nhất 12 nhà cung cấp được đánh giá là cho hiệu năng tốt hơn Opus 4.5, model mà Anthropic công bố vào tháng 12 và được xem là đã châm ngòi cho đợt tăng tốc gần đây
    Xét cả việc chi phí chuyển đổi cũng thấp, cạnh tranh hiện đã hoàn toàn quá nóng. Cá nhân tôi thấy mức Opus 4.5 là đủ cho hầu hết ứng dụng và mục đích sử dụng

    • Vì vậy OpenAI và Anthropic rất có thể sẽ yêu cầu mạnh tay hơn về quy định và lệnh cấm của chính phủ
      Nếu không thì toàn bộ mô hình doanh thu của họ sẽ sụp đổ
  • Để chạy trong OpenCode bằng Qwen Cloud Token Plan, cấu hình dưới đây hoạt động
    Vì không biết giới hạn chính xác nên tôi đã đặt giống hạn mức của Qwen 3.7 Max

    "provider": {  
      "alibaba-token-plan": {  
        "models": {  
          "qwen3.8-max-preview": {  
            "limit": {  
              "context": 1048576,  
              "output": 65536  
            },  
            "modalities": {  
              "input": ["text"],  
              "output": ["text"]  
            },  
            "name": "Qwen3.8 Max Preview"  
          }  
        }  
      }  
    }  
    
    • Phải chọn chính xác endpoint API và token
      Khi gọi đúng endpoint thì quota sẽ giảm gần như ngay lập tức, nên cần kiểm tra việc này
      Nếu làm sai, bạn có thể đốt hết API token không nằm trong Credits của gói thành viên và mất 200 USD chỉ trong 3 ngày; trường hợp dùng 200 USD nhận được từ bonus đăng ký Alibaba Cloud cũng vậy
  • Cách nói “chỉ đứng sau Fable 5” khá đáng chú ý
    Ban đầu có nhiều hoài nghi rằng Fable gần như không cải thiện so với Opus, nhưng thích hay không thì với điều kiện Anthropic vẫn tiếp tục cho dùng, họ đã xây được một hào lũy thực sự với model đó
    Sẽ rất thú vị nếu model mở vượt qua được nó

    • Khó mà gọi là hào lũy, nhưng đúng là model tốt hơn
      Trong công việc của tôi, tôi đánh giá Fable > K3 > Sol
      Tuy vậy, nó cũng không áp đảo hai model còn lại đến mức nếu không dùng được Fable nữa thì sẽ bị ảnh hưởng nghiêm trọng. Cả ba đều rất xuất sắc, và model duy nhất thường xuyên từ chối yêu cầu là Fable
    • “Hào lũy” của họ nằm ở chỗ Mythos hiện là model siêu lớn duy nhất
      Việc huấn luyện model 10 nghìn tỷ tham số để đạt hiệu năng cao hơn model 1 nghìn tỷ 10% vốn dĩ lúc nào cũng có thể làm được
      Nếu Mythos là Opus 5 với cùng kích cỡ và mức giá như Opus trước đó thì đó sẽ là khác biệt mang tính quyết định, nhưng thực tế không phải vậy
    • Dù là model tốt hơn thì nó cũng bị ràng buộc quá nhiều nên không hữu ích bằng Opus
    • Fable thường cho ra chất lượng kết quả kém
      Tôi dùng Sol làm chủ lực; Fable có thể sáng tạo, nhưng yếu ở việc thực hiện công việc ổn định mà không đốt token vô tận
  • Cuộc đua AI ở Trung Quốc đang nóng lên
    Tôi đang chờ xem Anthropic và OpenAI sẽ tung ra gì tiếp theo