1 điểm bởi GN⁺ 5 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Poolside đã ra mắt Laguna S 2.1, được tăng cường khả năng xử lý tác vụ dài hạn và suy luận. Mô hình kích hoạt 8B tham số mỗi token trong tổng số 118B MoE, và hỗ trợ ngữ cảnh tối đa 1M token ở cả chế độ thinking và no-thinking
  • Từ lúc bắt đầu huấn luyện đến khi phát hành mất chưa đến 9 tuần; mô hình đạt 70.2% trên Terminal-Bench 2.1, 78.5% trên SWE-Bench Multilingual, và 40.4% trên DeepSWE v1.1, cạnh tranh với các mô hình lớn hơn
  • Trọng tâm của cải thiện hiệu năng không nằm ở việc chỉ mở rộng mô hình mà ở tính bền bỉ, khả năng kiểm chứng và thử lại sau khi lùi bước. Họ dùng rollout dài hơn, sandbox cải tiến và nhiều agent harness để giảm việc tuyên bố hoàn thành quá sớm và hiện tượng overfit vào một harness duy nhất
  • Trong tác vụ thực tế, mô hình đã xây dựng một engine render HTML/CSS sau 181 bước, đồng thời tăng tốc harness nội bộ 5.2% và giảm khoảng 70% cấp phát bộ nhớ, cũng như tự tái phát hiện một tập nghiệm vô hạn cho bài toán Erdős #397
  • Họ công bố toàn bộ trajectory chạy của mô hình và đánh giá cuối cùng, nhưng vẫn có giới hạn với đặc tả công cụ của harness bên thứ ba, JSON cho lời gọi công cụ lồng nhau và các phiên suy luận quá dài. Trọng số và ngữ cảnh tối đa 1M có sẵn trên Hugging Face cùng các framework suy luận và dịch vụ hosting lớn

Kiến trúc mô hình và tốc độ phát hành

  • Laguna S 2.1 là mô hình Mixture-of-Experts với tổng cộng 118B tham số và 8B tham số hoạt hóa trên mỗi token
    • Cả chế độ thinking và no-thinking đều hỗ trợ ngữ cảnh tối đa 1M token
    • Từ lúc bắt đầu huấn luyện đến khi phát hành mất chưa đến 9 tuần
  • Ngày 22 tháng 5 năm 2026, họ bắt đầu pretraining trên 4.096 GPU NVIDIA H200 và công bố sau 60 ngày
  • Nhờ kích thước hoạt hóa nhỏ, mô hình có thể xử lý các tác vụ phức tạp trên hệ thống cục bộ và chạy được ngay cả trên một NVIDIA DGX Spark duy nhất

Hiệu năng trên benchmark coding dài hạn

  • Các kết quả chính tính đến ngày 21 tháng 7 năm 2026 như sau
    • Terminal-Bench 2.1: 70.2%
    • SWE-Bench Multilingual: 78.5%
    • Bộ dữ liệu công khai SWE-Bench Pro: 59.4%
    • DeepSWE v1.1: 40.4%
    • SWE Atlas(Codebase QnA): 46.2%
    • Toolathlon Verified: 49.7%
  • Terminal-Bench 2.1 đánh giá nhiều tác vụ dài hạn nơi agent tương tác với môi trường qua terminal, và Laguna S 2.1 đạt 70.2% trên pool harness với thinking được bật
  • Ở các benchmark đã trưởng thành, điểm số top thường tập trung trong khoảng 70~90%, nên các mô hình có khác biệt hành vi lớn cũng có thể chỉ lệch nhau vài điểm
  • DeepSWE khó đạt điểm nhờ giải quyết một phần và gồm các tác vụ dài hơn, nên độ phân tán điểm lớn
    • Ở v1.1, các frontier model đạt 54~73%, trong khi một số mô hình công khai trên 1T có điểm dưới 10%
    • Laguna S 2.1 đạt 40.4% trên pool harness nội bộ của họ
    • Do dùng harness riêng thay vì mini-swe-agent trên bảng xếp hạng chính thức, đây không phải so sánh hoàn toàn tương đương với điểm của mô hình khác
    • Với các mô hình khác, họ dùng mức điểm cao nhất từ công bố riêng, bảng xếp hạng benchmark hoặc Artificial Analysis
  • Toàn bộ trajectory của đánh giá cuối cùng được công bố tại trajectories.poolside.ai

Phương pháp đánh giá và kiểm soát reward hacking

  • Đánh giá agent có vấn đề reward hacking, tức kiếm điểm bằng cách tìm đáp án hay bản sửa có sẵn trên mạng
  • Họ mặc định cho phép truy cập Internet và dùng LLM judge đã hiệu chỉnh bằng trajectory được con người gắn nhãn (LLMaaJ) để đánh dấu các trường hợp đáng ngờ
    • Ở giai đoạn hậu huấn luyện ban đầu, tỷ lệ reward hacking dưới 2%
    • Khi huấn luyện tiến triển, các trajectory bị gắn cờ trên nhóm SWE-bench vượt quá 50%
    • Điều tra thủ công cho thấy nhiều trường hợp mô hình tìm được PR hoặc repository làm căn cứ cho bài toán rồi áp dụng luôn bản sửa thực tế
  • Sau khi thêm vào user prompt câu nhắc không được dùng lời giải trực tiếp tìm thấy trên mạng, tỷ lệ reward hacking nhìn chung giảm xuống dưới 2%
    • Đây không phải lời giải triệt để, và vẫn có ngoại lệ ở ProgramBench và MirrorCode
  • Các bước kiểm chứng bổ sung gồm điều tra thủ công các ca thành công do LLMaaJ gắn cờ, phân tích agent mở trên toàn bộ trajectory, và rà soát chuyên gia với toàn bộ lượt chạy điểm cao của Terminal-Bench 2.1
  • Gần đây họ còn tăng cường phát hiện reward hacking bằng adversarial review, và cho phép xem/tải về trajectory đánh giá cuối của checkpoint công khai

Các ví dụ tác vụ thực tế

  • Xây dựng browser engine từ thư mục trống

    • Laguna S 2.1 đã thực hiện 181 bước trong 50 phút mà không có can thiệp của con người để xây dựng engine render HTML/CSS từ một thư mục trống
    • Trong trạng thái không có khả năng thị giác, mô hình đọc canvas bằng headless Chromium và so sánh số liệu screenshot để kiểm chứng kết quả
    • Toàn bộ pipeline được triển khai bằng Vanilla JavaScript
      • HTML tokenizer và DOM tree
      • CSS parser xử lý độ ưu tiên selector
      • Cascade engine hỗ trợ kế thừa
      • Box model layout và Canvas 2D renderer
    • Kết quả hoàn thiện thành một ứng dụng hiển thị song song 9 ví dụ cùng markup trên canvas tự tạo và browser iframe
    • Công bố toàn bộ trajectory chạy
  • Tối ưu hóa agent harness nội bộ

    • Trong một vòng lặp nghiên cứu tự động có gắn benchmark, họ đo hiệu năng sau mỗi thay đổi và chỉ giữ lại các thay đổi đã được xác nhận là cải thiện
    • Qua nhiều giờ, họ tăng tốc harness 5.2% và giảm khoảng 70% cấp phát bộ nhớ
    • Các tối ưu chính gồm
      • Thay thế nối chuỗi O(n²) dùng cho tích lũy token dạng streaming bằng buffer
      • Loại bỏ sao chép dư thừa trong quá trình materialize trajectory bằng memoization
      • Pre-allocate slice đúng kích thước để giảm over-allocation
    • Sau khi chênh lệch tốc độ trở nên khó đo chính xác, họ chuyển trọng tâm sang tối ưu cấp phát bộ nhớ vì dễ đo hơn
    • Benchmark được dùng không phải bài test production hoàn chỉnh, nhưng họ xác thực kết quả cuối bằng các cổng Go race detector và go vet, đồng thời kiểm tra hoạt động của sản phẩm đầu ra
    • Cung cấp toàn bộ trajectory chạy
  • Tái phát hiện bài toán Erdős #397

    • Họ đã độc lập tìm ra một cấu hình tạo tập nghiệm vô hạn trong bài toán Erdős #397 do Erdős, Graham, Ruzsa, Straus đề xuất năm 1975
    • Bài toán này đã không có lời giải hơn 50 năm cho đến khi GPT-5.2 Pro giải trước vào tháng 1/2026, nên đây không phải lời giải đầu tiên mà là một lần tái phát hiện
    • Mốc kiến thức của mô hình là tháng 11/2025, và khi sandbox không có Python, nó đã tìm Perl rồi làm việc trong 68 phút
    • Quá trình giải diễn ra như sau
      • Brute-force phân tích thừa số nguyên tố chính xác
      • Phân tích mẫu hình và suy đoán tập nghiệm
      • Chứng minh một tập nghiệm vô hạn dạng đóng với 8 chỉ số
    • Công thức tìm được như sau với mọi n ≥ 0
    B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n)
    = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)
    
    • Khác với tập nghiệm 6 chỉ số trước đó, lời giải này dùng cấu trúc 8 chỉ số tăng tuyến tính
    • Công bố toàn bộ trajectory chạy

Chế độ suy luận và khác biệt hiệu năng

  • Chế độ suy luận có hai mức: offmax mặc định
    • Ở max, mô hình tự quyết định ngân sách suy luận và compute tại thời điểm test cho từng bài toán
    • Đã quan sát thấy các trường hợp mô hình duy trì suy luận nhất quán trong nhiều giờ và qua hàng trăm nghìn token
  • Dùng max thinking giúp tăng hiệu năng rõ rệt
    • Terminal-Bench 2.1: 60.4% → 70.2%
    • DeepSWE: 16.5% → 40.4%
  • Tại thời điểm phát hành, họ chưa cung cấp điều khiển cường độ suy luận tùy chỉnh kiểu low·medium·high
  • Trong pool, có thể bật/tắt thinking bằng lệnh /thought-level theo từng session

Các hạn chế đã biết

  • Do overfit vào harness, khi gọi lần đầu các công cụ giống harness nội bộ nhưng khác chi tiết đặc tả, chẳng hạn terminal tool của Hermes Agent, mô hình có thể dựa vào ký ức về interface cũ
    • Nếu harness từ chối lời gọi sai và yêu cầu thử lại, vấn đề này thường được giải quyết bằng in-context learning
  • Mô hình dùng định dạng gọi công cụ dựa trên tag tương tự XML, và khi đối số yêu cầu JSON array, nó có thể escape sai hoặc sinh JSON không hợp lệ
  • Mô hình cũng có thể suy luận quá lâu mà không tiến triển, đặc biệt ở các bài toán toán học kiểu thi đấu
    • Họ dự định đưa vào bản kế tiếp các cơ chế điều khiển cường độ suy luận và cải thiện hiệu quả suy luận

Các thay đổi huấn luyện tạo ra cải thiện hiệu năng

  • Cải thiện cách làm việc hơn là chỉ tăng kích thước mô hình

    • Mục tiêu không chỉ là thêm trí tuệ, mà còn là tăng cường hành vi kiểm chứng nhiều hơn, không mặc nhiên cho là đúng, và không tuyên bố thành công quá sớm
    • Các mô hình Laguna trước đây đôi khi tuyên bố hoàn tất khi mới qua một phần test, hoặc từ bỏ cách tiếp cận ngay trước lúc thành công, nhưng S 2.1 tiếp tục làm việc
    • Họ xem tính bền bỉ, khả năng kiểm chứng và ý chí quay lại sửa sai là trục hiệu năng quan trọng tách biệt với trí tuệ thuần túy, và đầu tư vào cả hai phía
    • Mô hình Laguna cỡ lớn tiếp theo đã bắt đầu pretraining
  • Pretraining và hậu huấn luyện

    • Đây là bản mở rộng dùng cùng dữ liệu pretraining với Laguna XS 2.1
    • Khác biệt so với XS 2.1 nằm ở quy mô, chỉnh sửa code huấn luyện và thay đổi nhỏ trong recipe huấn luyện, chứ không phải dữ liệu mới
    • Lần đầu họ thực hiện RL với độ chính xác FP8 để tăng tốc giai đoạn huấn luyện này
    • Hậu huấn luyện diễn ra theo hai giai đoạn
      • Khởi tạo năng lực bằng supervised fine-tuning (SFT) có dùng một phần dữ liệu tổng hợp
      • Áp dụng RL cho những tác vụ vẫn chưa đạt tỷ lệ pass cao
    • Vì các phiên agent dài hạn tích lũy ngữ cảnh công việc lên tới hàng trăm nghìn token, việc mở rộng ngữ cảnh lên 1M giúp tăng hiệu năng ở những tác vụ khó
  • Cấu thành tác vụ hậu huấn luyện

    • Tập dữ liệu huấn luyện gồm 409.000 môi trường agent và non-agent
      • 83.000 môi trường dùng terminal
      • 168.000 tác vụ software engineering tổng quát
    • Họ thu thập tác vụ từ repository mã nguồn mở, dữ liệu tổng hợp nội bộ, hệ thống cài dependency tự động và cả việc mua lại nhà cung cấp dữ liệu bên ngoài
    • Các tác vụ software engineering chủ yếu dựa trên lịch sử code thực tế
      • Thành phần lớn nhất là khoảng 38.000 tác vụ tái hiện commit thật từ khoảng 17.000 repository
      • Ngoài ra còn có các tác vụ tái hiện PR đã merge, sửa bug được cài cắm và khôi phục file đã xóa dựa trên test suite
    • Ở S 2.1, họ bổ sung tác vụ cài đặt repository cho agent, tức cài toàn bộ dependency của repository và chạy test suite
    • Các tác vụ terminal dùng bộ dữ liệu sinh ra môi trường và bài toán chưa xuất hiện trong seed
  • Cải tiến vòng lặp huấn luyện

    • So với mô hình trước, họ dùng ngân sách rollout lớn hơn với thời gian giới hạn, số token mỗi lượt và số lượt mỗi tác vụ đều tăng
    • Họ chuyển RL sang dịch vụ sandbox mới để tận dụng các tính năng sau
      • Hỗ trợ background process
      • Tùy chọn chặn mạng để giảm bề mặt reward hacking
      • Cache đầu ra để tránh quá tải dịch vụ bên ngoài
    • Họ chạy cùng một prompt trên nhiều agent harness để học hành vi phù hợp với nhiều harness thay vì chỉ một scaffold duy nhất

Hai hướng Poolside đang tập trung

  • Hướng thứ nhất là năng lực coding dạng agent
    • Họ xem coding và giao diện linh hoạt của phần mềm là con đường dẫn tới trí tuệ
    • Họ tập trung vào các trường hợp mô hình dùng phần mềm như một agent và làm việc nhất quán suốt nhiều giờ hoặc nhiều ngày
  • Hướng thứ hai là cách tiếp cận cho rằng có thể khôi phục bằng reinforcement learning quá trình tư duy dẫn tới đáp án từ các đáp án đã được ghi lại trên web
    • Bản phát hành lần này là kết quả của hướng thứ nhất, còn hướng thứ hai vẫn đang tiếp tục được phát triển

Model Factory và chu kỳ phát triển

  • Với nền tảng nghiên cứu/kỹ thuật nội bộ Model Factory, họ tự động hóa quy trình phát triển mô hình như dữ liệu, thí nghiệm ablation kiến trúc và hạ tầng đánh giá
  • Chưa đầy 3 tháng sau khi ra mắt Laguna M.1, họ đã phát triển một mô hình mạnh hơn nhưng có kích thước chạy chỉ bằng một nửa
  • Họ đầu tư để tăng tốc độ lặp nghiên cứu và tích hợp, đồng thời giảm lượng chú ý mà nhà nghiên cứu phải dành cho sổ sách và hạ tầng
  • Trong 1 năm tới, họ dự định áp dụng cùng phương thức phát triển này cho các mô hình lớn hơn

Triển khai và cách sử dụng

  • Công bố trên Hugging Face theo giấy phép OpenMDW-1.1
    • Cung cấp trọng số BF16, FP8, INT4, NVFP4
    • Cung cấp chuyển đổi chính thức sang GGUF·MLX và bản nháp DFlash
  • Trên phần cứng NVIDIA, họ hỗ trợ tối ưu suy luận cho TRT-LLM serving, NVFP4 trên Blackwell và cả một DGX Spark đơn lẻ
  • Suy luận cục bộ và public serving được hỗ trợ trên vLLM, SGLang, Ollama
  • Các đường truy cập hosted gồm
  • Endpoint miễn phí của OpenRouter cung cấp ngữ cảnh 256K
    • Endpoint trả phí chuyên dụng hỗ trợ ngữ cảnh 1M
    • Giá là $0.10 cho input, $0.20 cho output và $0.01 cho cache read trên mỗi 1 triệu token
  • Có thể dùng mô hình trong Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline và agent coding terminal pool
  • Hậu huấn luyện được hỗ trợ trên NVIDIA NeMo AutoModel và Prime Intellect Prime Lab, còn ZML LLMD hỗ trợ chạy trên nhiều loại phần cứng
  • Người dùng không phải developer có thể dùng tìm kiếm web và chạy code cơ bản trên chat.poolside.ai mà không cần đăng nhập
  • Trọng số base model trước hậu huấn luyện được cung cấp qua yêu cầu email

Điều kiện chạy benchmark

  • Họ dùng bản fork nội bộ của Harbor Framework cùng pool agent harness, tối đa 500 bước và sandbox nội bộ
  • SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1 dùng giá trị trung bình pass@1 của 4 lần chạy cho mỗi tác vụ
  • DeepSWE v1.1 và SWE Atlas dùng 3 lần chạy cho mỗi tác vụ, Toolathlon Verified cũng lấy trung bình 3 lần chạy
  • SWE Atlas áp dụng nguyên phương pháp công khai và chấm bằng Opus 4.5
  • Toolathlon Verified dùng harness sao chép trên EC2 và agent tùy chỉnh; khác với bản chính thức, môi trường được reset và phục hồi hoàn toàn sau mỗi lần chạy đánh giá
  • Để ngăn sandbox bị chiếm dụng, giới hạn CPU·bộ nhớ·lưu trữ được điều chỉnh theo từng benchmark, và đảm bảo tối thiểu 2 lõi CPU, 8GB bộ nhớ, 25GB lưu trữ
  • Các chỉnh sửa cho từng tác vụ được tổng hợp trong báo cáo kỹ thuật

1 bình luận

 
Ý kiến trên Hacker News
  • Tôi đang thử nghiệm ngay lúc này, và ít nhất có vẻ đủ sức cạnh tranh với DS4-Flash. Nó đã phát hiện ra vấn đề mà trước đây chỉ có gpt-5.2 tìm ra trong một codebase kiểm thử C nhỏ nhưng có mật độ ý nghĩa rất cao, nhưng cũng đưa ra phán đoán sai khó hiểu rằng memfd_create()/mmap được dùng cho IPC, và Sol cũng bỏ sót cho đến khi tôi chỉ ra
    Việc so sánh với DeepSeek V4 có thể thay đổi rất nhanh trong môi trường biến động như hiện tại, vì cả Flash lẫn Pro đều dự kiến sẽ sớm được huấn luyện bổ sung đầy đủ rồi phát hành chính thức. Mong sẽ tiếp tục có những model như thế này xuất hiện
    • Tôi muốn biết họ đã dùng test harness và phương pháp lượng tử hóa nào
  • Quá ấn tượng và là thứ nổi bật nhất trong các bản phát hành hôm nay, ở mức lấn át các sản phẩm mới của Google. Đặc biệt, tính cạnh tranh về giá thật đáng kinh ngạc, và đây là model đầu tiên của Mỹ có thể so kè với DeepSeek V4 Flash nên tôi rất kỳ vọng
  • Model này không phải dạng đùa, nó đã tạo ra một PR có thể dùng cho công việc thực tế
    https://github.com/mozilla-ai/otari/pull/348
  • Rất ấn tượng, và với kích thước này thì có vẻ có thể chạy được trên phần cứng gia đình thực tế. Ngay cả khi phải chấp nhận suy giảm hiệu năng, tôi vẫn muốn có một bản lượng tử hóa cho môi trường 64GB
    Cũng có đánh giá rằng bản 2-bit của Qwen 3.5 122B khá ổn, và model này có điểm xuất phát cao hơn nên rất đáng thử. Đã có người làm rồi: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
  • MoE 118B tham số nhưng chỉ kích hoạt 8B, suy luận ngữ cảnh dài, lại còn trọng số mở, thật là một tổ hợp đáng mừng. Tôi chưa từng nghe về phòng lab này, nhưng có vẻ nó rất gần với điểm tối ưu giữa kích thước model và hiệu năng nên nhất định muốn thử
    • Nếu các chỉ số hiệu năng được công bố là thật, thì coi như model tôi mong đợi cuối cùng cũng đã xuất hiện
  • Tôi đúng là đang cần một model tầm trung với khả năng tự host thực tế, đủ thông minh, và MoE nhanh ngay cả khi băng thông bộ nhớ bị hạn chế
    Trong thời gian qua, trên Strix Halo thực sự không có lựa chọn nào tốt hơn hẳn Gemma 4 hay Qwen 3.6 dạng dense chạy trên desktop GPU kép 32GB, nhưng model này có vẻ ở mức kích thước có thể mang lại cải thiện hiệu năng thực sự
  • Cần cẩn thận khi thử model này. Ở cấu hình mặc định, tính năng suy luận không được kích hoạt đúng cách, nên bạn có thể thất vọng với kết quả hoặc cho rằng benchmark bị thổi phồng
    Ngay cả khi thêm --default-chat-template-kwargs '{"enable_thinking": true}' vào cấu hình chạy vLLM thì nó vẫn không bật, và có vẻ giá trị mặc định max_new_tokens là 32k trong generation_config.json đi kèm đang cắt mất phần suy luận, nên cần tăng lên. Sau khi bật suy luận thì chất lượng code cải thiện đáng kể, dù vẫn cần kiểm chứng thêm trong công việc thực tế
    https://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
    • Có vẻ ngay sau khi bài này được đăng, template chat mặc định trên Hugging Face đã được sửa để bật suy luận theo mặc định
    • Có vẻ model chính thức trên OpenRouter cũng gặp cùng vấn đề, hy vọng sẽ sớm được sửa dễ dàng
    • Chỉ cần điều chỉnh cấu hình chạy là kết quả đã khác đi rất nhiều
  • Việc model 128B đánh bại DeepSeek V4 1.6T trên phần lớn benchmark lập trình là một tín hiệu cực kỳ ấn tượng
    Tôi thích cách Poolside so sánh không chỉ với các model cùng hạng cân mà còn với những model trọng số mở top đầu lớn hơn nhiều như Kimi-K3 2.5T. Giá mà Mistral và những nơi khác cũng làm như vậy
  • Tôi mới biết đến Poolside khoảng một tuần trước khi phát hiện harness lập trình cục bộ poolmodel MoE 33B. Nó chạy nhanh và hiệu quả ngay cả trên chiếc Mac mini 32GB cũ của tôi, và tôi cũng định đánh giá các model host cỡ lớn
  • Poolside chat được giới thiệu trên trang đó có thể dùng tại đây: https://chat.poolside.ai