Anthropic đã công bố Claude Opus 5 vào ngày 24/7/2026. Đây là mẫu model cải tiến mang tính “thay thế thế hệ” cho tier Opus, với định vị cốt lõi là cung cấp trí tuệ gần với Fable 5 (model frontier) với mức giá bằng một nửa.
Tóm tắt chính
- Định vị: Gần với trí tuệ cấp frontier của Fable 5 nhưng giá chỉ bằng một nửa. Được chỉ định là model mặc định mới của Claude Max và là model mạnh nhất có thể dùng trong Claude Pro.
- Benchmark: Đạt SOTA mới trong các đánh giá về coding và knowledge work như Frontier-Bench, GDPval-AA. Tuy nhiên, trong các tác vụ an ninh mạng, model này vẫn kém Mythos 5 (model cao cấp nhất của Anthropic).
- Hiệu năng coding: Đạt hiệu năng cao nhất trong tất cả các model trên Frontier-Bench v0.1, cải thiện hơn 2 lần so với Opus 4.8 (với chi phí thấp hơn). Ở cấu hình hiệu quả nhất của CursorBench, đạt kết quả chỉ kém điểm cao nhất của Fable 5 trong vòng 0,5% với chi phí bằng một nửa.
- Knowledge work/giải quyết vấn đề: Trên ARC-AGI 3, đạt điểm gấp 3 lần model xếp ngay sau; trên Zapier AutomationBench, tỷ lệ vượt qua cao hơn khoảng 1,5 lần so với model xếp sau; trên OSWorld 2.0 (benchmark sử dụng máy tính), vượt kỷ lục cao nhất của Fable 5 với chi phí chỉ khoảng một phần ba.
- Nghiên cứu khoa học: Cải thiện so với Opus 4.8 trên tất cả các đánh giá khoa học sự sống. +10,2 điểm phần trăm trong hóa hữu cơ (suy luận cấu trúc phân tử từ dữ liệu phổ), +7,7 điểm phần trăm trong dự đoán chuỗi protein–chức năng.
- Phong cách làm việc: Năng lực tự kiểm chứng và lặp lại được tăng cường đáng kể. Bài viết giới thiệu các ví dụ như tái dựng mô hình 3D CAD bằng code chỉ từ bản vẽ mà không có thông tin thị giác trực tiếp, hoặc tìm và sửa nguyên nhân gốc mà bản vá cộng đồng bỏ sót.
- Alignment: Trong audit hành vi nội bộ, được đánh giá là model có alignment tốt nhất từ trước đến nay. Tỷ lệ hành vi lừa dối thấp hơn Opus 4.8, Sonnet 5 và Fable 5, đồng thời năng lực tránh các hành vi rủi ro không thể đảo ngược cũng ở mức cao nhất.
- An toàn: Trong các lĩnh vực sinh học và an ninh mạng tấn công, model này kém Mythos 5. Khả năng “phát hiện” lỗ hổng tương đương Mythos 5, nhưng năng lực “phát triển exploit” thấp hơn đáng kể (do cố ý loại trừ huấn luyện cho các tác vụ mạng).
- Biện pháp bảo vệ: Can thiệp của bộ phân loại cyber ít hơn khoảng 85% so với Fable 5. Cho phép phát hiện lỗ hổng trong mã nguồn, nhưng chặn quét dựa trên binary, penetration testing và tạo exploit. Các yêu cầu liên quan đến sinh học từng bị chặn ở Fable 5 nay được định tuyến sang Opus 5.
Giá và cung cấp
- Có thể sử dụng từ hôm nay trên mọi nền tảng, API là
claude-opus-5 - Giá: input $5 / output $25 cho mỗi 1 triệu token (giống Opus 4.8)
- Có Fast mode (nhanh hơn khoảng 2,5 lần so với mặc định, giá gấp 2 lần)
- Không có yêu cầu lưu giữ dữ liệu (theo tiêu chuẩn sử dụng thông thường)
2 tính năng beta ra mắt đồng thời
- Thay đổi tool giữa cuộc trò chuyện: Có thể thay đổi các công cụ khả dụng ở giữa cuộc trò chuyện mà không làm mất hiệu lực prompt cache
- Fallback tự động: Tự động định tuyến yêu cầu bị bộ phân loại an toàn đánh dấu sang model khác (mặc định dùng model khả dụng tốt nhất thay vì chặn)
Tóm tắt bổ sung GN⁺
Neo đã tổng hợp thêm dựa trên bài gốc
- Cung cấp trí tuệ gần với Fable 5 với chi phí trên mỗi tác vụ bằng một nửa, được cung cấp làm model mặc định của Claude Max và model hiệu năng cao nhất của Claude Pro
- Đạt mức hàng đầu trong các đánh giá coding và knowledge work như Frontier-Bench và GDPval-AA; điểm ARC-AGI 3 cao gấp 3 lần model xếp ngay sau
- Tự kiểm chứng công việc và lặp lại cho đến khi thành công, thực hiện từ xây dựng pipeline computer vision, sửa nguyên nhân gốc của bug open source, đến triển khai feed dữ liệu thị trường và test harness
- Giá $5 cho mỗi 1 triệu token input, $25 cho mỗi 1 triệu token output, bằng với Opus 4.8; Fast mode nhanh hơn khoảng 2,5 lần được cung cấp với giá gấp 2 lần giá cơ bản
- Năng lực dual-use nguy hiểm thấp hơn Mythos 5; cho phép phát hiện lỗ hổng nhưng chặn quét binary, penetration testing và tạo exploit, đồng thời có thể áp dụng tự động thay thế bằng Opus 4.8 cho các yêu cầu bị đánh dấu
Hiệu năng và hiệu quả chi phí
- Claude Opus 5 cung cấp hiệu năng cao hơn với cùng mức giá như model trước đó, Opus 4.8
- Có thể điều chỉnh thiết lập effort để ưu tiên trí tuệ hoặc chọn chế độ chạy nhanh hơn, rẻ hơn nhằm tiết kiệm token
- Là model mặc định của Claude Max và được cung cấp là model mạnh nhất trong Claude Pro
- Vượt tất cả model khác trên Frontier-Bench v0.1, đạt hơn 2 lần hiệu năng của Opus 4.8 với chi phí trên mỗi tác vụ thấp hơn
- Đây là kết quả chạy nội bộ, đo bằng phần thưởng trung bình của 5 lần thử cho mỗi tác vụ trên mini-SWE-agent harness và backend GKE
- Với các yêu cầu bị Opus 5 và Fable 5 từ chối do bộ phân loại an toàn, Opus 4.8 được dùng làm model thay thế
- Ở max effort của CursorBench 3.2, model này chỉ kém điểm cao nhất của Fable 5 trong vòng 0,5% trong khi chi phí trên mỗi tác vụ bằng một nửa
- Ở high, xhigh và max effort, model đều đạt hiệu năng cao hơn tất cả model khác trên cùng cơ sở chi phí
- Cũng cho thấy hiệu quả chi phí cao trong các đánh giá knowledge work và giải quyết vấn đề
- Trên ARC-AGI 3, điểm giải quyết các bài toán mới cao gấp 3 lần model xếp ngay sau
- Trên Zapier AutomationBench, tỷ lệ vượt qua trên cùng chi phí mỗi tác vụ cao hơn khoảng 1,5 lần so với model xếp sau; ngay cả ở effort thấp nhất cũng vượt qua nhiều tác vụ hơn mọi model khác
- Trên OSWorld 2.0, vượt các model khác ở mọi mức chi phí và vượt kết quả tốt nhất của Fable 5 với chi phí chỉ hơn một phần ba
Nghiên cứu khoa học và kết quả thị giác
- Đạt hiệu năng cao hơn Opus 4.8 trên tất cả các đánh giá khoa học sự sống, bao gồm sinh học cấu trúc, hóa hữu cơ và tin sinh học
- Trên benchmark hóa hữu cơ nội bộ về suy luận cấu trúc phân tử từ dữ liệu phổ, cao hơn 10,2 điểm phần trăm
- Trong tác vụ dự đoán ảnh hưởng của biến thể chuỗi protein lên chức năng, cao hơn 7,7 điểm phần trăm
- Có thể tạo đầu ra thị giác mạnh hơn nhiều so với các model trước
Kiểm chứng tác vụ và lặp lại tự chủ
- Năng lực trực tiếp kiểm chứng kết quả và lặp lại cẩn thận cho đến khi thành công được tăng cường
- Trong tác vụ FreeCAD của Frontier-Bench, dưới điều kiện không thể trực tiếp nhìn bản vẽ linh kiện cơ khí, model tự viết pipeline computer vision để trích xuất hình dạng từ pixel thô và tái dựng linh kiện 3D
- Model đã thành công sau nhiều vòng lặp, trong khi các model cạnh tranh ở cùng điều kiện vẫn không giải được sau 5 lần thử
- Với một bug thực tế trong trình quản lý gói open source được dùng rộng rãi, model tìm ra nguyên nhân gốc và sửa cả edge case mà bản vá cộng đồng bỏ sót
- Model cạnh tranh chỉ sửa triệu chứng bề mặt rồi kết luận bug đã được giải quyết
- Một kỹ sư tại công ty trading đã xây dựng feed dữ liệu thị trường cho một sàn giao dịch mới trong một phiên duy nhất
- Các model trước không hoàn thành tác vụ dù kỹ sư đã cung cấp kế hoạch chi tiết
- Khi không có feed thời gian thực để kiểm chứng, model tự tạo test harness để xác nhận dữ liệu sàn được parse chính xác
Đánh giá coding và agent từ người dùng ban đầu
- Trong FrontierCode 1.1 của Devin, model tiến gần mức Fable với chi phí bằng một nửa và thể hiện thế mạnh ở debugging khó và phân tích nguyên nhân gốc
- Trên CursorBench, model kém Fable 5 một chút nhưng có đặc tính hành vi tương tự, cung cấp trí tuệ gần với Fable 5 với tốc độ và chi phí của Opus
- Trên Zapier AutomationBench, model đứng đầu mà không dùng nhiều token hơn các model Claude trước
- Trong workbook trạng thái tài khoản, model thực hiện trọn quy trình chống rời bỏ khách hàng: xác định khách hàng rủi ro, thông báo người phụ trách và tạo tóm tắt cho tổ chức giữ chân khách hàng, đạt 100% pass
- Trong phân tích bộ gen, model loại trừ yếu tố gây nhiễu bằng kiểm định thống kê phù hợp, cross-validate kết quả bằng phương pháp độc lập và duy trì phân tích nhiều bước dài
- Trong đánh giá nội bộ của Lovable, các tác vụ agent coding khó nhất cải thiện 22% so với Opus 4.7 và độ biến thiên giữa các lần chạy cũng giảm
- Trong cùng tác vụ xây dựng ứng dụng full-stack, model tạo ra các tác vụ animation, game và 3D tốt nhất trong dòng Opus, được đánh giá là cải thiện lớn nhất kể từ Opus 4.5
- Trong phân tích mở, nhiệm vụ càng khó và mơ hồ thì mức cải thiện so với Opus 4.8 càng lớn; câu trả lời rõ ràng, súc tích hơn và hiệu quả ở effort cao cũng được cải thiện
- Khi quản lý môi trường phát triển, model tạo monitor riêng, thao tác từng môi trường và chỉ yêu cầu con người quyết định những vấn đề cần phán đoán
- Trong codebase Fundamental Research Assistant, model thực hiện thay đổi quy mô lớn theo feedback và xử lý trong một workflow agent những công việc thường phải chia thành nhiều phần
- Trong đánh giá frontend, model tự mở trang ở độ rộng desktop và điện thoại, phát hiện và sửa sản phẩm bị ẩn phía dưới màn hình mobile và nút thanh toán nằm ngoài màn hình
- Trước khi bàn giao PR, model kiểm tra branch, template và ảnh hưởng đến test; không vội publish trước khi kiểm chứng như các model trước
- Trong quá trình redesign, model phân biệt ưu điểm của thiết kế được đề xuất với một vấn đề đơn lẻ, đồng thời đề xuất phương án thỏa hiệp để sửa lỗi mà vẫn giữ ưu điểm
- Khi thay đổi code, model tạo diff gọn không có code chết, phát hiện tốt hơn các rủi ro tinh vi đặc thù của codebase và được áp dụng cho workload production
- Nhiều use case và code review của nền tảng agent tích hợp Cosmos dự kiến sẽ được chuyển sang Opus 5
- Trong đánh giá của JetBrains, model xem xét sâu hơn trước khi viết code, phát hiện lỗi logic ở giai đoạn lập kế hoạch và đánh giá không chỉ việc câu trả lời có chạy hay không mà còn đúng vì lý do nào
- Trong benchmark trading, model đạt hiệu năng cao nhất trong dòng Opus, đồng thời giảm token suy luận xuống khoảng một phần bảy và độ trễ xuống dưới một nửa so với Opus 4.8
Đánh giá doanh nghiệp và công việc chuyên môn
- Trong nghiên cứu tài chính, suy luận số, thao tác bảng và tư duy phản biện chính xác được cải thiện so với Opus 4.8
- Trong đánh giá nội bộ của Box, hiệu năng phân tích nội dung doanh nghiệp chuyên môn cao hơn Opus 4.8 8%
- Workflow phân tích dữ liệu cải thiện 11%, due diligence cải thiện 17%
- Nhắm đến các công việc được dùng trong lĩnh vực công nghệ, y tế và khu vực công
- Trong mô hình tài chính khó, độ chính xác trung bình tăng 9 điểm phần trăm trên toàn bộ mức effort, số lượt hội thoại và lần gọi tool giảm một phần ba, thời gian cần thiết giảm 60%
- Trong tác vụ agent pháp lý, cải thiện nổi bật ở lĩnh vực quản trị doanh nghiệp và trọng tài
- Duy trì chất lượng tương tự với trung bình ít token hơn 26% so với max reasoning của Opus 4.8
- Trong bản sửa đổi hợp đồng ở lần thử đầu tiên, model đạt điểm cao nhất trong các model được thử nghiệm và gần gấp đôi Opus 4.8
- Việc sửa NDA cũng hoàn tất với ít thời gian và vòng lặp hơn trong khi vẫn duy trì hoặc tăng độ chính xác
- Với tác vụ dài, năng lực tạo toàn bộ bài thuyết trình rồi chỉnh sửa được cải thiện; kết quả cũng tốt hơn về hiểu thị giác, định dạng và lỗi slide
Alignment và năng lực rủi ro
- Trong audit hành vi tự động trước khi triển khai, Opus 5 cho thấy mức alignment cao nhất trong các model của Anthropic
- Tuân thủ Hiến pháp của Claude tốt hơn Opus 4.8, Sonnet 5 và Fable 5
- Có tỷ lệ hành vi lừa dối và mức dễ bị dẫn dụ lạm dụng thấp nhất
- Tránh tốt nhất các hành vi liều lĩnh có thể gây tác dụng phụ khó đảo ngược
- Không đẩy cao tuyến đầu của các năng lực dual-use nguy hiểm; trong các đánh giá thực hiện cùng đối tác dân sự và chính phủ, model cho thấy hiệu năng thấp hơn Mythos 5 ở cả nghiên cứu sinh học và an ninh mạng tấn công
- Có thể xem đánh giá chi tiết trong System Card
- Giống Opus 4.8, model cố ý không được huấn luyện cho tác vụ cyber, nhưng hiệu năng liên quan cũng cải thiện đáng kể nhờ năng lực chung tăng lên
- Khả năng phát hiện lỗ hổng gần với Mythos 5
- Phát triển exploit để biến lỗ hổng đã phát hiện thành mối đe dọa thực tế vẫn kém xa Mythos 5
- Trong đánh giá OSS-Fuzz, Opus 5 và Mythos 5 tìm lỗ hổng với tỷ lệ thành công tương tự, nhưng điểm phát triển exploit của Opus 5 thấp hơn nhiều
Biện pháp bảo vệ an ninh mạng và sinh học
- Các biện pháp bảo vệ được thiết kế để cho phép sử dụng có ích trong an ninh mạng và sinh học; nhìn chung tương tự Opus 4.8, ngoại trừ việc bổ sung hạn chế mạnh hơn cho một phạm vi hẹp các tác vụ cyber
- Bộ phân loại cyber ít hạn chế hơn tương đối so với Fable 5
- Cho phép phát hiện lỗ hổng trong mã nguồn
- Chặn quét lỗ hổng dựa trên binary, penetration testing và tạo exploit, vốn có khả năng cao liên quan đến tác nhân độc hại
- Trong thử nghiệm của Anthropic, dự kiến can thiệp của bộ phân loại sẽ ít hơn khoảng 85% so với Fable 5
- Các yêu cầu bị đánh dấu trên Claude.ai, Claude Code và Claude Cowork mặc định sẽ được thay thế bằng Opus 4.8, và API cũng có thể kích hoạt tính năng này
- Doanh nghiệp và nhà nghiên cứu tham gia Cyber Verification Program có thể dùng ngay Opus 5 với ít hạn chế bảo mật hơn
- Trong lĩnh vực sinh học, model duy trì các biện pháp bảo vệ tương tự Opus 4.8, đồng thời trở thành model nghiên cứu khoa học mạnh nhất trong nhóm model cung cấp phổ thông
- Vẫn có những giới hạn quan trọng đối với nghiên cứu tự chủ kéo dài, và Mythos 5 mạnh hơn ở loại tác vụ sinh học này
- Các yêu cầu sinh học bị chặn ở Fable 5 nay được chuyển sang Opus 5 thay vì Opus 4.8
Giá và tính năng dành cho developer
- Được cung cấp trên mọi nền tảng, định danh model trong Claude API là
claude-opus-5- $5 cho mỗi 1 triệu token input, $25 cho mỗi 1 triệu token output, giống Opus 4.8
- Với quyền truy cập thông thường, cũng như các model Opus trước, không có yêu cầu lưu giữ dữ liệu
- Fast mode chạy nhanh hơn tốc độ mặc định khoảng 2,5 lần
- Trên Claude Platform, giá gấp 2 lần giá cơ bản; trên Claude Code, được cung cấp bằng credit sử dụng
- Beta thay đổi tool giữa cuộc trò chuyện của Claude Platform cho phép thay đổi các công cụ mà Claude có thể dùng trong lúc hội thoại mà không làm mất hiệu lực prompt cache
- Khi bật beta tự động thay thế của API, yêu cầu Opus 5 hoặc Fable 5 bị bộ phân loại an toàn đánh dấu sẽ tự động được chuyển sang model khác
- Thay vì chặn yêu cầu, mặc định định tuyến sang model tốt nhất hiện có
- Cách sử dụng model có trong hướng dẫn prompting Opus 5
1 bình luận
Ý kiến trên Hacker News
Điểm mấu chốt ở đây không phải hiệu năng tuyệt đối, mà là các tổ chức giờ có thể dùng mô hình tầm Fable mà không có nghĩa vụ lưu giữ dữ liệu 30 ngày
Opus 5, giống Opus trước đây, không có yêu cầu lưu giữ dữ liệu đối với quyền truy cập thông thường; lý do Fable không có điểm ARC-AGI cũng là vì chính sách lưu giữ này
https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344
Việc giữ Fable 5 chỉ dùng bằng credit cũng là điều đáng mừng; có vẻ về sau các mô hình hàng đầu sẽ ngày càng được đặt sau API trả theo mức dùng hoặc credit, còn các mô hình khác sẽ bổ trợ bằng thuê bao tháng
Nếu vậy thì thông tin vẫn được lưu ở đâu đó, nên rất khó hiểu cách dữ liệu được lưu giữ
Hiện đang thử nghiệm chuyển ảnh → HTML; trước đây Fable là tốt nhất, còn Gemini 3.1 Pro bất ngờ đứng thứ hai
Opus 5 bám sát thiết kế gốc chính xác hơn Fable, triển khai nút dưới dạng hình chữ nhật bo góc thay vì dạng viên thuốc, và ảnh được tạo ra cũng gần bản gốc hơn
Bản gốc: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5: https://html.non.io/solaraOpus/
Fable 5: https://html.non.io/solara/
Hành vi responsive bị lệch, nhưng cảm giác đã đạt khoảng 90% sản phẩm hoàn chỉnh
Bản gốc: https://image.non.io/9d5fed20-b476-49d3-841b-37eb553fb88e.we...
Opus 5: https://html.non.io/neonRamen/
Inkling không tốt lắm: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Kimi 2.7, phiên bản tiền nhiệm của Kimi3 mới nhất, làm rất tốt: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Môi trường thử nghiệm: https://huggingface.co/spaces/abidlabs/vlm-screenshot-to-web...
Sẽ hữu ích hơn khi xem mô hình chuyển thiết kế của con người tốt đến đâu mà không làm nhòe/méo nó
Nhìn vào vô số lần ra mắt, cũng không ngạc nhiên khi model routing là một trong những lĩnh vực tăng trưởng nhanh nhất trong AI
Mỗi công ty trong hơn 10 công ty đều có các mô hình thuộc nhiều dạng thức và quy mô khác nhau, mức độ suy luận, chế độ agent·Pro·tốc độ cao, chạy tiêu chuẩn·linh hoạt·batch, cùng giá token đầu vào·đầu ra·cache khác nhau
Những công ty gửi prompt đến tổ hợp phù hợp và kinh tế nhất đang lấy được giá trị lớn từ khoảng trống mà các nhà phát triển mô hình bỏ qua
Đây là sự lặp lại của Bài học cay đắng (Bitter Lesson), và có vẻ các công ty dẫn đầu rốt cuộc sẽ trực tiếp cung cấp chức năng này
Hầu hết công việc văn phòng không cần AGI siêu mạnh nên lưu lượng sẽ hướng đến các mô hình rẻ, nhưng các phòng lab hàng đầu lại định vị rằng chỉ họ mới có thể làm cả AGI mạnh lẫn thay thế nhân viên văn phòng
Routing sang mô hình giá rẻ rất có khả năng tạo ra lỗ hổng trong câu chuyện đó
Với bất kỳ tác vụ nào, nếu không phải mô hình mới nhất có hiệu năng cao nhất thì khó chấp nhận, và quy tắc cần thiết chỉ là chọn mô hình mạnh nhất còn quota gói cố định
Đổi lại việc tiết kiệm chi phí là phải chấp nhận các bug không đo được mức độ nghiêm trọng và tần suất; cũng không thể biết giá trị của “bảo hiểm” khi giao toàn bộ suy luận cho mô hình cao cấp nhất, hay chi phí sửa về sau
Ở cấp dự án, cũng không có cách nào thử xem code sẽ khác đi bao nhiêu nếu dùng mô hình khác
Nếu không muốn đọc file PDF khoảng 190 trang thì có bài blog này: https://www.anthropic.com/news/claude-opus-5
Nếu so sánh văn phong của Opus 5 và Fable 5, Opus 5 vẫn tiếp tục dùng những cách diễn đạt đặc trưng của Claude mà Fable đã thoát khỏi, giống như 4.8
Các cụm như “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” lặp lại, nên cần một benchmark ‘tiếng Anh gây khó chịu’
Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
Văn phong đặc trưng của Claude dường như một phần bắt nguồn từ xu hướng ‘chủ động’ đẩy cuộc trò chuyện hay tác vụ tiến lên, và một benchmark định lượng phạm vi văn phong theo từng prompt cũng có vẻ hữu ích
Mức 55,7% của Anthropic và khoảng 21% trong paper OSWorld 2.0 là các chỉ số khác nhau
Opus 4.8 hoàn thành trọn vẹn khoảng 1 trong 5 tác vụ, ghi nhận tỷ lệ hoàn thành 20,6%, và trong các tác vụ còn lại cũng nhận điểm một phần, đạt điểm một phần 54,8%
Tuy nhiên, khác biệt chỉ số như vậy khiến tôi nghi ngờ liệu có thể so sánh benchmark giữa các paper trong phạm vi sai số hợp lý hay không: https://arxiv.org/pdf/2606.29537
Người tạo benchmark thích con số thấp để cho thấy còn dư địa cải thiện, còn nhà sản xuất mô hình thích con số cao để nhấn mạnh năng lực, nhưng 55,7% của Anthropic và 54,8% trong paper thực chất là cùng một kết quả
Nói rằng “Opus 5 nhìn chung không vượt trội hơn Fable 5”, nhưng trên blog lại liệt kê rằng nó tốt hơn ở phần lớn benchmark, nên cách truyền đạt khá rối
System card cũng nói năng lực R&D AI tương tự Claude Mythos 5, vốn được xem là Fable không bị giới hạn
Opus 5 không học cách khai thác lỗ hổng phần mềm nên năng lực phát hiện gần với Mythos 5, nhưng năng lực khai thác để chuyển thành mối đe dọa mạng thực tế thì kém xa
Ngay cả một mô hình trông vượt trội hơn Fable rất nhiều cũng đã được phát hành mà không gặp vấn đề gì lớn, vì không có màn quảng bá kiểu tận thế của Anthropic
Về lý thuyết, theo tiêu chuẩn của Anthropic thì nó phải ở cấp AGI, nhưng thực tế chỉ là một ngày thứ Sáu bình thường
Các mô hình này được bảo vệ chặt chẽ, và họ nói Mythos không có biện pháp an toàn nên không thể phát hành
OpenAI cũng từng có phản ứng tương tự khi thông báo rằng một mô hình không có biện pháp an toàn đã xâm nhập vào máy chủ HuggingFace
Dù GPT-6 ra mắt vào mùa hè, giờ gần như không còn ai kỳ vọng AGI, nên tôi tò mò họ sẽ duy trì chu kỳ thổi phồng như thế nào
Trường hợp quảng bá rằng Opus 5 đã tạo được nguồn cấp dữ liệu thị trường và công cụ xác minh cho một sàn giao dịch mới chỉ trong một phiên, thú vị là lại là dự án thường được giao cho thực tập sinh ở các công ty giao dịch
Tôi tò mò vì sao trên biểu đồ Frontier Code, hiệu quả trên mỗi tác vụ của chế độ suy nghĩ trung bình lại áp đảo, còn khi tăng lượng suy luận thì kết quả đánh giá lại xấu đi đáng kể
Có những trường hợp giảm nhẹ ở mức tối đa, nhưng mức này thì khá bất thường: https://imgur.com/a/Nv8V7Ry
Theo cảm nhận chủ quan, trong khung sử dụng 5 giờ, Opus 4.8 Medium hôm nay và Opus 5 Medium sau khi công bố cho cảm giác hiệu quả hơn Opus 4.8 tuần trước
Nếu dùng thiên về prompt hơn là agent thì có thể thấy giới hạn này, và mức trung bình có lẽ cân bằng hơn
Không rõ có phải suy nghĩ quá nhiều thì tệ, nhưng nếu suy nghĩ cực kỳ nhiều thì lại tốt hơn hay không