MarkTechPost
95

Mô hình

Ra mắt Claude Opus 5: Bước tiến mới về lập trình tự hành và khả năng điều khiển máy tính

(giờ Việt Nam)

Tóm tắt AI

Anthropic vừa trình làng Claude Opus 5, mẫu AI đầu bảng mới với khả năng lập trình và điều khiển máy tính vượt trội, trong khi vẫn giữ nguyên mức giá cũ.

Bản dịch AI

Meet the New Claude Opus 5: Frontier-Class Agentic Coding and Computer Use at Unchanged Opus Pricing

Hôm nay, Anthropic đã phát hành Claude Opus 5. Phiên bản này thay thế Claude Opus 4.8 để trở thành mô hình hàng đầu trong phân khúc Opus. Mức giá vẫn được giữ nguyên ở mức 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra.

Đội ngũ Anthropic định vị Opus 5 là mô hình có trí tuệ tiệm cận với Claude Fable 5 nhưng với mức giá chỉ bằng một nửa. Hiện tại, đây là mô hình mặc định trên Claude Max và là mô hình mạnh nhất trên Claude Pro.

Những thay đổi thực tế ở cấp độ API

Có ba thay đổi khá quan trọng cần lưu ý trước khi xem xét bất kỳ điểm chuẩn (benchmark) nào:

ID của mô hình là claude-opus-5. Ngữ cảnh (context) là 1 triệu token cho cả mặc định và tối đa, không có biến thể nhỏ hơn. Đầu ra tối đa là 128.000 token trên Messages API đồng bộ. Message Batches API đạt tới 300.000 token với tiêu đề beta output-300k-2026-03-24. Dung lượng prompt tối thiểu có thể lưu vào bộ nhớ đệm (cacheable) giảm xuống còn 512 token, thấp hơn mức 1.024 trước đây.

Kết quả về lập trình và tác nhân (agentic)

Trên FrontierBench v0.1, phiên bản kế nhiệm gồm 74 tác vụ của Terminal-Bench 2.1, Opus 5 đạt 43,3% ở mức nỗ lực tối đa (max effort). Opus 4.8 đạt 18,7%. Fable 5 đạt 33,7% và GPT-5.6 Sol đạt 37,5%. Ở mức nỗ lực xhigh, Opus 5 đạt phần thưởng trung bình 44,4%, đây là kết quả tốt nhất của nó.

Một chi tiết từ lần chạy thử nghiệm này rất đáng chú ý. Các bộ phân loại an toàn của Opus 5 đã gắn cờ và từ chối 5% các lệnh gọi API, trên tổng số 4% các lần thử nghiệm. Trong khi đó, các bộ phân loại của Fable 5 đã gắn cờ 42% các lệnh gọi trên 26% các lần thử nghiệm.

Opus 5 đạt 96,0% trên SWE-bench Verified và 79,2% trên SWE-bench Pro. Fable 5 vẫn nhỉnh hơn một chút ở bản Pro với 80,0%. Trên SWE-bench Multimodal, bước nhảy vọt lớn hơn, từ 38,4% lên 59,4%.

Các con số về tác nhân (agentic) là những chiến thắng rõ ràng nhất. Opus 5 đạt 70,57% trên OSWorld 2.0 so với 55,7% của Opus 4.8. Trên Zapier AutomationBench, nó đạt 26,0%, so với 17,0% của Opus 4.8 và 17,4% của Fable 5. Ở mức nỗ lực trung bình, nó vẫn đạt 24% với chi phí 0,89 USD mỗi tác vụ.

Trên bảng xếp hạng Artificial Analysis GDPval-AA v2, Opus 5 chiếm hai vị trí dẫn đầu với chỉ số ELO lần lượt là 1861 và 1827. Thiết lập xhigh vượt qua mọi mô hình khác trong khi sử dụng ít hơn 25% token đầu ra so với mức tối đa.

Khả năng suy luận và kết quả ARC-AGI-3

Anthropic đã yêu cầu Opus 5 giải tất cả sáu bài toán IMO 2026 mà không cần công cụ hoặc khung tác nhân hỗ trợ. Một hội đồng giám khảo gồm ba mô hình đã chấm tất cả 24 lời giải được tạo ra là chính xác. Các chuyên gia con người đã độc lập chấm điểm một lời giải được chỉ định trước cho mỗi bài toán với kết quả 7/7. Tổng điểm cuối cùng 42/42 đạt trình độ huy chương vàng, vượt xa ngưỡng 29/42.

ARC Prize Foundation báo cáo kết quả xác thực đạt 30,16% trên ARC-AGI-3 ở mức nỗ lực cao. Con số này gấp khoảng bốn lần điểm số cao nhất từng được báo cáo trên bảng xếp hạng trước đây. GPT-5.6 Sol đạt 7,78% và Opus 4.8 đạt 1,52%. Kết quả của Opus 5 ở mức nỗ lực tối đa chưa có sẵn tại thời điểm phát hành.

Trên Humanity's Last Exam, Opus 5 đạt 56,3% khi không sử dụng công cụ và 64,7% khi có sử dụng công cụ.

Công cụ vượt trội hơn khả năng tư duy trong các tác vụ đa phương thức

Phần đa phương thức mang lại một bài học thực tế. Việc sử dụng công cụ tác nhân giúp mở rộng khả năng tính toán tại thời điểm kiểm tra (test-time compute) hiệu quả về chi phí hơn so với việc chỉ dựa vào tư duy thích ứng.

Trên Chartography, Opus 5 đạt 29,6% khi không có công cụ và 83,0% khi có sự hỗ trợ của container và công cụ cắt ảnh. Trên BenchCAD Vision2Code, chỉ số voxel IoU tăng từ 0,366 lên 0,821. Với các công cụ, kết quả này vượt xa Claude Mythos 5 với 0,678.

Năng lực an ninh mạng tăng lên và các biện pháp bảo vệ được nới lỏng ở một khía cạnh

Anthropic không huấn luyện Opus 5 trên các tác vụ an ninh mạng. Tuy nhiên, năng lực này vẫn tăng lên như một sản phẩm phụ từ việc nâng cao năng lực tổng quát.

Trên ExploitBench, Opus 5 ghi nhận 10,14 cờ năng lực trung bình trong nhánh AutoNudge. Nó tạo ra 99 mã khai thác thực thi tùy ý (arbitrary-code-execution) hoàn chỉnh. Mythos 5 tạo ra 132. Trên OSS-Fuzz, Opus 5 đạt điểm khác không trên 79,4% các mục tiêu. Mythos 5 đạt khoảng 80%. Tuy nhiên, Opus 5 hoàn thành 4 mã khai thác đầy đủ so với 13 của Mythos 5.

Khoảng cách đó định hình thiết kế của các biện pháp bảo vệ. Opus 5 mạnh gần bằng Mythos 5 trong việc tìm kiếm lỗ hổng, nhưng kém hơn đáng kể trong việc khai thác chúng. Vì vậy, Anthropic đã mở khóa tính năng tìm kiếm lỗ hổng trong mã nguồn. Việc quét dựa trên tệp nhị phân, kiểm thử xâm nhập và tạo mã khai thác vẫn bị chặn. Các bộ phân loại dự kiến sẽ can thiệp ít hơn khoảng 85% so với trên Fable 5. Những người làm công tác phòng thủ có thể đăng ký tham gia Chương trình Xác minh An ninh mạng (Cyber Verification Program).

UK AISI đã thử nghiệm các checkpoint sớm trên ba phạm vi an ninh mạng với 100 triệu token mỗi lần thử. Opus 5 đã giải quyết 'The Last Ones' từ đầu đến cuối trong 8 trên 10 lần thử. Nó không giải được phạm vi 'Doing Life' khó hơn. Nó đã đạt đến bước 22 trên 23, xa hơn bất kỳ mô hình nào từng được thử nghiệm.

Theo RSP, Anthropic coi Opus 5 là mô hình có năng lực CB-1 nhưng chưa đạt CB-2. Nó áp dụng các biện pháp bảo vệ ASL-3 tương tự như đã dùng cho Opus 4.8. Ngưỡng R&D AI chưa bị vượt qua.

Tấn công chèn prompt (prompt injection) là chỉ số an toàn nổi bật nhất

Trên tiêu chuẩn đánh giá tấn công chèn prompt gián tiếp Gray Swan, tỷ lệ thành công của kẻ tấn công trong vòng 15 lần thử đã giảm từ 5,5% trên Opus 4.8 xuống còn 2,0%. Mythos 5 ở mức 2,6% và GPT-5.6 Sol ở mức 20,0%.

Trong môi trường trình duyệt chạy qua Claude Cowork, tỷ lệ tấn công thành công giảm từ 31,5% trên Opus 4.8 xuống còn 3,70%. Con số đó là khi không áp dụng bất kỳ biện pháp bảo vệ nào. Khi bật chế độ tự động, tỷ lệ này đạt 0% trên tất cả 129 môi trường.

Những điểm chính cần lưu ý

Nguồn: Bài đăng ra mắt của Anthropic, Thẻ hệ thống Claude Opus 5, Có gì mới trong Claude Opus 5, TechCrunch và đánh giá độc lập từ CodeRabbit.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo công chúng. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

AnthropicClaude Opus 5AI lập trìnhMô hình AICông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.