The Decoder
92

Mô hình

Anthropic ra mắt Claude Opus 5: Hiệu năng tiệm cận Fable 5 với chi phí chỉ bằng một nửa

(giờ Việt Nam)

Tóm tắt AI

Claude Opus 5 thiết lập tiêu chuẩn mới trong lập trình và xử lý tri thức với chi phí tối ưu. Đặc biệt, mô hình đạt 30,2% trên bài kiểm tra ARC-AGI-3, vượt xa các đối thủ hiện nay.

Bản dịch AI

Claude Opus 5, mô hình hàng đầu mới của Anthropic, đạt điểm số cao nhất trong lĩnh vực lập trình và xử lý tri thức, đồng thời tiệm cận hiệu suất của Claude Fable 5 với mức phí token chỉ bằng một nửa.

Anthropic đang phản ứng trước áp lực về giá từ GPT-5.6 Sol và các đối thủ cạnh tranh từ Trung Quốc. Mô hình Opus 5 mới được thiết kế để thu hẹp khoảng cách về giá thành và hiệu năng so với mẫu Fable 5 đắt đỏ hơn nhiều. Opus 5 trở thành mô hình mặc định trên Claude Max và là mô hình mạnh mẽ nhất hiện có trên Claude Pro.

Cửa sổ ngữ cảnh 1 triệu token và mức phí token vẫn không thay đổi. Giống như phiên bản tiền nhiệm Opus 4.8, Opus 5 có giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra. Chế độ Fast Mode mới giúp tăng tốc độ lên 2,5 lần nhưng lại tăng gấp đôi chi phí.

Tuy nhiên, mức phí token sẽ không phản ánh đầy đủ nếu không tính đến hiệu quả sử dụng token. Opus 4.7 cuối cùng lại tốn kém hơn từ 30 đến 40 phần trăm cho mỗi tác vụ so với Opus 4.6, mặc dù cả hai mô hình đều có cùng mức giá cơ bản. Một mô hình tương tự cũng vừa xuất hiện gần đây với Claude Sonnet 5.

Nỗ lực cao hơn có thể tốn kém hơn và mang lại hiệu quả kém hơn

Người dùng có thể đánh đổi giữa hiệu suất và mức sử dụng token thông qua năm thiết lập nỗ lực: thấp (low), trung bình (medium), cao (high), rất cao (xhigh) và tối đa (max). Anthropic cho biết Opus 5 mang lại giá trị tốt hơn so với phiên bản tiền nhiệm ở mọi cấp độ nỗ lực.

Trong hướng dẫn viết prompt, Anthropic khuyến nghị nên tận dụng rộng rãi các thiết lập "low" và "medium". Công ty cho biết các thiết lập này mang lại kết quả tốt với lượng token và độ trễ thấp hơn đáng kể, đồng thời vượt trội hơn so với các thiết lập tương tự trên các phiên bản Opus trước đó. Đối với lập trình và các tác vụ đại lý (agentic tasks), Anthropic vẫn khuyến nghị bắt đầu với thiết lập "xhigh".

Opus 5 đạt điểm thấp hơn một chút ở thiết lập nỗ lực tối đa so với thiết lập cao thứ hai trên hai bảng xếp hạng, mặc dù chi phí lại cao hơn. Sự sụt giảm này xuất hiện trên Frontier-Bench v0.1 và Artificial Analysis Coding Agent Index.

Opus 5 đánh bại Fable 5 trong lập trình đại lý (agentic coding)

Theo các bảng xếp hạng của chính Anthropic, Opus 5 thiết lập các kỷ lục trên nhiều đánh giá. Trên Frontier-Bench v0.1, mô hình đạt 43,3% trong lập trình terminal đại lý, vượt xa Fable 5 (33,7%), GPT-5.6 Sol (34,4%) và phiên bản tiền nhiệm Opus 4.8 (21,1%). Trên bảng xếp hạng về tri thức GDPval-AA v2, Opus 5 dẫn đầu với điểm Elo là 1.861, xếp trên Fable 5 (1.747) và GPT-5.6 Sol (1.736).

Opus 5 không chiến thắng ở mọi mặt trận. Trong lập trình đại lý qua DeepSWE v1.1, GPT-5.6 Sol dẫn đầu với 72,7%, theo sau là Fable 5 (69,7%) và Opus 5 (68,8%). Đối với các tác vụ y tế và bảng xếp hạng pháp lý, Fable 5 và Mythos 5 lần lượt vượt qua Opus 5.

Kết quả ARC-AGI-3 có lẽ là bất ngờ lớn nhất và là ngoại lệ trong các bảng xếp hạng của Anthropic. Bài kiểm tra này đo lường khả năng giải quyết vấn đề mới mà không dựa trên các khuôn mẫu đã ghi nhớ, và Opus 5 đạt 30,2%. Opus 4.8 chỉ đạt 1,5%, GPT-5.6 Sol đạt 7,8%. Đó là khoảng cách gần gấp 4 lần so với mô hình tốt thứ hai. Hiện chưa có kết quả của Fable 5 cho bài kiểm tra này, và vẫn chưa rõ liệu ưu thế lớn như vậy trên một bài kiểm tra có thể hiện trong quá trình sử dụng thực tế hay không.

Opus 5 xếp sau Mythos 5 trong các tác vụ an ninh mạng. Anthropic cho biết họ cố tình không huấn luyện Opus 5 về các tác vụ an ninh mạng, tương tự như phiên bản tiền nhiệm. Mô hình này tiệm cận khả năng của Mythos 5 trong việc tìm kiếm lỗ hổng nhưng hoạt động kém hơn nhiều khi được yêu cầu khai thác chúng.

Anthropic cũng cho biết Opus 5 đã cải thiện khả năng tạo đầu ra hình ảnh và phân tích nội dung trực quan như biểu đồ và sơ đồ.

Opus 5 tự xây dựng công cụ khi cần thiết

Anthropic mô tả Opus 5 có khả năng kiểm tra công việc của chính mình và cải thiện thông qua lặp lại tốt hơn nhiều. Trong một tác vụ của Frontier-Bench, Opus 5 nhận được bản vẽ của một chi tiết máy và phải tạo mô hình 3D trong FreeCAD. Điểm khó là mô hình cố tình không có cách nào để xem trực tiếp bản vẽ. Opus 5 đã phản hồi bằng cách tự viết một quy trình thị giác máy tính để trích xuất hình học từ các pixel thô, sau đó tái tạo hoàn chỉnh chi tiết máy đó. Anthropic cho biết không có mô hình nào khác giải được tác vụ này sau năm lần thử.

Opus 5 cũng đã xử lý một lỗi thực tế trong một trình quản lý gói mã nguồn mở phổ biến. Theo Anthropic, nó đã tìm ra nguyên nhân gốc rễ và sửa một trường hợp đặc biệt (edge case) mà bản vá của cộng đồng đã bỏ sót. Một mô hình đối thủ chỉ sửa được triệu chứng bề mặt trước khi báo cáo lỗi đã được giải quyết.

Một kỹ sư tại một công ty giao dịch được cho là đã sử dụng Opus 5 để xây dựng nguồn cấp dữ liệu thị trường cho một sàn giao dịch mới chỉ trong một phiên làm việc. Các mô hình trước đó không thể hoàn thành tác vụ này, ngay cả khi đã có kế hoạch chi tiết.

Các bộ lọc an ninh mạng của Opus 5 kích hoạt ít thường xuyên hơn so với Fable 5

Theo Anthropic, thiết lập an toàn của Opus 5 cho phép nghiên cứu lỗ hổng mã nguồn nhưng chặn quét lỗ hổng dựa trên tệp nhị phân, kiểm thử xâm nhập và tạo mã khai thác. Các bộ phân loại an ninh mạng kích hoạt ít hơn khoảng 85% so với trên Fable 5. Sự can thiệp thường xuyên của Fable 5 đã vấp phải nhiều chỉ trích. Các yêu cầu bị chặn trong Claude.ai, Claude Code và Claude Cowork sẽ mặc định chuyển sang Opus 4.8 như một phương án dự phòng, cách tiếp cận tương tự như với Fable 5.

Anthropic gọi Opus 5 là mô hình mạnh mẽ nhất hiện có cho nghiên cứu khoa học. Nó cho thấy sự tiến bộ so với Opus 4.8 trên tất cả các đánh giá về khoa học sự sống, với những cải tiến vượt trội trong hóa hữu cơ (tăng 10,2 điểm phần trăm trong việc suy luận cấu trúc phân tử từ dữ liệu quang phổ) và các tác vụ liên quan đến protein (tăng 7,7 điểm phần trăm).

Cùng với Opus 5, Anthropic đang phát hành hai tính năng beta. Mid-Conversation Tool Changes trên nền tảng Claude cho phép các nhà phát triển thay đổi các công cụ khả dụng trong khi đang hội thoại mà không làm mất hiệu lực bộ nhớ đệm prompt (prompt cache). Automatic Fallbacks trên API sẽ tự động chuyển hướng các yêu cầu bị chặn sang một mô hình khác.

Tin tức AI không thổi phồng – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về công nghệ tiên phong sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

AnthropicClaude Opus 5LLMAICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.