Mô hình
Anthropic ra mắt Claude Opus 5.5: Hiệu năng ngang ngửa Fable 5.1, chi phí vận hành giảm 40%
(giờ Việt Nam)
Tóm tắt AI
Anthropic vừa trình làng Claude Opus 5.5 với hiệu suất tương đương Fable 5.1, đồng thời tối ưu hóa chi phí vận hành thấp hơn 40% và tăng tốc độ phản hồi lên hơn 30%.
Bản dịch AI

Anthropic vừa ra mắt Claude Opus 5.5, mô hình đầu tiên trong dòng Claude 5.5 mới. Đội ngũ phát triển cho biết mô hình này đạt hiệu suất ngang bằng với Claude Fable 5.1 trong hầu hết các tác vụ. Ngoài ra, chi phí vận hành của nó cũng thấp hơn 40% so với Opus 5 đối với các khối lượng công việc thông thường ở cài đặt mặc định. Theo các bài kiểm tra đánh giá (benchmark) của chính Anthropic, mô hình này dẫn đầu về khả năng lập trình tác tử (agentic coding), sử dụng máy tính và công việc tri thức.
Liệu mô hình này có thể triển khai được không? Có, dưới dạng mô hình API được quản lý. Anthropic chưa phát hành trọng số (weights), vì vậy việc tự lưu trữ (self-hosting) không phải là một lựa chọn. Các nhà phát triển có thể gọi claude-opus-5-5 trên Claude Platform, Amazon Web Services, Google Cloud và Microsoft Azure. Tính năng không lưu trữ dữ liệu (zero data retention) vẫn được áp dụng như các phiên bản Opus trước đây.
Kết quả Benchmark: Dẫn đầu mạnh mẽ, nhưng không áp đảo hoàn toàn
Điểm số của Opus 5.5 sử dụng tư duy thích ứng (adaptive thinking) ở mức nỗ lực tối đa, với các biện pháp bảo vệ sản xuất được kích hoạt.
Terminal-Bench 4.0 được báo cáo ở mức nỗ lực xhigh cho Opus 5.5. GPT-6 Astra vẫn dẫn đầu trên Terminal-Bench-Science và AutomationBench. Zapier đã chạy AutomationBench mà không sử dụng các mô hình dự phòng, vì vậy các can thiệp bảo vệ được tính là thất bại. Anthropic cũng cảnh báo rằng biên độ của các bài kiểm tra đánh giá đang trở thành thước đo ít tin cậy hơn. Trong quá trình sử dụng thực tế, khoảng cách với Fable 5.1 hẹp hơn so với những gì điểm số thể hiện.
Các kết quả đã điều chỉnh theo chi phí cho thấy nhiều điều hơn. Ở mức nỗ lực mặc định (trung bình), Opus 5.5 đạt 54,6% trên FrontierCode. Con số này vượt qua điểm số cao nhất của GPT-6 Astra là 53,3% với chi phí chỉ bằng khoảng 1/5 cho mỗi tác vụ. Trên CursorBench, mức nỗ lực trung bình đạt 52,5%. Điều này cao hơn 11 điểm so với kết quả tốt nhất của GPT-5.6 Sol, với chi phí chỉ bằng khoảng 1/3.
Giá cả và Tốc độ
Opus 5.5 cần ít tài nguyên tính toán hơn để vận hành so với Opus 5, và giá cả phản ánh điều đó.
Việc đọc bộ nhớ đệm (cache reads) chiếm phần lớn chi phí cho các tác vụ tác tử và lập trình, và chi phí này đã giảm 60%. Opus 5.5 cũng sử dụng ít token hơn cho mỗi tác vụ. Tổng hợp lại, điều này dẫn đến mức giảm chi phí 40%. Tốc độ tạo đầu ra nhanh hơn hơn 30% so với Opus 5. Chế độ Fast trong Claude Code và Claude Platform cung cấp tốc độ nhanh gấp 2,5 lần với mức giá 8 USD cho đầu vào và 40 USD cho đầu ra trên mỗi triệu token.
Anthropic cũng đang tăng giới hạn sử dụng năm giờ cho các gói Pro, Max, Team và các gói Enterprise dựa trên số lượng người dùng. Người đăng ký nhận được tính năng đặt lại giới hạn tốc độ (rate limit reset) mà họ có thể lưu lại và sử dụng sau.
Những gì người thử nghiệm sớm báo cáo
Phong cách viết cũng đã thay đổi. Opus 5.5 đưa thông tin quan trọng lên trước, sử dụng ít thuật ngữ chuyên môn hơn và tuân thủ các quy tắc viết mà bạn cung cấp.
An toàn, Biện pháp bảo vệ và Thay đổi API
Opus 5.5 là bản phát hành đầu tiên của Anthropic kể từ khi CEO Dario Amodei kêu gọi kiểm soát tốc độ phát triển các mô hình tiên phong. Các đơn vị đánh giá độc lập bao gồm METR và Frontier Design đã kiểm thử mô hình này trước khi ra mắt. Nó đạt điểm số tốt nhất từ trước đến nay trong cuộc kiểm toán hành vi tự động của Anthropic, bao gồm gần 2.000 kịch bản. Trong một bài kiểm tra ngăn chặn mới, mô hình này đã cố gắng vượt qua các ranh giới ít hơn khoảng 85% so với Opus 5. Anthropic cũng lưu ý rằng mô hình thường xuyên nghi ngờ rằng nó đang bị đánh giá.
Khả năng về sinh học và an ninh mạng của nó tương đương với Claude Mythos 5.1. Vì vậy, Opus 5.5 được trang bị các biện pháp bảo vệ tương tự như Fable 5.1:
Hai thay đổi khác ảnh hưởng đến các tích hợp. Tính năng "Thinking" không còn có thể bị vô hiệu hóa. Các đầu ra cũng mang dấu chìm (watermarking) để tuân thủ Đạo luật AI của EU. Thông tin chi tiết đầy đủ có trong Opus 5.5 System Card.
Công cụ giải thích tương tác
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây. Mọi tín dụng thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost AI Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.