Mô hình
Anthropic ra mắt Claude Opus 5.5: Hiệu năng vượt trội với chi phí giảm 40%
(giờ Việt Nam)
Tóm tắt AI
Anthropic giới thiệu Claude Opus 5.5, mẫu đầu tiên trong dòng 5.5 với hiệu suất ngang ngửa Fable 5.1, tốc độ xử lý nhanh hơn 30% và chi phí vận hành thấp hơn 40% so với thế hệ trước.
Bản dịch AI

Chúng tôi xin giới thiệu Claude Opus 5.5, mô hình đầu tiên trong dòng sản phẩm Claude 5.5 mới. Mô hình này đạt hiệu suất tương đương Claude Fable 5.1 trong hầu hết các tác vụ công việc và có chi phí vận hành thấp hơn 40% so với Opus 5.
Claude Opus 5.5 là bản phát hành đầu tiên của chúng tôi kể từ khi chúng tôi kêu gọi sự thận trọng trong việc phát triển các mô hình tiên phong. Trước khi ra mắt, mô hình đã được kiểm định bởi các đơn vị đánh giá độc lập, bao gồm Frontier Design và METR. Trong bài kiểm tra đánh giá hành vi tự động – bài kiểm tra căn chỉnh toàn diện nhất mà chúng tôi thực hiện – Opus 5.5 là mô hình có hiệu suất mạnh mẽ nhất mà chúng tôi từng thử nghiệm cho đến nay. Nó cũng được trang bị các biện pháp bảo vệ mà chúng tôi đã phát triển cho các mô hình có năng lực cao nhất của mình.
Dưới đây là một số cải tiến mà bạn có thể mong đợi từ Opus 5.5:
Hiệu suất. Opus 5.5 là một bước tiến lớn so với Opus 5. Đây là mô hình dẫn đầu mới, và những người thử nghiệm sớm đã ghi nhận sự nhảy vọt về hiệu suất trong các công việc phức tạp nhất của họ. Một người thử nghiệm đã hoàn thành việc chuyển đổi 680.000 dòng mã nguồn trong chưa đầy một ngày—công việc vốn sẽ mất hàng tuần đối với một đội ngũ kỹ sư. Mô hình này rất giỏi trong việc tìm kiếm và khắc phục các điểm kém hiệu quả trong phần mềm: khi chúng tôi yêu cầu nó cắt giảm thời gian tải trên mọi trang của một ứng dụng web, Opus 5.5 đã thành công 39 trên 40 lần, trong khi Opus 5 chỉ thực hiện được những cải tiến nhỏ hơn và còn làm thay đổi hành vi của ứng dụng. Một người thử nghiệm khác đã yêu cầu các mô hình Claude xây dựng một trò chơi từ một câu lệnh duy nhất; Opus 5.5 đạt điểm cao hơn bất kỳ mô hình nào khác nhờ chất lượng đồ họa và độ hoàn thiện.
An toàn. Opus 5.5 đạt điểm số tốt nhất so với bất kỳ mô hình nào cho đến nay trong bài kiểm tra đánh giá hành vi tự động – bộ công cụ căn chỉnh của chúng tôi nhằm kiểm tra Claude qua hàng nghìn kịch bản mô phỏng. Nó ít có khả năng thực hiện các hành động khó đảo ngược hoặc hành động nằm ngoài phạm vi cho phép hơn so với các mô hình gần đây, đồng thời có khả năng chống lại các cuộc tấn công chèn câu lệnh (prompt injection) tốt hơn Opus 5. Chúng tôi cũng đã mở rộng phạm vi kiểm tra căn chỉnh để bao gồm các tác vụ dài hơn, các tác vụ bất khả thi và các kịch bản dựa trên sự cố thực tế, mặc dù nó vẫn có những giới hạn nhất định. Thông tin chi tiết về quá trình đánh giá có trong Thẻ hệ thống (System Card) của Opus 5.5.
Vì Opus 5.5 có năng lực tương đương Claude Mythos 5.1 trong lĩnh vực sinh học và an ninh mạng, chúng tôi triển khai nó với các biện pháp bảo vệ tương tự như trên Claude Fable 5.1. Các tổ chức đã qua kiểm duyệt có thể đăng ký tham gia Chương trình Xác minh Khoa học Sự sống (Life Sciences Verification Program) ngay hôm nay để sử dụng Opus 5.5 cho nghiên cứu sinh học. Trong những tuần tới, chúng tôi cũng sẽ mở rộng quyền truy cập vào Chương trình Xác minh An ninh mạng (Cyber Verification Program), và các chuyên gia an ninh mạng đã được xác minh sẽ có thể sử dụng Opus 5.5 cho công việc của họ.
Chi phí và tốc độ. Opus 5.5 yêu cầu ít tài nguyên tính toán hơn để vận hành so với Opus 5, và mức giá của nó phản ánh điều đó. Các thử nghiệm của chúng tôi cho thấy ở cài đặt mặc định, chi phí sẽ thấp hơn 40% so với Opus 5 đối với các khối lượng công việc thông thường. Token đầu vào và đầu ra có giá lần lượt là 4 USD và 20 USD cho mỗi triệu token, thấp hơn 20% so với Opus 5. Chi phí đọc bộ nhớ đệm (chiếm phần lớn chi phí cho các tác vụ đại lý và lập trình) là 0,20 USD cho mỗi triệu token, thấp hơn 60% so với Opus 5. Opus 5.5 cũng tạo đầu ra nhanh hơn hơn 30% so với Opus 5.
Ngoài việc giảm giá, chúng tôi còn tăng giới hạn sử dụng trong năm giờ cho các gói Pro, Max và Team. Chúng tôi cũng cung cấp cho người dùng đăng ký tính năng đặt lại giới hạn tốc độ, cho phép bạn lưu lại và sử dụng bất cứ khi nào bạn muốn.
Giao tiếp. Opus 5.5 giao tiếp tự nhiên hơn các mô hình trước đó. Những người thử nghiệm sớm nhận thấy văn phong của nó rõ ràng và dễ theo dõi hơn, điều này giải quyết một số phản hồi phổ biến mà chúng tôi nhận được về Opus 5. Nó đưa thông tin quan trọng nhất lên đầu, và phong cách của nó khiến nó trở thành một đối tác làm việc tốt hơn trong các phiên làm việc dài. Như một người thử nghiệm sớm đã nói: "nó viết giống cách tôi viết". Trong quá trình sử dụng của chính chúng tôi, điều này giúp công việc của Opus 5.5 dễ theo dõi và kiểm tra hơn—đây là một lợi ích về mặt an toàn cũng như tính thực tiễn.
Claude Sonnet 5.5 và Claude Haiku 5.5 sẽ ra mắt trong những tuần tới, với nhiều cải tiến tương tự về hiệu suất, hiệu quả và an toàn.
Hiệu suất và hiệu quả chi phí
Trên các bảng xếp hạng của chúng tôi, Claude Opus 5.5 dẫn đầu về lập trình đại lý (agentic coding), sử dụng máy tính và công việc tri thức. Tuy nhiên, ở các mức năng lực này, chúng tôi nhận thấy khoảng cách trên các bảng xếp hạng đã trở thành thước đo ít tin cậy hơn cho sự khác biệt trong thực tế. Trong quá trình sử dụng của chúng tôi, khoảng cách giữa Opus 5.5 và Claude Fable 5.1 hẹp hơn so với những gì các điểm số này thể hiện.
Trừ khi có ghi chú khác, tất cả kết quả của Claude Opus 5.5 đều sử dụng tư duy thích ứng (adaptive thinking) ở mức nỗ lực tối đa. Kết quả Terminal-Bench 4.0 được báo cáo cho Claude Opus 5.5 ở mức nỗ lực xhigh và GPT-6 Astra ở mức nỗ lực high, theo báo cáo của OpenAI; đây là điểm số cao nhất của mỗi mô hình. Claude Opus 5.5 được đánh giá với các biện pháp bảo vệ sản xuất được bật. Khi các biện pháp này can thiệp, các tác vụ an ninh mạng được hoàn thành bởi Claude Opus 4.8, và các tác vụ phát triển LLM tiên phong được hoàn thành bởi Claude Opus 5. Điều này có khả năng làm giảm hiệu suất của Claude Opus 5.5 trên các bảng xếp hạng này.
1Terminal-Bench 4.0: Sai số chuẩn là ±2,6 điểm đối với Claude Opus 5.5 và ±1,6–2 điểm đối với các mô hình Claude khác. Bảng xếp hạng công khai (5 lần thử/tác vụ, sử dụng Claude Code harness) báo cáo Claude Opus 5 đạt 51,8%; thiết lập của chúng tôi tái tạo kết quả ở mức 52,3%, nằm trong phạm vi sai số. Các số liệu của GPT-6 Astra và GPT-5.6 Sol là theo báo cáo của OpenAI.
2AutomationBench: Kết quả AutomationBench được chạy và báo cáo bởi Zapier. Các lần chạy này được thực hiện mà không có mô hình dự phòng, vì vậy các can thiệp của biện pháp bảo vệ được coi là thất bại—điều này dẫn đến điểm số thấp hơn so với những gì Claude Opus 5.5 đạt được trong thực tế. Kết quả của Claude Opus 5.5 đến từ quá trình đánh giá của chính Zapier trong giai đoạn truy cập sớm. Kết quả cho Opus 5, GPT-5.6 Sol và GPT-6 Astra đến từ bảng xếp hạng công khai của Zapier.
3Terminal-Bench-Science 0.1: Sai số chuẩn là ±3,5–5 điểm mỗi mô hình. Bảng xếp hạng công khai (3 lần thử/tác vụ, sử dụng Claude Code harness) báo cáo Claude Opus 5 đạt 30,0%; thiết lập của chúng tôi tái tạo kết quả ở mức 29,0%, nằm trong phạm vi sai số. Số liệu của GPT-6 Astra là theo báo cáo của OpenAI.
Lợi thế rất rõ ràng của Opus 5.5 là hiệu quả. Nó có chi phí mỗi token thấp hơn Opus 5 và sử dụng ít token hơn cho mỗi tác vụ, giúp giảm 40% chi phí tổng thể.
Định giá
Chế độ nhanh (Fast mode) cho Opus 5.5 cũng có sẵn trong Claude Code và Nền tảng Claude với tốc độ nhanh hơn tới 2,5 lần. Chi phí là 8 USD cho mỗi triệu token đầu vào và 40 USD cho mỗi triệu token đầu ra.
Lập trình
Opus 5.5 đặc biệt giỏi trong các công việc dài và phức tạp như chuyển đổi toàn bộ cơ sở mã (codebase) và kiểm định. Một người thử nghiệm sớm đã sử dụng nó để kiểm định và sửa lỗi một cơ sở mã 200.000 dòng trong chưa đầy ba giờ, trong khi Opus 5 mất hơn 20 giờ và sử dụng lượng token gấp 2,5 lần. Trong một thử nghiệm nội bộ, chúng tôi yêu cầu Opus 5.5 và Fable 5.1 dịch HAProxy, một phần mềm phổ biến dùng để cân bằng tải lưu lượng web giữa các máy chủ, từ C sang Rust. Cả hai bản viết lại đều vượt qua gần như tất cả các bài kiểm tra hồi quy của chính HAProxy, nhưng Opus 5.5 hoàn thành trong 9,5 giờ so với 12 giờ của Fable 5.1, và chi phí thấp hơn 51%.
Opus 5.5 mang lại kết quả tiên phong trong lập trình đại lý với chi phí chỉ bằng một phần nhỏ. Ở mức nỗ lực mặc định trên FrontierCode, nó đánh bại GPT-6 Astra với chi phí chỉ bằng khoảng 20% mỗi tác vụ. Trên Terminal Bench 4.0, nó ngang bằng với Astra với khoảng 40% chi phí, trong khi trên CursorBench, nó đánh bại GPT-5.6 Sol tới 11 điểm với chi phí chỉ bằng khoảng một phần ba.
[Biểu đồ: 0 10 20 30 40 50 60 70 Điểm (%) | 2 5 10 20 Chi phí mỗi lần thử (USD, thang log) | low med high xhigh max]
Terminal-Bench 4.0 đo lường khả năng hoàn thành các tác vụ chuyên môn phức tạp, đa bước trong giao diện dòng lệnh của mô hình. Opus 5.5 ở mức nỗ lực mặc định đánh bại Opus 5 ở mức nỗ lực tối đa với chi phí chỉ bằng khoảng một phần năm. Nó ngang bằng với GPT-6 Astra với khoảng 40% chi phí.
Những người thử nghiệm sớm của chúng tôi đã báo cáo những cải thiện tương tự về hiệu quả và trí thông minh:
Trích dẫn
“Các nhà phát triển muốn những đại lý có thể đảm nhận công việc phần mềm thực tế và hoàn thành chúng. Trong quá trình thử nghiệm của chúng tôi trên GitHub Copilot CLI và VS Code, Claude Opus 5.5 sử dụng số lượng token và bước ít nhất trong số các mô hình chúng tôi đo lường. Trong VS Code, nó giải quyết được nhiều tác vụ dòng lệnh hơn Opus 5 với số bước chưa bằng một nửa. Hơn cả việc làm cho các tác vụ riêng lẻ hiệu quả hơn, nó đang giúp các dự án lớn hơn của các nhà phát triển trở nên khả thi hơn.”
Công ty: GitHub
Tác giả: Mario Rodriguez, Giám đốc Sản phẩm
Đại lý lập trình an toàn nhất
Các doanh nghiệp sử dụng đại lý trong hệ thống của họ cần biết rằng các đại lý đó đang hoạt động đúng mục đích, đặc biệt là khi chúng chạy tự động trong nhiều giờ. Opus 5.5 có một bộ phân loại sàng lọc mọi hành động trước khi thực thi, một môi trường sandbox mã nguồn mở mà các đội ngũ bảo mật có thể kiểm định, và tính năng đánh giá mã nguồn giúp phát hiện các lỗ hổng trước khi hợp nhất.
Bản thân mô hình cũng có khả năng phòng thủ mạnh mẽ hơn. Đối với các cuộc tấn công chèn câu lệnh, nó ngang bằng hoặc đánh bại Opus 5 trong mọi cài đặt mà chúng tôi đã thử nghiệm, bao gồm lập trình, sử dụng công cụ, sử dụng máy tính và duyệt web. Trên một bảng xếp hạng do công ty bảo mật AI Gray Swan thực hiện, Opus 5.5 đồng hạng với Fable 5.1 về tỷ lệ thành công thấp nhất của các cuộc tấn công chèn câu lệnh trong số tất cả các mô hình được thử nghiệm.
Công việc tri thức
Opus 5.5 là một nhà nghiên cứu đáng tin cậy và thành thạo. Trong một thử nghiệm nội bộ, chúng tôi yêu cầu Opus 5.5, Fable 5.1 và Opus 5 viết một báo cáo về hiệu quả hoạt động hàng quý của một công ty chỉ sử dụng thông tin tìm thấy trên một bản sao web nơi thông cáo thu nhập rất khó tìm. Một trình chấm điểm tự động đã kiểm tra mọi số liệu và trích dẫn so với các nguồn. Qua các cài đặt nỗ lực khác nhau, 16 trên 18 báo cáo của Opus 5.5 đã vượt qua ngưỡng chất lượng của chúng tôi, nơi bất kỳ số liệu hoặc trích dẫn bịa đặt nào cũng sẽ bị coi là thất bại. Cả Fable 5.1 và Opus 5 đều không vượt qua được ngưỡng đó trong bất kỳ lần thử nào.
Nó cũng rất mạnh trong phân tích tài chính và công việc kinh doanh. Walleye Capital, một công ty đầu tư và là người thử nghiệm sớm, báo cáo rằng Opus 5.5 đã giải quyết phần lớn bộ đánh giá của họ ở mức cài đặt thấp nhất; ở các mức cài đặt cao hơn, nó còn thực hiện tốt hơn, nhận ra một lỗi trong hướng dẫn đánh giá của họ và tự sửa lỗi đó. Không có mô hình nào khác phát hiện ra lỗi này trước đó.
Trong một thử nghiệm khác, chúng tôi giao cho cả Opus 5.5 và Opus 5 phân tích một vụ sáp nhập đề xuất giữa hai công ty phần mềm nhân sự hư cấu. Mỗi mô hình xây dựng một mô hình tài chính trong Excel, sau đó chuyển nó thành một bài thuyết trình điều hành về việc liệu thương vụ có hợp lý ở mức giá đó hay không. Cả hai mô hình đều đưa ra kết luận giống nhau về thương vụ, nhưng mô hình của Opus 5.5 kỹ lưỡng hơn và bài thuyết trình dễ đọc hơn, trong khi của Opus 5 có một vài lỗi nhỏ. Opus 5.5 hoàn thành trong 63 phút so với 93 phút của Opus 5, và chi phí sản xuất thấp hơn 50%.
Trên các đánh giá về công việc tri thức, Opus 5.5 vượt trội hơn các mô hình khác trong khi sử dụng ít token hơn. Trên GDPval-AA v2.1, một bài kiểm tra công việc thực tế qua 44 ngành nghề, Opus 5.5 đạt 1846 Elo, vượt trên Fable 5.1 và Opus 5. Ở mức nỗ lực mặc định (trung bình), Opus 5.5 đánh bại GPT-6 Astra ở mức nỗ lực tối đa với chi phí chỉ bằng khoảng một phần năm mỗi tác vụ. Nó cũng vượt trội hơn các mô hình khác trên các bảng xếp hạng đo lường quy trình làm việc kinh doanh và thu thập dữ liệu quy mô lớn.
[Biểu đồ: 1200 1300 1400 1500 1600 1700 1800 Elo | 0.20 0.50 1 2 5 10 Chi phí ước tính mỗi tác vụ (USD, thang log) | low med high xhigh max]
GDPval-AA v2.1 của Artificial Analysis đánh giá các đại lý dựa trên công việc chuyên môn thực tế qua 44 ngành nghề. Ở mức nỗ lực tối đa, Opus 5.5 đạt 1846 Elo, trong khi Fable 5.1 đạt 1735 và Opus 5 đạt 1708. Ở mức nỗ lực mặc định (trung bình), Opus 5.5 đánh bại GPT-6 Astra ở mức nỗ lực tối đa với chi phí chỉ bằng khoảng một phần năm mỗi tác vụ.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.