# Anthropic ra mắt Claude Sonnet 5.5: Hiệu năng tiệm cận Opus 5.5 với chi phí giảm tới 30%

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-29 01:02 (giờ Việt Nam)
- Điểm AI: 81/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/5f46e3a18049e3aa
- Nguồn dữ liệu AI HOT: https://aihot.news/items/ag0ivtvpyt00uwr2o0o5vjur7
- Link gốc: https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task

## Lý do tinh chọn

Bài viết tổng hợp chi tiết kết quả benchmark, thay đổi về chi phí, các biện pháp an toàn mới và so sánh giá trực tiếp với các model đối thủ từ OpenAI.

## Tóm tắt AI

Anthropic vừa giới thiệu Claude Sonnet 5.5, phiên bản thứ hai trong dòng Claude 5.5. Model này cải thiện tốc độ phản hồi hơn 30% và tối ưu hóa chi phí nhờ khả năng tiêu thụ token hiệu quả hơn.

## Thân bài

![Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task](https://the-decoder.com/wp-content/uploads/2026/09/claude_55.png)

Anthropic vừa ra mắt Claude Sonnet 5.5, mô hình thứ hai trong dòng sản phẩm Claude 5.5. Nó tạo ra kết quả nhanh hơn hơn 30 phần trăm, chi phí mỗi tác vụ thấp hơn tới 30 phần trăm và gần như ngang bằng với Opus 5.5 trên một số bài kiểm tra đánh giá (benchmark).

Opus 5.5 được xây dựng cho các tác vụ phức tạp đòi hỏi sự đánh giá cẩn trọng. Sonnet 5.5 nhắm đến các công việc hàng ngày được xác định rõ ràng như sửa lỗi, viết tài liệu, xây dựng bài thuyết trình và tạo bảng tính. Anthropic cũng thông báo về Claude Haiku 5.5 sẽ ra mắt trong vài tuần tới. Mô hình đó sẽ tập trung vào các trường hợp sử dụng có lưu lượng cao và chi phí thấp.

Với Fable, Opus và Sonnet, Anthropic đã có các đối trọng với GPT-6 Astra, [Sol và Luna của OpenAI](https://the-decoder.com/openais-gpt-6-sol-and-luna-cut-prices-in-half-but-barely-move-the-needle-on-performance/), những sản phẩm đã khởi đầu cuộc chiến về giá gần đây. Nói một cách đại khái, Opus nằm cao hơn Sol một chút, Sonnet cao hơn Luna và Fable cao hơn Astra, mặc dù Anthropic tính phí cao hơn trên diện rộng. Sự khác biệt về hiệu suất giữa các cấp độ tương đương nhỏ đến mức chi phí có thể trở thành yếu tố quyết định. Haiku có thể giúp Anthropic thu hẹp khoảng cách đó.

### Hiệu suất lập trình tăng vọt

Theo Anthropic, khoảng cách hiệu suất giữa Sonnet 5.5 và phiên bản tiền nhiệm là đáng kể nhất trong lĩnh vực lập trình. Trên Terminal-Bench 4.0, một bài kiểm tra dành cho lập trình tác nhân (agentic coding), Sonnet 5.5 đạt 70,6 phần trăm so với 10,3 phần trăm của Sonnet 5. Trên CursorBench 4.0, bài kiểm tra tái tạo các phiên lập trình thực tế từ trình soạn thảo Cursor, Sonnet 5.5 đạt 55,5 phần trăm so với 34,1 phần trăm, chỉ thấp hơn Opus 5.5 (57,8 phần trăm) hai điểm.

Anthropic cho biết, trên FrontierCode 1.1 ở thiết lập "High", Sonnet 5.5 đạt điểm cao hơn mười điểm so với Sonnet 5 với chi phí mỗi tác vụ chỉ bằng khoảng một phần mười lăm. Những người thử nghiệm sớm đã ca ngợi khả năng nắm bắt cơ sở mã (codebase) nhanh chóng của mô hình này. Sonnet 5.5 cũng thực hiện các lệnh gọi công cụ (tool calls) theo lô thường xuyên hơn so với phiên bản tiền nhiệm, giúp giảm số lượng các bước cần thiết.

Cường độ suy luận có một điểm kỳ lạ. Ở mức nỗ lực cao nhất là "Max", Sonnet 5.5 thực tế lại đạt điểm thấp hơn trên FrontierCode so với mức "Xhigh". Anthropic cho biết ở mức nỗ lực tối đa, mô hình thường xuyên kích hoạt chức năng đánh giá mã chia nhỏ công việc cho nhiều tác nhân phụ. Trong một số trường hợp, điều này dẫn đến quá thời gian chờ hoặc các thay đổi nằm ngoài phạm vi tác vụ, cả hai đều bị FrontierCode trừ điểm.

### Công việc tri thức gần như ngang bằng với Opus 5.5

Trên GDPval-AA, một bài kiểm tra công việc tri thức do OpenAI phát triển bao gồm các tác vụ từ 44 ngành nghề và chín lĩnh vực, Sonnet 5.5 đạt 1.844 điểm. Con số này gần như ngang bằng với Opus 5.5 (1.846) và cao hơn khoảng 400 điểm so với Sonnet 5 (1.449). GPT-6 Sol của OpenAI đạt 1.487 điểm theo số liệu của Anthropic. Trên Chartography, một bài kiểm tra nhận dạng biểu đồ trực quan, Sonnet 5.5 tăng từ 15,6 lên 61,6 phần trăm.

| Danh mục | Bài kiểm tra (Benchmark) | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
| --- | --- | --- | --- | --- | --- |
| Lập trình dựa trên tác nhân | Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| Lập trình dựa trên tác nhân | FrontierCode 1.1 (Chính) | 46,2% (Max); 52,1% (Xhigh)² | 42.4% | 54.4% | 49.3% |
| Lập trình dựa trên tác nhân | CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| Công việc tri thức | GDPval-AA v2.1³ | 1,844 | 1,449 | 1,846 | 1,487 |
| Công việc tri thức | AA Briefcase v1.1³ | 1,811 | 1,359 | 1,822 | 1,483 |
| Tư duy liên ngành | Humanity's Last Exam (có công cụ) | 64.5% | 54.9% | 67.7% | — |
| Kỹ năng máy tính | OSWorld 2.1 (đánh giá một phần) | 80.1% | 57.0% | 81.8% | — |
| Nhận dạng sơ đồ trực quan | Chartography (không công cụ) | 61.6% | 15.6% | 64.4% | 53.6% |

¹ Đối với Opus 5.5, Terminal-Bench 4.0 cho thấy điểm số cao nhất ở thiết lập "Xhigh". ² Sonnet 5.5 đạt điểm thấp hơn trên FrontierCode ở mức "Max" so với "Xhigh". ³ Các giá trị của Sonnet 5.5 đến từ phiên bản tiền phát hành, nơi một lỗi đã được sửa có thể đã ảnh hưởng đến các đầu ra có cấu trúc.

Những người thử nghiệm sớm mô tả Sonnet 5.5 là một đối tác trò chuyện tự nhiên hơn với cảm quan tốt về thiết kế. Anthropic tuyên bố mô hình này có thể làm lại giao diện người dùng và thực thi các mẫu slide tốt đến mức kết quả hầu như không cần chỉnh sửa thêm.

Anthropic cũng cho biết Sonnet 5.5 là mô hình Sonnet đầu tiên có thể chơi hết trò chơi Pokémon Red chỉ bằng cách sử dụng ảnh chụp màn hình. [Astra của OpenAI gần đây cũng cho thấy sự tiến bộ tương tự trên các bài kiểm tra đánh giá trò chơi.](https://the-decoder.com/gpt-6-astra-pokemon-champion-in-18-hours-potato-farmer-after-one-creeper-mishap/) Những tác vụ như thế này từng được coi là khó chỉ vài năm trước và thường đòi hỏi các thuật toán tùy chỉnh. Giờ đây, ngay cả các mô hình tầm trung trong một dòng sản phẩm cũng có thể xử lý chúng.

### Cùng mức giá token, ít token hơn cho mỗi tác vụ

Sonnet 5.5 có giá mỗi triệu token tương đương với Sonnet 5: 2 USD cho token đầu vào, 10 USD cho token đầu ra và 0,20 USD cho lượt đọc bộ nhớ đệm (cache). Anthropic cho biết vì mô hình sử dụng ít token hơn cho mỗi tác vụ, chi phí thực tế giảm tới 30 phần trăm. Tốc độ tạo đầu ra cũng nhanh hơn hơn 30 phần trăm. Các thử nghiệm độc lập vẫn cần xác nhận những tuyên bố này.

| Giá mỗi triệu token | Claude Opus 5.5 | GPT-6 Sol | Claude Sonnet 5.5 | GPT-6 Luna |
| --- | --- | --- | --- | --- |
| Token đầu vào | 4 $ | 2 $ | $2 | $0.10 |
| Token đầu ra | $20 | $10 | $10 | $0.50 |
| Lượt truy cập đọc bộ nhớ đệm | $0.20 | $0.20 | $0.20 | $0.01 |
| Lượt truy cập ghi bộ nhớ đệm | $5 | $2.50 | $2.50 | $0.125 |

Giống như các mô hình khác của Anthropic và các đối trọng của OpenAI, Sonnet 5.5 cung cấp thiết lập nỗ lực có thể điều chỉnh, cho phép người dùng đánh đổi giữa chi phí, tốc độ và chất lượng đầu ra. Anthropic cho biết ở các thiết lập thấp hoặc trung bình, Sonnet 5.5 đã vượt qua điểm số tốt nhất của Sonnet 5 trên một số bài kiểm tra với chi phí mỗi tác vụ chỉ bằng khoảng một phần mười. Tuy nhiên, việc tìm ra mức nỗ lực phù hợp cho từng tác vụ vẫn mang tính nghệ thuật nhiều hơn là khoa học.

### Các biện pháp bảo vệ an ninh mạng mới cho một mô hình mạnh mẽ hơn

Claude Sonnet 5.5 hiện đã có sẵn trên tất cả các nền tảng đám mây lớn, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure. Giống như Opus 5.5 và Sonnet 5, Anthropic cung cấp mô hình này với chính sách không lưu trữ dữ liệu. Các nhà phát triển có thể truy cập thông qua Claude Platform bằng ID mô hình "claude-sonnet-5-5".

Vì Sonnet 5.5 có khả năng an ninh mạng vượt trội hơn nhiều so với phiên bản tiền nhiệm, Anthropic lần đầu tiên bổ sung các biện pháp bảo vệ cho một mô hình Sonnet. Các yêu cầu liên quan đến tác vụ an ninh mạng rủi ro cao sẽ được chuyển hướng một cách rõ ràng sang Sonnet 5. Thông qua [Chương trình Xác minh An ninh mạng](https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet) mở rộng, các chuyên gia đủ điều kiện có thể đăng ký quyền truy cập theo cấp độ.

Anthropic cũng đã thêm các bộ phân loại an toàn chống lại các cuộc tấn công chưng cất (distillation attacks), loại hình tương tự được sử dụng trong các mô hình mạnh mẽ nhất của họ. Liệu các biện pháp này có thực sự hiệu quả hay không sẽ trở nên rõ ràng trong những tháng tới. Nếu [các phòng thí nghiệm Trung Quốc đã và đang hưởng lợi từ những cuộc tấn công như vậy](https://the-decoder.com/just-like-deepseek-chinas-kimi-k3-is-forcing-western-ai-labs-to-question-their-compute-advantage/), việc đóng lại vectơ đó có thể nới rộng khoảng cách với các phòng thí nghiệm phương Tây một lần nữa.

### Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

[Đăng ký ngay](https://the-decoder.com/subscription/)
