MarkTechPost
Điểm AI 80/100

Mô hình

Anthropic ra mắt Claude Sonnet 5.5: Đạt 70.6% trên Terminal-Bench 4.0, giữ nguyên giá $2/$10

(giờ Việt Nam)

Tóm tắt AI

Anthropic vừa trình làng Claude Sonnet 5.5, phiên bản tối ưu hóa tốc độ và chi phí trong dòng Claude 5.5, hiện đã có mặt trên các nền tảng Claude Platform, AWS, Google Cloud và Azure.

Chính văn · Bản dịch AI

Anthropic Releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 at the Same $2/$10 Price

Anthropic vừa phát hành Claude Sonnet 5.5. Đây là mô hình thứ hai trong dòng Claude 5.5, tiếp nối Claude Opus 5.5. Anthropic định vị nó như một phiên bản bổ sung nhanh hơn, chi phí thấp hơn cho Opus 5.5. Mô hình này nhắm đến các tác vụ hàng ngày có phạm vi rõ ràng, sửa lỗi, cũng như hoàn thiện tài liệu, bản trình bày và bảng tính.

Có thể triển khai được không? Có, nó đã có mặt trên Claude Platform với tên gọi claude-sonnet-5-5, cùng với AWS, Google Cloud và Microsoft Azure. Đây là mô hình đóng (closed-weights), vì vậy không thể tự lưu trữ (self-hosting).

Những thay đổi so với Sonnet 5

Anthropic báo cáo 4 nâng cấp chính so với Sonnet 5:

  • Tốc độ: tạo đầu ra nhanh hơn 30%+, biến nó thành phiên bản Sonnet nhanh nhất từ trước đến nay.
  • Chi phí mỗi tác vụ: thấp hơn tới 30%, do cần ít token và ít lệnh gọi công cụ hơn.
  • Viết lách: văn phong rõ ràng hơn, những người thử nghiệm sớm đánh giá đây là đối tác cộng tác tốt hơn.
  • Thị giác và công việc dài hạn: đây là phiên bản Sonnet đầu tiên vượt qua Pokémon Red chỉ bằng cách sử dụng ảnh chụp màn hình.

Thông số kỹ thuật từ tổng quan mô hình: ngữ cảnh 1 triệu token, đầu ra tối đa 128K và thời điểm cắt kiến thức đáng tin cậy là tháng 6 năm 2026. Adaptive thinking (tư duy thích ứng) được bật theo mặc định. Effort (nỗ lực) chạy qua 5 cấp độ: thấp, trung bình, cao, rất cao và tối đa.

Điểm chuẩn (Benchmarks)

Tất cả các điểm số dưới đây đều do nhà cung cấp báo cáo trong bài đăng ra mắt. Phương pháp luận nằm trong Thẻ hệ thống Sonnet 5.5.

  • Terminal-Bench 4.0: 70,6%, so với 10,3% của Sonnet 5 và 66,4% của Opus 5.5 ở mức Xhigh.
  • CursorBench 4.0: 55,5%, thấp hơn khoảng 2 điểm so với Opus 5.5 (57,8%).
  • FrontierCode 1.1: 52,1% ở mức Xhigh và 46,2% ở mức Max. GPT-6 Sol đạt 49,3%.
  • GDPval-AA v2.1: 1844, so với 1846 của Opus 5.5 và 1449 của Sonnet 5.
  • OSWorld 2.1: 80,1% về khả năng sử dụng máy tính, gần bằng Opus 5.5 (81,8%).
  • Humanity’s Last Exam: 64,5% khi sử dụng công cụ, tăng từ 54,9%.

Kết quả Max thấp hơn Xhigh là có lý do. Ở mức Max, mô hình thường xuyên thực hiện đánh giá mã đa tác nhân hơn. Điều đó đôi khi gây ra tình trạng quá thời gian hoặc các chỉnh sửa nằm ngoài phạm vi, vốn bị FrontierCode trừ điểm. Anthropic cũng tuyên bố rằng Opus 5.5 vẫn mạnh hơn rõ rệt trong các công việc phức tạp, mở.

Giá cả và Hiệu suất

Giá niêm yết không thay đổi so với Sonnet 5: 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra. Đọc bộ nhớ đệm tốn 0,20 USD và ghi bộ nhớ đệm tốn 2,50 USD mỗi triệu token. Con số này bằng một nửa so với Opus 5.5 (4 USD/20 USD). Tiết kiệm đến từ hiệu quả sử dụng token, không phải từ việc giảm giá.

Dữ liệu khách hàng hỗ trợ điều này. Balyasny Asset Management đo lường khoảng 121K token mỗi câu trả lời so với 497K trên Sonnet 5. Base44 báo cáo 3,6 lần lặp cho mỗi bản dựng ứng dụng, trong khi Opus 5 cần 7,7 lần. Zendesk xử lý các phiếu hỗ trợ nhanh hơn 20%.

Mặc định Effort khác nhau tùy theo giao diện. Claude Code và các ứng dụng Claude mặc định ở mức Trung bình. Claude Platform mặc định ở mức Cao.

So sánh

Tính năngClaude Sonnet 5.5GPT-6 SolGemini 3.1 Pro PreviewClaude Opus 5.5
Nhà phát triểnAnthropicOpenAIGoogleAnthropic
Giá mỗi 1 triệu token (đầu vào/đầu ra)$2 / $102 USD / 10 USD (prompt lên tới 272K)2 USD / 12 USD (prompt lên tới 200K)$4 / $20
Cửa sổ ngữ cảnh1 triệu token1.050.000 token1.048.576 token1 triệu token
Đầu ra tối đa128K token128K token65.536 token128K token
Thời điểm cắt kiến thứcTháng 6 năm 202620 tháng 4 năm 2026Không liệt kêTháng 6 năm 2026
Kiểm soát suy luậnAdaptive thinking, 5 cấp độ nỗ lực6 cấp độ nỗ lực (không đến tối đa)Hỗ trợ tư duyAdaptive thinking (luôn bật)
Đầu vàoVăn bản, hình ảnhVăn bản, hình ảnhVăn bản, hình ảnh, video, âm thanh, PDFVăn bản, hình ảnh
FrontierCode 1.152,1% (Xhigh)49.3%Không báo cáo54.4%
GDPval-AA v2.118441487Không báo cáo1846
Chartography (không công cụ)61.6%53.6%Không báo cáo64.4%
Giai đoạn phát hànhPhát hành rộng rãiPhát hành rộng rãiBản xem trước (Preview)Phát hành rộng rãi
Trọng số mở (Open weights)KhôngKhôngKhôngKhông

Điểm chuẩn do Anthropic báo cáo; GDPval-AA được thực hiện bởi Artificial Analysis. Giá là mức niêm yết API tiêu chuẩn, được xác minh vào ngày 28 tháng 9 năm 2026.

Công cụ giải thích tương tác

Nhấn để xem các điểm chuẩn, mức độ nỗ lực, chi phí tác vụ và trình kiểm tra di chuyển API.

Chọn mức độ nỗ lực. Sonnet 5.5 cung cấp 5 mức.

Độ sâu suy luận

Tốc độ và tiết kiệm token

Các thước đo mang tính minh họa cho hướng đi mà Anthropic mô tả (nỗ lực cao hơn giúp suy luận lâu hơn và kiểm tra công việc kỹ hơn). Các khuyến nghị đến từ hướng dẫn di chuyển Sonnet 5.5.

Ước tính minh họa theo giá niêm yết (2 USD đầu vào, 10 USD đầu ra trên mỗi 1 triệu token, giống hệt nhau cho Sonnet 5 và 5.5).

Token đầu vào mỗi tác vụ: Token đầu ra mỗi tác vụ trên Sonnet 5: Giảm token trên Sonnet 5.5: % (Anthropic: chi phí mỗi tác vụ thấp hơn tới 30%)

Sonnet 5, mỗi tác vụ

Sonnet 5.5, mỗi tác vụ

Với 10.000 tác vụ mỗi tháng, bạn tiết kiệm được

Tiết kiệm đến từ việc giảm số lượng token và lệnh gọi công cụ, không phải từ việc giảm giá niêm yết. Tỷ lệ thực tế phụ thuộc vào khối lượng công việc của bạn.

Chọn một cài đặt từ mã nguồn thời Sonnet 5 của bạn để xem Sonnet 5.5 trả về kết quả gì.

Nguồn: Bài đăng ra mắt của Anthropic và tài liệu nền tảng Claude, ngày 28 tháng 9 năm 2026 © Marktechpost

Điểm chính

  • Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0, tăng từ 10,3%.
  • Giá vẫn giữ nguyên 2 USD/10 USD, nhưng chi phí mỗi tác vụ giảm tới 30%.
  • Đạt kết quả trong phạm vi 2 điểm so với Opus 5.5 trên GDPval-AA.
  • Sonnet đầu tiên có các biện pháp bảo vệ an ninh mạng và bộ phân loại trích xuất suy luận.
  • Có thể triển khai ngay qua API, AWS, Google Cloud và Azure.

Xem thông báo chính thức, hướng dẫn di chuyển và thẻ hệ thống. Mọi tín dụng thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML và đăng ký bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Kết nối với chúng tôi

Michal Sutter

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động.

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Anthropic ra mắt Claude Sonnet 5.5, chỉ số thông minh AA vươn lên vị trí thứ 2
Anthropic ra mắt Claude Sonnet 5.5: Đạt 70.6% trên Terminal-Bench 4.0, giữ nguyên giá $2/$10 | AIHOT.vn