‹ Quay lạiTinh chọnĐiểm AI 86/100
Hacker News: AI bài nổi bật
Tinh chọnĐiểm AI 86/100

Mô hình

Anthropic ra mắt Claude Sonnet 5.5: Tốc độ tăng 30%, chi phí giảm tới 30%

(giờ Việt Nam)

Tóm tắt AI

Anthropic vừa giới thiệu Claude Sonnet 5.5, thành viên thứ hai của dòng Claude 5.5, với tốc độ tạo văn bản nhanh hơn 30% và chi phí mỗi tác vụ giảm tới 30% so với bản tiền nhiệm, trong khi vẫn giữ nguyên mức giá cũ.

Chính văn · Bản dịch AI

Introducing Claude Sonnet 5.5

Giới thiệu Claude Sonnet 5.5, mô hình thứ hai trong dòng Claude 5.5. Đây là bản nâng cấp rõ rệt so với Claude Sonnet 5, chạy nhanh hơn 30%+ và tiết kiệm chi phí tới 30% cho hầu hết các tác vụ.

Sonnet 5.5 là phiên bản bổ sung nhanh hơn, chi phí thấp hơn cho Claude Opus 5.5. Trong khi Opus 5.5 được xây dựng cho các công việc phức tạp đòi hỏi sự đánh giá cẩn trọng, thì Sonnet 5.5 lại mạnh nhất ở các tác vụ hàng ngày có phạm vi rõ ràng, sửa lỗi, và tạo các tài liệu, slide, bảng tính chỉn chu. Nó cũng có khả năng thiết kế rất sắc bén. Claude Haiku 5.5, được xây dựng cho các ứng dụng có khối lượng công việc lớn và nhạy cảm về chi phí, sẽ gia nhập dòng Claude 5.5 trong những tuần tới.

Sonnet 5.5 cải thiện so với Sonnet 5 ở các điểm:

Hiệu suất. Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0, một bài kiểm tra lập trình tác tử (agentic coding), so với 10,3% của Sonnet 5. Nó chỉ kém Opus 5.5 hai điểm trên GDPval-AA, một bài kiểm tra công việc thực tế trong nhiều ngành nghề khác nhau. Nó cũng rất mạnh trong các công việc dài hạn và khả năng hiểu hình ảnh—đây là mô hình Sonnet đầu tiên đánh bại trò chơi Pokémon Red chỉ bằng cách làm việc từ ảnh chụp màn hình.

Cộng tác. Giống như Opus 5.5, Sonnet 5.5 viết rõ ràng hơn thế hệ mô hình trước của chúng tôi; những người thử nghiệm sớm mô tả nó là một đối tác cộng tác tốt hơn so với Sonnet 5. Tốc độ của nó cũng giúp nó rất phù hợp cho việc lặp lại nhanh các tác vụ ít phức tạp hơn.

Chi phí. Sonnet 5.5 có giá tương đương Sonnet 5 ở mức 2 USD cho mỗi triệu token đầu vào, 10 USD cho mỗi triệu token đầu ra, và 0,20 USD cho mỗi triệu token đọc từ bộ nhớ đệm (cache), nhưng nó thường cần ít token hơn nhiều để hoàn thành cùng một công việc. Trong thử nghiệm của chúng tôi, nó tiết kiệm tới 30% chi phí cho mỗi tác vụ so với phiên bản tiền nhiệm.

Tốc độ. Sonnet 5.5 tạo đầu ra nhanh hơn 30%+ so với Sonnet 5, trở thành mô hình Sonnet nhanh nhất của chúng tôi tính đến nay.

Căn chỉnh và an toàn. Trong quá trình kiểm định hành vi tự động, Sonnet 5.5 cải thiện hoặc ngang bằng với Sonnet 5 ở hầu hết các thước đo về căn chỉnh. Vì khả năng an ninh mạng của nó tương đương với Opus 5, đây là mô hình Sonnet đầu tiên ra mắt với các biện pháp bảo vệ và dự phòng an ninh mạng giống như những gì chúng tôi đã phát triển cho các mô hình mạnh nhất của mình. Các biện pháp bảo vệ sinh học của nó giống với Sonnet 5. Cả hai biện pháp bảo vệ đều nhắm vào một nhóm nhỏ các yêu cầu rủi ro cao; việc phát triển phần mềm thông thường và hầu hết các công việc khoa học sự sống đều không bị ảnh hưởng.

Hiệu suất

Sonnet 5.5 cải thiện so với Sonnet 5 trên nhiều lĩnh vực—trong một số trường hợp là rất đáng kể. Trên một số bài đánh giá, Sonnet 5.5 ở mức nỗ lực Tối đa (Max) thậm chí có hiệu suất tương đương Opus 5.5. Tuy nhiên, điểm số chuẩn chỉ nắm bắt được một khía cạnh trong khả năng của mô hình; trong thử nghiệm của chúng tôi và của các bên thử nghiệm độc lập, Opus 5.5 vẫn rõ ràng mạnh hơn ở các công việc phức tạp, mở, đòi hỏi sự đánh giá liên tục.

Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Lập trình tác tử Terminal-Bench 4.070.6%10.3%66.4%¹—
Lập trình tác tử FrontierCode 1.1 (Chính)46,2% Tối đa²42.4%54.4%49.3%
52,1% Xcao
Lập trình tác tử CursorBench 4.055.5%34.1%57.8%—
Công việc tri thức GDPval-AA v2.1³1844144918461487⁴
Công việc tri thức AA-Briefcase v1.1³1811135918221483⁴
Suy luận đa ngành Humanity’s Last Exam64,5% với công cụ54,9% với công cụ67,7% với công cụ—
Sử dụng máy tính OSWorld 2.180,1% một phần57,0% một phần81,8% một phần—
Nhận diện biểu đồ trực quan Chartography61,6% không công cụ15,6% không công cụ64,4% không công cụ53,6%⁴ không công cụ

Để biết chi tiết về cách chúng tôi thực hiện các bài đánh giá, hãy xem Thẻ hệ thống Sonnet 5.5.

Các biểu đồ dưới đây vẽ điểm số của từng mô hình so với chi phí cho mỗi tác vụ ở mọi mức độ nỗ lực. Khi nỗ lực tăng lên, các mô hình thường làm việc lâu hơn, dẫn đến chi phí cho mỗi tác vụ cao hơn nhưng thường cũng đạt điểm số cao hơn. Điểm càng gần góc trên bên trái của biểu đồ, thì khả năng mang lại trên mỗi đô la càng cao.

Trên một số tiêu chuẩn, Sonnet 5.5 ở mức nỗ lực Thấp hoặc Trung bình đánh bại điểm số tốt nhất của Sonnet 5 với chi phí chỉ bằng khoảng một phần mười cho mỗi tác vụ. Nó bổ sung tốt nhất cho Opus 5.5 khi chạy ở các cài đặt nỗ lực thấp hơn, nơi nó tốn ít chi phí hơn cho mỗi tác vụ. Ở các cài đặt cao hơn, nó có thể thực hiện tương đương với chi phí tương tự.

Lập trình

Bước nhảy vọt về hiệu suất của Sonnet 5.5 đặc biệt đáng chú ý trong lập trình. Ở mức nỗ lực Cao trên FrontierCode, nó đạt điểm cao hơn 10 điểm so với Sonnet 5 ở cùng cài đặt, với chi phí chỉ bằng khoảng một phần mười lăm cho mỗi tác vụ. Trên CursorBench, bài kiểm tra các mô hình dựa trên các tác vụ từ các phiên lập trình Cursor thực tế, điểm số tốt nhất của nó chỉ kém Opus 5.5 khoảng hai điểm.

Những người thử nghiệm sớm đánh giá cao tốc độ Sonnet 5.5 hiểu một cơ sở mã (codebase). Họ cũng bị ấn tượng bởi hiệu quả của nó: trong các lần chạy đối đầu, nó gộp các lệnh gọi công cụ lại với nhau nhiều hơn so với Sonnet 5, dẫn đến ít bước hơn và chi phí thấp hơn.

Trích dẫn

“Trong thử nghiệm ban đầu của Epic, Claude Sonnet 5.5 đã vượt qua cùng một tiêu chuẩn chất lượng mà bạn mong đợi từ một mô hình cấp cao hơn, duy trì tốt trong quá trình kiểm định thiết kế hệ thống và đánh giá luồng dữ liệu. Mô hình mới đã quản lý hàng chục nghìn dòng mã cho kiến trúc hệ thống trò chơi, giữ cho phản hồi nhanh nhạy, xử lý các tác vụ kéo dài nhiều giờ và mang lại kết quả với ít lời nhắc mang tính chỉ dẫn hơn.”

Công ty Epic Games

Tác giả Daniel Vogel, Giám đốc vận hành

Công việc tri thức

Sonnet 5.5 cho thấy sự tiến bộ trong nhiều lĩnh vực công việc tri thức. Trên GDPval-AA, bài kiểm tra các mô hình dựa trên các tác vụ thực tế qua 44 ngành nghề và chín ngành công nghiệp lớn, Sonnet 5.5 đạt điểm gần bằng Opus 5.5 và cao hơn khoảng 400 điểm so với Sonnet 5. Nó gần với Opus 5.5 trong việc sử dụng máy tính và nhận diện biểu đồ, đồng thời vượt trội rõ rệt so với Sonnet 5 và GPT-6 Sol trong công việc tri thức dài hạn.

Những người thử nghiệm sớm nhấn mạnh các cải tiến khó định lượng hơn. Họ thấy nó là một đối tác trò chuyện tự nhiên hơn và nhận xét về khả năng thiết kế của nó, lưu ý rằng nó làm cho giao diện người dùng trở nên chỉn chu hơn và có thể tuân theo các mẫu slide để tạo ra các bộ trình bày cần rất ít chỉnh sửa. Trong một thử nghiệm nội bộ, chúng tôi đã cung cấp cho nó tài liệu thu nhập hàng quý và bản ghi cuộc gọi của một công ty đại chúng, cùng với một mẫu slide, và yêu cầu tạo một bài đánh giá hoạt động gồm 10 slide. Hai chuyên gia đã đánh giá bản nháp đầu tiên của nó là sẵn sàng để gửi đi ngay lập tức.

Trích dẫn

“Mà không cần thay đổi bất kỳ lời nhắc nào của chúng tôi, Claude Sonnet 5.5 đã làm tốt hơn Sonnet 5 trên hầu hết các đánh giá Slackbot ngoại tuyến của chúng tôi, với ít bước hơn và ít hơn khoảng 14% token đầu ra. Khi ai đó giao cho Slackbot một tác vụ, chất lượng và tốc độ là điều quan trọng nhất, và Sonnet 5.5 cho phép Slackbot mang lại kết quả tốt hơn cho người dùng, nhanh hơn.”

Công ty Slack

Tác giả Curtis Allen, Kỹ sư chính

Chi phí và tốc độ

Định giá

Giá mỗi 1 triệu tokenClaude Sonnet 5.5Claude Opus 5.5
Đọc từ bộ nhớ đệm (Cache)$0.20$0.20
Ghi vào bộ nhớ đệm (Cache)$2.50$5
Token đầu vào$2$4
Token đầu ra$10$20

Sonnet 5.5 yêu cầu ít token hơn cho mỗi tác vụ so với Sonnet 5, vì vậy chi phí vận hành thấp hơn. Nó cũng tạo ra kết quả nhanh hơn 30%+ và hiệu suất này có thể nhận thấy ngay lập tức:

Câu lệnh (Prompt):

Một đàn 400 con sáo đá trong một tệp HTML

Việc điều chỉnh mức độ nỗ lực cho phép bạn cân bằng giữa chi phí, tốc độ và chất lượng tổng thể. Trong Claude Code và các ứng dụng của chúng tôi, mức độ nỗ lực mặc định được đặt là Trung bình (Medium), trong khi Nền tảng Claude mặc định là Cao (High). Ở các cài đặt thấp hơn, Claude trả lời nhanh hơn và sử dụng ít token hơn, phù hợp với các công việc thường nhật. Ở các cài đặt cao hơn, Claude suy luận lâu hơn và kiểm tra công việc của mình kỹ lưỡng hơn.

An toàn

Căn chỉnh (Alignment)

Sonnet 5.5 không mở rộng giới hạn về khả năng của các mô hình của chúng tôi, vì vậy đánh giá căn chỉnh của chúng tôi tập trung vào một nhóm rủi ro mục tiêu áp dụng cho các mô hình ở mọi cấp độ khả năng, bao gồm việc hành động trái với lợi ích của người dùng, gây hiểu lầm cho người dùng và hợp tác với các hành vi lạm dụng nghiêm trọng.

Trong quá trình kiểm định hành vi tự động, vốn thử nghiệm Claude qua khoảng 1.850 kịch bản, Sonnet 5.5 cải thiện hoặc tương đương với Sonnet 5 ở hầu hết các thước đo về căn chỉnh, khả năng chống lạm dụng và tính trung thực. Trong các đánh giá về kiểm soát (containment) mới hơn của chúng tôi, Sonnet 5.5 đạt kết quả gần bằng Opus 5.5, mô hình tốt nhất mà chúng tôi đã thử nghiệm, về tần suất cố gắng thoát khỏi môi trường sandbox, và đây là mô hình ít có khả năng thăm dò giới hạn của các vùng chứa (containers) nhất trong số các mô hình của chúng tôi. Trên toàn bộ quá trình kiểm định, Opus 5.5 vẫn hoạt động tốt hơn một chút về tổng thể, nhưng chúng tôi không tìm thấy bằng chứng nào cho thấy Sonnet 5.5 theo đuổi các mục tiêu xung đột với ý định của người dùng.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Anthropic ra mắt Claude Sonnet 5.5
Anthropic ra mắt Claude Sonnet 5.5: Tốc độ tăng 30%, chi phí giảm tới 30% | AIHOT.vn