Latent Space
92

Mô hình

Claude Opus 3.5: Hiệu năng đỉnh cao với mức giá chỉ bằng một nửa

(giờ Việt Nam)

Tóm tắt AI

Anthropic tiếp tục khẳng định vị thế dẫn đầu khi ra mắt Claude Opus 3.5, mang đến sức mạnh xử lý vượt trội với chi phí tối ưu hơn bao giờ hết.

Bản dịch AI

[AINews] Claude Opus 5: Fable-level performance at Opus price (half Fable)

Trong một đợt ra mắt hiếm hoi vào thứ Sáu, Opus 5 đã chiếm sóng tiêu đề hôm nay. Mặc dù hầu hết các điểm chuẩn (benchmark) chính thức đều cho thấy nó vượt qua Fable về mặt kỹ thuật, thông điệp chính thức vẫn cho rằng nó “tiệm cận”. Điều này phần lớn phản ánh sự khó khăn của các Evals - nội dung chính trong bản tin AIE hôm nay - khi không phản ánh được “cảm giác về mô hình lớn” (big model smell) mà Anthropic rõ ràng biết là Fable vẫn giữ được nhưng lại không thể đo lường.

Rất may, các đánh giá độc lập về Opus đã xác nhận hiệu suất vượt trội này:

X avatar for @ArtificialAnlys

Artificial Analysis@ArtificialAnlys

Claude Opus 5 là người dẫn đầu mới trên tiêu chuẩn đánh giá công việc tri thức dựa trên tác nhân (agentic knowledge work benchmark) của chúng tôi, AA-Briefcase, vượt qua Claude Fable 5 gần 150 Elo trong khi giảm 20% Chi phí trên mỗi Tác vụ. @AnthropicAI đã phát hành Claude Opus 5, người dẫn đầu mới trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index), và

10:10 CH · 24 thg 7, 2026 · 34,5 N lượt xem

16 Trả lời · 45 Đăng lại · 451 Lượt thích

Và câu chuyện về hiệu quả được cải thiện, ngoài vấn đề giá cả, cũng rất quan trọng… mặc dù nó chỉ vừa mới ngang bằng với GPT 5.6 Sol:

Tin tức AI từ 23/7/2026 đến 24/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn tham gia/hủy đăng ký nhận email theo tần suất!

Tin nổi bật: Ra mắt mô hình Claude Opus 5

Việc ra mắt Claude Opus 5 của Anthropic đã tạo ra sự kết hợp giữa việc giám sát điểm chuẩn, những lời khen ngợi mạnh mẽ từ trải nghiệm thực tế về tác nhân lập trình (coding-agent) và cuộc tranh luận mới về việc đánh giá các mô hình tiên phong (frontier model).

Nhiều tweet thảo luận rõ ràng về Claude Opus 5 như một mô hình mới ra mắt và so sánh nó với các hệ thống tiên phong khác về các chỉ số lập trình và khả năng tổng quát, bao gồm đánh giá ECI của Epoch, thảo luận về sự bất thường của FrontierCode và phản ứng sớm của người dùng từ các quy trình sử dụng công cụ như tự động hóa trình duyệt @abacaj, @abacaj.

Epoch báo cáo rằng Claude Opus 5 đạt ECI là 159, “thấp hơn một chút so với giá trị 161 của Fable 5”, trong khi ngang bằng với Fable 5 về SWE-ECI ở mức 161 trên các tiêu chuẩn đánh giá kỹ thuật phần mềm @EpochAIResearch.

Kết quả ECI ngay lập tức vấp phải sự chỉ trích từ những người dùng cảm thấy điểm số này đã hạ thấp những cải tiến thực tế của Opus 5; một phản hồi gọi nó là “bị đánh giá thấp một cách khó tin”, lưu ý rằng nó chỉ có vẻ tốt hơn Opus 4.8 đúng 1 điểm mặc dù trên thực tế dường như “tốt hơn nhiều ở mọi thứ” @scaling01. Người dùng này cũng lập luận rằng cần có các tiêu chuẩn đánh giá công khai khó hơn @scaling01.

Một luồng thảo luận khác đã làm nổi bật một sự bất thường rõ ràng trong điểm chuẩn: Opus 5 đạt điểm tốt hơn trên FrontierCode ở mức nỗ lực trung bình so với mức nỗ lực cao hơn, mặc dù nỗ lực nhiều hơn thường cải thiện hiệu suất trên các bài đánh giá khác @jerhadf. Điều đó cho thấy sự đánh đổi giữa tìm kiếm/nỗ lực cụ thể theo tác vụ hoặc sự thiếu ổn định trong đánh giá thay vì sự tăng trưởng đơn điệu từ việc bổ sung tài nguyên tính toán trong thời gian suy luận (inference-time compute).

Một số người dùng am hiểu kỹ thuật đã ca ngợi hiệu suất lập trình của Opus 5. Mikhail Parakhin @MParakhin cho biết “Best-of-n là quy tắc vàng” và báo cáo một chiến thắng rõ ràng khi đối đầu trực tiếp với Fable “về toán học và thực sự là mọi thứ”, đồng thời ước rằng nó có sẵn trong Codex.

Arena đã quảng bá những ấn tượng đầu tiên về Opus 5 và cho biết điểm số bảng xếp hạng dựa trên việc sử dụng thực tế sẽ sớm ra mắt @arena, cho thấy các đánh giá từ cộng đồng vẫn đang được cập nhật tại thời điểm đăng bài.

Cổng thông tin của Nous Research đã thêm quyền truy cập vào mô hình này, với một tweet cho biết người dùng có thể trực tiếp sử dụng Opus 5 thông qua Nous Portal và giảm giá 20% cho tất cả các mô hình bao gồm cả Opus 5 @witcheer. Đây là thông tin về phân phối/khả dụng thay vì tuyên bố về năng lực.

Các trải nghiệm thực tế của người dùng nhấn mạnh vào việc điều khiển trình duyệt / sử dụng tác nhân công cụ. Một bài đăng cho biết Opus 5 đã mở trình duyệt và hủy đăng ký ChatGPT Pro @abacaj, theo sau là “Thứ này thực sự có thể điều khiển trình duyệt, thật kinh ngạc” @abacaj. Đây là những bản demo riêng lẻ, không phải đánh giá có hệ thống, nhưng chúng phù hợp với sự quan tâm rộng rãi của thị trường đối với các tác nhân sử dụng máy tính.

Những phản ứng sớm khác mang tính chất meme nhiều hơn là kỹ thuật, bao gồm “Kết quả FPS tàu điện ngầm của Opus 5” @bijanbowen, “Trên Claude đó người anh em” @andrew_n_carr, và “Họ đang khiếp sợ Anthropic” @teortaxesTex. Những điều này phản ánh tâm lý chứ không phải bằng chứng.

Chỉ số Năng lực Epoch (ECI):

ECI của Claude Opus 5 = 159

ECI của Fable 5 = 161

SWE-ECI của Claude Opus 5 = 161, ngang bằng với Fable 5 về kỹ thuật phần mềm @EpochAIResearch

Phản hồi từ cộng đồng lưu ý rằng mô hình này dường như chỉ cao hơn +1 điểm ECI so với Opus 4.8, điều mà một số độc giả cho là quá nhỏ so với những cải tiến về chất lượng @scaling01, @scaling01.

Hành vi của FrontierCode: một người đánh giá lưu ý rằng mức nỗ lực trung bình > mức nỗ lực cao trên FrontierCode đối với Opus 5 mặc dù mô hình cải thiện thông thường là nỗ lực nhiều hơn sẽ tốt hơn ở những nơi khác @jerhadf. Tweet không cung cấp các con số thô trong đoạn trích này, nhưng điểm kỹ thuật chính là việc tăng nỗ lực không mang lại lợi ích đồng nhất.

Các tuyên bố so sánh dựa trên trải nghiệm thực tế:

Một chiến thắng đối đầu rõ ràng so với Fable trong thử nghiệm của một người dùng, đặc biệt là với phương pháp lấy mẫu best-of-n @MParakhin

Ngang bằng với “huyền thoại” trong một bài tóm tắt hệ sinh thái, mặc dù không đính kèm số liệu @eliebakouch

Các tuyên bố mang tính thực tế / định hướng đo lường hơn

Tuyên bố điểm chuẩn của Epoch rằng Opus 5 đạt 159 ECI và 161 SWE-ECI là tuyên bố thực nghiệm rõ ràng nhất trong tập hợp @EpochAIResearch.

Tuyên bố của Arena rằng những ấn tượng đầu tiên đã có sẵn và điểm số bảng xếp hạng thực tế sắp ra mắt là thông tin thực tế nhưng chưa đầy đủ @arena.

Việc Nous Portal cung cấp quyền truy cập vào Opus 5 với mức giảm giá 20% là một thực tế về tính khả dụng của sản phẩm @witcheer.

Giải thích / ý kiến

“ECI bị đánh giá thấp” và “chúng ta cần các tiêu chuẩn đánh giá công khai khó hơn” là những ý kiến về tính hợp lệ và độ nhạy của điểm chuẩn @scaling01, @scaling01.

“Làm thế nào để làm lung lay niềm tin vào bất kỳ điểm chuẩn nào: hãy cho thấy Anthropic làm không tốt trên đó” là sự hoài nghi mang tính tu từ về diễn ngôn điểm chuẩn và định kiến cộng đồng @teortaxesTex.

“Best-of-n là quy tắc vàng” và việc Opus là “người chiến thắng rất rõ ràng” so với Fable là những đánh giá không chính thức từ người thực hành, hữu ích nhưng không được tiêu chuẩn hóa @MParakhin.

AnthropicClaudeAICông nghệMô hình ngôn ngữ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.