Mô hình
Claude Opus 5 của Anthropic: Hiệu năng vượt trội Fable 5 với chi phí rẻ hơn đáng kể
(giờ Việt Nam)
Tóm tắt AI
Claude Opus 5 dẫn đầu bảng xếp hạng Artificial Analysis với điểm số 61, vượt qua Fable 5 và GPT-5.6 về khả năng lập trình và phân tích, đồng thời có mức giá cạnh tranh hơn nhiều.
Bản dịch AI

Theo nhiều tiêu chuẩn đánh giá, Claude Opus 5 của Anthropic hiện là mô hình AI mạnh mẽ nhất hiện nay, vượt qua Fable 5 trong khi có chi phí thấp hơn.
Opus 5 đạt 61 điểm trên Artificial Analysis Intelligence Index, chỉ số tổng hợp từ chín bài kiểm tra bao gồm công việc tri thức, lập trình, suy luận khoa học và độ chính xác thực tế. Kết quả này giúp nó vượt lên trên Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) và Claude Opus 4.8 (56). Artificial Analysis đã hợp tác với Anthropic để thử nghiệm mô hình này trước khi ra mắt công chúng.
Trong lĩnh vực lập trình, Claude Opus 5 ở mức "xhigh" kết hợp với Claude Code đã đồng hạng nhất trên Artificial Analysis Coding Index, chỉ số đo lường khả năng xử lý các tác vụ lập trình độc lập của AI, bao gồm cả việc tìm và sửa lỗi. Trên Terminal-Bench v2.1, bài kiểm tra các tác nhân AI như những kỹ sư tự hành trong môi trường terminal thực tế, Opus 5 đạt 89% ở mức "max", ngang bằng với người dẫn đầu trước đó là GPT-5.6 Sol.

Về suy luận khoa học, Opus 5 đạt 53% trong Humanity's Last Exam, một bài kiểm tra kiến thức rất khó bao phủ nhiều lĩnh vực học thuật. Kết quả này ngang bằng với Fable 5. Trên CritPt, một tiêu chuẩn đánh giá vật lý từ các nhà nghiên cứu tại Argonne National Laboratory và UIUC, nó một lần nữa cân bằng với Fable 5 nhưng vẫn xếp sau GPT-5.6 Sol, GPT-5.5 Pro và GPT-5.6 Terra.
Độ chính xác thực tế vẫn là một điểm yếu: Trên AA-Omniscience, bài kiểm tra độ chính xác của các tuyên bố kiến thức từ mô hình, Opus 5 đã cải thiện 7 điểm so với Opus 4.8 nhưng vẫn xếp sau Fable 5. Opus 5 cũng đưa ra câu trả lời thường xuyên hơn ngay cả khi không chắc chắn, đẩy tỷ lệ ảo tưởng (hallucination) tăng 14 điểm lên mức 50%.
Epoch AI xác nhận cuộc đua gay cấn giữa các mô hình tiên phong
Epoch AI cũng đã thử nghiệm Claude Opus 5. Viện nghiên cứu này chấm cho mô hình điểm Epoch Capability Index tổng thể là 159, thấp hơn một chút so với Fable 5 (161). Tuy nhiên, khi chỉ xét riêng các tiêu chuẩn kỹ thuật phần mềm (SWE-ECI), Opus 5 lại ngang bằng với Fable 5 ở mức 161, vượt qua GPT-5.6 Terra và Claude Opus 4.8. GPT-5.6 Sol hiện dẫn đầu ở cả hai hạng mục.

Nhìn chung, điều này xác nhận rằng cuộc đua giữa các mô hình tiên phong đang rất gay cấn. Không có mô hình đơn lẻ nào có thể bứt phá hoặc khẳng định ưu thế rõ rệt. Điều này củng cố lập luận rằng các mô hình AI cuối cùng sẽ trở thành hàng hóa phổ thông (commoditized).
Các cấp độ suy luận thấp hơn mang lại giá trị và kết quả lập trình tốt hơn
Chi phí trung bình cho mỗi tác vụ trên Intelligence Index là 2,03 USD với Opus 5, thấp hơn mức 2,75 USD của Claude Fable 5 khi có dự phòng. Mức này cao hơn Opus 4.8 (1,80 USD) và Sonnet 5 (1,53 USD). Tuy nhiên, ở các cấp độ "high" và "xhigh", Opus 5 đánh bại cả Opus 4.8 và Sonnet 5 trong khi có chi phí thấp hơn.
Vals.ai đã thử nghiệm Claude Opus 5 trên tất cả năm cấp độ suy luận bằng Vibe Code Bench, một tiêu chuẩn đánh giá cho các tác vụ lập trình. Điểm số tăng từ 76,7% ở mức "low" lên 82% ở mức "medium" và 89,8% ở mức "high". Hiệu suất giảm nhẹ ở hai cấp độ cao nhất, với "xhigh" đạt 88,3% và "max" đạt 88,4% mặc dù chi phí cao hơn nhiều.
Vals.ai nhận thấy rằng các cấp độ cao nhất có xu hướng tạo ra các giải pháp phức tạp hơn nhưng lại chứa lỗi thường xuyên hơn. Cấp độ "high" tạo ra các giải pháp đơn giản hơn nhưng đáp ứng yêu cầu một cách đáng tin cậy hơn.

Terminal-Bench 2.1 cho thấy mô hình tương tự. Cấp độ "high" vượt trội hơn "max" vì ở cấp độ cao nhất, mô hình dành nhiều thời gian hơn cho mỗi lần thử, dẫn đến ít lượt thử nghiệm hơn trong giới hạn thời gian. Điều này khớp với hướng dẫn của Anthropic, khi "high" được đặt làm cấp độ mặc định trong cả API và Claude Code.
Giá token vẫn giữ nguyên ở mức 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra. Chi phí ghi bộ nhớ đệm (cache writes) là 6,25 USD mỗi triệu token với thời gian tồn tại năm phút, trong khi lượt truy cập bộ nhớ đệm (cache hits) chỉ tốn 0,50 USD mỗi triệu token.
Opus 5 bứt phá trong công việc tri thức
Opus 5 thể hiện đặc biệt tốt trên tiêu chuẩn đánh giá AA-Briefcase, đo lường khả năng xử lý các tác vụ văn phòng điển hình của AI như viết báo cáo nghiên cứu, xây dựng bài thuyết trình và phân tích bảng tính dựa trên hàng nghìn tệp đầu vào. Hiệu suất được chấm điểm dựa trên độ chính xác, chất lượng phân tích và chất lượng trình bày, sau đó được quy đổi thành xếp hạng Elo tương tự như bảng xếp hạng cờ vua.
Ở mức suy luận tối đa (max), Opus 5 đạt Elo 1720, vượt xa 146 điểm so với Claude Fable 5 (1574). Ba cấp độ cao nhất của nó (max, xhigh, high) chiếm trọn ba vị trí dẫn đầu. Kết hợp với Fable 5, Sonnet 5 và Opus 4.8, Anthropic hiện nắm giữ phần lớn các vị trí trong top 10.

Chi phí cho mỗi tác vụ đã giảm 20% xuống còn 17,79 USD, thấp hơn mức 22,30 USD của Fable 5. Biến thể "xhigh" có giá 14,26 USD và "high" chỉ ở mức 10,41 USD, chưa bằng một nửa so với Fable 5. Cả hai đều vượt qua Fable 5 trong bảng xếp hạng Elo. Ở mức hiệu suất trung bình, Opus 5 đạt Elo 1470, chỉ đứng sau GPT-5.6 Sol (max, 1505). Ở mức hiệu suất thấp, nó đạt 1223 Elo, thấp hơn một chút so với GLM-5.2 (max, 1254).

Những cải tiến lớn nhất của Opus 5 thể hiện ở chất lượng phân tích. Ở mức "max", nó đạt Elo Chất lượng Phân tích là 2016, cao hơn gần 300 điểm so với Fable 5. Tỷ lệ vượt qua tiêu chuẩn (Rubric Pass Rate), theo dõi tần suất mô hình đáp ứng các tiêu chuẩn chất lượng định sẵn, đạt 58% ("max"), 57,2% ("xhigh") và 56% ("high"). Chất lượng trình bày lại là một câu chuyện khác. Opus 5 đạt Elo Trình bày là 1628, thấp hơn khoảng 40 điểm so với GPT-5.6 Sol ở mức "max" (1666).
Hiệu suất cao hơn đòi hỏi nhiều thời gian hơn: Ở mức "max", Opus 5 cần hơn 36 phút cho mỗi tác vụ và trung bình 103 lượt thực hiện, lâu hơn khoảng 50% so với Opus 4.8 (24 phút và 55 lượt thực hiện).
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các mô hình tiên phong sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.