Mô hình
Claude Opus 5 soán ngôi vương bảng xếp hạng trí tuệ nhân tạo, dẫn đầu nhiều chỉ số quan trọng
(giờ Việt Nam)
Tóm tắt AI
Claude Opus 5 (phiên bản max và xhigh) vừa chiếm lĩnh vị trí dẫn đầu trên bảng xếp hạng Artificial Analysis v4.1, vượt qua hàng loạt đối thủ nhờ điểm số ấn tượng trong các bài kiểm tra năng lực tư duy phức tạp.
Bản dịch AI

Trí tuệ
Chỉ số Trí tuệ Artificial Analysis
Chỉ số Trí tuệ Artificial Analysis v4.1 kết hợp 9 đánh giá: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
Chỉ số Trí tuệ Artificial Analysis v4.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Chỉ số Trí tuệ để biết thêm chi tiết, bao gồm phân tích từng đánh giá và cách chúng tôi thực hiện chúng.
Chỉ số Trí tuệ Artificial Analysis theo Trọng số mở / Độc quyền
Chỉ số Trí tuệ Artificial Analysis v4.1 kết hợp 9 đánh giá: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
Chỉ số Trí tuệ Artificial Analysis v4.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Chỉ số Trí tuệ để biết thêm chi tiết, bao gồm phân tích từng đánh giá và cách chúng tôi thực hiện chúng.
Cho biết liệu trọng số của mô hình có sẵn hay không. Các mô hình được dán nhãn 'Commercial Use Restricted' (Hạn chế sử dụng thương mại) nếu trọng số có sẵn nhưng việc sử dụng thương mại bị hạn chế (thường yêu cầu phải có giấy phép trả phí).
Các đánh giá về Trí tuệ
Các đánh giá về trí tuệ được đo lường độc lập bởi Artificial Analysis · Chỉ số càng cao càng tốt
Hoạt động kinh doanh đại lý (Agentic)
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
Mặc dù trí tuệ của mô hình thường được áp dụng trên nhiều trường hợp sử dụng, nhưng các đánh giá cụ thể có thể phù hợp hơn với một số trường hợp nhất định.
Chỉ số Trí tuệ Artificial Analysis v4.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Chỉ số Trí tuệ để biết thêm chi tiết, bao gồm phân tích từng đánh giá và cách chúng tôi thực hiện chúng.
AA-Briefcase
AA-Briefcase Elo
AA-Briefcase là một tiêu chuẩn đánh giá công việc tri thức theo hướng đại lý (agentic) do Artificial Analysis phát triển. AA-Briefcase Elo là một chỉ số tổng hợp bao gồm tỷ lệ đạt tiêu chuẩn, Elo chất lượng phân tích và Elo trình bày · Chỉ số càng cao càng tốt
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
AA-Briefcase Elo là một chỉ số tổng hợp bao gồm Elo chất lượng phân tích, Elo trình bày và tỷ lệ đạt tiêu chuẩn, với hiệu suất tiêu chuẩn được chuyển đổi thành Elo thông qua các trận đấu đối kháng tổng hợp. Elo và khoảng tin cậy 95% được giới hạn ở mức 0.
AA-Omniscience
Chỉ số AA-Omniscience
Chỉ số AA-Omniscience (càng cao càng tốt) đo lường độ tin cậy của kiến thức và hiện tượng ảo giác (hallucination). Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt khi mô hình từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn số câu trả lời đúng.
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
Chỉ số AA-Omniscience (càng cao càng tốt) đo lường độ tin cậy của kiến thức và hiện tượng ảo giác. Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt khi mô hình từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn số câu trả lời đúng.
Độ mở (Openness)
Chỉ số Độ mở Artificial Analysis: Điểm số
Chỉ số Độ mở đánh giá mức độ mở của mô hình trên thang đo chuẩn hóa từ 0 đến 100 (càng cao càng mở)
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
So sánh Chỉ số Trí tuệ
Chỉ số Trí tuệ so với Chi phí cho mỗi tác vụ Chỉ số Trí tuệ
Chỉ số Trí tuệ Artificial Analysis · Chi phí trung bình có trọng số (USD) cho mỗi tác vụ Chỉ số Trí tuệ Artificial Analysis
Góc phần tư hấp dẫn nhất
Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn
Chi phí trung bình có trọng số cho mỗi tác vụ Chỉ số Trí tuệ. Chi phí của mỗi đánh giá được tính từ giá của token đầu vào, bộ nhớ đệm (cache hit/write), suy luận và câu trả lời, chia cho số lượng tác vụ và được tính trọng số theo trọng số của Chỉ số Trí tuệ đó.
Chỉ số Trí tuệ Artificial Analysis v4.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Chỉ số Trí tuệ để biết thêm chi tiết, bao gồm phân tích từng đánh giá và cách chúng tôi thực hiện chúng.
Sử dụng Token
Token đầu ra cho mỗi tác vụ Chỉ số Trí tuệ
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.