Hacker News: AI bài nổi bật
92

Thủ thuật

Artificial Analysis đánh giá Claude Opus 5.5: Hiệu năng vượt trội với chỉ số 58 điểm

(giờ Việt Nam)

Tóm tắt AI

Trang Artificial Analysis vừa công bố kết quả đánh giá Claude Opus 5.5, đạt 58 điểm trên bảng xếp hạng Intelligence Index, bỏ xa mức trung bình 25 điểm của các mô hình cùng phân khúc.

Bản dịch AI

Claude Opus 5.5 (max with fallback) - Intelligence, Performance & Price Analysis | Artificial Analysis

IntelligenceUpdated (Cập nhật Trí tuệ)

Chỉ số Trí tuệ Artificial Analysis

Artificial Analysis Intelligence Index v4.3.2 bao gồm 10 đánh giá: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1

Artificial Analysis Intelligence Index v4.3.2 bao gồm: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích từng bài đánh giá và cách chúng tôi thực hiện chúng.

Chỉ số Trí tuệ Artificial Analysis theo Trọng số Mở / Độc quyền

Artificial Analysis Intelligence Index v4.3.2 bao gồm 10 đánh giá: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1

Artificial Analysis Intelligence Index v4.3.2 bao gồm: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích từng bài đánh giá và cách chúng tôi thực hiện chúng.

Cho biết liệu trọng số của mô hình có sẵn hay không. Các mô hình được dán nhãn 'Commercial Use Restricted' (Hạn chế sử dụng thương mại) nếu việc sử dụng thương mại bị giới hạn bởi các điều kiện, và 'Non-commercial' (Phi thương mại) nếu giấy phép cấm sử dụng thương mại.

Các Chỉ số Năng lực

Đo lường hiệu suất của các mô hình trên các năng lực và ngành cụ thể

Các Đánh giá Trí tuệ

Các đánh giá trí tuệ được đo lường độc lập bởi Artificial Analysis · Điểm càng cao càng tốt

Công việc tri thức mang tính tác nhân (Agentic), (Elo-500)/2000

Các tác vụ công việc thực tế mang tính tác nhân, (Elo-500)/2000

Quy trình làm việc SaaS mang tính tác nhân

Lập trình & sử dụng terminal mang tính tác nhân

Suy luận tài liệu chuyên môn, All-pass (Đạt tất cả)

Suy luận ngữ cảnh dài trong y tế

Mặc dù trí tuệ của mô hình thường có thể áp dụng trên nhiều trường hợp sử dụng, các đánh giá cụ thể có thể phù hợp hơn với một số trường hợp nhất định.

Artificial Analysis Intelligence Index v4.3.2 bao gồm: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích từng bài đánh giá và cách chúng tôi thực hiện chúng.

AA-Briefcase v1.1Updated (Cập nhật)

AA-Briefcase Elo

AA-Briefcase v1.1 là một tiêu chuẩn đánh giá công việc tri thức mang tính tác nhân do Artificial Analysis phát triển. AA-Briefcase Elo là một chỉ số tổng hợp kết hợp tỷ lệ đạt rubric, Elo chất lượng phân tích và Elo trình bày · Điểm càng cao càng tốt

AA-Briefcase Elo là một chỉ số tổng hợp kết hợp Elo chất lượng phân tích, Elo trình bày và tỷ lệ đạt rubric, với hiệu suất rubric được chuyển đổi thành Elo thông qua các trận đấu đối kháng tổng hợp. Elo và khoảng tin cậy 95% được giới hạn ở mức 0.

AA-Omniscience

Chỉ số AA-Omniscience

Chỉ số AA-Omniscience (điểm càng cao càng tốt) đo lường độ tin cậy của kiến thức và hiện tượng ảo giác (hallucination). Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt việc từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn đúng.

Chỉ số AA-Omniscience (điểm càng cao càng tốt) đo lường độ tin cậy của kiến thức và hiện tượng ảo giác. Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt việc từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn đúng.

So sánh Chỉ số Trí tuệ

Chỉ số Trí tuệ so với Chi phí trên mỗi tác vụ Chỉ số Trí tuệ

Chỉ số Trí tuệ Artificial Analysis · Chi phí trung bình có trọng số (USD) trên mỗi tác vụ Chỉ số Trí tuệ Artificial Analysis

Góc phần tư hấp dẫn nhất

Đường Pareto

Chi phí trung bình có trọng số trên mỗi tác vụ Chỉ số Trí tuệ. Chi phí của mỗi đánh giá được tính từ giá của token đầu vào, cache hit, cache write, suy luận và câu trả lời, chia cho số lượng tác vụ và được tính trọng số theo trọng số của Chỉ số Trí tuệ.

Artificial Analysis Intelligence Index v4.3.2 bao gồm: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích từng bài đánh giá và cách chúng tôi thực hiện chúng.

Sử dụng Token

Token đầu ra trên mỗi tác vụ Chỉ số Trí tuệ

Số lượng token đầu ra trung bình có trọng số được sử dụng để thực hiện một tác vụ trong Chỉ số Trí tuệ Artificial Analysis

Số lượng token cần thiết cho mỗi tác vụ Chỉ số Trí tuệ. Con số này được tính bằng cách nhân số token đầu ra trên mỗi bài đánh giá với trọng số tương đối của từng tiêu chuẩn trong Chỉ số Trí tuệ, sau đó chia cho số lượng tác vụ (không bao gồm các lần lặp lại).

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.