The Decoder: AI News
85

Tin ngành

Artificial Analysis cập nhật bảng xếp hạng AI v4.2 sau tranh cãi về điểm số GPT-6 Astra

(giờ Việt Nam)

Tóm tắt AI

Artificial Analysis vừa ra mắt Intelligence Index v4.2 nhằm điều chỉnh lại các tiêu chuẩn đánh giá, sau khi điểm số của GPT-6 Astra gây ra nhiều tranh cãi so với các kết quả từ Epoch AI và ARC-AGI-3.

Bản dịch AI

Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism

Artificial Analysis vừa phát hành phiên bản 4.2 của Intelligence Index, có khả năng là để phản hồi lại những chỉ trích cho rằng các tiêu chuẩn đánh giá (benchmark) của họ đã không phản ánh đúng sự tiến bộ thực tế của GPT-6 Astra.

Trước đó, một số đánh giá, bao gồm cả đánh giá của chính OpenAI, đã xếp Astra vượt xa các đối thủ khác. Epoch AI xếp mô hình này ở vị trí thứ nhất trong số 267 mô hình với 169 điểm trên hơn 50 tiêu chuẩn đánh giá, và ARC-AGI-3 cho thấy một bước nhảy vọt từ lớn đến rất lớn tùy thuộc vào bộ công cụ (harness) được sử dụng. Trong khi đó, Artificial Analysis chỉ đánh giá Astra ngang bằng với phiên bản tiền nhiệm của nó.

Với chỉ số được cập nhật, GPT-6 Astra hiện cho thấy mức tăng bốn điểm so với phiên bản tiền nhiệm. Claude Fable 5.1 của Anthropic vẫn dẫn đầu bảng xếp hạng, theo sau là Astra ở vị trí thứ hai và Meta ở vị trí thứ ba. Theo Artificial Analysis, Astra cũng sử dụng ít token cho mỗi tác vụ hơn bất kỳ mô hình tiên phong (frontier model) nào khác. Về tỷ lệ hiệu năng trên chi phí, Anthropic, OpenAI, Meta và Zhipu AI đều đang chia sẻ vị trí dẫn đầu.

Chỉ số này bổ sung hai tiêu chuẩn đánh giá mới: AA-Briefcase dành cho công việc tri thức thực tế và GDP.pdf từ Surge AI dành cho phân tích tài liệu PDF. GPQA-Diamond đã bị loại bỏ vì các mô hình đã giải quyết được nó. Dữ liệu kiểm thử riêng (private test data) hiện chiếm 40% trọng số để khiến việc "gian lận" (gaming) trở nên khó khăn hơn. Artificial Analysis cũng đã sửa các lỗi chấm điểm trên một số tiêu chuẩn đánh giá và tinh chỉnh hệ thống phân loại để có kết quả ổn định hơn.

Artificial Analysis cho biết họ đã trì hoãn các bản cập nhật để giữ cho điểm số ổn định trong các đợt ra mắt mô hình lớn, nhưng bảng xếp hạng thay đổi quá nhanh khiến việc cập nhật tạm thời là cần thiết. Họ cho biết phiên bản 5 đã được phát triển trong tám tháng và sẽ được triển khai theo từng giai đoạn.

Tin tức AI không thổi phồng – Được biên soạn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo tiên phong "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay

GPT-6Đánh giá AIBenchmarkArtificial AnalysisTin tức AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.