Sản phẩm
Artificial Analysis cập nhật Intelligence Index v4.2: Bổ sung bộ tiêu chuẩn đánh giá AI mới
(giờ Việt Nam)
Tóm tắt AI
Artificial Analysis ra mắt bản cập nhật v4.2, bổ sung AA-Briefcase cho tác vụ trí tuệ nhân tạo và GDP.pdf để kiểm tra khả năng suy luận trên tài liệu dài, đồng thời loại bỏ các bài kiểm tra đã bão hòa.
Bản dịch AI

Chúng tôi đang đẩy nhanh các yếu tố trong bản phát hành v5 sắp tới bằng các bản cập nhật tạm thời để bắt kịp tốc độ phát triển của công nghệ tiên phong. Index v4.2 có các tác vụ phức tạp và thực tế hơn, cùng nhiều bộ kiểm thử riêng tư hơn để ngăn chặn tình trạng gian lận kết quả.
Nhật ký thay đổi của Intelligence Index v4.2:
+ AA-Briefcase, đánh giá công việc tri thức mang tính tác nhân (agentic) của chúng tôi với một bộ kiểm thử riêng tư.
+ GDP.pdf của Surge, khả năng lập luận trên tài liệu ngữ cảnh dài với 4.592 trang PDF.
- GPQA Diamond, một bài đánh giá lập luận khoa học xuất sắc hiện đã đạt đến ngưỡng bão hòa.
… cộng với việc tăng trọng số cho các bộ kiểm thử độc lập (held-out test sets) để ngăn chặn gian lận, và nâng cấp cơ sở hạ tầng chấm điểm để tăng tính ổn định.
Bản cập nhật này đưa Index đến gần hơn với các trường hợp sử dụng thực tế bằng các tác vụ thách thức, phức tạp và thực tế hơn cùng các bộ kiểm thử riêng tư để ngăn chặn gian lận. Chúng tôi đã lên kế hoạch và xây dựng các yếu tố của Index v5 trong nhiều tháng - đã 8 tháng kể từ khi chúng tôi ra mắt Index v4 vào tháng 1.
Chúng tôi đã cố tình trì hoãn các bản cập nhật để giữ cho Index ổn định trong suốt các đợt ra mắt mô hình lớn gần đây. Tuy nhiên, với tốc độ phát triển nhanh chóng của công nghệ tiên phong trong những tuần qua, chúng tôi cảm thấy việc đưa ra một bản cập nhật tạm thời ngay lập tức là rất quan trọng để đảm bảo Index của chúng tôi vẫn luôn phù hợp và hữu ích cho người dùng.
Ngoài bản cập nhật tạm thời này, đội ngũ của chúng tôi đang nỗ lực làm việc cho phiên bản v5 của Index. Chúng tôi đang lên kế hoạch cho nhiều bản phát hành gia tăng hơn trong tương lai gần. Hãy cùng đón chờ!
Chi tiết các thay đổi trong Intelligence Index v4.2:
➤ Bổ sung AA-Briefcase: Bài đánh giá nội bộ của chúng tôi với bộ kiểm thử riêng tư độc lập, AA-Briefcase kiểm tra các mô hình dựa trên các tác vụ công việc tri thức mang tính tác nhân thực tế trong các dự án phức tạp do các chuyên gia trong ngành xây dựng. Các mô hình được đánh giá dựa trên các dự án công việc tri thức kéo dài nhiều tuần, mỗi dự án có nhiều tác vụ liên kết và hàng ngàn tệp nguồn đầu vào. AA-Briefcase kết hợp chấm điểm theo tiêu chí (rubric) và chấm điểm cặp (pairwise) để đánh giá sự thành công của tác vụ có thể kiểm chứng, chất lượng phân tích và chất lượng trình bày, mang lại cái nhìn toàn diện về năng lực tác nhân tổng thể trong công việc tri thức.
➤ Bổ sung GDP.pdf: Được tạo bởi Surge AI, GDP.pdf đánh giá khả năng lập luận tài liệu chuyên môn trong một lượt (single-turn) trên 100 tệp PDF và mười lĩnh vực. Các mô hình phải tổng hợp bằng chứng được phân bổ trên 4.592 trang, bao gồm văn bản, bảng biểu, biểu đồ, chú thích và các phần loại trừ. Các phản hồi được chấm điểm dựa trên 1.275 tiêu chí nguyên tử do chuyên gia soạn thảo; tỷ lệ "All-pass Rate" (tỷ lệ đạt tất cả) chỉ ghi nhận thành công cho một tác vụ khi mọi tiêu chí đều được đáp ứng.
➤ Trọng số để đo lường việc sử dụng thực tế và ngăn chặn gian lận: 40% trọng số Index của chúng tôi hiện là các bộ kiểm thử riêng tư, độc lập - gấp đôi con số từ v4.1. Dữ liệu độc lập bao gồm AA-Briefcase, AA-Omniscience và các giải pháp cho CritPt. Điều này làm giảm khả năng các phòng thí nghiệm gian lận trong các bài đánh giá. Tỷ lệ dữ liệu độc lập sẽ còn tăng thêm trong Index v5.
➤ Cải thiện cơ sở hạ tầng chấm điểm: Trong AA-LCR v1.1, chúng tôi đã thêm một hệ thống nhắc lệnh (system prompt) chấm điểm và sửa các lỗi cũng như sự mơ hồ trong đáp án, giúp cải thiện độ chính xác của điểm số. Đối với GDPval-AA v2 và AA-Briefcase, chúng tôi đã cải thiện việc lấy mẫu và tái thiết lập thang đo Elo, giúp xếp hạng ổn định hơn khi các mô hình mới được thêm vào. Đối với SciCode, chúng tôi đã cải thiện tính ổn định của các môi trường chấm điểm (sandboxes) để đảm bảo mã nguồn chạy chậm nhưng đúng không bị tính là thất bại.
Kết quả chính:
➤ Anthropic và OpenAI dẫn đầu Index: Claude Fable 5.1 của Anthropic dẫn đầu Index, theo sau là GPT-6 Astra của OpenAI, với mức tăng 4 điểm so với GPT-5.6 Sol. Meta là phòng thí nghiệm xếp thứ ba trên bảng xếp hạng, theo sau là SpaceXAI, Moonshot/Kimi, Z.AI và Google.
➤ Đường biên Pareto về chi phí trên mỗi tác vụ (Cost per Task) được chia sẻ bởi bốn phòng thí nghiệm: Anthropic, OpenAI, Meta và Z.AI chiếm lĩnh đường biên Cost per Task đã cập nhật.
➤ GPT-6 Astra thống trị đường biên hiệu suất token đầu ra: GPT-6 Astra sử dụng token hiệu quả hơn hầu hết các mô hình khác gần ngưỡng tiên phong, với Claude Fable 5.1, Grok 4.5 và Gemini 3.5 Flash-Lite ở hai đầu của đường cong (không bao gồm các mô hình dưới 25 điểm trên Index).

GPT-6 Astra sử dụng token hiệu quả hơn hầu hết các mô hình khác gần ngưỡng tiên phong, với Claude Fable 5.1, Grok 4.5 và Gemini 3.5 Flash-Lite ở hai đầu của đường cong (không bao gồm các mô hình dưới 25 điểm trên Index).

Claude Fable 5.1 và Opus 5 của Anthropic dẫn đầu AA-Briefcase, theo sau là GPT-6 Astra và Muse Spark 1.3. GPT-6 Astra cho thấy mức tăng đáng kể so với GPT-5.6 Sol khoảng 85 điểm Elo.
AA-Briefcase là bài đánh giá nội bộ tiên phong của chúng tôi với bộ kiểm thử riêng tư độc lập. Bài đánh giá kiểm tra các mô hình dựa trên các tác vụ công việc tri thức mang tính tác nhân thực tế trong các dự án phức tạp do các chuyên gia trong ngành xây dựng. Các mô hình được đánh giá dựa trên các dự án công việc tri thức kéo dài nhiều tuần, mỗi dự án có nhiều tác vụ liên kết và hàng ngàn tệp nguồn đầu vào. AA-Briefcase kết hợp chấm điểm theo tiêu chí và chấm điểm cặp để đánh giá sự thành công của tác vụ có thể kiểm chứng, chất lượng phân tích và chất lượng trình bày, mang lại cái nhìn toàn diện về năng lực tác nhân tổng thể trong công việc tri thức.

OpenAI dẫn đầu GDP.pdf với GPT-6 Astra đạt 33,2% và GPT-5.6 Sol đạt 28,2%, theo sau là Claude Fable 5.1 với 26,2%.
Được tạo bởi Surge AI, GDP.pdf đánh giá khả năng lập luận tài liệu chuyên môn trong một lượt trên 100 tệp PDF và mười lĩnh vực. Các mô hình phải tổng hợp bằng chứng được phân bổ trên 4.592 trang, bao gồm văn bản, bảng biểu, biểu đồ, chú thích và các phần loại trừ. Các phản hồi được chấm điểm dựa trên 1.275 tiêu chí nguyên tử do chuyên gia soạn thảo; tỷ lệ "All-pass Rate" chỉ ghi nhận thành công cho một tác vụ khi mọi tiêu chí đều được đáp ứng.

Phân tích chi tiết đầy đủ cho từng mô hình ở bên dưới:

Đọc thêm về Artificial Analysis Intelligence Index v4.2 tại https://artificialanalysis.ai/methodology/intelligence-benchmarking
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.