HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 37/100

Nghiên cứu

WhatWorkedBench: Bộ tiêu chuẩn đánh giá khả năng thấu hiểu thực nghiệm của AI Agent

(giờ Việt Nam)

Tóm tắt AI

WhatWorkedBench là bộ benchmark mới giúp đo lường khả năng dự đoán hiệu quả các thay đổi thành phần trong điều kiện ngân sách hạn chế của AI Agent, thông qua phân tích 1.248 bản ghi cấu hình và 108 tập dữ liệu thực nghiệm.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các tác nhân nghiên cứu AI cần kiến thức đáng tin cậy về cách các thí nghiệm của chúng làm thay đổi kết quả. Chúng tôi giới thiệu WhatWorkedBench để đo lường khả năng hiểu biết thực nghiệm, độ chính xác của các dự đoán về thay đổi thành phần sau khi thử nghiệm có ngân sách. Các tác nhân kiểm tra mã nguồn, chọn các phép đo và gửi một bề mặt phản hồi (response surface), một bảng dự đoán điểm số cho mọi cấu hình cài đặt thành phần. Việc thực thi CPU toàn diện cung cấp các hiệu ứng tham chiếu cho việc thay đổi từng thành phần trong khi giữ nguyên các thành phần khác. Các hiệu ứng này nắm bắt các tổ hợp thay đổi trên 36 tác vụ từ 30 nguồn dữ liệu và 8 loại quy trình làm việc, với 1248 bản ghi cấu hình. Đánh giá cốt lõi kết hợp 4.206 bản ghi kiểm soát số trên tất cả tám nhóm và 108 tập tác nhân trên sáu nhóm gốc. Tại tám phép đo mới, phương pháp pair-effect ridge chọn ra giá trị tối ưu trên 15 trong số 22 nguồn và giới hạn mọi sai số hiệu ứng ở mức 10% phạm vi điểm số trên ba nguồn. Việc khớp một quy trình Gaussian (GP) với cùng các quan sát của tác nhân giúp nâng cao khả năng khôi phục hiệu ứng, độ chính xác tương đối so với cường độ hiệu ứng thực, từ 0,632 lên 0,698 trong nhóm Flash gốc và từ 0,621 lên 0,720 trong một nhóm bổ sung. Trên sáu bài nộp về phát hiện nhịp điệu và đồ thị đã hoàn thành, GP với cùng quan sát giúp nâng khả năng khôi phục family-macro từ 0,303 lên 0,455. Trên sáu quy trình làm việc với sáu tùy chọn nhị phân tại 20 phép đo mới, việc mã hóa các tương đương mã nguồn (các cấu hình có hành vi giống hệt nhau) giúp nâng khả năng khôi phục của GP từ 0,248 lên 0,462. WhatWorkedBench hỗ trợ nghiên cứu về các tác nhân thực nghiệm, thiết kế thực nghiệm thích ứng, suy luận số và việc sử dụng cấu trúc chương trình.

Chủ đề:Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG)
Trích dẫn là:arXiv:2609.27490 [cs.AI]
(hoặc arXiv:2609.27490v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.27490 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jingjie Ning [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 07:49:24 UTC (216 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

WhatWorkedBench: Bộ tiêu chuẩn đánh giá khả năng thấu hiểu thực nghiệm của AI Agent | AIHOT.vn