Hugging Face Daily Papers
85

Nghiên cứu

Zero Gap không phải là phục hồi: Đánh giá xác suất theo câu hỏi để xử lý rò rỉ dữ liệu benchmark

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu chỉ ra lỗ hổng của chỉ số G-AP trong việc đánh giá khả năng thực sự của mô hình AI bị nhiễm dữ liệu benchmark, đồng thời đề xuất SA-PPG – phương pháp đánh giá phân tầng dựa trên xác suất giải quyết từng câu hỏi để đo lường chính xác hơn.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Ruijie Hou [xem email] [v1] Thứ Sáu, ngày 7 tháng 8 năm 2026 15:37:03 UTC (417 KB)

AIBenchmarkLLMĐánh giá mô hìnhDữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.