Nghiên cứu
Zero Gap không phải là phục hồi: Đánh giá xác suất theo câu hỏi để xử lý rò rỉ dữ liệu benchmark
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra lỗ hổng của chỉ số G-AP trong việc đánh giá khả năng thực sự của mô hình AI bị nhiễm dữ liệu benchmark, đồng thời đề xuất SA-PPG – phương pháp đánh giá phân tầng dựa trên xác suất giải quyết từng câu hỏi để đo lường chính xác hơn.
Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Ruijie Hou [xem email] [v1] Thứ Sáu, ngày 7 tháng 8 năm 2026 15:37:03 UTC (417 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.