Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Nghiên cứu

Khi các bài kiểm tra AI chạm ngưỡng bão hòa: Nghiên cứu hệ thống về sự lỗi thời của các tiêu chuẩn đánh giá

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu phân tích 60 bộ tiêu chuẩn đánh giá ngôn ngữ và phát hiện gần một nửa đã bão hòa. Kết quả cho thấy việc thiết kế bài kiểm tra bởi chuyên gia thay vì dựa vào dữ liệu công khai có thể kéo dài tuổi thọ và độ tin cậy của các phương pháp đánh giá AI.

Bản dịch AI

Tác giả: Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite

Lịch sử gửi bài

Từ: Mubashara Akhtar [xem email] [v1] Thứ Tư, 18/02/2026 16:51:37 UTC (222 KB) [v2] Thứ Bảy, 30/05/2026 16:41:50 UTC (640 KB) [v3] Thứ Hai, 29/06/2026 17:01:58 UTC (636 KB)

AIĐánh giá mô hìnhNghiên cứu AILLMBenchmark
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.