Nghiên cứu
JEV-as-a-Judge: Chiến lược đánh giá AI tiết kiệm chi phí bằng cách phân tầng độ tin cậy
(giờ Việt Nam)
Tóm tắt AI
JEV-as-a-Judge sử dụng mô hình đánh giá chi phí thấp để sàng lọc sơ bộ, kết hợp cơ chế leo thang khi độ tin cậy thấp, giúp duy trì 99% độ chính xác của các mô hình SOTA với chi phí chỉ bằng 0,36%.
Chính văn · Bản dịch AI
Tóm tắt: LLM-as-a-judge (LLM đóng vai trò giám khảo) cho phép đánh giá trên nhiều tác vụ đa dạng, nhưng chi phí suy luận và độ tin cậy của kết quả trở nên quan trọng khi triển khai ở quy mô lớn. Chúng tôi nghiên cứu liệu một giám khảo chỉ đưa ra quyết định (decision-only judge) có thể cung cấp bước sàng lọc đầu tiên tiết kiệm và xác định khi nào cần đánh giá chuyên sâu hơn hay không. Khi so sánh JEV-as-a-judge với mười sáu giám khảo là mô hình tạo sinh và mô hình phần thưởng, cùng với sự thẩm định mù từ con người, chúng tôi nhận thấy nó chỉ chênh lệch trong khoảng ba điểm phần trăm so với một LLM giám khảo hiện đại nhất (đối thủ mạnh nhất của chúng tôi) về các tiêu chí ưu tiên thông thường và tính xác thực dựa trên bằng chứng, với chi phí chỉ bằng 0,36% so với đối thủ này. Khoảng cách lớn hơn xuất hiện khi các đánh giá đòi hỏi phải kiểm tra quá trình suy luận hoặc chống lại các câu trả lời sai được viết một cách tinh vi. Trên một số tiêu chuẩn đánh giá, khoảng cách của JEV so với đối thủ này tập trung vào các quyết định có độ tin cậy thấp. Một hệ thống phân tầng cố định (frozen cascade) chấp nhận các phán quyết có độ tin cậy cao và chuyển tiếp các phán quyết không chắc chắn vẫn giữ được 99% độ chính xác của đối thủ với chi phí thấp hơn.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.26550 [cs.AI] |
| (hoặc arXiv:2609.26550v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.26550 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yubo Li [xem email] [v1] Thứ Ba, 22 tháng 9 năm 2026 15:05:56 UTC (2.824 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.