DAIR.AI@dair_ai
85

Nghiên cứu

Nghiên cứu mới: LLM làm 'giám khảo' không còn đáng tin cậy trong các cuộc hội thoại thực tế

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu chỉ ra rằng các chỉ số tự động và phương pháp 'LLM-as-a-judge' truyền thống không khớp với đánh giá của chuyên gia. Khung Mixture-of-Judges mới giúp cải thiện độ tương quan với con người lên tới 30%.

Xem nguyên văn trên X

Bài viết được AI dịch và tổng hợp tự động từ X: DAIR.AI (@dair_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.