Nghiên cứu
AgentJudgeBench: Bộ tiêu chuẩn đánh giá khả năng làm 'giám khảo' của LLM trong các tác vụ dùng công cụ
(giờ Việt Nam)
Tóm tắt AI
AgentJudgeBench là bộ tiêu chuẩn đầu tiên đánh giá độ tin cậy của LLM khi đóng vai trò giám khảo cho các quy trình làm việc phức tạp (DAG). Nghiên cứu chỉ ra rằng khả năng đánh giá của LLM giảm dần theo độ khó, đặc biệt khi thiếu dữ liệu đối chứng.
Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Abhigya Verma Ms. [xem email] [v1] Thứ Năm, 27 tháng 8 năm 2026 05:20:22 UTC (1,412 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.