Nghiên cứu
Taste-Bench: Microsoft đo lường 'gu' ra quyết định của các AI Agent
(giờ Việt Nam)
Nguyên văn trên X
Banger paper from Microsoft and colleagues. We talk about human taste being important in this AI er…
Dịch · tóm tắt AI
Microsoft giới thiệu Taste-Bench, bộ tiêu chuẩn đánh giá khả năng chọn hướng đi đúng của AI Agent trong các tác vụ dài. Kết quả cho thấy ngay cả khi tăng ngân sách suy luận, các mô hình vẫn gặp khó khăn với độ chính xác chỉ 59,7%, đòi hỏi phương pháp chưng cất tri thức từ mô hình giáo viên để cải thiện hiệu suất.

Bài viết được AI dịch và tổng hợp tự động từ X: Elvis Saravia (@omarsar0, DAIR.AI). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.