Nghiên cứu
Nghiên cứu τ^τ-Bench: Claude 3.5 Opus chỉ đạt 23,9% khi tự xây dựng AI Agent, trong khi con người đạt 82,2%
(giờ Việt Nam)
Tóm tắt AI
Sierra và ĐH Princeton ra mắt τ^τ-Bench, bộ tiêu chuẩn đánh giá khả năng tự xây dựng AI Agent của các mô hình ngôn ngữ. Kết quả cho thấy khoảng cách lớn giữa AI và chuyên gia con người trong việc thiết lập hệ thống chăm sóc khách hàng thực tế.

Bài viết được AI dịch và tổng hợp tự động từ X: DAIR.AI (@dair_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.