DAIR.AI@dair_ai
85

Nghiên cứu

Nghiên cứu τ^τ-Bench: Claude 3.5 Opus chỉ đạt 23,9% khi tự xây dựng AI Agent, trong khi con người đạt 82,2%

(giờ Việt Nam)

Tóm tắt AI

Sierra và ĐH Princeton ra mắt τ^τ-Bench, bộ tiêu chuẩn đánh giá khả năng tự xây dựng AI Agent của các mô hình ngôn ngữ. Kết quả cho thấy khoảng cách lớn giữa AI và chuyên gia con người trong việc thiết lập hệ thống chăm sóc khách hàng thực tế.

Xem nguyên văn trên X

Bài viết được AI dịch và tổng hợp tự động từ X: DAIR.AI (@dair_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.