Nghiên cứu
Đánh giá τ^τ-bench: Các AI lập trình mạnh nhất chỉ đạt 23,9% trong bài kiểm tra thực tế
(giờ Việt Nam)
Tóm tắt AI
Sierra và Đại học Princeton ra mắt τ^τ-bench, một bộ tiêu chuẩn mô phỏng quy trình xây dựng AI thực tế cho khách hàng, đòi hỏi AI phải xử lý từ tài liệu, API đến ngân sách để tạo ra sản phẩm hoàn thiện.

Bài viết được AI dịch và tổng hợp tự động từ X: Rohan Paul (@rohanpaul_ai). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.