Nghiên cứu
Baidu ra mắt DuMateBench: Bộ tiêu chuẩn đánh giá khả năng thực thi tác vụ thực tế của AI Agent
(giờ Việt Nam)
Tóm tắt AI
Baidu giới thiệu DuMateBench, bộ tiêu chuẩn đánh giá khả năng hoàn thành hơn 200 tác vụ văn phòng thực tế của AI Agent, tập trung vào kỹ năng sử dụng công cụ và thực thi quy trình thay vì chỉ đưa ra câu trả lời.
Bản dịch AI

Baidu đã ra mắt DuMateBench, một bảng xếp hạng đánh giá được thiết kế để đo lường khả năng hoàn thành các tác vụ thực tế và cung cấp kết quả có thể sử dụng được của các AI agent, thay vì chỉ dừng lại ở việc tạo ra câu trả lời. Bộ tiêu chuẩn này bao gồm hơn 200 tác vụ văn phòng thuộc sáu danh mục và kiểm tra hiệu suất của agent trong các môi trường vận hành phức tạp.
DuMateBench đánh giá khả năng hiểu tác vụ, sử dụng công cụ, thực thi liên tục và bàn giao kết quả cuối cùng. Công cụ này sử dụng một khung đánh giá tổng quát và các giao diện mở để các mô hình và agent khác nhau có thể được kiểm tra theo cùng một tiêu chí, qua đó chuyển dịch trọng tâm từ việc một mô hình AI có thể trả lời những gì sang việc nó có thể hoàn thành và cung cấp những gì. [Theo TechNode]





Bài viết được AI dịch và tổng hợp tự động từ TechNode. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.