Nghiên cứu
AgentWorld: Bộ tiêu chuẩn đánh giá khả năng cộng tác dài hạn của các hệ thống đa tác nhân LLM
(giờ Việt Nam)
Tóm tắt AI
AgentWorld là bộ benchmark mới với 100 tác vụ phức tạp, yêu cầu nhiều tác nhân AI phối hợp lập kế hoạch và chia sẻ tài nguyên trong môi trường giả lập, nhằm khắc phục hạn chế của các bài kiểm tra ngắn hạn hiện nay.
Chính văn · Bản dịch AI
Tóm tắt: Các bộ tiêu chuẩn đánh giá đa tác tử (multi-agent benchmarks) hiện nay chủ yếu kiểm thử trong các môi trường cạnh tranh, các tương tác ngắn hạn dưới 20 bước, hoặc chỉ đơn giản là tổng hợp hiệu suất cá nhân, dẫn đến việc không thể tách biệt và làm nổi bật các khả năng cộng tác thực sự của các tác tử dựa trên LLM. Chúng tôi giới thiệu AgentWorld, một bộ tiêu chuẩn gồm 100 tác vụ được con người chú giải (với 100 biến thể mở rộng) để đánh giá khả năng cộng tác đa tác tử trong dài hạn. Các tác vụ trải dài hơn 50 vòng tương tác trong một môi trường sandbox MMORPG phong phú và yêu cầu từ 3-20 tác tử với các vai trò và khả năng bất đối xứng phải phối hợp thông qua giao tiếp, lập kế hoạch chung và chia sẻ tài nguyên trong môi trường hộp đen (blackbox), nơi mỗi tác tử hoạt động độc lập mà không có quyền truy cập vào trạng thái nội bộ của các tác tử khác. Để định lượng hiệu quả cộng tác bên cạnh kết quả thành công/thất bại nhị phân thông thường, chúng tôi đề xuất Causal Collaboration Effectiveness (CCE), một thước đo dựa trên đồ thị giúp truy vết các phụ thuộc nhân quả giữa các hành động của tác tử và đo lường tỷ lệ nỗ lực của nhóm thực sự đóng góp vào kết quả cuối cùng. Các thử nghiệm với Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini và DeepSeek R1-70B cho thấy ngay cả mô hình tốt nhất cũng chỉ đạt 52,0% tỷ lệ thành công, với các kiểu thất bại hệ thống bao gồm sự cố giao tiếp, nhầm lẫn vai trò và không thể duy trì kế hoạch chung qua các vòng. AgentWorld hoàn toàn là mã nguồn mở.
| Bình luận: | Được chấp nhận tại COLM 2026. Trang web dự án: this https URL |
| Chủ đề: | Hệ thống đa tác tử (cs.MA) |
| Trích dẫn là: | arXiv:2609.31590 [cs.MA] |
| (hoặc arXiv:2609.31590v1 [cs.MA] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.31590 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử nộp bài
Từ: Raphael Shu [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 17:44:03 UTC (3.143 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.