Nghiên cứu
Agent Seer: Phương pháp tự động tổng hợp kịch bản đánh giá AI Agent từ đặc tả công cụ
(giờ Việt Nam)
Tóm tắt AI
Agent Seer giúp tự động tạo các kịch bản kiểm thử thực tế cho AI Agent bằng cách phân tích đặc tả công cụ, loại bỏ nhu cầu xây dựng thủ công và giải quyết vấn đề khó mở rộng trong các bộ benchmark truyền thống.
Bản dịch AI

Tác giả: Harish Karumuri, Mahesh Vemula, David Lopes Pegna
Việc đánh giá các AI agent sử dụng công cụ bên ngoài đòi hỏi những kịch bản kiểm thử thực tế, phản ánh cách người dùng kết hợp các công cụ và tương tác qua nhiều lượt hội thoại. Việc xây dựng thủ công các kịch bản này đòi hỏi chuyên môn sâu, không thể mở rộng trên các hệ sinh thái công cụ khác nhau và tạo ra các bộ benchmark tĩnh không thể theo kịp sự thay đổi của các API. Chúng tôi nhận thấy rằng các đặc tả công cụ (tool specifications)—bao gồm tên hàm, mô tả bằng ngôn ngữ tự nhiên và lược đồ tham số có kiểu dữ liệu—đã chứa đủ thông tin ngữ nghĩa để tổng hợp các kịch bản đánh giá thực tế mà không cần biên soạn thủ công hay thực thi công cụ trực tiếp. Agent Seer tận dụng thông tin tiềm ẩn này: chỉ từ một đặc tả Model Context Protocol (MCP) duy nhất, không cần ví dụ, không cần truy cập công cụ trực tiếp và không cần tinh chỉnh theo từng lĩnh vực. Pipeline này làm phong phú các lược đồ thô, tạo ra các kịch bản được phân loại với đầu ra công cụ tổng hợp, và mở rộng chúng thành các đoạn hội thoại đa lượt dựa trên dữ liệu giả lập, thể hiện độ chính xác cao trong việc gọi công cụ và tính mạch lạc trong hội thoại. Chất lượng đánh giá được đo lường bằng cách áp dụng pipeline này trên bảy đặc tả MCP thuộc các lĩnh vực và quy mô bộ công cụ đa dạng, đồng thời đo lường độ chính xác khi gọi công cụ và tính mạch lạc của hội thoại. Pipeline đạt chất lượng cao trên tất cả các lĩnh vực, với độ bao phủ công cụ hoàn chỉnh trên các đặc tả quy mô nhỏ và trung bình. Hai phát hiện nổi bật từ phân tích này là: độ phức tạp của lược đồ tham số là yếu tố tương quan mạnh nhất với sự biến thiên chất lượng—quy mô bộ công cụ đóng vai trò nhỏ hơn và độc lập—và độ chính xác của giá trị đối số là dạng lỗi phổ biến nhất trong các kịch bản chưa hoàn thiện, một khía cạnh phụ mà các chỉ số khớp tên thô không thể phát hiện được.
Các bài đọc và cập nhật liên quan.
Khả năng suy luận tích hợp đa công cụ cho phép các agent sử dụng công cụ dựa trên LLM giải quyết các tác vụ phức tạp bằng cách đan xen giữa suy luận ngôn ngữ tự nhiên và các lệnh gọi công cụ bên ngoài. Tuy nhiên, việc huấn luyện các agent này bằng phần thưởng chỉ dựa trên kết quả cuối cùng thường gặp vấn đề về sự mơ hồ trong phân bổ tín dụng (credit-assignment ambiguity), gây khó khăn trong việc xác định bước trung gian (hoặc quyết định sử dụng công cụ) nào dẫn đến thành công hay thất bại. Trong bài báo này, chúng tôi đề xuất PORTool, một thuật toán tối ưu hóa chính sách dựa trên mức độ quan trọng (importance-aware policy-optimization)…
Đọc thêm
Bài báo này đã được chấp nhận tại Hội thảo lần thứ năm về Tạo, Đánh giá và Chỉ số Ngôn ngữ Tự nhiên (Workshop on Natural Language Generation, Evaluation, and Metrics) tại ACL 2026.
Các agent gọi công cụ được đánh giá dựa trên khả năng lựa chọn công cụ, độ chính xác của tham số và nhận diện phạm vi, tuy nhiên các đánh giá về quỹ đạo của LLM vẫn mang tính chất hậu kiểm (post-hoc). Do tách biệt khỏi vòng lặp thực thi chủ động, các đánh giá này thường xác định những lỗi vốn được xử lý thông qua tinh chỉnh prompt hoặc huấn luyện lại, và về cơ bản không thể…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.