Tin ngành
Google ra mắt ToolGrad: Đột phá mới giúp AI sử dụng công cụ chính xác tới 99,8%
(giờ Việt Nam)
Tóm tắt AI
Google cùng các đối tác giới thiệu ToolGrad, phương pháp đảo ngược quy trình tạo dữ liệu bằng cách kiểm chứng chuỗi công cụ trước khi tạo truy vấn, giúp nâng tỷ lệ thành công trên ToolBench từ 63,8% lên 99,8%.
Bản dịch AI

Việc huấn luyện một LLM để gọi công cụ một cách đáng tin cậy đòi hỏi các tập dữ liệu ghép nối truy vấn của người dùng với các chuỗi sử dụng công cụ chính xác. Việc tạo ra dữ liệu đó trên quy mô lớn vốn rất chậm và tốn kém. Một nhóm các nhà nghiên cứu từ Google, Đại học Tokyo, RIKEN AIP và Đại học Tohoku đã giới thiệu ToolGrad. Công trình nghiên cứu này đảo ngược quy trình thông thường: xây dựng chuỗi công cụ đã được xác minh trước, sau đó mới viết truy vấn. Các mô hình Gemma-3 được tinh chỉnh trên 500 mẫu dữ liệu thu được đã đạt điểm số ngang hàng với các mô hình độc quyền tiên tiến trên bảng xếp hạng Berkeley Function Calling Leaderboard.
Liệu nó có thể triển khai được không? Có. Mã nguồn được cấp phép theo Apache-2.0, tập dữ liệu ToolGrad-500 cùng các mô hình 1B, 4B và 12B đều có sẵn trên Hugging Face, và đã có một gói PyPI đi kèm.
Vấn đề với phương pháp tạo truy vấn trước (query-first generation)
Các quy trình trước đây như ToolBench và ToolACE tuân theo công thức truy vấn trước. Hệ thống lấy mẫu từ một nhóm các API, yêu cầu LLM tạo ra một chỉ dẫn người dùng hợp lý, sau đó điều phối một tác nhân tìm kiếm theo chiều sâu (DFS) để tìm đường dẫn sử dụng công cụ đáp ứng chỉ dẫn đó. Việc tìm kiếm này không đảm bảo thành công. Khi rơi vào ngõ cụt, tài nguyên tính toán đã bỏ ra cho việc khám phá sẽ bị lãng phí và mẫu đó bị loại bỏ. Bài báo coi đây là quá trình chắt lọc các quỹ đạo có giá trị từ quá trình khám phá phức tạp và thường thất bại của tác nhân, vốn dĩ không hiệu quả.
ToolGrad đảo ngược thứ tự này. Nó xây dựng một chuỗi sử dụng công cụ chuẩn (ground-truth) bằng cách thực thi các API thực tế, sau đó chú thích chuỗi đó bằng một truy vấn người dùng phù hợp. Một chuỗi hoạt động rõ ràng, cụ thể sẽ ít mơ hồ hơn nhiều so với một lời nhắc (prompt) giả định, vì vậy bước chuyển từ chuỗi sang truy vấn chỉ cần một lần gọi LLM duy nhất.
Bốn mô-đun trong một vòng lặp
Mỗi lần lặp chạy bốn mô-đun theo trình tự:
Việc lặp lại vòng lặp tạo ra một mẫu: truy vấn người dùng, quy trình làm việc API đã được xác minh và phản hồi cuối cùng. Cấu hình mặc định của kho lưu trữ chạy 10 lần lặp trên 50 API được lấy mẫu cho mỗi quy trình làm việc.
Hiệu quả tạo dữ liệu trên ToolBench
Nhóm nghiên cứu đã đánh giá việc tạo dữ liệu trên cơ sở dữ liệu API của ToolBench, vốn chứa hơn 16.000 API thực tế, và so sánh ToolGrad với phương pháp truy vấn trước dựa trên DFS của ToolBench. Theo bài báo nghiên cứu:
Trường hợp thất bại 0,2% xảy ra khi tác nhân không thể nhận được phản hồi thành công từ 3 API đã chọn trong tất cả 10 lần lặp và lưu lại một mẫu trống.
Trình giải thích tương tác
Kết quả BFCL với Gemma-3
Các nhà nghiên cứu đã tạo ra ToolGrad-500, một tập dữ liệu gồm 500 mẫu được xây dựng bằng Gemini 2.5 Flash-Lite, và sử dụng nó để hậu huấn luyện (post-train) Gemma-3 ở các quy mô 1B, 4B và 12B tham số. Họ đã đánh giá trên Berkeley Function Calling Leaderboard, nơi sử dụng bộ công cụ khác với ToolBench, tạo thành một bài kiểm tra ngoài phân phối (out-of-distribution) với các công cụ chưa từng thấy. Những phát hiện được các tác giả báo cáo:
Các tập lệnh tái lập của kho lưu trữ nhắm mục tiêu vào BFCL V1 và V2 thông qua một bản fork tùy chỉnh, chạy suy luận trong một hình ảnh Docker vLLM và đã được xác minh trên một máy đơn NVIDIA A100 40GB.
Những điểm chính cần lưu ý
Hãy xem qua Bài báo, Trang GitHub và Blog Nghiên cứu của Google. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Bản phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn, v.v.? Hãy kết nối với chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.