Tin ngành
Google giới thiệu ToolGrad: Phương pháp tạo tập dữ liệu gọi công cụ hiệu quả bằng 'gradient văn bản'
(giờ Việt Nam)
Tóm tắt AI
Google ra mắt ToolGrad, khung làm việc giúp tối ưu hóa việc tạo tập dữ liệu gọi công cụ bằng cách sử dụng LLM để xây dựng chuỗi lệnh và gắn nhãn ngược từ truy vấn người dùng, vừa được công bố tại ACL 2026.
Bản dịch AI

Các AI agent đã cho thấy tiềm năng to lớn trong việc tự động hóa các tác vụ thực tế, chẳng hạn như thực hiện tìm kiếm trên Google, đọc các tệp tin trên máy tính cục bộ hoặc thực thi các tập lệnh Python được tạo ra. Để đạt được các quy trình làm việc mang tính agent như vậy, các LLM cần học cách sử dụng công cụ một cách chính xác và hiệu quả. Để dạy cho các mô hình ngôn ngữ lớn cách sử dụng công cụ, chúng ta cần các tập dữ liệu về chuỗi sử dụng công cụ và các truy vấn người dùng tương ứng. Trong nghiên cứu trước đây của chúng tôi được giới thiệu trong InstructPipe, chúng tôi đã chú thích dữ liệu đánh giá theo cách thủ công, nhưng việc mở rộng quy mô chú thích của con người cho các quy trình tinh chỉnh LLM nâng cao là không khả thi. Để hợp lý hóa quy trình dữ liệu, các nghiên cứu trước đây, ví dụ như ToolBench và ToolACE, đã khám phá việc sử dụng một agent để tự động tìm kiếm đường dẫn sử dụng công cụ thông qua phương pháp thử và sai. Cách tiếp cận chú thích tiêu biểu này bao gồm hai bước: (1) tạo một hướng dẫn giả định từ người dùng từ một nhóm API được lấy mẫu, và (2) sử dụng một agent tìm kiếm theo chiều sâu (DFS) để tìm giải pháp sử dụng công cụ cho hướng dẫn đó. Cách tiếp cận này vốn dĩ kém hiệu quả vì cốt lõi của nó là chắt lọc các quỹ đạo có giá trị từ quá trình khám phá phức tạp của agent để huấn luyện một LLM.
Trong bài báo “ToolGrad: Efficient Tool-use Dataset Generation with Textual ‘Gradients’” (tạm dịch: ToolGrad: Tạo tập dữ liệu sử dụng công cụ hiệu quả với ‘gradient’ văn bản), được trình bày tại ACL 2026, chúng tôi giới thiệu một mô hình giải pháp thay thế. ToolGrad trước tiên tạo ra một chuỗi sử dụng công cụ chuẩn (ground-truth) và sau đó chú thích truy vấn người dùng tương ứng. Theo trực giác, một giải pháp sử dụng công cụ tường minh cung cấp nhiều thông tin không mơ hồ hơn so với một câu lệnh (prompt), giúp việc chú thích, từ cách sử dụng công cụ đến truy vấn sử dụng, trở nên dễ dàng hơn nhiều và chỉ cần một bước LLM. Kết quả của chúng tôi cho thấy phương pháp "trả lời trước" (answer-first) có thể tạo ra dữ liệu sử dụng công cụ phức tạp hơn (tầm nhìn dài hạn) với chi phí thấp hơn. Các LLM được huấn luyện trên dữ liệu do chúng tôi tạo ra cũng vượt trội hơn so với các mô hình được huấn luyện bằng các phương pháp cơ sở, và thậm chí ngang bằng với các LLM độc quyền đạt chuẩn SoTA trên các tập dữ liệu phân phối ngoài (OOD) với các công cụ chưa từng thấy.
Tạo chuỗi sử dụng công cụ lặp lại với “gradient” văn bản
Các hệ thống học máy (ML) tiêu chuẩn cải thiện bằng cách tính toán gradient mất mát số học trên các mini-batch của mẫu huấn luyện, sau đó được sử dụng bởi một thuật toán tối ưu hóa để cập nhật trọng số mô hình. Gần đây, TextGrad đã điều chỉnh mô hình này cho kỹ thuật prompt bằng cách sử dụng một LLM đóng vai trò người đánh giá để cung cấp phản hồi phong phú, mô tả bằng văn bản thuần túy — phản hồi được gọi là “gradient văn bản”. Những gradient văn bản này sau đó hướng dẫn việc tinh chỉnh một prompt nhất định thành một bản nháp mới có thể giải quyết tác vụ mục tiêu tốt hơn.
ToolGrad điều chỉnh khái niệm gradient văn bản từ tối ưu hóa prompt sang tạo tập dữ liệu tổng hợp. Thay vì tối ưu hóa một prompt văn bản tĩnh, ToolGrad sử dụng các gradient này để xây dựng lặp đi lặp lại các quy trình làm việc API phức tạp và hợp lệ từ các thư viện công cụ lớn.
Khung làm việc ToolGrad
ToolGrad có bốn mô-đun cốt lõi thực hiện tuần tự các bước: đề xuất, thực thi, lựa chọn và cập nhật.
Việc lặp lại quy trình này tạo ra một mẫu dữ liệu bao gồm truy vấn người dùng, quy trình làm việc API đã được xác minh và phản hồi cuối cùng của AI.
Thực nghiệm
Hiệu quả tạo dữ liệu
Trước tiên, chúng tôi đánh giá chi phí và chất lượng của việc tạo dữ liệu. Chúng tôi sử dụng ToolBench làm cơ sở dữ liệu API, bao gồm hơn 16 nghìn API thực tế, để tạo tập dữ liệu sử dụng công cụ của mình. Chúng tôi so sánh phương pháp tạo dữ liệu "truy vấn trước" (query-first) ban đầu trên ToolBench, sử dụng tìm kiếm theo chiều sâu (DFS), với phương pháp "trả lời trước" của chúng tôi là ToolGrad. Kết quả chứng minh rằng ToolGrad có thể tạo ra dữ liệu sử dụng công cụ phức tạp hơn với tỷ lệ thành công cao hơn, sử dụng chi phí tạo thấp hơn.
Bảng xếp hạng gọi hàm Berkeley (Berkeley function calling leaderboard)
Chúng tôi đã tạo các tập dữ liệu sử dụng công cụ quy mô nhỏ có tên là ToolGrad-500, sử dụng cơ sở dữ liệu API từ ToolBench. Sau đó, chúng tôi tinh chỉnh các mô hình Gemma-3 (1B, 4B và 12B) bằng ToolGrad-500, và gọi các mô hình đã tinh chỉnh này là ToolGrad-1B, ToolGrad-4B và ToolGrad-12B. Chúng tôi đã đánh giá hiệu suất sử dụng công cụ của các mô hình này trên Berkeley Function Calling Leaderboard (BFCL), một tiêu chuẩn đánh giá sử dụng công cụ với bộ công cụ khác với ToolBench. Chúng tôi so sánh các mô hình đã tinh chỉnh của mình với (1) các mô hình cơ sở không qua tinh chỉnh, (2) các mô hình độc quyền đạt chuẩn SoTA (Gemini, GPT và Claude), và (3) các mô hình chuyên dụng về sử dụng công cụ đạt chuẩn SoTA (ToolACE, Hammer-2.1-7B).
Phần sau đây tóm tắt các phát hiện của chúng tôi.
Kết luận và hướng phát triển tương lai
ToolGrad chứng minh rằng các tập dữ liệu sử dụng công cụ chất lượng cao có thể được tạo ra hiệu quả và đáng tin cậy hơn thông qua mô hình "trả lời trước". Bằng cách thiết kế một khung làm việc mang tính agent, liên kết các API một cách lặp lại thông qua gradient văn bản, ToolGrad giải quyết các nút thắt lâu nay về chi phí và khả năng mở rộng trong việc tạo dữ liệu chuẩn (ground-truth). Thiết kế của chúng tôi đạt tỷ lệ thành công gần như 100% trong việc tạo dữ liệu, cho phép các mô hình tương đối nhỏ gọn hoạt động cực kỳ hiệu quả và cho thấy các LLM học viên thậm chí có thể vượt qua cả giáo viên của chúng.
Nhìn về phía trước, nghiên cứu này có thể được mở rộng sang các ứng dụng thực tế rộng lớn hơn bằng cách mở rộng quy mô khung làm việc để xử lý các hệ sinh thái API ngày càng năng động và rộng lớn. Nghiên cứu trong tương lai cũng sẽ khám phá việc mở rộng khả năng tự tiến hóa này để hỗ trợ học tập liên tục, tức thời nhằm cá nhân hóa theo thời gian. Khi các quy trình làm việc mang tính agent ngày càng được tích hợp vào các tác vụ doanh nghiệp và đời sống hàng ngày, các khung làm việc như ToolGrad đặt nền móng thiết yếu cho việc huấn luyện các digital agent vừa có năng lực cao vừa có khả năng mở rộng kinh tế khi triển khai.
Lời cảm ơn
Nghiên cứu này chủ yếu được thực hiện bởi Zhongyi Zhou trong thời gian ông làm Nghiên cứu viên khách mời tại Google. Chúng tôi gửi lời cảm ơn chân thành đến những người đóng góp chính là Kohei Uehara, Haoyu Zhang, Jingtao Zhou, Lin Gu, Zheng Xu, Tatsuya Harada vì sự hỗ trợ của họ, và đến Adarsh Kowdle và Shahram Izadi vì sự hướng dẫn chiến lược và những đánh giá sâu sắc.





Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.