Nghiên cứu
Apple giới thiệu phương pháp tạo dữ liệu tổng hợp không cần môi trường thực thi cho AI Agent
(giờ Việt Nam)
Tóm tắt AI
Apple phát triển kỹ thuật huấn luyện AI Agent gọi API bằng cách dùng LLM mô phỏng môi trường thay vì môi trường thực tế, giúp cải thiện đáng kể hiệu suất trên các bộ benchmark như AppWorld.
Bản dịch AI

Tác giả: Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli
Việc huấn luyện các tác nhân (agent) mô hình ngôn ngữ lớn (LLM) có khả năng gọi API đòi hỏi một lượng lớn các quỹ đạo (trajectories) chất lượng cao. Tuy nhiên, việc thu thập dữ liệu này trên quy mô lớn thường yêu cầu các môi trường được triển khai đầy đủ với các API có thể thực thi và các cơ sở dữ liệu backend thực tế, được nạp sẵn dữ liệu, điều này tạo ra một nút thắt lớn cho khả năng mở rộng. Để khắc phục vấn đề này, chúng tôi đề xuất một phương pháp tạo dữ liệu tổng hợp không cần môi trường, tận dụng các LLM như những mô hình thế giới kỹ thuật số tức thời. Chỉ với các thông số kỹ thuật của API, phương pháp của chúng tôi tạo ra các quỹ đạo mô phỏng sự tương tác giữa một tác nhân và một môi trường có trạng thái (stateful environment). Cụ thể, một LLM trước tiên sẽ tạo ra các tác vụ đa dạng có thể giải quyết bằng các API được cung cấp. Sau đó, một tác nhân giáo viên (teacher agent) sẽ giải quyết từng tác vụ theo phương pháp lặp, trong khi một trình mô phỏng LLM sẽ tạo ra các phản hồi API tổng hợp nhất quán dựa trên ngữ cảnh tác vụ và lịch sử mô phỏng. Cuối cùng, một LLM đóng vai trò giám khảo sẽ lọc các quỹ đạo để đảm bảo chất lượng của tập dữ liệu thu được. Chúng tôi đánh giá phương pháp của mình trên các bộ tiêu chuẩn đầy thách thức là AppWorld và OfficeBench, bao gồm cả các tác vụ truy xuất thông tin và thay đổi trạng thái. Việc tinh chỉnh các mô hình dựa trên dữ liệu tổng hợp của chúng tôi mang lại hiệu suất vượt trội đáng kể, chứng minh rằng sự giám sát hiệu quả cho các tác nhân gọi API có thể được tạo ra mà không cần bất kỳ môi trường thực thi nào. Kết quả của chúng tôi khẳng định việc mô phỏng API dựa trên LLM là một giải pháp thiết thực, có khả năng mở rộng để huấn luyện các tác nhân trên nhiều hệ sinh thái API đa dạng.
Các bài đọc và cập nhật liên quan.
Các tác nhân kỹ thuật số tương tác (Interactive digital agents - IDA) tận dụng các API của môi trường kỹ thuật số có trạng thái để thực hiện các tác vụ nhằm phản hồi yêu cầu của người dùng. Mặc dù các IDA được vận hành bởi các mô hình ngôn ngữ lớn (LLM) đã qua tinh chỉnh hướng dẫn có thể phản ứng với phản hồi từ các lệnh gọi giao diện trong các trao đổi nhiều bước, chúng lại chưa được huấn luyện trong các môi trường kỹ thuật số tương ứng của mình. Các phương pháp trước đây chỉ hoàn thành chưa đến một nửa số tác vụ trong các bộ tiêu chuẩn phức tạp như AppWorld. Chúng tôi trình bày một…
Đọc thêm
Các câu lệnh (prompt) dài đặt ra thách thức đáng kể cho các hệ thống dựa trên LLM thực tế vốn cần vận hành với độ trễ thấp và tài nguyên hạn chế. Chúng tôi nghiên cứu việc nén câu lệnh cho các hệ thống hội thoại zero-shot, nơi các hệ thống này học cách sử dụng các API chưa từng biết trực tiếp trong ngữ cảnh từ tài liệu của chúng, vốn có thể chiếm hàng trăm token câu lệnh cho mỗi API. Chúng tôi bắt đầu từ một phương pháp mới được giới thiệu gần đây (Mu và cộng sự, 2023), phương pháp này học cách nén câu lệnh thành một vài “gist…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.