Google Developers Blog
92

Thủ thuật

Google ra mắt autofinetune: Tự động hóa hậu huấn luyện LLM trên TPU bằng AI Agent

(giờ Việt Nam)

Tóm tắt AI

Google giới thiệu autofinetune, sử dụng AI Agent kết hợp Gemini Flash 3.7 để tự động hóa quy trình SFT và GRPO cho LLM trên hạ tầng TPU, giúp tối ưu hóa việc huấn luyện mô hình.

Bản dịch AI

Autonomous LLM post-training with Tunix on TPUs

11 THÁNG 9, 2026

Hãy tưởng tượng bạn đi ngủ sau khi viết một bản đặc tả Markdown duy nhất và thức dậy để thấy rằng một AI agent đã chạy hàng chục thử nghiệm tinh chỉnh (fine-tuning) LLM thay cho bạn trong đêm - khám phá các LoRA rank tối ưu, tinh chỉnh lịch trình tốc độ học (learning rate schedules), điều chỉnh kích thước batch và commit từng cải tiến đã được xác thực lên Git.

Đây không còn là chuyện viễn tưởng nữa. Đầu năm nay, dự án autoresearch đã trình diễn cách các LLM agent tự hành có thể khám phá quá trình tiền huấn luyện (pre-training) một cách lặp đi lặp lại trong một vòng lặp khép kín. Lấy cảm hứng từ mô hình này, chúng tôi đã tạo ra autofinetune: áp dụng các vòng lặp nghiên cứu tự hành vào quá trình hậu huấn luyện (post-training) LLM (Tinh chỉnh có giám sát - Supervised Fine-Tuning và Học tăng cường thông qua GRPO), sử dụng toàn bộ hệ sinh thái AI của Google—Tunix, Gemma và Cloud TPU được điều phối bởi Antigravity CLI và Gemini Flash 3.7.

fullstack

Trong bài viết này, chúng ta sẽ khám phá cách vòng lặp nghiên cứu tự hành hoạt động đối với quá trình hậu huấn luyện và xem qua một vài nghiên cứu điển hình về tinh chỉnh LLM trong thực tế.

Sự thay đổi mô hình: Từ tinh chỉnh thủ công sang các vòng lặp tự hành

Quá trình hậu huấn luyện truyền thống bao gồm một chu kỳ thủ công, lặp đi lặp lại:

Như đã được chứng minh trong autoresearch, giờ đây chúng ta có thể tự động hóa toàn bộ quy trình này với sức mạnh của các AI agent:

agentloop

Nghiên cứu điển hình 1: Tinh chỉnh có giám sát (SFT) trên FunctionGemma

Trong thử nghiệm đầu tiên với autofinetune, chúng tôi đã sử dụng thiết lập SFT tương tự như bài blog trước và mở rộng nó bằng cách tạo ra vòng lặp autoresearch để tối ưu hóa google/functiongemma-270m-it trên tập dữ liệu google/mobile-actions.

Thiết lập

Agent được cung cấp các giới hạn trong tệp program.md:

Quỹ đạo mẫu

Dưới đây là một quỹ đạo mẫu từ sample_runs/SFT_results.tsv cho thấy cách agent thực hiện leo đồi (hill climbing).

SFT_results

Như bạn có thể thấy, agent có khả năng tự động điều chỉnh LoRA rank/alpha, trình tối ưu hóa (optimizer), tốc độ học, v.v. để liên tục cải thiện độ chính xác của mô hình trong việc tạo ra các lệnh gọi hàm (function calls) chính xác.

Nghiên cứu điển hình 2: Học tăng cường (GRPO) trên Gemma cho suy luận toán học

Tinh chỉnh có giám sát chỉ là một bài kiểm tra đơn giản. Đối với nghiên cứu điển hình thứ hai, chúng tôi đã lấy ví dụ GRPO chính thức từ kho lưu trữ Tunix (huấn luyện Gemma 3 1B cho suy luận toán học sử dụng GSM8K; mô hình đã huấn luyện có độ chính xác về số liệu và định dạng tốt hơn trong các câu trả lời) và thiết lập nó cho việc tinh chỉnh RL tự hành. Học tăng cường vốn nhạy cảm với siêu tham số, thiếu ổn định và tốn thời gian thực thi lâu hơn - khiến nhiệm vụ này trở nên thách thức và tốn kém thời gian hơn.

Thiết lập Arena

Quỹ đạo mẫu

Dưới đây là một quỹ đạo mẫu được ghi lại trong sample_runs/RL_results.tsv, cho thấy tiến trình của agent. Agent đã có thể xác định các cấu hình LoRA, nhiệt độ rollout (rollout temperature), hình phạt KL (KL penalty), system prompt, v.v. tốt hơn để cải thiện tổng phần thưởng (total reward) thêm khoảng 10%.

SFT_results

Tiếp theo là gì?

Chúng tôi hy vọng dự án này cho bạn thấy sức mạnh của các AI agent trong lĩnh vực hậu huấn luyện LLM và truyền cảm hứng để bạn suy nghĩ về cách tận dụng chúng nhằm tự động hóa quy trình tinh chỉnh LLM của mình bằng cách sử dụng Tunix trên TPU. Hãy xem mã nguồn, các lượt chạy mẫu và các mẫu program.md trong kho lưu trữ autofinetune trên GitHub, khám phá thư viện Tunix và bắt đầu xây dựng phòng thí nghiệm hậu huấn luyện tự hành của riêng bạn ngay hôm nay!

Trước

Tiếp theo

LLMTPUHậu huấn luyệnTự động hóaGoogle
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Developers Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.