Hướng dẫnĐiểm AI 62/100
Tinh chọnAnt Group và ASystem hiện thực hóa quy trình huấn luyện hậu kỳ cho Agentic RL trên một máy đơn lẻ
Ant Group và ASystem đã kết hợp Ling-3.0-tiny cùng thuật toán GSPO để tối ưu hóa quy trình huấn luyện hậu kỳ cho Agentic RL. Kết quả thử nghiệm trên cờ caro cho thấy hiệu suất mô hình cải thiện rõ rệt, ổn định khả năng gọi công cụ và rút ngắn độ dài phản hồi.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong việc tối ưu hóa huấn luyện Agent, giúp giảm rào cản hạ tầng cho các mô hình RL phức tạp.