Nghiên cứu
QwenGyre: Khung học tăng cường đàn hồi cho các tác nhân AI thực hiện nhiệm vụ siêu dài
(giờ Việt Nam)
Tóm tắt AI
QwenGyre là khung làm việc tối ưu hóa RL trực tuyến giúp giải quyết vấn đề lãng phí GPU và dư thừa dữ liệu khi huấn luyện các tác nhân AI thực hiện các tác vụ kéo dài hàng giờ với hàng triệu token.
Chính văn · Bản dịch AI
Tác giả: Weiqi Wang, Yuxin Zhou, Mouxiang Chen, Siyuan Zhang, Yi Zhang, Yuyan Luo, Zhiyu Yin, Chencan Wu, Jiemin Jiang, Wentao Yao, Chujie Zheng, JianWei Zhang
Tóm tắt: Các tác nhân mô hình ngôn ngữ lớn (LLM) ngày càng đảm nhận các tác vụ có thời gian thực thi cực dài (xlong), trong đó một lần thực thi duy nhất có thể kéo dài hàng giờ, hàng trăm tương tác giữa mô hình và môi trường, cùng gần 1 triệu token cho mỗi lần triển khai. Việc áp dụng học tăng cường (RL) trực tuyến cho các quá trình thực thi như vậy đặt ra hai thách thức cơ bản: (1) sự biến thiên nghiêm trọng trong thực thi và độ trễ triển khai kéo dài gây ra tình trạng nhàn rỗi GPU trên diện rộng; và (2) sự phân nhánh phi tuyến tính phức tạp tạo ra sự dư thừa quỹ đạo khổng lồ, làm tê liệt hiệu quả đào tạo. Để giải quyết vấn đề này, chúng tôi giới thiệu QwenGyre, một khung làm việc đầu-cuối dành cho RL trực tuyến với thời gian thực thi cực dài. QwenGyre phân bổ lại GPU một cách linh hoạt giữa quá trình triển khai và đào tạo mà không làm gián đoạn các thực thi trực tiếp, trong khi bộ xử lý quỹ đạo của nó tái cấu trúc các lịch sử phân nhánh, chấm điểm tiến độ từng phần và loại bỏ các đường dẫn dư thừa để giới hạn chi phí đào tạo. Được mở rộng quy mô trên mô hình chủ lực của chúng tôi là Qwen~3.8 2.4T, với 700 nghìn token mỗi lần triển khai, QwenGyre mang lại mức tăng tuyệt đối 6,0% trên NL2RepoBench (52,5% $\to$ 58,5%) trong 48 bước. Qua các đánh giá trên nhiều lĩnh vực tập dữ liệu đào tạo khác nhau, QwenGyre đạt tốc độ nhanh hơn tới $1,85\times$ và $1,78\times$ so với Colocate và Async.
| Chủ đề: | Học máy (cs.LG); Điện toán phân tán, song song và cụm (cs.DC) |
| Trích dẫn là: | arXiv:2609.33848 [cs.LG] |
| (hoặc arXiv:2609.33848v1 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33848 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Mouxiang Chen [xem email] [v1] Chủ nhật, 27 tháng 9 năm 2026 19:02:03 UTC (535 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.