14/08

Thứ Sáu · 1 tin
WeChat: Ant Ling
Hướng dẫnĐiểm AI 62/100

Tinh chọnAnt Group và ASystem hiện thực hóa quy trình huấn luyện hậu kỳ cho Agentic RL trên một máy đơn lẻ

Ant Group và ASystem đã kết hợp Ling-3.0-tiny cùng thuật toán GSPO để tối ưu hóa quy trình huấn luyện hậu kỳ cho Agentic RL. Kết quả thử nghiệm trên cờ caro cho thấy hiệu suất mô hình cải thiện rõ rệt, ổn định khả năng gọi công cụ và rút ngắn độ dài phản hồi.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong việc tối ưu hóa huấn luyện Agent, giúp giảm rào cản hạ tầng cho các mô hình RL phức tạp.

12/08

Thứ Tư · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnLibra: Hệ thống tối ưu hóa tài nguyên cho Agentic RL, tăng tốc độ huấn luyện gấp 3 lần

Nhóm nghiên cứu từ CUHK và HSU giới thiệu Libra, hệ thống quản lý tài nguyên đột phá giúp giải quyết tình trạng mất cân bằng tải trong huấn luyện Agentic RL, tăng hiệu suất lên gấp 3 lần so với các phương pháp truyền thống.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng về tối ưu hóa hệ thống cho AI Agents, giải quyết bài toán thực tế về hiệu suất GPU trong huấn luyện RL, có giá trị cao cho kỹ sư và nhà nghiên cứu.
Tổng 2 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (18 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Agentic RL” | AIHOT.vn