Rufus-Air công bố quy trình hậu huấn luyện có thể tái lập cho GLM-4.5-Air-Base (106B-A12B), bao gồm 8 giai đoạn từ SFT, RLHF đến các tác nhân chuyên biệt như Coding và Search Agent.
Nghiên cứu thiết lập các điều kiện toán học để định nghĩa tín dụng ở cấp độ token, từ đó giải thích cơ chế của các thuật toán hiện tại và đề xuất quy trình huấn luyện actor-critic tối ưu hơn cho LLM.
White Circle just unveiled Halo, an open-source, distributed post-training framework for models that…
DịchHalo là framework hậu huấn luyện phân tán giúp tối ưu hóa hiệu suất vượt trội so với HuggingFace TRL, đạt tốc độ nhanh gấp 2.8 lần và tiết kiệm 25% bộ nhớ mà vẫn giữ nguyên định dạng mô hình gốc.
Meshy là khung huấn luyện RL mới giúp loại bỏ sự phụ thuộc vào các framework điều phối phức tạp như Ray, thay vào đó sử dụng kiến trúc hướng dữ liệu và SPMD để tối ưu hóa hiệu suất và khả năng mở rộng cho các hệ thống RL hiện đại.
Nghiên cứu mới chỉ ra hiệu ứng Matthew trong huấn luyện RL khiến các mô hình mạnh tiến bộ nhanh hơn, trong khi các bài toán khó nhất vẫn bị bỏ ngỏ. Tác giả đề xuất phương pháp 'Never Give Up' để khắc phục hạn chế này.
Nghiên cứu chỉ ra rằng RL hiện nay thường lãng phí tài nguyên vào các bài toán dễ. Phương pháp Never Give Up (NGU) đề xuất cơ chế lấy mẫu thích ứng, giúp phân bổ lại tài nguyên tính toán để giải quyết hiệu quả các bài toán khó mà mô hình chưa làm tốt.
Vì sao đáng đọc: Đề xuất giải pháp thực tiễn cho vấn đề 'Hiệu ứng Matthew' trong RL, giúp cải thiện hiệu suất huấn luyện LLM một cách thông minh và tiết kiệm tài nguyên.
An basic idea in scaling RL: Can we allocate more compute to the harder problems? We did this: If …
DịchNghiên cứu mới giải quyết 'hiệu ứng Matthew' trong học tăng cường (RL) bằng cách buộc mô hình tiếp tục lấy mẫu khi gặp câu trả lời sai, giúp GRPO vượt qua giới hạn ở các bài toán phức tạp.
DịchTailSFT là giải pháp hậu huấn luyện nhẹ nhàng và hiệu quả, giúp cải thiện độ bao phủ và nâng cao hiệu suất RL cho các mô hình ngôn ngữ như Olmo 3 mà không tốn kém chi phí như các phương pháp truyền thống.
SPACEXAI 🔥: Grok 4.7 has been delayed for few more Elon days. The second half of September will b…
DịchElon Musk cho biết Grok 4.7 cần thêm thời gian tinh chỉnh vì thuật toán học tăng cường (RL) đang phạt quá nặng các phản hồi dài, khiến mô hình bỏ cuộc sớm. Trong khi đó, sự cạnh tranh từ OpenAI và Meta vào cuối tháng 9 đang tạo áp lực lớn cho phiên bản này.
Hugging Face ra mắt AsyncGRPOTrainer giúp tách biệt quá trình huấn luyện LoRA và suy luận vLLM trên các máy chủ khác nhau mà không cần NCCL, giúp tăng tốc độ huấn luyện lên 3.9 lần.
Vì sao đáng đọc: Đây là giải pháp kỹ thuật thực tiễn cao, giải quyết bài toán khó về hạ tầng khi huấn luyện RLHF, giúp tiết kiệm tài nguyên và tăng hiệu suất đáng kể cho các kỹ sư AI.
09/09
Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Miles v0.1 là hệ thống hậu huấn luyện toàn diện, tối ưu cho môi trường sản xuất, giúp chuẩn hóa quy trình huấn luyện RL với thiết kế linh hoạt, dễ tùy chỉnh và kiểm chứng.
Tác giả lập luận rằng việc coi LLM chỉ là máy dự đoán token là cách hiểu phiến diện. Với sự hỗ trợ của RLHF và RLVR, các mô hình hiện nay đã vượt xa khả năng bắt chước văn bản thuần túy, hoạt động giống như các cỗ máy tìm kiếm giải pháp tối ưu thay vì chỉ sao chép dữ liệu huấn luyện.
Nghiên cứu giới thiệu ERPO, phương pháp chuyển chính quy hóa từ hành động sang đầu vào giúp cân bằng giữa tính ổn định và khả năng khám phá của LLM. ERPO cải thiện đáng kể độ chính xác trong suy luận toán học mà không làm tăng chi phí tính toán.
ARC giải quyết vấn đề thiên kiến trong mô hình phần thưởng khi tương tác với người dùng, giúp AI học cách phản hồi linh hoạt và phù hợp với ngữ cảnh thay vì chỉ chạy theo tối ưu hóa phần thưởng đơn thuần.
i have not verified this but this is absolutely bananas if true. How hard did they RL-fry our boy to…
DịchNgười dùng phản ánh các mô hình AI hiện nay gặp vấn đề nghiêm trọng về tuân thủ chỉ dẫn, buộc họ phải liên tục nhắc nhở AI không được nói lan man. Điều này đặt ra nghi vấn về việc quá trình huấn luyện RL (Học tăng cường) đang bị đẩy đi quá xa.
Bài viết hướng dẫn quy trình từ A-Z sử dụng TRL và LoRA để huấn luyện mô hình Qwen2.5 bằng DPO, tập trung vào việc phát hiện thiên kiến và đánh giá hiệu suất mô hình.
SA-MRPO giải quyết vấn đề các mục tiêu đã bão hòa vẫn tiêu tốn tài nguyên bằng cách chuẩn hóa độc lập và điều chỉnh trọng số thích ứng, giúp cải thiện hiệu suất đáng kể trong các bài toán suy luận và lập trình.