26/09

Thứ Bảy · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnV-Rubrics: Tối ưu hóa học tăng cường đa phương thức với 350.000 tiêu chí đánh giá chi tiết

V-Rubrics giải quyết vấn đề 'phân bổ tín dụng' trong mô hình đa phương thức bằng cách chia nhỏ đánh giá thành các tiêu chí chi tiết, giúp mô hình học từ cả những suy luận đúng ngay cả khi kết quả cuối cùng sai.


Vì sao đáng đọc: Nghiên cứu quan trọng được chấp nhận tại EMNLP 2026, giải quyết bài toán hóc búa trong huấn luyện mô hình đa phương thức bằng phương pháp đánh giá phân đoạn sáng tạo.

24/09

Thứ Năm · 2 tin
Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 40/100

Cùng sự kiệnTencent Hunyuan: Nghiên cứu tối ưu hóa kích thước batch trong học tăng cường cho LLM

⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi…

DịchNghiên cứu từ Tencent Hunyuan cho thấy việc điều chỉnh learning rate giúp tăng hiệu suất huấn luyện GRPO và PPO, giúp tăng tốc độ xử lý lên 2,29 lần và tiết kiệm 29% thời gian huấn luyện.

Cùng sự kiện, bài đại diện «Tencent Hunyuan: Nghiên cứu mở rộng kích thước batch trong học tăng cường LLM»
Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 39/100

Tencent Hunyuan: Nghiên cứu mở rộng kích thước batch trong học tăng cường LLM

⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi…

DịchNhóm nghiên cứu Tencent Hunyuan tối ưu hóa học tăng cường cho LLM bằng cách mở rộng kích thước batch, giúp tăng tốc độ xử lý của PPO lên 2,29 lần và rút ngắn 29% thời gian huấn luyện GRPO mà vẫn đảm bảo hiệu suất.

16/09

Thứ Tư · 1 tin
Nathan Lambert@natolambert
NgànhĐiểm AI 43/100

Never Give Up: Phương pháp mới giúp GRPO chinh phục các bài toán khó

An basic idea in scaling RL: Can we allocate more compute to the harder problems? We did this: If …

DịchNghiên cứu mới giải quyết 'hiệu ứng Matthew' trong học tăng cường (RL) bằng cách buộc mô hình tiếp tục lấy mẫu khi gặp câu trả lời sai, giúp GRPO vượt qua giới hạn ở các bài toán phức tạp.

10/09

Thứ Năm · 1 tin
Hugging Face: Blog
Hướng dẫnĐiểm AI 61/100

Tinh chọnHugging Face tối ưu huấn luyện GRPO: Dùng LoRA và Storage Bucket tăng tốc 3.9 lần, loại bỏ NCCL

Hugging Face ra mắt AsyncGRPOTrainer giúp tách biệt quá trình huấn luyện LoRA và suy luận vLLM trên các máy chủ khác nhau mà không cần NCCL, giúp tăng tốc độ huấn luyện lên 3.9 lần.


Vì sao đáng đọc: Đây là giải pháp kỹ thuật thực tiễn cao, giải quyết bài toán khó về hạ tầng khi huấn luyện RLHF, giúp tiết kiệm tài nguyên và tăng hiệu suất đáng kể cho các kỹ sư AI.

07/09

Thứ Hai · 1 tin

03/09

Thứ Năm · 1 tin

18/08

Thứ Ba · 1 tin

17/08

Thứ Hai · 1 tin
swyx@swyx
Hướng dẫnĐiểm AI 26/100

Trajectory được swyx đánh giá cao trong lĩnh vực học liên tục (Continual Learning)

Trajectory have generally impressed me with their tasteful execution on ambitious goals. on our Cont…

DịchChuyên gia swyx khen ngợi Trajectory là đơn vị tiên phong trong học liên tục. Đội ngũ Trajectory đã chia sẻ giải pháp kỹ thuật vượt qua hạn chế của GRPO, chuyển hướng sang on-policy và tối ưu hóa các thuật toán như SDPO.

13/08

Thứ Năm · 1 tin
Tổng 10 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (27 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “GRPO” | AIHOT.vn