25/09

Thứ Sáu · 1 tin

24/09

Thứ Năm · 1 tin

22/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Sản phẩmĐiểm AI 50/100

White Circle ra mắt Halo: Framework hậu huấn luyện mã nguồn mở hiệu suất cao

White Circle just unveiled Halo, an open-source, distributed post-training framework for models that…

DịchHalo là framework hậu huấn luyện phân tán giúp tối ưu hóa hiệu suất vượt trội so với HuggingFace TRL, đạt tốc độ nhanh gấp 2.8 lần và tiết kiệm 25% bộ nhớ mà vẫn giữ nguyên định dạng mô hình gốc.

17/09

Thứ Năm · 1 tin

16/09

Thứ Tư · 3 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 53/100

Học tăng cường khiến LLM mạnh càng thêm mạnh: Phương pháp 'Never Give Up' giải mã các bài toán khó

Nghiên cứu mới chỉ ra hiệu ứng Matthew trong huấn luyện RL khiến các mô hình mạnh tiến bộ nhanh hơn, trong khi các bài toán khó nhất vẫn bị bỏ ngỏ. Tác giả đề xuất phương pháp 'Never Give Up' để khắc phục hạn chế này.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnNever Give Up: Tối ưu hóa học tăng cường cho LLM bằng cách tập trung vào các bài toán khó

Nghiên cứu chỉ ra rằng RL hiện nay thường lãng phí tài nguyên vào các bài toán dễ. Phương pháp Never Give Up (NGU) đề xuất cơ chế lấy mẫu thích ứng, giúp phân bổ lại tài nguyên tính toán để giải quyết hiệu quả các bài toán khó mà mô hình chưa làm tốt.


Vì sao đáng đọc: Đề xuất giải pháp thực tiễn cho vấn đề 'Hiệu ứng Matthew' trong RL, giúp cải thiện hiệu suất huấn luyện LLM một cách thông minh và tiết kiệm tài nguyên.
Nathan Lambert@natolambert
NgànhĐiểm AI 43/100

Never Give Up: Phương pháp mới giúp GRPO chinh phục các bài toán khó

An basic idea in scaling RL: Can we allocate more compute to the harder problems? We did this: If …

DịchNghiên cứu mới giải quyết 'hiệu ứng Matthew' trong học tăng cường (RL) bằng cách buộc mô hình tiếp tục lấy mẫu khi gặp câu trả lời sai, giúp GRPO vượt qua giới hạn ở các bài toán phức tạp.

12/09

Thứ Bảy · 2 tin
Testing Catalog@testingcatalog
Hướng dẫnĐiểm AI 55/100

Elon Musk hoãn ra mắt Grok 4.7 do lỗi tối ưu hóa độ dài phản hồi

SPACEXAI 🔥: Grok 4.7 has been delayed for few more Elon days. The second half of September will b…

DịchElon Musk cho biết Grok 4.7 cần thêm thời gian tinh chỉnh vì thuật toán học tăng cường (RL) đang phạt quá nặng các phản hồi dài, khiến mô hình bỏ cuộc sớm. Trong khi đó, sự cạnh tranh từ OpenAI và Meta vào cuối tháng 9 đang tạo áp lực lớn cho phiên bản này.

10/09

Thứ Năm · 1 tin
Hugging Face: Blog
Hướng dẫnĐiểm AI 61/100

Tinh chọnHugging Face tối ưu huấn luyện GRPO: Dùng LoRA và Storage Bucket tăng tốc 3.9 lần, loại bỏ NCCL

Hugging Face ra mắt AsyncGRPOTrainer giúp tách biệt quá trình huấn luyện LoRA và suy luận vLLM trên các máy chủ khác nhau mà không cần NCCL, giúp tăng tốc độ huấn luyện lên 3.9 lần.


Vì sao đáng đọc: Đây là giải pháp kỹ thuật thực tiễn cao, giải quyết bài toán khó về hạ tầng khi huấn luyện RLHF, giúp tiết kiệm tài nguyên và tăng hiệu suất đáng kể cho các kỹ sư AI.

09/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Ra mắt Miles v0.1: Hệ thống RL mã nguồn mở chuyên dụng cho hậu huấn luyện cấp sản xuất

Miles v0.1 là hệ thống hậu huấn luyện toàn diện, tối ưu cho môi trường sản xuất, giúp chuẩn hóa quy trình huấn luyện RL với thiết kế linh hoạt, dễ tùy chỉnh và kiểm chứng.

05/09

Thứ Bảy · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 44/100

Tại sao tư duy coi LLM chỉ là 'máy dự đoán token tiếp theo' đã lỗi thời?

Tác giả lập luận rằng việc coi LLM chỉ là máy dự đoán token là cách hiểu phiến diện. Với sự hỗ trợ của RLHF và RLVR, các mô hình hiện nay đã vượt xa khả năng bắt chước văn bản thuần túy, hoạt động giống như các cỗ máy tìm kiếm giải pháp tối ưu thay vì chỉ sao chép dữ liệu huấn luyện.

25/08

Thứ Ba · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

Vượt qua giới hạn ổn định: ERPO - Phương pháp chính quy hóa môi trường tối ưu hóa chiến lược LLM

Nghiên cứu giới thiệu ERPO, phương pháp chuyển chính quy hóa từ hành động sang đầu vào giúp cân bằng giữa tính ổn định và khả năng khám phá của LLM. ERPO cải thiện đáng kể độ chính xác trong suy luận toán học mà không làm tăng chi phí tính toán.

21/08

Thứ Sáu · 1 tin
Dex Horthy (HumanLayer)@dexhorthy
Hướng dẫnĐiểm AI 24/100

Mô hình AI 'lắm lời' đến mức người dùng phải nhắc nhở giữ im lặng mỗi lượt chat

i have not verified this but this is absolutely bananas if true. How hard did they RL-fry our boy to…

DịchNgười dùng phản ánh các mô hình AI hiện nay gặp vấn đề nghiêm trọng về tuân thủ chỉ dẫn, buộc họ phải liên tục nhắc nhở AI không được nói lan man. Điều này đặt ra nghi vấn về việc quá trình huấn luyện RL (Học tăng cường) đang bị đẩy đi quá xa.

20/08

Thứ Năm · 1 tin

18/08

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

SA-MRPO: Phương pháp tối ưu hóa đa mục tiêu trong học tăng cường giúp tránh lãng phí tài nguyên tính toán

SA-MRPO giải quyết vấn đề các mục tiêu đã bão hòa vẫn tiêu tốn tài nguyên bằng cách chuẩn hóa độc lập và điều chỉnh trọng số thích ứng, giúp cải thiện hiệu suất đáng kể trong các bài toán suy luận và lập trình.

Tổng 17 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (32 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “RLHF” | AIHOT.vn