Hôm qua · 27/09

Chủ Nhật · 1 tin

24/09

Thứ Năm · 2 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 49/100

NVIDIA Skill2Env: Chuyển đổi kỹ năng Agent thành môi trường RL tự động

Exciting work from NVIDIA. (bookmark it) Interesting to see this approach to turn public Agent Ski…

DịchNVIDIA giới thiệu Skill2Env, công cụ chuyển đổi hơn 3.400 kỹ năng Agent thành gần 8.000 nhiệm vụ RL thực thi được trên 13 lĩnh vực, sử dụng GPT-5.6 Sol với chi phí API lên tới 90.000 USD.

23/09

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tối ưu hóa huấn luyện Reinforcement Learning cho LLM với định dạng FP8 toàn trình

Nghiên cứu giải quyết tình trạng mất ổn định khi huấn luyện RL cho LLM bằng FP8, vốn gây ra lỗi sai lệch gradient và làm giảm chất lượng mô hình. Nhóm tác giả đề xuất phương pháp mới giúp duy trì độ chính xác và hiệu suất huấn luyện ổn định hơn.

22/09

Thứ Ba · 4 tin
JiQiZhiXin
Mô hìnhĐiểm AI 92/100

Tinh chọnKhi sở hữu 10.000 hay 100.000 GPU: Làm thế nào để mở rộng quy mô huấn luyện RL?

Bài viết phân tích chiến lược tối ưu hóa Batch Size trong huấn luyện Reinforcement Learning (RL) quy mô lớn, giúp cân bằng giữa hiệu suất tính toán và thời gian huấn luyện để tiết kiệm chi phí vận hành hàng triệu USD.


Vì sao đáng đọc: Chủ đề cực kỳ thực tế cho các kỹ sư AI và doanh nghiệp đang chạy mô hình lớn, phân tích sâu về bài toán tối ưu hóa chi phí và hiệu suất phần cứng.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

One to More, More to One: Huấn luyện chuyên gia lặp theo danh mục cho tác nhân kỹ thuật phần mềm

Nghiên cứu giới thiệu khung huấn luyện tác nhân AI dựa trên việc phân loại nhiệm vụ kỹ thuật phần mềm, giúp giải quyết tình trạng hiệu suất không đồng đều giữa các nhóm tác vụ khác nhau thông qua cơ chế củng cố hành vi và chọn lọc tác vụ thích ứng.

Nathan Lambert@natolambert
Quan điểmĐiểm AI 27/100

Tại sao môi trường RL mã nguồn mở chất lượng cao lại là 'chìa khóa vàng' cho AI?

Strong agree. There's way less of this than I would expect - partially due to the fact that making a…

DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.

Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Quan điểmĐiểm AI 41/100

Đồng sáng lập Hugging Face kêu gọi mở nguồn các môi trường RL chất lượng cao

releasing many high quality open-source RL environments is the most impactful thing anyone can do to…

DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.

19/09

Thứ Bảy · 1 tin
Hongming@hongming731
Quan điểmĐiểm AI 35/100

Cùng sự kiệnĐiểm tin AI: Anthropic và công thức huấn luyện RL cho Agent 397B đột phá

Bản tin tổng hợp 10 nội dung nổi bật, tiêu điểm là công thức huấn luyện RL cho Agent 397B từ các chuyên gia OpenAI o1 và tác giả LoRA, giúp cải thiện hiệu suất Pass@1 lên tới 70%.

Cùng sự kiện, bài đại diện «Anthropic công bố số liệu: Claude tự động hóa 26% quy trình phát triển phần mềm nội bộ»

17/09

Thứ Năm · 1 tin

09/09

Thứ Tư · 2 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 47/100

Cùng sự kiệnMicrosoft ra mắt FrogNano: Mô hình lập trình 4B tham số huấn luyện thuần bằng Reinforcement Learning

Super cool paper from Microsoft. They show that it's possible to build competitive small coding ag…

DịchMicrosoft giới thiệu FrogNano, mô hình lập trình 4B tham số được huấn luyện hoàn toàn bằng học tăng cường (RL) mà không cần chưng cất tri thức từ các mô hình lớn. Phương pháp này chứng minh rằng việc tập trung vào các tác vụ tự tổng hợp phù hợp với khả năng của mô hình giúp tối ưu hiệu suất vượt trội.

Cùng sự kiện, bài đại diện «Microsoft ra mắt FrogNano: Tác nhân AI 4B tham số tự học lập trình qua Reinforcement Learning»
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 59/100

Microsoft ra mắt FrogNano: Tác nhân AI 4B tham số tự học lập trình qua Reinforcement Learning

Banger report from Microsoft. (bookmark it) They show that it's possible to build competitive smal…

DịchMicrosoft giới thiệu FrogNano, mô hình 4B tham số tự học lập trình trên 1.500 môi trường phần mềm bằng Reinforcement Learning mà không cần chưng cất từ mô hình lớn. Điểm đột phá nằm ở quy trình tổng hợp nhiệm vụ trực tuyến giúp tối ưu hóa khả năng học tập của mô hình.

Thêm 1 nguồn khác đưa tinX: Elvis Saravia (@omarsar0, DAIR.AI)

27/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

RL suy luận theo đoạn tiếp theo có thực sự vượt trội hơn SFT? Đánh giá lại chiến lược huấn luyện với dữ liệu không có CoT

Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.

24/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Meta công bố EvoHarness-RL: Đưa Qwen3-8B đạt hiệu suất 96.9% trong tác vụ ALFWorld

New Meta paper says giving an agent more memory and tools is not enough if the agent never learns wh…

DịchNghiên cứu mới từ Meta giới thiệu EvoHarness-RL, phương pháp huấn luyện RL giúp AI tự quyết định thời điểm dùng công cụ thay vì truy cập liên tục, giúp Qwen3-8B tăng vọt hiệu suất giải quyết tác vụ phức tạp.

Tổng 14 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (32 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Reinforcement Learning” | AIHOT.vn