Nghiên cứu chỉ ra rằng việc tối ưu hóa học tăng cường với bộ kiểm chứng (RLVR) có thể cải thiện hiệu suất hiện tại nhưng lại làm giảm khả năng khám phá các hành vi thành công trong tương lai, gây ra sự suy giảm đa dạng trong các phản hồi mô hình.
Nghiên cứu giới thiệu phương pháp CaRL giúp LLM nhận diện giới hạn năng lực của chính mình, từ đó từ chối trả lời thay vì đưa ra các suy luận sai lệch nhưng nghe có vẻ thuyết phục.
Vì sao đáng đọc: Giải quyết vấn đề 'ảo tưởng' (hallucination) và suy luận sai của LLM bằng cách huấn luyện mô hình biết thừa nhận giới hạn, một bước tiến quan trọng cho độ tin cậy của AI.
SKILLER giải quyết thách thức trong việc tự động tạo các kỹ năng hiệu quả cho mô hình ngôn ngữ nhỏ, giúp giảm chi phí vận hành tác vụ mà vẫn đảm bảo hiệu suất cao trên phần cứng phổ thông.
7.9B total. 1.3B active. One DGX Spark. No cluster. Ling-3.0-tiny × ASystem AReno closes the Agentic…
DịchVới 7.9B tham số, Ling-3.0-tiny kết hợp cùng ASystem AReno cho phép thực hiện quy trình học tăng cường (RL) khép kín ngay trên một máy chủ DGX Spark, giúp tối ưu hóa việc lặp lại và huấn luyện mô hình mà không cần cụm máy chủ phức tạp.
Intern-S2-Preview là dòng mô hình nền tảng đa phương thức chuyên dụng cho nghiên cứu khoa học, hỗ trợ suy luận phức tạp và xử lý chuỗi thời gian dài với hiệu suất vượt trội trên nhiều tiêu chuẩn đánh giá.
Nghiên cứu giới thiệu phương pháp 3PO, thay đổi cách khám phá trong học tăng cường cho LLM bằng cách lấy mẫu các tham số mô hình thay vì chỉ điều chỉnh phân phối đầu ra, giúp cải thiện hiệu suất huấn luyện.
Nhóm OpenMOSS giới thiệu World Critic Model (WCM), giúp mô hình VLA không chỉ đánh giá hiện tại mà còn dự đoán trạng thái tương lai, giải quyết triệt để hạn chế của việc chỉ nhìn ảnh tĩnh trong điều khiển robot.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực robot học, giải quyết vấn đề cốt lõi của VLA-RL bằng cách kết hợp dự đoán thế giới vào mô hình đánh giá, có tính ứng dụng thực tế cao.
Nhóm nghiên cứu từ CUHK và HSU giới thiệu Libra, hệ thống quản lý tài nguyên đột phá giúp giải quyết tình trạng mất cân bằng tải trong huấn luyện Agentic RL, tăng hiệu suất lên gấp 3 lần so với các phương pháp truyền thống.
Vì sao đáng đọc: Đây là nghiên cứu quan trọng về tối ưu hóa hệ thống cho AI Agents, giải quyết bài toán thực tế về hiệu suất GPU trong huấn luyện RL, có giá trị cao cho kỹ sư và nhà nghiên cứu.
Tổng 8 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (9 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả
Chủ đề
Kênh
Đang lọc:Thẻ: Học tăng cường
Toàn bộ tin AI · Thẻ “Học tăng cường” — Trang 5 | AIHOT.vn