Nghiên cứu
RewardVerse: Tối ưu hóa chính sách dựa trên tiêu chí đánh giá cho mô hình tạo video
(giờ Việt Nam)
Tóm tắt AI
RewardVerse giải quyết vấn đề điểm số không ổn định trong mô hình tạo video bằng cách sử dụng hệ thống đánh giá dựa trên tiêu chí (rubric), giúp việc chấm điểm trở nên nhất quán và đáng tin cậy hơn cho học tăng cường.
Chính văn · Bản dịch AI
Tóm tắt: Học tăng cường (RL) đóng vai trò thiết yếu trong việc tối ưu hóa các mô hình tạo video, với mô hình phần thưởng (RM) mạnh mẽ là nền tảng cốt lõi. Tuy nhiên, các mô hình phần thưởng video hiện nay thường tạo ra các điểm số vô hướng không ổn định vì chúng ánh xạ trực tiếp chất lượng video phức tạp, mang tính chủ quan thành một điểm số duy nhất mà không có tiêu chí đánh giá rõ ràng. Điều này dẫn đến hiện tượng trôi vô hướng (scalar drift), nơi thang điểm bị sụp đổ hoặc thay đổi giữa các câu lệnh (prompt) khác nhau, khiến phần thưởng trở nên thiếu tin cậy đối với RL. Lấy cảm hứng từ kỹ thuật chú thích của con người chuyên nghiệp, chúng tôi giải quyết vấn đề này với RewardVerse, một khung phần thưởng video dựa trên tiêu chí (rubric-based), giới thiệu một bộ tiêu chí động làm đại diện trung gian giữa truy vấn đánh giá và bộ chấm điểm. Thay vì chấm điểm trực tiếp không bị ràng buộc, RewardVerse trước tiên tạo ra các tiêu chí đánh giá rõ ràng và sau đó thực hiện chấm điểm dựa trên tiêu chí, cung cấp một điểm neo ngữ nghĩa ổn định giúp giảm thiểu hiện tượng trôi vô hướng. Để tối ưu hóa quy trình cộng tác này một cách hiệu quả, chúng tôi đề xuất Rubric-Guided Policy Optimization (RGPO), một thuật toán huấn luyện hai giai đoạn. RGPO trước tiên khởi động bộ chấm điểm bằng cách sử dụng các tiêu chí hạt giống tự tiến hóa, sau đó tối ưu hóa đồng thời bộ tạo tiêu chí để tạo ra các tiêu chí đánh giá thích ứng với truy vấn, đồng thời liên tục căn chỉnh bộ chấm điểm với xếp hạng của con người. Các thử nghiệm mở rộng trên bộ tiêu chuẩn EvalVerse 16 chiều và các tập dữ liệu bên ngoài chứng minh rằng RewardVerse giúp giảm thiểu hiện tượng trôi vô hướng, đạt hiệu suất tiên tiến nhất (state-of-the-art) trên cả đánh giá theo điểm và theo cặp, đồng thời cung cấp tín hiệu phần thưởng mạnh mẽ và có thể diễn giải cho RL trong tạo video.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.22947 [cs.CV] |
| (hoặc arXiv:2609.22947v2 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.22947 DOI do arXiv cấp thông qua DataCite |
Lịch sử gửi bài
Từ: Zhenchen Tang [xem email] v1 Thứ Bảy, 19 tháng 9 năm 2026 11:01:14 UTC (949 KB) [v2] Thứ Tư, 23 tháng 9 năm 2026 02:00:44 UTC (949 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.