Nghiên cứu
AV-GRPO: Khung học tăng cường khuếch tán tách biệt đa phương thức cho tạo video-âm thanh đồng bộ
(giờ Việt Nam)
Tóm tắt AI
AV-GRPO là khung học tăng cường khuếch tán trực tuyến giúp tách biệt các ưu tiên đa phương thức thành bài toán đơn lẻ, tối ưu hóa sự đồng bộ giữa âm thanh và hình ảnh. Kết quả thực nghiệm trên JavisBench và VABench cho thấy hiệu suất vượt trội so với LTX-2.3 trong việc căn chỉnh ngữ nghĩa và chất lượng tạo nội dung.
Chính văn · Bản dịch AI
Tóm tắt: Những năm gần đây đã chứng kiến bước tiến lớn trong việc tạo nội dung âm thanh-hình ảnh kết hợp. Các mô hình hiện tại vẫn gặp hạn chế về độ trung thực của từng phương thức, sự căn chỉnh văn bản-phương thức chưa đầy đủ và khả năng đồng bộ hóa đa phương thức còn yếu. Mặc dù hậu huấn luyện bằng học tăng cường (reinforcement-learning post-training) mang lại giải pháp đầy hứa hẹn, việc áp dụng trực tiếp vào tạo nội dung âm thanh-hình ảnh kết hợp lại rất thách thức. Các phần thưởng đa phương thức không đồng nhất làm rối loạn tín hiệu học tập và gây khó khăn cho việc phân bổ tín dụng (credit assignment). Việc tối ưu hóa đồng thời hai tháp phương thức (modality towers) rất tốn kém về mặt tính toán do động lực học khác biệt của chúng. Hơn nữa, độ khó trong việc đánh giá đồng bộ hóa phụ thuộc vào các mẫu ghép cặp, ngăn cản việc so sánh phần thưởng công bằng. Chúng tôi đề xuất AV-GRPO, một khung RL khuếch tán trực tuyến dựa trên phương thức (modality-anchored), và 5DAV, một tập dữ liệu huấn luyện tách rời, có thể kiểm soát độ khó. AV-GRPO bao gồm ba mô-đun chính: (1) triển khai dựa trên phương thức để tách biệt các tín hiệu học tập và ổn định độ khó; (2) tối ưu hóa tháp đóng băng khóa quỹ đạo (trajectory-locked frozen-tower optimization) để giảm chi phí và tái phân bổ tín dụng; (3) các mục tiêu thích ứng và cường độ nhiễu được thiết kế riêng cho động lực học đặc thù của từng phương thức. Điều này chuyển đổi việc học ưu tiên đa phương thức kết hợp thành các bài toán con đơn phương thức để phân bổ phần thưởng chính xác và đồng bộ hóa tốt hơn. Tập dữ liệu 5DAV của chúng tôi tách rời các mẫu trên năm chiều để huấn luyện có hệ thống. Các thí nghiệm trên JavisBench và VABench chứng minh AV-GRPO vượt trội hơn LTX-2.3 về chất lượng tạo nội dung, căn chỉnh ngữ nghĩa và đồng bộ hóa đa phương thức trong cả LoRA và tinh chỉnh toàn phần (full fine-tuning). Các thử nghiệm triệt tiêu (ablations) xác nhận tính hiệu quả của các thiết kế của chúng tôi. Mã nguồn và dữ liệu: URL này
| Bình luận: | 22 trang |
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Âm thanh (cs.SD) |
| Trích dẫn là: | arXiv:2609.29816 [cs.CV] |
| (hoặc arXiv:2609.29816v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.29816 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Zhiyu Xu [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 13:53:05 UTC (11.284 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.