Nghiên cứu
WanPE: Bước tiến mới trong tối ưu hóa câu lệnh cho video điện ảnh
(giờ Việt Nam)
Tóm tắt AI
WanPE là mô hình 397B tham số giúp nâng cao chất lượng câu lệnh, đảm bảo tính nhất quán ngữ nghĩa qua các cảnh quay và cải thiện đáng kể trải nghiệm người dùng khi vận hành Wan3.0.
Chính văn · Bản dịch AI
Tác giả: Yubo Zhu, Yawen Shao, Ziyun Dai, Zixun Fang, Kai Zhu, Siyang Sun, Haolan Xue, Chuxin Wang, Tingyu Weng, Jingming Luo, Chen Shi, Lianghua Huang, Yufeng Ai, Yuzheng Wang, Wenyuan Zhang, Yu Shang, Yuxiang Bao, Zoubin Bi, Jie Xiao, Jinbo Xing, Jiaxing Zhao, Chongyang Zhong, Hengjian Chen, Chenwei Xie, Akide Liu, Zhehan Kan, Yu Liu, Wei Zhai, Sheng Zhong, Wei Tong
Tóm tắt: Quá trình tạo video bắt đầu trong không gian văn bản bằng việc soạn thảo kịch bản điện ảnh, sau đó hiện thực hóa thành các điểm ảnh (pixel). Khi các trình tạo video đương đại mở rộng quy mô lên 30 giây và tuân thủ chính xác các điều kiện phức tạp, câu lệnh văn bản (prompt) đóng vai trò chủ đạo trong việc chỉ đạo sản xuất, lập kế hoạch cho các hành động, quỹ đạo camera, ánh sáng và âm thanh diễn ra xuyên suốt các chuỗi đa cảnh. Trong bài báo này, chúng tôi giới thiệu WanPE, một mô hình tăng cường câu lệnh với 397 tỷ tham số, được huấn luyện trên 1,05 triệu video thực tế để làm chủ khả năng lập kế hoạch điện ảnh ở cấp độ đạo diễn. WanPE xây dựng các kế hoạch điện ảnh theo từng cảnh thông qua phương pháp tái cấu trúc ngược dựa trên video và sử dụng Semantic-Consistency GRPO (SC-GRPO) để bảo toàn trung thực các yêu cầu của người dùng qua từng cảnh và theo thời gian. Để đánh giá khả năng này, chúng tôi xây dựng WanPEval, một bộ kiểm thử được con người chú giải, bao gồm thời lượng từ 5 đến 30 giây với các mức độ chi tiết ý định khác nhau, được hỗ trợ bởi khoảng 11.000 đánh giá mù theo cặp. Khi cung cấp sức mạnh cho trình tạo video Wan3.0, WanPE-397B giúp tăng mức độ ưu tiên của con người so với các câu lệnh gốc của người dùng từ 10,66-18,84 điểm ở thời lượng 5-15 giây và tăng vọt 50,86 điểm ở thời lượng 30 giây. Các nghiên cứu triệt tiêu (ablation studies) cho thấy phương pháp tái cấu trúc ngược thể hiện sự vượt trội rõ rệt so với phương pháp viết lại xuôi, trong khi SC-GRPO bảo toàn độ trung thực ngữ nghĩa một cách mạnh mẽ trên các quy mô mô hình khác nhau. Cuối cùng, WanPE dẫn đầu tất cả các sản phẩm thương mại được đánh giá ở phân khúc 5-15 giây và duy trì khả năng cạnh tranh với Seedance 2.5 ở phân khúc 30 giây.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.30221 [cs.CV] |
| (hoặc arXiv:2609.30221v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.30221 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Wei Tong [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 17:48:19 UTC (3.376 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.