# Google Research ra mắt AI Video Co-Director: Hệ thống 4 tác nhân tạo video dài nhất quán

- Nguồn: MarkTechPost
- Thời gian phát hành: 2026-09-28 09:44 (giờ Việt Nam)
- Điểm AI: 64/100
- Link AIHOT.vn: https://aihot.vn/items/0cde861dd566ee65
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuknsyrq1yf2ro9h5u9s4a1u
- Link gốc: https://www.marktechpost.com/2026/09/27/google-research-introduces-an-ai-video-co-director-4-agentic-frameworks-for-coherent-minutes-long-video-generation

## Tóm tắt AI

Google Research giới thiệu khung làm việc gồm 4 tác nhân AI chạy trên Gemini và Veo, giúp giải quyết triệt để vấn đề sai lệch nhận diện và lỗi logic trong các video dài nhiều cảnh quay.

## Thân bài

![Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation](https://www.marktechpost.com/wp-content/uploads/2026/09/blog111-31.png)

[Google Research](https://research.google/blog/coherent-long-form-video-generation/) vừa giới thiệu một AI đồng đạo diễn video dành cho việc tạo video dài. Bộ khung gồm 4 tác nhân (agentic frameworks) này biến các đoạn clip ngắn thành những câu chuyện mạch lạc kéo dài hàng phút. Nó nhắm đến việc giải quyết tình trạng mất nhận diện (identity drift) và lỗi dây chuyền (cascading errors) – hai thất bại khiến hầu hết các quy trình tạo video AI đa cảnh hiện nay bị đổ vỡ.

### Tại sao các video AI dài thường thất bại

Các mô hình khuếch tán (diffusion models) có thể dựng các clip độ phân giải cao trong vài giây, nhưng việc ghép chúng thành một câu chuyện lại khó khăn hơn. Hầu hết các quy trình tác nhân đều liên kết các mô-đun bằng những câu lệnh (prompt) thủ công độc lập. Điều này gây ra [trôi dạt ngữ nghĩa](https://arxiv.org/abs/2511.17986), khiến trang phục hoặc bối cảnh thay đổi giữa các cảnh quay. Nó cũng gây ra [lỗi dây chuyền](https://arxiv.org/abs/2606.24976), nơi một tài sản đầu vào bị lỗi sẽ làm hỏng mọi cảnh quay sau đó.

Nhóm nghiên cứu của Google coi đây là vấn đề phân bổ tín dụng (credit assignment problem). Một video cuối cùng bị lỗi rất khó để truy ngược lại câu lệnh nào đã gây ra nó.

### Cách thức hoạt động của AI đồng đạo diễn video

Hệ thống này vận hành dựa trên [Gemini](https://deepmind.google/models/gemini/pro/) và Veo. Nó không phụ thuộc vào mô hình cụ thể (model-agnostic), vì vậy cùng một lớp này có thể điều khiển các trình tạo video khác. Các đầu ra được kế thừa tính năng đóng dấu bản quyền [SynthID](https://deepmind.google/models/synthid/) từ các mô hình cơ sở.

### 1. Co-Director: lập kế hoạch sáng tạo dưới dạng tìm kiếm bandit

[Co-Director](https://arxiv.org/abs/2604.24842), được chấp nhận tại COLM 2026, sử dụng thuật toán multi-armed bandit (MAB). Một Tác nhân Điều phối (Orchestrator Agent) sẽ chọn cấu hình dựa trên Chiến lược Sáng tạo, Chế độ Tường thuật và Nguyên mẫu Thẩm mỹ. Một Tác nhân Tiền kỳ sẽ xây dựng bảng phân cảnh (storyboard). Các tác nhân phụ về Khung hình chính, Video và Âm thanh sẽ tạo ra nội dung. Sau đó, một MLLM Judge sẽ chấm điểm đoạn cắt và gửi phần thưởng phân tách ngược lại cho bandit.

### 2. CANVAS: bộ nhớ hình ảnh bền vững

[CANVAS](https://arxiv.org/abs/2604.13452), được chấp nhận tại EMNLP 2026, theo dõi các nhân vật, địa điểm và trạng thái đối tượng khi câu chuyện phát triển. Nó truy xuất các điểm neo hình ảnh đã lưu trữ khi một cảnh quay trở lại. Trong thử nghiệm vụ trộm bảo tàng của Google, [AutoStudio](https://arxiv.org/abs/2406.01388) đã làm mất chiếc mũ của tên trộm và Gemini-3.1-Pro đã làm thay đổi viên đá quý. CANVAS đã giữ cho cả hai yếu tố này nhất quán.

### 3. A²RD: video dài theo từng phân đoạn

[A²RD](https://arxiv.org/abs/2605.06924) (Agentic Autoregressive Diffusion) là một kiến trúc không cần huấn luyện. Mỗi phân đoạn chạy một vòng lặp Truy xuất, Tổng hợp, Tinh chỉnh, Cập nhật dựa trên bộ nhớ video đa phương thức. Tác nhân chuyển đổi giữa ngoại suy (extrapolation) cho các nhịp truyện mới và nội suy (interpolation) cho các thực thể quay trở lại. Google đã chia sẻ một [bộ phim dài 10 phút](https://www.youtube.com/watch?v=jaLZK8Zb6Kc) được tạo theo cách này.

### 4. VQQA: tinh chỉnh câu lệnh vòng lặp kín

[VQQA](https://arxiv.org/abs/2603.12310) (Video Quality Question Answering) tạo ra các câu hỏi về hình ảnh cho mỗi câu lệnh. Các đánh giá từ VLM đóng vai trò như những "gradient ngữ nghĩa" để viết lại câu lệnh văn bản. Nó không cần truy cập vào cấu trúc bên trong của mô hình. Bước Lựa chọn Toàn cục (Global Selection) sẽ chọn ra video tốt nhất trong tất cả các lần lặp, thay vì chỉ chọn lần cuối cùng.

### Các tiêu chuẩn đánh giá và kết quả

Google đã xây dựng 3 tiêu chuẩn đánh giá mới. [GenAD-Bench](https://co-director-agent.github.io/genad_bench.html) có 400 kịch bản quảng cáo trên 200 sản phẩm hư cấu từ 50 thương hiệu. HardContinuityBench kiểm tra khả năng xuất hiện lại của cảnh quay và thay đổi trạng thái đạo cụ. [LVBench-C](https://github.com/dxlong2000/AARD) có 120 kịch bản nơi các tài sản chính biến mất trong ít nhất 10 phân đoạn trước khi quay trở lại.

- Co-Director: đạt trung bình 81.4 điểm trên GenAD-Bench và 3.96/5 điểm đánh giá từ con người, theo [trang dự án](https://co-director-agent.github.io/). Các mô hình đối chứng bao gồm Veo 3.1, Kling 3.0 Omni, Wan 2.6 và MovieAgent.
- CANVAS: đạt mức tăng 21.6% về tính liên tục của bối cảnh, 9.6% về tính nhất quán của nhân vật và 7.6% về tính nhất quán của đạo cụ.
- A²RD: cải thiện tới 30% về tính nhất quán và 20% về tính mạch lạc của câu chuyện trên các video dài từ 1 đến 10 phút.
- VQQA: đạt mức tăng tuyệt đối 11.57% trên [T2V-CompBench](https://github.com/KaiyueSun98/T2V-CompBench) và 8.43% trên [VBench2](https://github.com/Vchitect/VBench) so với việc tạo video thông thường.

### So sánh

| Tính năng | Google AI Video Co-Director | StoryMem (ByteDance, NTU) | MovieAgent (Show Lab, NUS) | AutoStudio |
| --- | --- | --- | --- | --- |
| Đầu ra | Video đa cảnh dài hàng phút với lời bình và nhạc nền | Video đa cảnh dài một phút | Video đa cảnh, nhiều góc quay với phụ đề và âm thanh | Chuỗi hình ảnh đa lượt (không phải video) |
| Kiến trúc | 4 khung làm việc trong lớp điều phối đa tác nhân phân cấp | Mô hình khuếch tán bộ nhớ-sang-video, từng cảnh một | Lập kế hoạch chuỗi tư duy đa tác nhân (đạo diễn, biên kịch, họa sĩ phân cảnh, quản lý bối cảnh) | 3 tác nhân LLM cộng với một tác nhân dựa trên Stable Diffusion |
| Cơ chế nhất quán | Bộ nhớ hình ảnh bền vững (CANVAS) và bộ nhớ video đa phương thức (A²RD) | Ngân hàng bộ nhớ khung hình chính từ các cảnh trước | Lập kế hoạch phân cấp cộng với tùy chỉnh theo từng nhân vật | Quản lý đối tượng cộng với Parallel-UNet |
| Vòng lặp tự sửa lỗi | Tìm kiếm bandit với MLLM Judge; tinh chỉnh câu lệnh VQQA với Global Selection | Lựa chọn khung hình chính ngữ nghĩa và lọc thẩm mỹ | Không báo cáo | Không báo cáo |
| Huấn luyện mô hình | Không tinh chỉnh; điều phối các mô hình hiện có | Tinh chỉnh LoRA trên mô hình cơ sở | LoRA theo từng nhân vật (ED-LoRA qua ROICtrl) | Không cần huấn luyện |
| Trình tạo cơ sở | Gemini và Veo (không phụ thuộc mô hình) | Wan2.2 | ROICtrl, SVD, HunyuanVideo I2V | Stable Diffusion |
| Đầu ra dài nhất được báo cáo | 10 phút (A²RD) | Khoảng 1 phút | Không xác định | N/A (hình ảnh) |
| Mã nguồn | Co-Director và A²RD đã công khai; CANVAS sắp ra mắt | Công khai | Công khai | Công khai |

Nguồn: các bài báo, trang dự án và kho lưu trữ GitHub được liên kết. Xác minh ngày 27 tháng 9 năm 2026.

### Những điểm chính

- Google coi video dạng dài là một bài toán tối ưu hóa toàn cục và theo dõi trạng thái thế giới.
- 4 khung làm việc bao gồm lập kế hoạch, phân cảnh, tạo video dài và tự sửa lỗi.
- Nó vận hành như một lớp điều phối trên Gemini và Veo, với tính năng đóng dấu bản quyền SynthID.
- A²RD đã tạo ra một bộ phim dài 10 phút liên tục với nhân vật và bối cảnh ổn định.
- Co-Director đạt 81,4 điểm trên GenAD-Bench, vượt qua mức cơ sở tìm kiếm ngẫu nhiên là 75,7.

### Câu hỏi thường gặp

- AI video co-director của Google là gì? Đây là một lớp điều phối đa tác nhân trên Gemini và Veo. Nó lập kế hoạch, tạo và chỉnh sửa các video nhiều cảnh quay để đảm bảo tính nhất quán.
- Video có thể dài bao lâu? A²RD đã được đánh giá trên các video từ 1 đến 10 phút, và Google đã phát hành một bộ phim demo dài 10 phút liên tục.
- Các nhà phát triển có thể sử dụng nó ngay bây giờ không? Một phần. Mã nguồn của Co-Director và A²RD đã có trên GitHub. Mã nguồn của CANVAS đang chờ xử lý, và toàn bộ quy trình này chưa phải là một sản phẩm thương mại của Google.

Xem [Chi tiết kỹ thuật](https://research.google/blog/coherent-long-form-video-generation/?). Mọi ghi nhận thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy theo dõi chúng tôi trên [Twitter](https://x.com/intent/follow?screen_name=marktechpost) và đừng quên tham gia [SubReddit 150k+ ML](https://www.reddit.com/r/machinelearningnews/) cũng như đăng ký [Bản tin của chúng tôi](https://magic.beehiiv.com/v1/f5e63dd4-5653-4f09-83e2-321a8b1ba526?email={{email}}). Khoan đã! Bạn có dùng Telegram không? [bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.](https://t.me/machinelearningresearchnews)

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? [Kết nối với chúng tôi](https://forms.gle/MJjjVDPS7whH8Ngs6)

![](https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-150x150.png)

#### Asif Razzaq

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông Trí tuệ nhân tạo Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, đảm bảo tính kỹ thuật nhưng vẫn dễ hiểu với đông đảo khán giả. Nền tảng này đạt hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
