Google Research: Blog (Web)
Điểm AI 37/100

Nghiên cứu

Google giới thiệu AI video co-director: Khung đa tác tử tự động tạo video dài nhất quán

(giờ Việt Nam)

Tóm tắt AI

Google Research ra mắt AI video co-director, một khung đa tác tử phân cấp sử dụng thuật toán Multi-Armed Bandit để tối ưu hóa chiến lược sáng tạo, giúp tạo ra các video dài có tính nhất quán cao về mặt nội dung và thẩm mỹ.

Chính văn · Bản dịch AI

Automating coherent long-form video generation

Những tiến bộ gần đây trong mô hình khuếch tán video cho thấy khả năng tạo nội dung có độ trung thực cao đáng kinh ngạc với các mô hình có thể dựng cảnh chân thực chỉ trong vài giây. Tuy nhiên, mặc dù các mô hình khuếch tán tạo ra được các đoạn video chất lượng cao, việc biến chúng thành những công cụ kể chuyện dài mạch lạc vẫn là một thách thức.

Hầu hết các quy trình đại lý (agentic pipeline) hiện nay tự động hóa quá trình này thông qua các mô-đun liên kết, nhưng lại gặp phải tình trạng trôi dạt ngữ nghĩa (những thay đổi tinh vi về trang phục nhân vật hoặc bối cảnh giữa các cảnh quay) và lỗi dây chuyền (ví dụ: một lỗi ở tài sản đầu nguồn làm hỏng quá trình tổng hợp video ở hạ nguồn) do việc tạo câu lệnh (prompting) thủ công và độc lập. Vì các lỗi ban đầu lan truyền và phá vỡ tính nhất quán trong thời gian dài, quy trình này thường đòi hỏi sự can thiệp thủ công rất lớn. Từ góc độ cấu trúc, điều này phản ánh bài toán phân bổ tín dụng (credit assignment problem) cổ điển, vì các lỗi cuối cùng rất khó truy xuất ngược lại các câu lệnh cụ thể. Hơn nữa, các phương pháp hiện tại còn gặp vấn đề trôi dạt đặc trưng (feature drift), nơi các thực thể và môi trường dần thay đổi ngoài ý muốn, hoặc sụp đổ nội dung (content collapse), nơi các câu chuyện không thể phát triển một cách có ý nghĩa.

Hôm nay, chúng tôi giới thiệu nghiên cứu về AI video co-director, một khung làm việc đa đại lý (multi-agent framework) thống nhất, giúp lập kế hoạch rõ ràng cho tính liên tục về hình ảnh trong các câu chuyện đa cảnh quay. Được xây dựng như một lớp điều phối trên nền tảng Gemini và Veo, khung làm việc này kế thừa nguyên bản các cơ chế an toàn như đóng dấu bản quyền SynthID. Bằng cách coi việc tạo nội dung dài là một bài toán tối ưu hóa toàn cục và theo dõi trạng thái thế giới, chúng tôi đã phát triển một bộ khung làm việc — Co-Director (sẽ xuất hiện tại COLM 2026), CANVAS (sẽ xuất hiện tại EMNLP 2026), A²RD, và VQQA — giúp chuyển đổi các yêu cầu sáng tạo cấp cao của con người thành kết quả thực thi bằng cách tự động hóa các tác vụ điều phối lặp đi lặp lại, từ việc tạo câu lệnh đa mô hình và liên kết cảnh quay đến tinh chỉnh hình ảnh theo vòng lặp khép kín.

Chúng tôi thiết kế các khung làm việc này để đóng vai trò là những đối tác sáng tạo phản hồi nhanh, giúp loại bỏ gánh nặng duy trì tính liên tục về hình ảnh, giải phóng người dùng để họ tập trung vào nghệ thuật kể chuyện. Kiến trúc này tách biệt quá trình tổng hợp sáng tạo khỏi tính nhất quán bằng cách mô hình hóa chất lượng như một mục tiêu kiểm thử thời gian thực. Qua các đánh giá toàn diện, khung làm việc của chúng tôi cho thấy những cải thiện đáng kể về tính nhất quán của câu chuyện đa cảnh và sự bền bỉ của nhân vật, tạo thành công các video dài hàng phút trong khi giảm thiểu tình trạng trôi dạt hình ảnh và lan truyền lỗi trong quy trình.

Cách thức hoạt động

Để giải quyết bài toán đa diện về video dài, chúng tôi chia nghiên cứu thành bốn trụ cột nền tảng, mỗi trụ cột giải quyết một nút thắt cụ thể trong quy trình tạo nội dung.

1. Điều phối ý tưởng sáng tạo với AI video co-director

Để đảm bảo tính mạch lạc về ngữ nghĩa xuyên suốt toàn bộ video, chúng tôi giới thiệu AI video co-director, một khung làm việc đa đại lý phân cấp, chính thức hóa việc kể chuyện bằng video thành một bài toán tối ưu hóa toàn cục. Thay vì dựa vào các chuỗi câu lệnh cứng nhắc, tuyến tính, chúng tôi giới thiệu tham số hóa phân cấp: một thuật toán multi-armed bandit (MAB) giúp xác định các hướng sáng tạo tiềm năng trên phạm vi toàn cục.

Điều này chính thức hóa quá trình sáng tạo như một cuộc tìm kiếm sự cân bằng tối ưu giữa việc khám phá các chiến lược kể chuyện mới lạ và khai thác các cấu hình sáng tạo hiệu quả. Hệ thống lấy mẫu các quỹ đạo sáng tạo trừu tượng — chẳng hạn như kết hợp một chiến lược thông tin với chế độ kể chuyện dạng tiểu phẩm và một nguyên mẫu thẩm mỹ cụ thể — rồi đưa chúng một cách linh hoạt vào các câu lệnh hệ thống của các đại lý con. Sự điều hướng từ trên xuống này đảm bảo toàn bộ quy trình vận hành dưới một tầm nhìn thống nhất. Vì khung làm việc AI video co-director hoạt động như một lớp điều phối, nó đạt được tầm nhìn này bằng cách đưa các câu lệnh có cấu trúc trực tiếp vào các mô hình nền tảng Gemini và Veo (mặc dù kiến trúc bất khả tri với mô hình của nó cho phép nó vận hành trên bất kỳ mô hình tạo nội dung nền tảng nào). Kiến trúc này đảm bảo rằng tất cả hình ảnh, video và âm thanh được tạo ra đều mang sẵn các biện pháp bảo vệ an toàn, bao gồm cả đóng dấu bản quyền SynthID. Đối với sản xuất, các bộ phân loại an toàn bổ sung có thể được áp dụng trên video cuối cùng để bảo vệ khỏi các tương tác ngữ cảnh không mong muốn giữa các đoạn clip an toàn riêng lẻ.

Quy trình thực hiện tối ưu hóa toàn cục thông qua hai vòng lặp kết nối: điều hướng chiến lược và sản xuất đa giai đoạn. Đầu tiên, Đại lý Điều phối (Orchestrator Agent) đánh giá các đầu vào bằng thuật toán MAB để chọn cấu hình sáng tạo trên ba chiều: (1) Chiến lược Sáng tạo (ý định), (2) Chế độ Kể chuyện (cấu trúc câu chuyện), và (3) Nguyên mẫu Thẩm mỹ (tông màu hình ảnh và kỹ thuật quay phim). Cấu hình này điều khiển hệ thống phân cấp sản xuất. Đại lý Tiền sản xuất (Pre-Production Agent) tổng hợp cốt truyện từng cảnh và tài sản hình ảnh thành một bảng phân cảnh (storyboard) thống nhất. Sau đó, Đại lý Sản xuất (Production Agent) chuyển đổi bảng phân cảnh này thành phương tiện nghe nhìn cụ thể bằng cách sử dụng các đại lý con chuyên biệt: Đại lý Khung hình chính (Keyframe Agent) cố định hình ảnh nhân vật và bối cảnh, Đại lý Video (Video Agent) thêm chuyển động, và Đại lý Âm thanh (Audio Agent) lồng ghép lời bình và nhạc nền phù hợp.

Cuối cùng, một LLM đa phương thức (MLLM) đóng vai trò Giám khảo sẽ phê bình bản cắt đã biên tập dựa trên ba chiều đã chỉ định, gửi tín hiệu phần thưởng có phân tích ngược lại cho MAB để lặp lại việc tinh chỉnh và tối ưu hóa các lựa chọn qua các vòng lặp tạo nội dung kế tiếp.

2. Bảng phân cảnh hình ảnh với CANVAS

Ngay cả với một kịch bản thống nhất, việc tạo các cảnh quay tuần tự dài thường dẫn đến tình trạng trôi dạt nhân vật và môi trường không ổn định. Để giải quyết vấn đề này, chúng tôi giới thiệu Continuity-Aware Narratives via Visual Agentic Storyboarding (CANVAS), một khung làm việc đa đại lý giúp lập kế hoạch rõ ràng cho tính liên tục về hình ảnh trong các câu chuyện đa cảnh quay.

CANVAS thực thi tính mạch lạc bằng cách duy trì các biểu diễn có cấu trúc về nhân vật, địa điểm và trạng thái đối tượng khi câu chuyện phát triển. Được xây dựng như một lớp điều phối trên nền tảng Gemini, nó dựa vào bộ nhớ hình ảnh bền vững. Bằng cách truy xuất các điểm neo hình ảnh từ bộ nhớ hoặc khởi tạo các điểm mới khi cần, CANVAS đảm bảo các chuyển cảnh mượt mà trong cùng một bối cảnh. Việc mô hình hóa trạng thái thế giới rõ ràng này đảm bảo rằng các nhân vật giữ được danh tính và môi trường bảo toàn được cấu trúc không gian khi được quay lại.

Để thấy các phương pháp này hoạt động, hình dưới đây trình bày một chuỗi cảnh trộm bảo tàng gồm nhiều cảnh quay, so sánh CANVAS với các mô hình cơ sở tiêu biểu: tạo trực tiếp bằng mô hình nền tảng (Gemini-3.1-Pro) và một khung làm việc đa tác nhân thay thế (AutoStudio). Các câu lệnh (prompt) ở cuối hình làm nổi bật các yếu tố lặp đi lặp lại — ví dụ: tên trộm, sảnh triển lãm và viên đá quý — vốn phải duy trì các đặc điểm hình ảnh giống hệt nhau. Hãy chú ý cách mỗi phương pháp xử lý các chuyển cảnh liên tiếp (ví dụ: trang phục của nhân vật) so với các chuyển cảnh không liên tiếp (ví dụ: khi máy quay quay trở lại sảnh chính sau một đoạn chuyển cảnh). Việc tạo video chỉ với Gemini-3.1-Pro cho thấy sự thiếu nhất quán về đạo cụ (hiện vật bị thay đổi) và trôi dạt bối cảnh (bố cục phòng bị thay đổi), cho thấy những hạn chế của việc tạo video không có hướng dẫn. AutoStudio cũng bị suy giảm chất lượng qua các lần cắt cảnh, dẫn đến trôi dạt nhân vật (mũ của tên trộm biến mất) và thiếu nhất quán về bối cảnh. Ngược lại, bộ nhớ hình ảnh bền vững của CANVAS đảm bảo rằng nhân vật, hình học không gian và trạng thái đối tượng vẫn hoàn toàn nhất quán trong suốt toàn bộ câu chuyện.

3. Mở rộng quy mô động lực học thời gian với A²RD

Để chuyển đổi các bảng phân cảnh (storyboard) thành video thực tế dài hàng phút, chúng tôi đã phát triển A²RD, một kiến trúc tạo video tự hồi quy dựa trên tác nhân. A²RD có tính năng tạo theo từng phân đoạn, được tăng cường bằng bộ nhớ video đa phương thức giúp theo dõi ngữ cảnh và động lực học của từng phân đoạn.

Đối với mỗi phân đoạn, hệ thống vận hành trong một vòng lặp truy xuất-tổng hợp-tinh chỉnh-cập nhật. Một phần quan trọng của vòng lặp này là cách tác nhân xác định linh hoạt chế độ tạo phân đoạn. Nó chuyển đổi mượt mà giữa ngoại suy (extrapolation) — để cho phép tiến trình câu chuyện diễn ra tự nhiên — và nội suy (interpolation), giúp neo các phân đoạn vào các thực thể và môi trường hiện có. Điều này cân bằng hiệu quả giữa nhu cầu thúc đẩy câu chuyện tiến triển với sự cần thiết phải duy trì thực tế vật lý của cảnh quay.

Để kiểm tra hệ thống này, bộ phim dài mười phút dưới đây trình bày quá trình tạo video dạng dài, đòi hỏi sự tiến triển câu chuyện nhất quán qua các khoảng cách thời gian dài hàng phút. Video làm nổi bật cách hệ thống chuyển đổi linh hoạt giữa hai chế độ vận hành: sử dụng ngoại suy để đẩy cốt truyện vào các nhịp điệu mới, và nội suy để neo các nhân vật và môi trường quay trở lại với thiết kế ban đầu của chúng. Trong khi các trình tạo video tiêu chuẩn gặp phải tình trạng suy giảm hình ảnh nghiêm trọng — nơi nhân vật bị biến đổi và địa điểm bị thay đổi hình dạng — A²RD liên tục truy vấn bộ nhớ video đa phương thức của nó để duy trì danh tính nhân vật, chi tiết trang phục và hình học cấu trúc từ cảnh quay mở đầu đến khung hình cuối cùng.

4. Tinh chỉnh vòng lặp kín với VQQA

Cuối cùng, chúng tôi cần một cách để hệ thống tự động xác định và sửa lỗi các tạo tác hình ảnh (visual artifacts). Các phương pháp tối ưu hóa trong thời gian thử nghiệm hiện có thường tốn kém về mặt tính toán hoặc yêu cầu quyền truy cập vào nội bộ mô hình (white-box). Để giải quyết vấn đề này, chúng tôi đã phát triển Video Quality Question Answering (VQQA), một khung làm việc đa tác nhân thống nhất có khả năng tổng quát hóa trên các phương thức đầu vào và tác vụ tạo video đa dạng.

VQQA tạo ra các câu hỏi hình ảnh động phù hợp với câu lệnh cụ thể và sử dụng các đánh giá từ Vision-Language Model (VLM) làm các gradient ngữ nghĩa (cung cấp phản hồi định hướng bằng ngôn ngữ tự nhiên để hướng dẫn tinh chỉnh lặp lại, tương tự như gradient số trong lan truyền ngược). Điều này thay thế các chỉ số đánh giá thụ động truyền thống bằng phản hồi có thể thực thi và dễ hiểu đối với con người. Sau đó, hệ thống có thể thực hiện một vòng lặp phản hồi lặp lại hiệu quả cao (nơi mô hình tạo video, đánh giá nó thông qua các câu hỏi hình ảnh và tinh chỉnh câu lệnh văn bản dựa trên đánh giá) thông qua giao diện ngôn ngữ tự nhiên. Để ngăn chặn sự trôi dạt ngữ nghĩa trong quá trình tinh chỉnh này, VQQA sử dụng cơ chế Global Selection: thay vì mù quáng lấy kết quả của lần lặp cuối cùng, một bộ đánh giá VLM toàn cục sẽ đánh giá mọi video được tạo ra trong suốt quỹ đạo tối ưu hóa so với câu lệnh gốc chưa chỉnh sửa. Sau đó, hệ thống chọn ứng viên có điểm số cao nhất, đảm bảo rằng các chỉnh sửa cục bộ không làm ảnh hưởng đến ngữ cảnh rộng hơn.

Trong thực tế, VQQA hoạt động như một trình tối ưu hóa câu lệnh "hộp đen" thay vì một trình chỉnh sửa cấp độ pixel. Thay vì sửa đổi trực tiếp các pixel, nó tinh chỉnh lặp lại câu lệnh văn bản để sửa các lỗi bố cục cấp cao như lỗi liên kết thuộc tính hoặc thuộc tính nhân vật không nhất quán. Câu lệnh cập nhật này hướng dẫn trình tạo lấy mẫu một đường dẫn mới trong không gian tiềm ẩn của nó. Trong các ví dụ dưới đây, VQQA không che hoặc vẽ đè lên các khung hình gốc; thay vào đó, nó giải quyết vấn đề khó khăn về liên kết vật liệu của mô hình bằng cách kết xuất kết cấu bóng bay mylar thực tế lên một hình học khối lập phương nghiêm ngặt, và sửa lỗi thay đổi nhạc cụ hỗn loạn giữa màn trình diễn bằng cách giữ cho nghệ sĩ violin và nghệ sĩ piano được neo nhất quán với nhạc cụ tương ứng của họ qua các lần cắt cảnh.

Kết quả chính & các tiêu chuẩn đánh giá

Để đánh giá nghiêm ngặt các khung làm việc của mình, chúng tôi đã phát triển ba tiêu chuẩn đánh giá chuyên biệt được thiết kế để phản ánh những thách thức trong sản xuất video chuyên nghiệp.

  1. GenAD-Bench: Sử dụng quy trình con người trong vòng lặp (human-in-the-loop) kết hợp Gemini 3 Pro với các mô hình hình ảnh chuyên biệt để xây dựng 50 thương hiệu hư cấu, mỗi thương hiệu chứa bốn sản phẩm riêng biệt. Qua 400 kịch bản độc đáo, nó kiểm tra các ràng buộc tiếp thị chính xác mà không dựa vào các xung đột bản quyền hoặc các tiền đề đào tạo.
  2. HardContinuityBench: Được thiết kế để đánh giá tính liên tục về không gian và môi trường. Được tạo bằng các bảng phân cảnh tường thuật nhiều cảnh quay phức tạp của GPT-5.2, tiêu chuẩn này thách thức các mô hình với những khoảng cách lớn giữa các lần xuất hiện lại của cảnh quay, việc thay đổi trang phục và phụ kiện thường xuyên cho diễn viên, và các thay đổi trạng thái phức tạp cho các đạo cụ tương tác.
  3. LVBench-C: Giải quyết các động lực học thời gian dài hạn. Tập dữ liệu này chứa 120 kịch bản chỉ có văn bản được nhóm thành các trạng thái nhân vật đang phát triển, các thuộc tính đối tượng thay đổi và các tiết lộ môi trường dần dần, duy trì quy tắc khoảng cách nghiêm ngặt, trong đó các tài sản hình ảnh quan trọng phải biến mất trong ít nhất 10 phân đoạn trước khi quay trở lại với những thay đổi thực tế, theo hướng tường thuật.

Các đánh giá của chúng tôi cho thấy hiệu suất được cải thiện rõ rệt so với các kiến trúc tạo video hiện có. Bằng cách điều hướng không gian tìm kiếm chiến lược sáng tạo, AI video co-director đạt điểm chất lượng cao nhất là 81,4 trên GenAD-Bench và tăng cường tính nhất quán của câu chuyện trên ViStoryBench. CANVAS tận dụng bộ nhớ hình ảnh có cấu trúc để giảm thiểu hiện tượng trôi cảnh (scene drift), mang lại những cải thiện đáng kể về tính liên tục khi các cảnh xuất hiện trở lại trên ST-Bench và HardContinuityBench. Đối với các động lực thời gian dài, A²RD giảm thiểu hiện tượng trôi bố cục để cải thiện tính nhất quán của nhân vật và môi trường trong các lần chạy liên tục kéo dài nhiều phút trên VBench-Long và LVBench-C. Cuối cùng, quy trình tối ưu hóa prompt vòng lặp kín của VQQA giải quyết các điểm không nhất quán về vật lý và bố cục, mang lại những cải thiện chất lượng tuyệt đối đáng chú ý trên T2V-CompBench, VBench2 và VBench-I2V. Vui lòng tham khảo các bài báo riêng lẻ để biết chi tiết toàn diện về kiến trúc mô hình, cấu hình huấn luyện và các đánh giá cơ sở của chúng tôi.

Hướng phát triển tương lai

Các khung làm việc này đại diện cho một bước nền tảng hướng tới việc mở khóa khả năng kể chuyện bằng hình ảnh mạch lạc, dài hạn cho người sáng tạo. Khi tiếp tục tinh chỉnh các kiến trúc tác nhân (agentic architectures) này, chúng tôi đang khám phá cách tích hợp các quy trình làm việc có sự tham gia của con người (human-in-the-loop). Mục tiêu cuối cùng của chúng tôi không phải là thay thế việc kể chuyện của con người mà là trao quyền cho người sáng tạo bằng cách trừu tượng hóa các phức tạp tẻ nhạt về tính nhất quán thời gian và theo dõi trạng thái thế giới, đảm bảo họ vẫn nắm quyền kiểm soát định hướng sáng tạo và thiết kế tường thuật.

Lời cảm ơn

Công trình này có thể thực hiện được nhờ những nỗ lực tận tâm của các nhóm nghiên cứu rộng lớn hơn của chúng tôi trên khắp Google. Chúng tôi xin gửi lời cảm ơn đến Andrew Pan, Brett Slatkin, Burak Gokturk, Carina Claassen, Daniel Vlasic, Do Xuan Long, Ishani Mondal, Jasmine Leon, Jingyun Liu, Joe Timmons, Jordan Boyd-Graber, Khanh G. LeViet, Kuang Su, Long T Le, Mihir Parmar, Min-Yen Kan, Nathan Hodson, Nick Losier, Palash Goyal, Rhyard Zhu, Sebastian Ko, Scott Penberthy, Yan Xu, Yang Li, Ye Jin và Tomas Pfister vì những đóng góp vô giá của họ cho bộ nghiên cứu này.

A man and woman sit at a table looking at a glowing blue 3D holographic projection of a house emerging from a blueprint.AI-video-co-director1_PipelineAI-video-co-director5_evaluationAI-video-co-director2_VisualStoryBoard

Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Google giới thiệu AI video co-director: Khung đa tác tử tự động tạo video dài nhất quán | AIHOT.vn