QbitAI
85

Mô hình

Thay vì viết prompt 2000 chữ, hãy dựng mô hình 3D: AI video bước vào kỷ nguyên 'tiền kỳ'

(giờ Việt Nam)

Tóm tắt AI

Công nghệ AI mới cho phép kiểm soát chính xác chuyển động camera thông qua mô hình 3D, giúp việc sáng tạo video trở nên chuyên nghiệp và đúng ý đồ hơn.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

19-08-2026 15:22:19 Nguồn: QbitAI

AI cuối cùng đã có thể thực hiện chính xác các yêu cầu về chuyển động máy quay

Heng Yu, đưa tin từ QbitAI | Official Account QbitAI

Không phải tôi nói quá đâu, nhưng với năng lực của các mô hình ngày càng mạnh mẽ, các video AI xuất sắc trên các nền tảng lớn hiện nay đã vượt xa phạm vi của những người chơi AI thông thường.

Phần lớn là nhờ những người có tư duy biên đạo, dân chuyên nghiệp/có đào tạo bài bản đã tận dụng ngưỡng gia nhập thấp mà AI mang lại để khuếch đại năng lực chuyên môn của mình, từ đó "càn quét" các đường đua này.

Để kiểm chứng sự khác biệt đó, tôi cũng đã dùng một mô hình video đang rất hot gần đây để tạo ra một đoạn phim:

Một võ sĩ mặc giáp samurai truyền thống, chậm rãi bước đi trên con phố của một ngôi làng gỗ Nhật Bản cổ, nhân vật nằm ở trung tâm khung hình, bước đi vững chãi. Dọc hai bên đường, dân làng người đứng người quỳ cúi đầu hành lễ, không khí trang nghiêm, mặt đất hơi ẩm ướt. Máy quay từ từ tiến lại gần, tổng thể mang lại cảm giác chân thực như một bộ phim lịch sử.

Kết quả thu được như sau (và prompt đã được AI giúp tôi trau chuốt, bổ sung):

Bản thân năng lực của mô hình không có vấn đề gì cả!

Thế nhưng, cô em khóa dưới xuất thân bài bản, hiện đang là "trâu ngựa" trong ngành điện ảnh của tôi sau khi xem xong đã cười khẩy, bảo rằng tôi thứ nhất không hiểu tư duy biên đạo và cách kết nối các cảnh quay, thứ hai là không hiểu về tạo video bằng AI.

Nghe những lời châm chọc không thương tiếc đó, tôi đang định nổi cáu thì cô ấy cho tôi xem thành phẩm từ cùng một mô hình, khiến tôi cứng họng không nói nên lời.

Cô ấy đã có sẵn logic về phân cảnh và điều phối trong đầu, nhưng cô ấy nói sự khác biệt lớn như vậy chủ yếu là do người ngoại đạo không biết đến "Blockout/Previs" (mô hình trắng/tiền kỳ) vốn được sử dụng thường xuyên trong ngành điện ảnh.

Đó chính là thứ ở nửa trên màn hình trong video phía trên.

Cô ấy hào hứng giải thích: "Trước đây muốn làm Blockout thì phải học dựng mô hình, giờ không cần vất vả học nữa! Có công cụ AI mới rồi, chỉ cần tải ảnh tham chiếu bối cảnh lên, AI sẽ nhanh chóng tạo ra các cảnh Blockout 3D với độ chính xác cao."

Đối với người bình thường, nó vẫn có độ khó nhất định khi bắt đầu, nhưng đối với dân chuyên nghiệp thì thực sự là "một vốn bốn lời"!

Dưới sự hướng dẫn của cô ấy, tôi đã có một trải nghiệm cực kỳ ấn tượng với tính năng mới ra mắt của updream: Previs Studio.

Nó mang quy trình làm việc Previs (tiền kỳ) chuyên nghiệp của ngành điện ảnh vào khung làm việc sáng tạo:

Người sáng tạo trước tiên dựng cảnh Blockout 3D, cố định vị trí máy quay, sắp xếp vị trí di chuyển của nhân vật, ghi lại video tiền kỳ, sau đó giao cho các mô hình video như Seedance, Kling, Wan, Gemini Veo để hoàn thiện khâu render cuối cùng.

Thiết kế cảnh quay trước, sau đó mới tạo video, từ đó giải quyết vấn đề kiểm soát "quay cái gì" và "quay như thế nào" đối với các mô hình video AI.

Tuyệt thật!

Đừng vội tạo video! Hãy dùng AI để làm tiền kỳ Blockout cho các cảnh quay phức tạp trước

Làm thế nào để người sáng tạo nói cho mô hình biết chính xác "tôi muốn quay như thế nào" vẫn là một bài toán thiếu phương pháp tiếp cận gần gũi với công nghiệp điện ảnh, đây rõ ràng là vấn đề mới cần đối mặt khi sáng tạo video AI bước sang giai đoạn tiếp theo.

Điểm yếu của video AI nằm ở khả năng kiểm soát không gian 3D và điều phối máy quay – nhiều người đổ lỗi cho việc tạo video thất bại là do viết prompt chưa hoàn thiện, nhưng mấu chốt thực sự nằm ở sự hao hụt thông tin trong quá trình truyền tải.

Văn bản có thể viết "máy quay từ từ tiến về phía trước", "nhân vật đi ngang từ trái sang phải", nhưng không thể quy định nghiêm ngặt tốc độ di chuyển cụ thể, khoảng cách giữa nhân vật và môi trường, cũng như bố cục khi kết thúc chuyển động.

Hình ảnh trong đầu người sáng tạo trước tiên phải được dịch sang prompt, sau đó giao cho AI phân tích lần thứ hai, hai lần "phiên dịch" này sẽ làm mất đi rất nhiều thông tin quan trọng.

Trước khi tạo, chúng ta không thể biết mô hình đã tiếp nhận những chỉ dẫn nào, cũng không thể biết cuối cùng nó sẽ tạo ra hình ảnh gì.

Biết làm sao được? Chỉ có thể thử đi thử lại như chơi xổ số.

Trong khi đó, tham chiếu Blockout là hướng đi đã được kiểm chứng trong ngành điện ảnh và giải trí.

Blockout đảm nhận vai trò truyền tải thông tin thuần túy về không gian và trình tự thời gian.

Các mô hình Blockout 3D thô đóng vai trò là điểm neo không gian cho việc tạo video, giúp mô hình hiểu chính xác độ sâu, sự che khuất, tỷ lệ và không gian có thể di chuyển trong phân cảnh, những khái niệm vốn rất khó mô tả rõ ràng chỉ bằng prompt.

Ngay từ thời Stable Diffusion, ControlNet đã đưa ra lời giải cho vấn đề này.

Khi đó, để giải quyết tình trạng mất kiểm soát hình ảnh, người ta nhập các thông tin không gian như bản đồ độ sâu (depth map), bản đồ pháp tuyến (normal map) hoặc mô hình 3D đơn giản trước khi tạo ảnh, ngay cả khi chỉ là hình người que, nó cũng có thể ràng buộc ổn định tư thế nhân vật và quan hệ phối cảnh.

Tư duy này sau đó cũng được chuyển dịch sang lĩnh vực tạo video.

Blockout chỉ xuất ra các ràng buộc không gian, còn chất liệu và ánh sáng sẽ để mô hình tự do phát huy, nhưng cấu trúc không gian thì không được phép sai lệch.

Ngay cả khi không có màu sắc hay kết cấu, nó vẫn có thể hướng dẫn mô hình tổ chức khung hình, giảm đáng kể khả năng xảy ra lỗi về vị trí nhân vật và phối cảnh bối cảnh.

AI VideoSáng tạo nội dungCông nghệ 3DXu hướng AISản xuất phim
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.