Tin ngành
Runway ra mắt công nghệ tạo video thời gian thực: Vừa nhập lệnh, vừa xuất hình
(giờ Việt Nam)
Tóm tắt AI
Runway giới thiệu mô hình thế giới GWM-1 cho phép tạo video dạng luồng (stream) ngay khi người dùng nhập mô tả, thay vì phải chờ đợi kết quả hoàn chỉnh. Công nghệ này sử dụng cơ chế tự huấn luyện để giảm thiểu sai số trong quá trình tạo hình liên tục.
Bản dịch AI
Runway vừa chia sẻ cái nhìn về nghiên cứu của họ trong lĩnh vực tạo video thời gian thực. Thay vì nhập câu lệnh (prompt) rồi chờ đợi, người dùng sẽ có thể stream video ngay khi họ đang mô tả chúng.
Các mô hình video hiện nay hoạt động theo từng bước riêng biệt. Bạn nhập câu lệnh, chờ vài giây hoặc vài phút, rồi nhận được video hoàn chỉnh. Nếu kết quả không như ý, bạn phải làm lại từ đầu. Runway cho biết người dùng thường xuyên phản hồi rằng họ mất nhiều thời gian nhất vào việc tạo và chỉnh sửa video, vì vậy công ty muốn tối thiểu hóa thời gian xuất hiện khung hình đầu tiên, sau đó stream video khi người dùng tiếp tục đưa ra câu lệnh.
Runway lần đầu thảo luận về phương pháp này vào tháng 3 với Runway Characters. Nó sử dụng GWM-1, "Mô hình Thế giới Tổng quát" (General World Model) đầu tiên của công ty mà Runway đã giới thiệu vào tháng 12 năm 2025. GWM-1 được xây dựng dựa trên Gen-4.5, tạo video theo từng khung hình và chấp nhận các điều khiển như chuyển động camera, lệnh điều khiển robot hoặc âm thanh. Chỉ vài tuần trước, Runway đã trình diễn Solaris, một hệ thống sử dụng Gen-4.5 để tạo giao diện người dùng theo từng khung hình. Nó có thể phản hồi lại các thao tác nhấp chuột hoặc đầu vào bằng giọng nói.
Tạo video thời gian thực có thể cắt giảm thời gian chờ đợi và chi phí GPU
Runway lập luận rằng việc tạo video thời gian thực giúp thu hẹp khoảng cách giữa ý tưởng và quá trình thực thi. Với phản hồi tức thì, người dùng sẽ dành phần lớn thời gian để chủ động điều hướng video thay vì phải chờ đợi.
Runway cũng chỉ ra lợi ích về chi phí thấp hơn. Các mô hình nhanh hơn sử dụng ít thời gian GPU hơn, giúp chúng tiết kiệm chi phí hơn. Theo Runway, chi phí cho mỗi đầu ra ở một mức chất lượng nhất định sẽ quyết định ứng dụng nào mang lại hiệu quả kinh tế. Việc tạo video tức thì sẽ hạ thấp ngưỡng đó, giúp các ứng dụng vốn không có lợi nhuận trước đây trở nên khả thi.

Những lỗi hình ảnh nhỏ có thể phát triển thành biến dạng lớn
Một mô hình văn bản có thể tự sửa lỗi giữa chừng, nhưng mô hình video lại xây dựng mỗi khung hình dựa trên khung hình trước đó, cho phép các lỗi nhỏ tích tụ thành những biến dạng lớn theo thời gian. Runway mô tả đây là vấn đề cốt lõi của các phương pháp dựa trên LLM và giải quyết nó bằng cách huấn luyện mô hình trên chính các đầu ra của nó thay vì chỉ sử dụng các dữ liệu đầu vào không lỗi, từ đó dạy mô hình cách tự sửa các sai lệch thay vì khuếch đại chúng.

Startup Decart đã sử dụng phương pháp tương tự cho mô hình thời gian thực MirageLSD của họ, bằng cách cố tình để nó tiếp xúc với các hình ảnh bị lỗi hoặc biến dạng trong quá trình huấn luyện. Google Deepmind cho biết mô hình thế giới Genie 3 của họ giữ cho các thế giới tương tác ổn định trong vài phút ở tốc độ 24 khung hình/giây với độ phân giải 720p.
Theo Runway, việc tạo video thời gian thực chuyển dịch khối lượng tính toán từ giai đoạn huấn luyện sang giai đoạn sử dụng. Mô hình phải tạo ra mỗi khung hình đủ nhanh để theo kịp tốc độ phát lại trong khi vẫn chạy trên phần cứng được chia sẻ bởi nhiều phiên làm việc cùng lúc.
Các mô hình thế giới sẽ huấn luyện robot và robotaxi
Runway coi các ứng dụng tương tác là trường hợp sử dụng dài hạn lớn nhất cho phương tiện truyền thông do AI tạo ra. Công ty cho biết giáo dục, trò chơi và robot cần video phản hồi nhanh nhạy như chính người đang xem nó. Việc đánh giá cách robot hoặc xe tự hành hoạt động trong thế giới thực cũng đòi hỏi các môi trường tạo video thời gian thực và phản hồi tức thì với các tình huống biên (edge cases). Trước đó, Runway đã giới thiệu GWM Robotics, một biến thể của GWM-1 chuyên tạo dữ liệu huấn luyện tổng hợp cho robot.
Waymo đang áp dụng phương pháp tương tự với Waymo World Model, dựa trên Genie 3 và được tùy chỉnh cho giao thông đường bộ. Nó cho phép Waymo mô phỏng các tình huống mà đội xe của họ chưa từng gặp phải, chẳng hạn như chạm trán với một con voi, một cơn lốc xoáy hoặc một khu dân cư bị ngập lụt. Theo Waymo, Waymo Driver đã di chuyển hàng tỷ dặm trong các thế giới ảo trước khi đối mặt với các kịch bản trên đường phố thực tế.
Vào tháng 3, Runway cũng đã trình diễn bản xem trước nghiên cứu về một mô hình thời gian thực được phát triển cùng Nvidia tại hội nghị GTC của nhà sản xuất chip này. Nó chạy trên nền tảng Vera Rubin và được thiết kế để cung cấp khung hình đầu tiên trong dưới 100 mili giây. Runway vẫn chưa công bố mốc thời gian cụ thể cho việc ra mắt.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.