QbitAI
92

Mô hình

Bước ngoặt cho mô hình thế giới: Tạo video 24FPS kèm âm thanh nổi 48kHz theo thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Công nghệ mô hình thế giới vừa đạt cột mốc mới khi hỗ trợ tạo video đồng bộ âm thanh chất lượng cao theo thời gian thực và sắp sửa được công bố mã nguồn mở hoàn toàn.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/imgs/qbitai-logo-1.png" width="400" height="400">

17-08-2026 15:39:56 Nguồn: QbitAI

Sắp mở mã nguồn hoàn toàn

Yun Zhong, đưa tin từ Aofeisi

QbitAI | Kênh chính thức QbitAI

Cạnh tranh quá khốc liệt! Trong hai năm qua, các mô hình tạo video đã gần như "chạy đua" về mọi thông số hình ảnh.

4K, tính nhất quán vật lý, hình ảnh ngày càng chân thực và thời lượng cũng ngày càng dài hơn.

Tuy nhiên, các mô hình tạo video truyền thống luôn tạo ra một đoạn video cố định, được thiết lập sẵn; bạn không thể can thiệp vào cốt truyện, không thể điều chỉnh góc nhìn và càng không thể thay đổi nội dung khung hình tiếp theo.

Sự thay đổi mà các mô hình thế giới (World Models) mang lại chính là ở điểm này.

Nó sẽ kết xuất (render) theo thời gian thực dựa trên thao tác của bạn và tạo ra thế giới một cách linh hoạt.

Nhấn phím tiến, cảnh vật phía trước sẽ được mở rộng và tạo ra ngay lập tức; quay đầu nhìn lại, con phố phía sau sẽ được tính toán và hiện ra tức thì.

Bạn không còn là người xem thụ động mà là một người tham gia thực thụ.

Và hiện nay, ngày càng có nhiều đội ngũ tham gia vào lĩnh vực này. Genie 3 của Google DeepMind, WorldPlay của Tencent, LingBot-World của Ant Group, cùng hàng loạt công ty khởi nghiệp đều đang thúc đẩy hướng đi này.

△ Các "cao thủ" tranh tài, ngày càng mang đậm phong cách "Ready Player One"

Nhìn vào hiện tại, các mô hình thế giới đã bước đầu hiện thực hóa được các cảnh quan thị giác có thể tự do khám phá và tương tác thời gian thực. Chất lượng hình ảnh, tốc độ khung hình, thời gian tạo liên tục và độ ổn định đều đã có những cải thiện đáng kể.

Nhưng khi bạn đeo tai nghe vào để trải nghiệm nhập vai, bạn sẽ nhận ra một điểm yếu chí mạng: thế giới này hoàn toàn tĩnh lặng.

Bạn dạo bước trên phố, xe cộ lướt qua bên cạnh nhưng không hề có tiếng gầm rú; bạn đẩy cánh cửa gỗ nặng nề, cánh cửa từ từ xoay chuyển nhưng không nghe thấy một tiếng cọ xát của bản lề; bạn thấy dã thú đang gầm gừ ngay gần đó, thân hình hiện rõ trước mắt, nhưng bên tai lại là sự im lặng chết chóc.

Có hình mà không có tiếng, thì không thành một thế giới.

Ra mắt! Mô hình thế giới âm thanh - hình ảnh tương tác HelixWorld 1.0

Giờ đây, mảnh ghép còn thiếu rõ rệt nhất này cuối cùng đã được lấp đầy.

Noiz AI, phối hợp cùng các nhà nghiên cứu từ Đại học Khoa học và Công nghệ Hồng Kông (HKUST), Đại học Thanh Hoa, CMU, Google DeepMind và các tổ chức khác, vừa công bố mô hình thế giới âm thanh - hình ảnh tương tác thời gian thực HelixWorld 1.0.

Chỉ cần nhập một hình ảnh và một câu lệnh (prompt), một thế giới được tạo liên tục sẽ mở ra trước mắt bạn.

Và từ đây, mọi thứ đã khác.

Bạn không còn ngồi yên để xem. Khi bạn tiến về phía trước, xoay người, hình ảnh và âm thanh sẽ đồng thời bắt kịp. Bạn đi đến đâu, thế giới sẽ mở rộng đến đó.

Điều được bổ sung lần này chính là phản hồi thời gian thực hoàn chỉnh hơn của thế giới đối với hành động của người dùng, vượt xa hơn hẳn một dải âm thanh đơn thuần.

Trong một thế giới tương tác, âm thanh đảm nhận vai trò lớn hơn nhiều so với nhạc nền (BGM).

Khoảng cách bao xa, đang giẫm lên chất liệu gì, âm thanh đến từ hướng nào, tất cả đều khiến nó trở nên khác biệt; tiếng bước chân phía sau, tiếng va chạm ngoài góc khuất, thường chỉ có đôi tai mới nghe thấy trước.

Các thông số cũng khá ấn tượng: HelixWorld hỗ trợ tạo hình ảnh thời gian thực ở tốc độ 24 FPS, đồng thời xuất âm thanh stereo 48kHz.

Điểm mấu chốt thực sự nằm ở phía sau. Hình ảnh và âm thanh được tạo đồng nhất bởi kiến trúc Transformer nguyên bản, chúng gắn kết với nhau ngay từ đầu chứ không phải đợi video hoàn thành rồi mới chèn thêm dải âm thanh khác.

Âm thanh và hình ảnh đến từ cùng một thế giới, mỗi thao tác của người dùng sẽ đồng thời tác động lên cả hai phương thức (modalities).

Việc tạo âm thanh và hình ảnh cùng lúc, âm thanh chuyển động theo cảnh quan và có thể tương tác thời gian thực chính là điểm khác biệt của HelixWorld so với các giải pháp hiện có. Khi đặt vào bảng so sánh các mô hình thế giới tương tác hiện nay, điều này sẽ càng rõ ràng hơn:

△ So sánh khả năng của các mô hình thế giới tương tác

Vở kịch hay chỉ mới bắt đầu. Trong vài tuần tới, trọng số mô hình và mã nguồn của HelixWorld sẽ được mở hoàn toàn. (Chi tiết xem các chương tiếp theo)

Lộ trình: Để thế giới có khả năng phản hồi đa phương thức nguyên bản

Thêm một dải âm thanh vào video không khó, cái khó là làm sao để các phương thức khác nhau thuộc về thế giới này ngay từ khi bắt đầu tạo.

Để đạt được mục tiêu này, HelixWorld chia lộ trình thành bốn bước.

Bước 1: Xây dựng dữ liệu âm thanh - hình ảnh/thế giới có không gian và hành động

Dữ liệu quyết định giới hạn tối đa. Mô hình thế giới có thể tiến xa đến đâu, phần lớn phụ thuộc vào việc nó đã được "nhìn thấy" những thế giới nào trong quá trình huấn luyện.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.