QbitAI
85

Mô hình

Vivix ra mắt mô hình tương tác thời gian thực với kiến trúc dòng chảy thống nhất

(giờ Việt Nam)

Tóm tắt AI

Vivix vừa công bố mô hình tương tác thời gian thực đầu tiên với khả năng xử lý vượt ngưỡng 10.000 video tokens/giây trên một card đồ họa, tối ưu hóa toàn diện quy trình tạo nội dung đa phương thức.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

25/07/2026 11:21:53 Nguồn: QbitAI

Đạt tốc độ hơn 10.000 video tokens/s trên một card đơn, Vivix khai thông toàn bộ quy trình tạo đa phương thức thời gian thực

henry đưa tin từ Aofei Temple, QbitAI | Tài khoản chính thức QbitAI

Theo tôi, bộ phim "Interstellar" của Nolan vẫn còn hơi bảo thủ.

Trong phim, sự giao thoa giữa hai không gian song song phải dựa vào mã Morse.

Còn ngày nay, AI đã có thể "nhập" vào bất kỳ vật thể hay nhân vật nào, để chúng cất tiếng, hành động trong một thế giới khác và thực hiện cuộc gọi video thời gian thực với bạn.

Ví dụ, chú mèo nhỏ này vừa có thể nói những lời tán tỉnh ngọt ngào, vừa cong lưng, vẫy đuôi, giơ chân, thậm chí đi lại trong thế giới của riêng nó (hãy chú ý, cái bóng dưới chân nó cũng thay đổi theo).

Quan trọng là, những phản ứng này không hề được lập trình sẵn.

Chú mèo sẽ thay đổi tức thì theo giọng nói của bạn: bạn nói một câu, nó sẽ đưa ra hành động và phản hồi mới dựa trên dữ liệu đầu vào đó.

Và đứng sau chú mèo này chính là A1, mô hình đa phương thức tương tác thời gian thực mới nhất vừa được Vivix công bố.

A1 cho phép người dùng giao tiếp liên tục với nhân vật ảo ở phía bên kia màn hình giống như đang thực hiện một cuộc gọi video.

So với các mô hình tạo video và người ảo kỹ thuật số truyền thống, điểm khác biệt lớn nhất của A1 nằm ở chỗ——

Nhân vật trong màn hình thực sự sở hữu một cơ thể. Nó không chỉ đứng yên nói chuyện trước ống kính, mà có thể hành động, xoay người, thay đổi tư thế và tương tác liên tục với các vật thể cũng như môi trường xung quanh trong thế giới của nó.

Có thể nói, cảm giác này thực sự giống như đang kết nối với một thế giới song song khác.

Đồng thời, để thế giới phía sau nhân vật trở nên phong phú hơn, Vivix cũng đồng thời ra mắt W1.

W1 giúp người dùng không còn chỉ đứng ngoài màn hình để xem câu chuyện, mà có thể can thiệp bất cứ lúc nào, thay đổi lựa chọn, hành động của nhân vật và hướng đi tiếp theo của cốt truyện.

Đọc đến đây, có lẽ bạn sẽ nghĩ: Điều này tốn bao nhiêu tài nguyên tính toán nhỉ?

Tuy nhiên, theo blog kỹ thuật trên trang web chính thức của Vivix, dù A1 sở hữu gần 30B tham số kích hoạt, nhưng thông qua chiến lược huấn luyện và suy luận MJD, NVFP4 nguyên bản cùng cơ sở hạ tầng suy luận mega-kernel kết hợp lập lịch tính toán-truyền thông tự phát triển, nó đã hạ thấp ngưỡng triển khai xuống mức suy luận thời gian thực trên GPU tiêu dùng, giúp hiệu suất suy luận tăng gần hai bậc độ lớn ở chất lượng hình ảnh tương đương.

Đồng thời, thời gian phản hồi của bộ lập lịch luồng đối với dữ liệu đầu vào mới ngắn nhất là 300 mili giây, từ lúc người dùng đưa ra yêu cầu đến khi hình ảnh phản hồi đầu tiên xuất hiện, độ trễ trung bình chỉ là 0,6 giây.

Nghĩa là, ngay khi bạn vừa dứt lời, nhân vật ở phía bên kia màn hình gần như đã bắt đầu chuyển động.

Hiện phía chính thức đã mở thử nghiệm nội bộ, mời truy cập trang web chính thức và nền tảng API mở để đăng ký trải nghiệm: https://vivix.ai/

Rốt cuộc nó đã làm điều đó như thế nào?

Kiến trúc luồng thống nhất và mô hình hóa tương tác nguyên bản

Để cuộc gọi video với thế giới song song này thực sự được kết nối, bước đầu tiên không phải là làm cho nhân vật trả lời thông minh đến mức nào, mà là đảm bảo trong quá trình tạo liên tục, nó vẫn luôn là nhân vật đó và ở trong cùng một thế giới.

Vivix định vị A1 là mô hình nền tảng đầu tiên trên thế giới thống nhất tham chiếu đa phương thức, tương tác thời gian thực và tạo luồng trong một kiến trúc luồng nguyên bản duy nhất.

Phân tích chi tiết, ở cấp độ mô hình, A1 chủ yếu thực hiện ba việc:

Điều kiện tham chiếu phải có hiệu lực liên tục, các tương tác mới phải được chèn vào bất cứ lúc nào, và âm thanh lẫn hình ảnh phải được tạo ra không ngừng nghỉ.

Thống nhất tham chiếu đa phương thức, tương tác và tạo luồng

Để đạt được hiệu quả trên, trước hết A1 đã thống nhất tham chiếu đa phương thức, tương tác thời gian thực và tạo video vào một kiến trúc luồng nguyên bản.

Điều này nghe có vẻ như chỉ là ghép các mô-đun lại với nhau, nhưng khó khăn thực sự nằm ở chỗ:

Mô hình vừa phải phản hồi tức thì các yêu cầu mới của người dùng, vừa phải duy trì tính nhất quán lâu dài của nhân vật, vật thể và bối cảnh trong quá trình tạo liên tục về phía trước.

Các mô hình video dựa trên clip truyền thống thường tạo một đoạn hoàn chỉnh cùng lúc, nhờ có thể nhìn thấy trước toàn bộ đoạn phim, nó có thể điều phối các hành động và hình ảnh trước sau, tương đối dễ dàng để đảm bảo mối quan hệ giữa nhân vật, bối cảnh và vật thể không thay đổi đáng kể.

Tạo luồng (streaming generation) lại không có điều kiện đó, nó không biết điều gì sẽ xảy ra sau vài giây nữa, chỉ có thể vừa nhìn vào hình ảnh đã tạo, vừa nhận lệnh từ người dùng để dự đoán nội dung tiếp theo trong thời gian thực.

Điều này giống như vừa đặt đường ray vừa lái tàu hỏa. Quá trình tạo càng kéo dài, sai số càng dễ tích tụ. Hình dáng, vị trí và hành động của nhân vật có thể dần bị lệch, mối quan hệ không gian giữa vật thể và bối cảnh cũng có thể bị phá vỡ.

Cách giải quyết đơn giản nhất, đương nhiên là để nhân vật cử động ít đi, đánh đổi sự ổn định bằng sự cứng nhắc.

Nhưng một chú mèo không dám xoay người, không dám đi lại, thậm chí không thể thực sự tiếp xúc với môi trường, thì rõ ràng không thể gọi là sở hữu một cơ thể.

Cách làm của A1 là ghi hình ảnh, video, âm thanh, lịch sử tương tác và nội dung đã tạo vào trạng thái liên tục, để chúng phát huy hiệu lực lặp đi lặp lại trong quá trình tạo luồng tiếp theo.

Cụ thể, A1 thông qua mô hình hóa trình tự nhân quả và duy trì trạng thái luồng, giúp các hành động liền kề giữ được tính liên tục, đồng thời duy trì danh tính nhân vật, bối cảnh và mối quan hệ vật thể trong khoảng thời gian dài hơn.

VivixAI thời gian thựcĐa phương thứcMô hình AICông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.