Mô hình
Alibaba công bố chiến lược mô hình đa phương thức toàn diện: Tương lai không còn ranh giới
(giờ Việt Nam)
Tóm tắt AI
Alibaba dự báo trong 3 năm tới sẽ xuất hiện mô hình tạo sinh đa phương thức thống nhất, xóa bỏ hoàn toàn ranh giới giữa các loại hình dữ liệu, mở ra trải nghiệm người dùng hoàn toàn mới.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
Đạo diễn Lục Xuyên tự tay tái hiện hiện trường lịch sử, Vương Lạc Đan thức đêm "quay thẻ", Alibaba bắt đầu đưa mô hình toàn phương thức (all-modality) vào sản xuất thực tế.
22-09-2026 23:59:35 Nguồn: QbitAI
Alibaba: Trong vòng ba năm tới sẽ xuất hiện một mô hình tạo sinh thống nhất toàn phương thức nguyên bản, trải nghiệm tương lai sẽ không còn bị giới hạn bởi ranh giới các phương thức.
Điền Yến Lâm đưa tin từ Aofei Temple.
QbitAI | Tài khoản chính thức QbitAI
5 ngày.
Không cần dựng cảnh, không cần chờ diễn viên, đạo diễn Lục Xuyên và đội ngũ đã trực tiếp dùng AI để "nhào nặn" ra hiện trường một thảm họa thời nhà Minh xảy ra cách đây 400 năm!
Cung điện, kho thuốc súng, và cả vụ nổ lớn với những đám mây khói đen như linh chi đen trong sử liệu. Theo cách làm của ngành công nghiệp điện ảnh truyền thống, việc phục dựng những cảnh quay như vậy thường tiêu tốn hàng tháng trời và khoản đầu tư lên tới hàng chục triệu.
Nhưng lần này, họ chỉ mất 5 ngày!
Nào, không nói nhiều nữa, hãy xem đoạn phim ngắn trước đã.
[Liên kết]
Thế nào? Đủ ấn tượng chứ?
Khuôn mặt, làn da và thần thái của nhân vật đã vô cùng chân thực, vài nhân vật thời nhà Minh cũng không còn vẻ "nhựa" giả tạo kiểu AI như trước đây nữa.
Hãy nhìn lại vụ nổ. Khói bụi, mảnh vỡ, lửa cháy cùng bùng lên, những cảnh quay phức tạp vốn dễ bị lộ "sạn" nhất này đều được xử lý vô cùng ổn định.
Nếu đi theo con đường của ngành điện ảnh truyền thống, trước đây chỉ riêng một cảnh quay cháy nổ đã phải mất tới 19 ngày.
Lần này, đội ngũ của Lục Xuyên đã dịch từng chút văn bản trong sử liệu thành các khái niệm thị giác hiện đại, thực hiện khoảng bốn vòng tối ưu hóa câu lệnh (prompt), đồng thời tham chiếu hình ảnh cháy nổ thực tế để hiệu chỉnh.
Cuối cùng, độ chính xác trong việc tái hiện các khung hình phức tạp như khói bụi, mảnh vỡ của mô hình tạo video Alibaba đã đạt hơn 95% so với kỳ vọng của đội ngũ.

AI hiện nay đã tiến hóa đến mức không chỉ đơn thuần là đưa cho đạo diễn vài đoạn tư liệu nữa.
Từ khâu thu thập sử liệu, sản xuất hình ảnh đến thảo luận chủ đề, nó đã bắt đầu tham gia vào toàn bộ chuỗi sáng tạo; chỉ riêng trong khâu tạo video, đóng góp của mô hình Alibaba đã vượt quá một nửa.
Ngày 22 tháng 9, tại Hội nghị Vân Tê (Yunqi Conference), Alibaba Cloud lại tung ra một đòn lớn, trực tiếp phô diễn toàn bộ "gia tài" mô hình của mình.
Trước tiên hãy nhìn vào mô hình nền tảng Qwen: kiến trúc, khả năng tự tiến hóa, toàn phương thức, quy mô tham số, gần như mỗi tầng đều đang được đẩy mạnh về phía trước:
Qwen3.8-Max bắt đầu tự huấn luyện chính mình, Qwen3.8-Flash tung ra kiến trúc thế hệ tiếp theo sớm hơn dự kiến, Qwen3.8-Omni mở ra phân vùng tư duy hoàn toàn mới cho mô hình lớn, Qwen4 đã bắt đầu được huấn luyện, Qwen4.5 và Qwen5 cũng đang trên đường ra mắt.
Hơn nữa, quy mô tham số còn nhắm thẳng tới mức 5 nghìn tỷ đến 10 nghìn tỷ.

Ngoài ra, mô hình tạo ảnh Qwen-Image-3.1, mô hình tạo nhạc Happy Shrimp 1.1, mô hình thế giới HappyOyster 2.0 Preview, gia đình mô hình giọng nói Qwen-Audio-3.1 và mô hình phiên dịch đồng thời Qwen3.8-LiveTranslate cũng đồng loạt xuất hiện.
Mô hình tạo video thế hệ tiếp theo dự kiến sẽ được công bố vào tháng 11.
Chỉ cần tách riêng bất kỳ mô hình nào ra cũng có thể nói cả ngày không hết. Nhưng khi kết hợp với đoạn phim ngắn của Lục Xuyên và nhìn tổng thể, cảm giác lại hoàn toàn khác biệt.
Đợt nâng cấp toàn phương thức lần này của Alibaba không còn giống như đang bù đắp các khả năng đơn lẻ. Điều họ quan tâm hơn là liệu những mô hình này có thể thâm nhập vào các kịch bản thực tế nhanh hơn để trở thành năng suất lao động thực thụ hay không.
Mảnh ghép toàn phương thức của Alibaba về cơ bản đã được hoàn thiện.
Trải rộng tất cả các bản cập nhật mô hình tại Hội nghị Vân Tê lần này, một bản đồ toàn phương thức khá hoàn chỉnh đã hiện ra trước mắt.
Về văn bản và trí tuệ tổng quát, có Qwen3.8 và Qwen4 đã được đưa vào huấn luyện.
Nhìn ra bên ngoài, tạo và chỉnh sửa hình ảnh có Qwen-Image-3.1; tạo video có dòng Wan, Happy Horse và mô hình video thế hệ tiếp theo dự kiến ra mắt vào tháng 11; về âm thanh có Qwen-Audio-3.1, còn âm nhạc được giao cho Happy Shrimp 1.1.
Mở rộng hơn nữa ra thế giới thực, HappyOyster 2.0 Preview bắt đầu xử lý mô hình thế giới và môi trường tương tác; Qwen3.8-Omni-Flash đưa văn bản, hình ảnh, âm thanh, video vào một khung hiểu thống nhất; Qwen Intelligence tiếp tục đẩy mạnh khả năng Agent lên các thiết bị di động.

Nhìn qua chuỗi tên gọi này, rất dễ có cảm giác như các buổi họp báo ra mắt sản phẩm mới diễn ra không ngừng nghỉ.
Nhưng khi đặt chúng vào một nhiệm vụ cụ thể, mối quan hệ sẽ trở nên rõ ràng hơn nhiều.
Quay một quảng cáo, kịch bản, hình ảnh sản phẩm, nhân vật, lời thoại, âm nhạc vốn dĩ đã trộn lẫn vào nhau; làm một bộ phim cũng vậy.
Đạo diễn có thể cung cấp cho mô hình một đoạn văn bản, một hình ảnh tham chiếu, một bản nhạc, và cuối cùng nhận lại là một bộ nội dung nghe nhìn hoàn chỉnh.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.