Mô hình
Sand.ai ra mắt mô hình video MoE 114 tỷ tham số đầu tiên trên thế giới
(giờ Việt Nam)
Tóm tắt AI
Sand.ai vừa mã nguồn mở mô hình tạo video MoE với 114 tỷ tham số, cho phép tạo video 10 giây chuẩn 1080P với chi phí cực thấp chỉ 500 đồng.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
05/08/2026 15:05:41 Nguồn: QbitAI
10 giây 1080P, chi phí chỉ 5 hào (khoảng 1.700 VNĐ)
Tác giả: Lù Yũ, đưa tin từ QbitAI
QbitAI | Kênh chính thức QbitAI
Dù mô hình lớn có "khủng" đến đâu, cũng phải ra mắt công khai trước ngành thì mới coi là thực sự hoàn thành bài thi.

Hiện tại, có một đội ngũ xuất thân từ Đại học Thanh Hoa đang khẳng định vị thế, quy mô không lớn nhưng thực lực lại không hề nhỏ —
Tiên phong sử dụng kiến trúc MoE để đưa mô hình tạo video lên quy mô hàng trăm tỷ tham số, mã nguồn và trọng số còn được công khai hoàn toàn!

Ngay khi vừa ra mắt, mô hình đã phủ sóng khắp giới công nghệ trong và ngoài nước. Vừa lớn, vừa mạnh, lại còn hào phóng mở mã nguồn.
Hãy cùng xem qua hiệu quả tạo video để kiểm chứng:

Link video: https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg
Bạn thấy sao? Những bộ phim hoạt hình AI đang gây sốt gần đây, hội tụ đủ cả âm thanh, lời thoại, hình ảnh và biểu cảm.
Hoặc là một cú máy dài (long-take) đầy mãn nhãn, với góc nhìn chuyển đổi linh hoạt theo hành động của nhân vật.

Link video: https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg
Không chỉ để giải trí, các kịch bản thương mại cũng không thành vấn đề.

Link video: https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg
Chỉ riêng khả năng điều khiển camera, lấy nét và biểu cảm nhân vật này, nếu đem ra so kè với các mô hình đóng (closed-source) hàng đầu, thì vẫn hoàn toàn có thể cạnh tranh sòng phẳng.
Không vòng vo nữa, đây chính là tác phẩm mới nhất của Sand.ai — MAGI-2-preview. Tiếp nối sự xuất hiện đầy ấn tượng của Magi-1, mô hình mới này một lần nữa nhắm tới vị trí dẫn đầu trong cộng đồng mã nguồn mở.
Tổng tham số mô hình là 114B, nhưng mỗi lần suy luận (forward) chỉ kích hoạt khoảng 6B.
Tính theo giá thị trường hiện tại của 8 card H100, chi phí để tạo một video 10 giây 1080P chỉ tốn khoảng 5 hào, gần như chỉ bằng 1/10 so với các mô hình phổ biến trong ngành.
Thứ hạng trên các bảng xếp hạng (Benchmark) cũng rất ấn tượng, MAGI-2-preview đứng thứ sáu trên bảng xếp hạng tạo video AA. Chỉ với 6B tham số kích hoạt, hiệu quả đã tiệm cận rất gần với nhóm dẫn đầu.

Tuyệt vời, ngành tạo video giờ đây đã có thêm một biến số mới ở quy mô hàng trăm tỷ tham số.
Scaling mô hình video không thể sao chép y nguyên LLM
Sự thay đổi này đánh thẳng vào lộ trình Scaling của các mô hình tạo video.
Thực tế, vấn đề này hiện đang là nhu cầu cấp thiết, nỗi sợ lớn nhất khi làm mô hình lớn chính là không đủ kinh phí để "đốt".
Với mô hình văn bản thì còn đỡ, vì chúng xử lý các token rời rạc, chỉ cần chồng thêm tham số và tăng sức mạnh tính toán là mô hình sẽ ngày càng mạnh. Nhưng mô hình video thì sao? Chúng phải đối mặt với cả một thế giới động.
Mỗi khung hình đều phải được chia nhỏ thành vô số các patch không gian, các khung hình liên tiếp còn phải ghi lại hành động của nhân vật, mối quan hệ giữa các vật thể và sự thay đổi của góc máy. Nếu cộng thêm thông tin văn bản, âm thanh, thì độ dài chuỗi dữ liệu sẽ tăng lên gấp bội...
Nếu vẫn sử dụng mô hình dày đặc (dense model), chi phí huấn luyện và suy luận cho việc Scaling là điều không thể tưởng tượng nổi.
Mô hình phải lớn hơn, video phải dài hơn, nhưng chi phí phải nằm trong tầm kiểm soát, ba yếu tố này chính là "bộ ba bất khả thi" mà ngành tạo video đang phải đối mặt.
Hình ảnh được tạo bởi AI
Tất nhiên, không phải là không có giải pháp — đó là MoE.
Cái gọi là MoE chính là tách biệt dung lượng mô hình và phần tính toán trong mỗi lần suy luận. Mô hình vẫn có thể sở hữu tổng dung lượng hàng chục, hàng trăm tỷ tham số, nhưng mỗi lần suy luận chỉ kích hoạt một phần nhỏ trong đó, giúp chi phí được kiểm soát tương đối.
Tuy nhiên, MoE cho video cũng có những rắc rối riêng, rào cản đầu tiên chính là vấn đề truyền tải dữ liệu.
Phương pháp song song chuyên gia (expert parallelism) truyền thống sẽ chọn ra Top-K chuyên gia cho mỗi token, sau đó gửi token đó đến GPU nơi chuyên gia đang cư trú. Nói cách khác, số lượng chuyên gia được kích hoạt càng nhiều thì lượng dữ liệu cần vận chuyển càng lớn.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.