# MiniMax H3 Max: Đột phá tạo video AI thời gian thực và ra mắt kênh livestream 24/7

- Nguồn: elsewhere: Bài viết
- Thời gian phát hành: 2026-08-31 17:00 (giờ Việt Nam)
- Điểm AI: 40/100
- Link AIHOT.vn: https://aihot.vn/items/3afd48c776ddd0f0
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmticmdih0hmmrofqhfqp6ce8
- Link gốc: https://elsewhere.news/zh/vitalbridge/minimax-h3-maxai

## Tóm tắt AI

MiniMax H3 Max gây ấn tượng với khả năng tạo video AI nhanh hơn tốc độ phát, mở ra kỷ nguyên tương tác thời gian thực và chính thức vận hành kênh livestream AI hoạt động liên tục 24 giờ.

## Thân bài

![MiniMax H3 Max: Faster Than Playback, AI Video Enters the Era of Real-Time Interaction | Luzhou Shengmingli](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/ee6557439bf7.jpg)

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/4bfcd20ab89d.gif)

MiniMax, công ty trong danh mục đầu tư của Oasis Capital, gần đây đã ra mắt mô hình H3 Max: việc tạo ra một đoạn video-âm thanh 5 giây, độ phân giải 768p mất chưa đầy 3 giây, cho phép tạo video "vượt tốc độ phát" lần đầu tiên và vượt qua ngưỡng tốc độ quan trọng cho tương tác thời gian thực.

Kể từ khi H3 được phát hành mã nguồn mở cách đây hơn ba tuần, mô hình này đã được tải xuống hơn 24 triệu lần và tạo ra hơn 300 mô hình phái sinh công khai. Các nhà phát triển đã xây dựng các kênh livestream thời gian thực và các đài truyền hình AI hoạt động 24 giờ dựa trên H3 Max, khi các mô hình video bắt đầu chuyển mình từ công cụ tạo nội dung thành các hệ thống nội dung vận hành liên tục.

Với những tiến bộ trong việc hiểu các chỉ dẫn phức tạp, tương tác thời gian thực và tạo nội dung đa phương thức, H3 Max cung cấp một nền tảng kỹ thuật ổn định và hiệu quả hơn cho các ứng dụng như livestream, trò chơi và kể chuyện tương tác. Điều này cũng báo hiệu rằng các mô hình lớn đang tăng tốc tích hợp vào các hoạt động kinh doanh thực tế và trải nghiệm hàng ngày, mở ra giá trị ứng dụng rộng lớn hơn.

Dưới đây là toàn bộ chia sẻ từ MiniMax. Mời bạn theo dõi.

Kỹ sư Alex Koumpas của fal đã biến kênh Twitch của mình thành một phòng biên kịch.

Một người nhập câu lệnh yêu cầu một cảnh đường phố; người xem tiếp theo muốn một quảng cáo phong cách rối thập niên 1960; người khác lại yêu cầu khung hình đột ngột chuyển sang khuôn mặt robot bị vướng trong vô số dây điện. Khung chat tràn ngập ý tưởng bằng tiếng Anh, Tây Ban Nha, Nhật Bản, Nga, Trung Quốc — những gợi ý từ người dùng trên khắp thế giới.

Koumpas đặt cho buổi stream một tiêu đề đơn giản: "Chat Directs the Show with MiniMax H3 Max" (Khán giả điều khiển chương trình với MiniMax H3 Max).

Twitch — kênh koumpas (video đã được tăng tốc). Buổi stream này là một hình ảnh thu nhỏ cho thấy hệ sinh thái nhà phát triển đã phát triển nhanh chóng như thế nào kể từ khi H3 được phát hành mã nguồn mở.

Sau khi mở mã nguồn H3, chúng tôi tiếp tục huấn luyện và tối ưu hóa mô hình cùng với các đối tác trong hệ sinh thái cho các trường hợp sử dụng khác nhau, đồng thời cung cấp các biến thể này cho cộng đồng:

Hôm nay, chúng tôi mang H3 Max 768P và H3 Max 480P lên Open Platform và MiniMax Design.

H3 Max tạo ra một đoạn video-âm thanh 5 giây, 768p trong chưa đầy 3 giây, vượt qua ngưỡng tốc độ cần thiết cho livestream thời gian thực. Trong khi một đoạn clip đang phát, hệ thống đã có thời gian để chuẩn bị đoạn tiếp theo.

Các nhà phát triển nước ngoài đã xây dựng các buổi livestream trên Twitch, các "đài truyền hình AI" 24 giờ và các thử nghiệm sáng tạo mời gọi người xem viết lại cốt truyện trong thời gian thực dựa trên H3 Max. Các mô hình video đang được kết nối vào các luồng nội dung chạy liên tục, bắt đầu tham gia vào tương tác thời gian thực nơi mỗi lệnh của người xem có thể thay đổi những gì xuất hiện tiếp theo.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/efed3b8f6a12.png)

Tạo nội dung trong 3 giây, đồng sáng tạo thời gian thực với người xem

Trong làn sóng livestream AI này, buổi stream Twitch của kỹ sư Rehan Sheikh tại fal là buổi đầu tiên gây sốt. Rehan kết nối trực tiếp H3 Max vào luồng livestream, tạo ra một "truyền hình xuyên không gian" không có lịch phát sóng cố định. Mô hình tạo ra hình ảnh và âm thanh mới liên tục trong vài giây, được truyền trực tiếp vào buổi phát sóng. Khái niệm này đã thu hút gần 3,5 triệu lượt xem trên X.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/80cea1df7460.png)

Ngay sau đó, nhà phát triển nổi tiếng Pieter Levels đã ra mắt một trang web livestream AI 24 giờ. Trang chủ chỉ có một quy tắc đơn giản: "Khung chat quyết định nội dung tiếp theo."

Người xem nhập vào khung chat và AI cố gắng kết nối các yêu cầu mới với cảnh trước đó trước khi tạo đoạn clip tiếp theo. Trong đài truyền hình mini chỉ với vài giây nội dung dự phòng này, buổi phát sóng có thể đột ngột chuyển từ hoạt hình sang một cuộc phỏng vấn trực tiếp, rồi nhảy sang một quảng cáo phi lý. Tin nhắn tiếp theo của khán giả sẽ đưa câu chuyện đi theo một hướng hoàn toàn khác.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/221db50007af.png)

Không giống như việc quay trước một video demo để phát sóng, livestream thời gian thực đòi hỏi phải xử lý đồng thời các câu lệnh lạ, tạo video, sắp xếp hàng đợi và phát trực tuyến liên tục. Tốc độ, khả năng hiểu chỉ dẫn và năng lực âm thanh-video của mô hình đều được kiểm chứng trong cùng một quy trình công khai: người xem đưa ra lệnh, mô hình tạo clip, clip đi vào livestream, lệnh mới tiếp nối.

Đây chính là lý do tại sao tốc độ tạo nội dung quyết định liệu buổi livestream có thể duy trì được hay không.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/35cd4260-2c09-4ac0-9e94-ffe73c7687eb/3ce8767debb9.png)

Tốc độ tạo nhanh hơn tốc độ phát, mở khóa các kịch bản livestream tức thời

H3 Max có thể hỗ trợ loại hình livestream này vì nó đủ nhanh.

H3 Max hỗ trợ chuyển văn bản thành video và hình ảnh thành video, tạo ra âm thanh-video hoàn chỉnh ở độ phân giải 480p hoặc 768p, từ 5 đến 15 giây, ở tốc độ 24fps. Một video 5 giây, 768p được tạo trong chưa đầy 3 giây; một video 15 giây hoàn thành trong khoảng 15 giây. Thông qua việc tối ưu hóa phối hợp giữa hậu huấn luyện và các công cụ suy luận, H3 Max đạt được thông lượng gấp khoảng 35 lần so với MiniMax H3 cơ sở, đứng đầu trên bảng xếp hạng chuyển hình ảnh thành video của Artificial Analysis và Design Arena.

Dựa trên nền tảng mã nguồn mở của MiniMax H3, fal đã thêm dữ liệu mới và học tăng cường có thể kiểm chứng để liên tục tối ưu hóa việc tuân thủ câu lệnh và chất lượng hình ảnh, đồng thời thích ứng với cơ sở hạ tầng suy luận của riêng mình để tối ưu hóa tạo nội dung thời gian thực. Một video 5 giây được tạo trong chưa đầy 3 giây, về lý thuyết để lại khoảng trống cho việc xếp hàng đợi, kiểm duyệt nội dung, mã hóa và phát trực tuyến. Mặc dù livestream thời gian thực vẫn phụ thuộc vào tính đồng thời và điều kiện mạng, đôi khi có hiện tượng giật lag, nhưng H3 Max đã đáp ứng các yêu cầu tốc độ cơ bản cho loại hình thử nghiệm thời gian thực này.

Demo tính nhất quán của phong cách vẽ bình gốm Hy Lạp cổ đại — trang web chính thức của fal

Đội ngũ FastVideo đã chọn một hướng đi khác trong việc thích ứng H3. FastVideo, Nuva Lab và NVIDIA FastGen đã cùng nhau phát hành FastH3, nén 49 lượt truyền tiến (forward passes) của Transformer cơ sở xuống còn 4, kết hợp với khả năng tăng tốc độ thưa (sparsity) VSA 90%.

FastH3 sử dụng 8 card B200 để tạo một video 15 giây, 768p trong 13 giây; trên một GPU Blackwell duy nhất, nó đạt tốc độ nhanh gấp 14 lần so với H3 cơ sở chạy trên phần cứng tương đương. FastH3 đã phát hành công khai trọng số mô hình, LoRA và các giải pháp suy luận, với phiên bản hiện tại hỗ trợ tạo văn bản thành âm thanh-video.

FastH3 — Demo chính thức của Hao AI Lab

Mã nguồn mở và sự cởi mở, để sự sáng tạo lên ngôi

Chúng tôi rất hào hứng khi thấy các hình thức tạo và tương tác video mới liên tục xuất hiện trong cộng đồng, được xây dựng trên mô hình H3 mã nguồn mở. Đối với MiniMax, cộng đồng mã nguồn mở không chỉ là người dùng của H3 — họ còn là những người tham gia quan trọng vào sự phát triển không ngừng của mô hình và sự đổi mới liên tục của các kịch bản ứng dụng thực tế.

Các buổi livestream AI 24 giờ hiện nay vẫn đang ở giai đoạn đầu; tính đồng thời và hoạt động dài hạn vẫn cần được kiểm chứng thêm. Độ ổn định giọng nói cho nhân vật, liệu hình ảnh có thể duy trì tính nhất quán trong thời gian dài hay không, liệu các giao diện suy luận có phù hợp với việc gọi liên tục hay không — những phản hồi thực tế từ các kịch bản livestream này sẽ quay trở lại phục vụ cho vòng tối ưu hóa mô hình và hệ thống tiếp theo.

Điều quan trọng là trong làn sóng livestream AI này, việc tạo video đang trở nên nhiều hơn là một công cụ tạo nội dung dùng một lần. Nó đang bắt đầu hoạt động như một hệ thống nội dung phản hồi trong thời gian thực và phát triển liên tục. MiniMax và cộng đồng mã nguồn mở đang cùng nhau thúc đẩy các giới hạn về tốc độ, tính tương tác và ứng dụng của các mô hình video.

Khi các mô hình tiếp tục lặp lại, chúng tôi tin rằng các nội dung tương tác mới, các công cụ sáng tạo mới và những sản phẩm mà con người chưa từng hình dung hay định nghĩa sẽ xuất hiện từ cộng đồng. Chúng tôi mong đợi các nhà phát triển và người sáng tạo đưa H3 vào nhiều kịch bản cụ thể hơn, khám phá những khả năng trước đây vốn không thực tế hoặc thậm chí không thể tưởng tượng được.

Kể từ khi H3 được phát hành mã nguồn mở cách đây hơn ba tuần, số lượt tải xuống đã vượt quá 24 triệu, với hơn 300 mô hình phái sinh công khai, trở thành mô hình được tải xuống nhiều nhất trên toàn cầu trong năm 2026. Chúng tôi sẽ tiếp tục khám phá cùng cộng đồng mã nguồn mở và các đối tác hệ sinh thái, giảm bớt rào cản cho các nhà phát triển và doanh nghiệp, đưa H3 vào nhiều ứng dụng thương mại thực tế hơn và giải quyết các vấn đề trước đây vốn nan giải.

Truy cập API cho H3 Max: platform.minimaxi.com/docs/api-reference/video-generation-v2-create

Tải xuống MiniMax Design: design.minimaxi.com
