Mô hình
MiniMax ra mắt MiniMax H3: Mô hình đa phương thức tạo video 2K kèm âm thanh nổi 15 giây
(giờ Việt Nam)
Tóm tắt AI
MiniMax vừa trình làng mô hình đa phương thức H3, có khả năng xử lý đồng nhất văn bản, hình ảnh, âm thanh để tạo ra video 2K chất lượng cao với âm thanh nổi nguyên bản, thời lượng từ 4 đến 15 giây.
Bản dịch AI

MiniMax ra mắt MiniMax H3, một mô hình tạo nội dung đa phương thức (multimodal) đa năng. MiniMax H3 không phải là một mô hình chuyển văn bản thành video (text-to-video) có kèm các tiện ích bổ sung. MiniMax mô tả đây là mô hình tạo đa phương thức đa năng, có khả năng đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh thống nhất, sau đó trả về video với âm thanh nổi (stereo) nguyên bản. Các thông số kỹ thuật chính bao gồm: đầu ra 2K, thời lượng 4–15 giây, chỉ hỗ trợ các giá trị thời lượng số nguyên.
Các hệ thống video trước đây thường chia nhỏ thành các tác vụ như chuyển văn bản thành video, hình ảnh thành video, khung hình đầu và cuối, tham chiếu chủ thể, tham chiếu chuyển động và chỉnh sửa video, mỗi tác vụ thường là một mô hình chuyên biệt riêng lẻ. MiniMax H3 hợp nhất các tác vụ này vào một mô hình tiền huấn luyện duy nhất, nơi các mối quan hệ tham chiếu và chỉnh sửa được diễn đạt bằng ngôn ngữ tự nhiên. Ví dụ về câu lệnh (prompt) của MiniMax đã làm rõ điều này: tham chiếu chuyển động camera từ Video 1, yêu cầu nhân vật trong Hình ảnh 2 hát, và khớp giọng hát với Âm thanh 3.
Mô hình này có thể triển khai được không?
Hiện tại: có, thông qua API, nhưng chưa thể chạy trên phần cứng của riêng bạn. MiniMax đã ra mắt H3 vào ngày 31 tháng 7 năm 2026, với mô hình hiện đang hoạt động trên nền tảng API dưới ID MiniMax-H3 và trong ứng dụng người dùng Hailuo AI.
Các ngành ứng dụng: MiniMax định vị MiniMax H3 cho các lĩnh vực quảng cáo, xây dựng thương hiệu, thương mại điện tử, thiết kế sản phẩm, UI/UX, trò chơi, cùng với tiền hình ảnh hóa (pre-visualization) phim và phương tiện truyền thông cho danh mục bán lẻ.
Ứng dụng: Tạo các biến thể quảng cáo, video sản phẩm và danh mục, áp phích hoạt hình, phân cảnh tiêu đề phim, video vòng lặp (loop) cho trang web, các đoạn phim cắt cảnh (cinematics) trong game với nhân vật nhất quán, và chuyển đổi chuyển động từ video sang video.
Giao diện API
Tài liệu hướng dẫn tạo video ghi lại ba chế độ nhập liệu: văn bản thành video, hình ảnh thành video (khung hình đầu/cuối), và tạo dựa trên tham chiếu. Tất cả nằm sau một endpoint duy nhất với quy trình bất đồng bộ gồm ba bước: tạo tác vụ, truy vấn task_id, và tải xuống content.url.
Các giới hạn đầu vào cần lưu ý khi thiết kế:
Bốn thành phần kỹ thuật thực hiện công việc
Contextual Omni Representation (Biểu diễn ngữ cảnh toàn diện): MiniMax đã xây dựng lại hệ thống chú thích để mô tả mối quan hệ giữa ngữ cảnh và video mục tiêu, thay vì chỉ mô tả mục tiêu. Hầu hết các tài liệu nguồn yêu cầu khoảng 100K token suy luận, được chắt lọc xuống còn khoảng 4K token trung bình. Ngôn ngữ chính là cầu nối biến một tập hợp tác vụ cố định thành một tập hợp mở và có tính mô tả.
H3-VAE: Một cuộc đại tu hoàn toàn về tokenizer. Tỷ lệ nén cao của nó mang lại mức tăng gấp 4 lần về độ dài chuỗi hiệu dụng, giúp cắt giảm chi phí huấn luyện và suy luận, đồng thời là công nghệ then chốt cho khả năng hỗ trợ 2K nguyên bản.
H3-Omni Transformer: MiniMax đã loại bỏ kiến trúc Hailuo-02 trong trường hợp này. Ngữ cảnh đa phương thức làm tăng gấp ba lần phương sai độ dài chuỗi, vì vậy kiến trúc huấn luyện tách biệt khối lượng công việc hiểu và tạo, đồng thời tinh chỉnh việc sử dụng phần cứng cho từng phần. Kết quả được báo cáo: thông lượng huấn luyện end-to-end tăng gần 30%.
In-Context Regeneration (Tái tạo trong ngữ cảnh): Thay vì sử dụng mô-đun siêu phân giải (super-resolution) gắn ngoài, mô hình cơ sở sẽ tự tái tạo đầu ra độ phân giải thấp của chính nó ngay trong ngữ cảnh, bằng cách đọc lại ngữ cảnh đa phương thức ban đầu. Đây chính là yếu tố giúp khôi phục văn bản nhỏ và các chi tiết tinh vi mà các bộ nâng cấp (upscaler) thông thường chỉ có thể đoán — điều này cực kỳ quan trọng đối với việc kết xuất (render) thương hiệu và sản phẩm.
Giá cả và vị thế
Tuyên bố từ phía MiniMax: ở độ phân giải 2K, giá mỗi giây của H3 thấp hơn một phần ba so với các mô hình phổ biến; ở 768p, giá thấp hơn một nửa so với các mô hình 720p phổ biến. Công ty đã quảng bá cả sự kiện ra mắt và khung giá trên X (1, 2). Các đơn vị theo dõi bên thứ ba và các bài viết ra mắt cho biết mức giá pay-as-you-go cho 2K là 0,13 USD mỗi giây, khoảng 1,95 USD cho một clip 15 giây, tuy nhiên trang pay-as-you-go của MiniMax tại thời điểm viết bài vẫn chỉ liệt kê các gói Hailuo 2.3, vì vậy hãy coi con số này là thông tin tham khảo, không phải thông tin chính thức.
Về vị thế: SCMP dẫn nguồn từ Artificial Analysis cho biết H3 dẫn đầu trong lĩnh vực chỉnh sửa video, trong khi vẫn xếp sau Google Gemini Omni Flash ở mảng văn bản thành video, và xếp sau cả Seedance 2.0 lẫn Gemini Omni Flash ở mảng hình ảnh thành video.
Những điểm chính cần lưu ý
Phân tích cảm xúc
Hãy xem các chi tiết kỹ thuật. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký Bản tin (Newsletter) của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến (Webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy (machine learning) và học sâu (deep learning), vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.