IT Home
92

Mô hình

MiniMax H3 chính thức mã nguồn mở: Mô hình video đa phương thức hỗ trợ độ phân giải 2K

(giờ Việt Nam)

Tóm tắt AI

MiniMax vừa ra mắt mô hình video H3, cho phép xử lý đồng bộ văn bản, hình ảnh, âm thanh để tạo video 2K dài 15 giây kèm âm thanh nổi nguyên bản.

Bản dịch AI

Theo tin từ IT ngày 3 tháng 8, hôm nay MiniMax đã chính thức mã nguồn mở thế hệ mô hình video đa năng mới mang tên MiniMax H3.

Theo giới thiệu, MiniMax H3 là một hệ thống tạo nội dung toàn phương thức (full-modal) đa năng. Nó có khả năng hiểu thống nhất các ngữ cảnh đa phương thức bao gồm văn bản, hình ảnh, video và âm thanh, đồng thời có thể tạo ra video với độ phân giải lên tới 2K, thời lượng tối đa 15 giây, đi kèm âm thanh nổi (stereo) nguyên bản. Nhờ thiết kế hệ thống hướng tới khả năng tổng quát hóa tác vụ, H3 đã sở hữu năng lực hiểu và tạo ngữ cảnh đa phương thức rộng rãi ngay từ giai đoạn tiền huấn luyện, từ đó có thể tuân thủ xuất sắc các chỉ dẫn đa phương thức phức tạp.

IT lưu ý, H3 hỗ trợ các thông số kỹ thuật đầu vào và đầu ra sau:

Thời lượng đầu ra: 4–15 giây

Tỷ lệ khung hình đầu ra: Hỗ trợ nhiều tỷ lệ khung hình, bao gồm nhưng không giới hạn ở 21:9, 16:9, 4:3, 1:1, 3:4 và 9:16

Độ phân giải đầu ra: Hỗ trợ nhiều kích thước độ phân giải, mặc định cạnh ngắn được thiết lập là 768 pixel. Sử dụng H3-Regenerate-2K có thể tạo ra độ phân giải 2K

Tốc độ khung hình đầu ra: 24 FPS

Âm thanh đầu ra: 32 kHz stereo

Ngôn ngữ hội thoại được hỗ trợ: Hỗ trợ ổn định 11 ngôn ngữ: tiếng Ả Rập, tiếng Trung, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha. Đối với các ngôn ngữ khác, hệ thống cũng cung cấp mức độ hỗ trợ khác nhau.

Phiên bản mô hình và thông số kỹ thuật đầu vào:

① H3-Base-FL2VA

Chế độ khung hình đầu - cuối: Hỗ trợ nhập 0, 1 hoặc 2 hình ảnh:

Khi không nhập hình ảnh: chế độ văn bản sang video (text-to-video);

Khi nhập hình ảnh khung đầu: chế độ khung đầu sang video;

Khi nhập hình ảnh khung cuối: chế độ khung cuối sang video;

Khi nhập đồng thời hình ảnh khung đầu và khung cuối: chế độ khung đầu - cuối sang video

② H3-Base-Ref2VA

Chế độ tham chiếu toàn phương thức:

Hình ảnh: tối đa 9 ảnh;

Video: tối đa 3 đoạn; mỗi đoạn phải có thời lượng từ 2–15 giây, tổng thời lượng không quá 15 giây;

Âm thanh: tối đa 3 đoạn. Âm thanh phải được nhập cùng với hình ảnh hoặc video, không thể là đầu vào duy nhất; mỗi đoạn phải có thời lượng từ 2–15 giây, tổng thời lượng không quá 15 giây;

Đầu vào hỗn hợp: Tổng cộng tối đa 12 tệp đầu vào thuộc mọi loại

图片

Hệ thống H3 hoàn chỉnh bao gồm ba mô-đun sau:

H3-Context-IR: Khi đầu vào ngày càng phức tạp, chúng tôi đã xây dựng một hệ thống chuyên biệt để hiểu sâu và tinh lọc các chỉ dẫn đa phương thức đầu vào, sau đó chuyển đổi chúng thành dạng mà H3 dễ hiểu hơn và có thể sử dụng trực tiếp để tạo nội dung, đó là Context Intermediate Representation (Biểu diễn trung gian ngữ cảnh). H3-Context-IR rất quan trọng đối với chất lượng đầu ra cuối cùng. Do đó, chúng tôi đặc biệt khuyến nghị tích hợp API H3-Context-IR vào quy trình tạo nội dung. Hoặc, bạn có thể tham khảo hướng dẫn về prompt để xây dựng hệ thống xử lý ngữ cảnh của riêng mình.

H3-Base: Tạo âm thanh và video dựa trên đầu ra của H3-Context-IR, với kết quả đầu ra có độ phân giải 768p.

H3-Regenerate-2K: Gửi kết quả tạo ra ở mức 768p cùng với ngữ cảnh gốc trở lại H3 để tạo lại đầu ra ở độ phân giải 2K. Điều này vừa phát huy khả năng tạo nội dung mạnh mẽ của H3, vừa tận dụng triệt để thông tin phong phú chứa trong ngữ cảnh gốc, từ đó tạo ra kết quả có độ phân giải cao với chi tiết chính xác hơn và độ trung thực hình ảnh cao hơn.

MiniMax H3 được phát hành dựa trên giấy phép MiniMax H3 Community License.

Địa chỉ mã nguồn mở: huggingface.co/MiniMaxAI/MiniMax-H3

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.

MiniMaxVideoAIMãNguồnMởGenerativeAIH3
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.