MiniMax: Blog (Web)
92

Mô hình

MiniMax ra mắt H3: Mô hình đa phương thức mã nguồn mở, hỗ trợ video 2K kèm âm thanh nổi

(giờ Việt Nam)

Tóm tắt AI

MiniMax vừa trình làng H3, mô hình đa phương thức có khả năng hiểu và tạo video 2K dài 15 giây với âm thanh nổi sống động. Với chi phí vận hành thấp hơn đáng kể so với các đối thủ, H3 hứa hẹn sẽ sớm được mở mã nguồn để thúc đẩy cộng đồng phát triển.

Bản dịch AI

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities

Hôm nay, chúng tôi chính thức ra mắt MiniMax H3, một mô hình tạo nội dung đa phương thức (omni-modal) đa năng. H3 có khả năng hiểu đồng thời các ngữ cảnh đa phương thức bao gồm văn bản, hình ảnh, video và âm thanh. Mô hình này tạo ra video với âm thanh nổi (stereo) nguyên bản ở độ phân giải lên tới 2K và thời lượng 15 giây.

Các thử nghiệm ban đầu cho thấy MiniMax H3 mang lại khả năng tạo nội dung sẵn sàng cho sản xuất trên nhiều trường hợp sử dụng khác nhau. Mô hình này vượt trội trong việc tuân thủ chỉ dẫn, trình bày văn bản và thương hiệu chính xác, cũng như tính năng V2V Motion Transfer. Với khả năng tạo và chỉnh sửa đa phương thức chính xác, có thể kiểm soát, H3 được xây dựng cho quảng cáo, xây dựng thương hiệu, thương mại điện tử, thiết kế sản phẩm, UI/UX, trò chơi và nhiều lĩnh vực khác.

Được vận hành bởi các công nghệ bao gồm Contextual Omni Representation, H3-VAE, H3-Omni Transformer và In-Context Regeneration, H3 mang lại hiệu năng trên giá thành dẫn đầu ngành. Chúng tôi cung cấp độ phân giải 2K làm mặc định. Ở mức 2K, giá mỗi giây của H3 thấp hơn một phần ba so với các mô hình phổ biến hiện nay, và ở mức 768p, giá này thấp hơn một nửa so với mức 720p của các mô hình phổ biến.

Các mô hình nguồn đóng từ lâu đã thống trị lĩnh vực tạo video, với tốc độ lặp lại chậm hơn và hệ sinh thái ít mở hơn so với các lĩnh vực như mô hình ngôn ngữ lớn. Để hỗ trợ cộng đồng mã nguồn mở, đẩy nhanh khả năng tương thích với nhiều loại phần cứng AI hơn và giúp người dùng dễ dàng xây dựng các phiên bản tùy chỉnh của riêng họ, chúng tôi dự định sẽ mở trọng số mô hình trong những ngày tới, tuân thủ các luật và quy định hiện hành. Khả năng tương thích phần cứng đã là một yếu tố then chốt ngay từ những giai đoạn đầu tiên trong quá trình thiết kế H3.

Hiểu ngữ cảnh đa phương thức

Công việc sáng tạo thực tế đòi hỏi sự kết hợp các thông tin phức tạp giữa các phương thức, sử dụng hình ảnh, âm thanh, video và nhiều nguồn đầu vào khác. Ví dụ, câu lệnh (prompt) cho cảnh quay dưới đây là: "Tham chiếu chuyển động máy quay kiểu Hitchcock từ Video 1, yêu cầu nhân vật trong Hình ảnh 2 hát, với phần giọng hát khớp với Âm thanh 3." Chỉ cần mô tả mối quan hệ giữa ngữ cảnh và video mục tiêu bằng lời. H3 tự mình xử lý việc hiểu toàn bộ phương thức phức tạp này.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Video 1

H3 en-v2 image 1

Hình ảnh 2

Trình duyệt của bạn không hỗ trợ âm thanh này. Vui lòng sử dụng trình duyệt khác.

Âm thanh 3

Video do H3 tạo ra:

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Các trường hợp sử dụng H3

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Trình duyệt của bạn không hỗ trợ video này. Vui lòng sử dụng trình duyệt khác.

Triết lý thiết kế của H3

Phá vỡ ranh giới giữa các tác vụ: Từ chuyên biệt đến đa năng

Trước đây chúng tôi đã phát triển hai thế hệ mô hình: Hailuo 01 xây dựng hệ thống từ con số không, và Hailuo 02 tập trung vào việc cải thiện các thành phần cốt lõi như hiệu quả kiến trúc, chất lượng dữ liệu và quy mô.

Khi thiết kế H3, chúng tôi nhận ra những hạn chế của các mô hình tạo nội dung trước đây về ranh giới tác vụ: tạo ảnh thường bị chia thành các mô hình chuyên gia riêng biệt cho T2I (văn bản sang ảnh), chỉnh sửa, tham chiếu chủ thể, tham chiếu chuyển động và tham chiếu phong cách; giọng nói, hiệu ứng âm thanh và âm nhạc trong tạo âm thanh phần lớn được nghiên cứu như các lĩnh vực riêng biệt; và tạo video còn bị phân mảnh hơn nữa thành văn bản sang video, ảnh sang video, khung hình đầu và cuối, tham chiếu chủ thể, tham chiếu chuyển động, tham chiếu giọng nói, chỉnh sửa video, v.v., với ranh giới rõ ràng giữa ảnh, video và âm thanh.

Những tác vụ, khả năng và phương thức biệt lập này đã hạn chế sự tự do sáng tạo trong thực tế. Và về phía đào tạo, nó giới hạn khả năng khái quát hóa của mô hình. Cả hai đều cho thấy dư địa lớn để thay đổi, cả trong mô hình ứng dụng và mô hình đào tạo. Vì vậy, nguyên tắc đầu tiên định hướng sự phát triển của H3 là thống nhất và khái quát hóa trên các tác vụ.

Dựa trên điều này, đây là tổng quan ngắn gọn về mô hình tiền huấn luyện của H3:

Những lựa chọn này đều hướng tới cùng một mục tiêu: mang lại cho H3 khả năng hiểu và tạo ngữ cảnh đa phương thức rộng rãi ngay từ giai đoạn tiền huấn luyện.

Trước đó chúng tôi đã nói về sự thay đổi trong mô hình đào tạo, vậy bối cảnh ứng dụng cho các mô hình video đang thay đổi như thế nào?

Chúng tôi đang thấy các nhà sáng tạo mô tả ý định của họ trực tiếp bằng ngôn ngữ tự nhiên, thay vì chỉ nhập một câu lệnh hình ảnh đơn giản. Khi khả năng hiểu đa phương thức, tuân thủ chỉ dẫn và thực thi tác vụ phức tạp tiếp tục được cải thiện, các mô hình video sẽ có thể nắm bắt ý định sáng tạo đầy đủ hơn, xử lý các nhu cầu nội dung phức tạp hơn và dần dần chuyển từ "tạo một đoạn clip" sang thực sự tham gia vào toàn bộ quá trình sản xuất nội dung.

Các lựa chọn kỹ thuật của H3

H3 được xây dựng trên một triết lý thiết kế đơn giản, nhưng việc hiện thực hóa nó lại vô cùng phức tạp. Từ Hailuo 01 và Hailuo 02 đến H3, mỗi thế hệ đều có độ phức tạp khi xây dựng tăng lên gấp bội so với thế hệ trước.

Một cái nhìn ngắn gọn về một số công nghệ cốt lõi của H3:

Một trong những điều quan trọng nhất chúng tôi đã thực hiện trong quá trình kỹ thuật H3 là tăng cường khả năng chú thích (captioning).

H3-Omni Transformer: Một kiến trúc được xây dựng để khái quát hóa tác vụ

Chúng tôi sẽ sớm chia sẻ Báo cáo Kỹ thuật H3 đầy đủ. Chúng tôi rất mong nhận được phản hồi từ các bạn.

Tầm nhìn & Những bước tiếp theo của chúng tôi

Ngôn ngữ, hình ảnh, video và âm thanh là những phương thức cơ bản của trải nghiệm con người. Chúng kết nối sâu sắc với nhau và đóng vai trò là giao diện chính của chúng ta với thế giới. Cùng nhau, chúng tạo thành các ngữ cảnh đa phương thức có thể truyền đạt một lượng lớn thông tin một cách hiệu quả, và khả năng thể hiện cũng như chia sẻ thông tin tự thân nó đã là một dạng năng suất.

Đối với việc hiểu và tạo đa phương thức, chúng tôi coi ngôn ngữ là một hệ thống tính toán có khả năng khái quát hóa và mở rộng. Đó là lý do tại sao chúng tôi tin rằng trí tuệ đa phương thức nên được đặt nền tảng sâu sắc trên ngôn ngữ.

MiniMaxAI tạo videoMã nguồn mởĐa phương thứcCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MiniMax: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.