Mô hình
ComfyUI hỗ trợ MiniMax H3: Mở khóa khả năng tạo video 2K và âm thanh gốc
(giờ Việt Nam)
Tóm tắt AI
ComfyUI vừa cập nhật hỗ trợ Day-0 cho mô hình MiniMax H3, cho phép người dùng khai thác sức mạnh đa phương thức từ văn bản, hình ảnh đến video 2K và âm thanh ngay trong quy trình làm việc.
Bản dịch AI

MiniMax H3 đã chính thức ra mắt hôm nay với trọng số mở (open weights) và được hỗ trợ trực tiếp trong ComfyUI ngay từ sáng nay. Ngay trong ngày đầu tiên.
Đây là mô hình video mã nguồn mở thế hệ mới. Chỉ cần cung cấp văn bản, hình ảnh, video hoặc âm thanh, mô hình sẽ tạo ra video với âm thanh stereo chân thực, độ phân giải lên đến 2K và thời lượng tối đa 15 giây mỗi clip. Đây là mô hình video thế hệ thứ ba của MiniMax, tiếp nối Hailuo 01 và Hailuo 02, đồng thời là mô hình đầu tiên được công ty phát hành dưới dạng trọng số mở.
Trải nghiệm trên Comfy Cloud
Text-to-video — chỉ cần nhập câu lệnh (prompt).
Image-to-video — thổi hồn vào hình ảnh.
First-and-last-frame — kiểm soát khung hình đầu, khung hình cuối hoặc cả hai, và để mô hình tự hoàn thiện phần còn lại.
Reference-to-video — cung cấp hình ảnh, video hoặc âm thanh tham chiếu để truyền tải chủ thể, chuyển động hoặc giọng nói vào clip.
Đầu ra đạt độ phân giải 2K và thời lượng lên đến 15 giây. Âm thanh được tạo cùng lúc với video trong một lần xử lý, là âm thanh stereo thực thụ chứ không phải được chèn thêm sau đó.
Đây là khả năng dẫn đầu của MiniMax, giúp hợp nhất năm tác vụ riêng biệt vào một mô hình duy nhất. Công việc thực tế hiếm khi chỉ dựa trên một phương thức duy nhất. H3 tiếp nhận hình ảnh, âm thanh và video cùng lúc, sau đó xử lý chúng dựa trên câu lệnh mô tả mối quan hệ giữa các yếu tố đó. Bạn chỉ cần mô tả mối liên hệ giữa các đầu vào và cảnh quay mong muốn, mô hình sẽ tự xử lý các tác vụ đa phương thức (cross-modal).
Âm thanh là một thuộc tính của mô hình, không phải là quy trình hậu kỳ. Mọi đầu ra âm thanh đều là stereo nguyên bản.
Chuyển đổi chuyển động (motion transfer) là yếu tố quan trọng nhất đối với công việc đồ họa. Một video tham chiếu có thể cung cấp chuyển động — như góc máy, diễn xuất, nhịp cắt — trong khi chủ thể và phong cách được lấy từ nguồn khác. Kết hợp với tính năng chỉnh sửa tại chỗ (in-place editing), điều này cho phép bạn lặp lại và tinh chỉnh cảnh quay một cách dễ dàng.
Để H3 chạy mượt mà trên phần cứng phổ thông, đội ngũ đã phải thực hiện kỹ thuật học máy đáng kể. Chúng tôi nhận thấy rằng các trọng số điều biến của mô hình (~40% tổng tham số) có thể được cắt tỉa và thay thế bằng một bảng tra cứu (lookup table) tương đương về chức năng, giúp giảm đáng kể dung lượng bộ nhớ mà không làm giảm chất lượng đầu ra.
Ngoài ra, các trọng số còn đi kèm với kỹ thuật lượng tử hóa int8 convrot chính xác và hiệu quả, cùng các nhân (kernel) tùy chỉnh giúp giảm mức sử dụng VRAM đỉnh điểm trong quá trình suy luận (inference).

Kết quả là tổng dung lượng bộ nhớ giảm 66%, từ 123,6 GB ở độ chính xác đầy đủ xuống còn 42,5 GB với các biến thể mô hình nhỏ nhất. Kết hợp với tính năng giảm tải VRAM động của chúng tôi, mô hình video 2K thế hệ mới này có thể chạy cục bộ trên các GPU như RTX 3060.
Hãy cập nhật ComfyUI lên phiên bản mới nhất 0.30.0 hoặc truy cập Comfy Cloud.
Tải xuống các quy trình làm việc (workflow) bên dưới hoặc tìm chúng trong thư viện mẫu.
Tải xuống quy trình làm việc MiniMax H3 I2V
Tải xuống quy trình làm việc MiniMax H3 R2V
Tải xuống quy trình làm việc MiniMax H3 T2V
Làm theo ghi chú trong quy trình làm việc để tải xuống các mô hình và lưu chúng vào đúng thư mục mô hình.
Viết câu lệnh (prompt) của bạn, kết nối các đầu vào khung hình hoặc tham chiếu, và nhấn chạy.
Trọng số mô hình: 🤗 Comfy-Org/MiniMax-H3
Như thường lệ, chúc bạn sáng tạo vui vẻ!
Không có bài viết nào
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.