IT Home
85

Thủ thuật

Intel hỗ trợ tối ưu hóa mô hình video MiniMax H3 trên GPU Arc Pro B70

(giờ Việt Nam)

Tóm tắt AI

Intel công bố hỗ trợ Day 0 cho mô hình video đa phương thức MiniMax H3, triển khai giải pháp song song hóa trên nhiều GPU Arc Pro B70 để tối ưu hóa hiệu suất suy luận.

Bản dịch AI

Theo tin từ IT ngày 3 tháng 8, Intel hôm nay thông báo cung cấp hỗ trợ Day 0 cho mô hình video đa phương thức mã nguồn mở thế hệ mới MiniMax H3.

Theo giới thiệu, Intel Arc Pro B70 đã hoàn tất việc thích ứng với MiniMax H3 ngay từ thời điểm ra mắt, đội ngũ Intel đã triển khai một phương án vận hành dựa trên GPU đa card. Phương án này sử dụng kiến trúc tổng thể bao gồm Encoder 8-card Tensor Parallel (8TP), DiT 8-card USP (Ulysses Sequence Parallel, kết hợp với Layer-wise Offloading) và VAE được triển khai trên GPU B70, qua đó hiện thực hóa việc tăng tốc GPU cho toàn bộ quy trình tạo video.

Trong đó, Encoder sử dụng 8-card Tensor Parallel để hoàn tất quá trình mã hóa văn bản; là mô-đun có khối lượng tính toán lớn nhất trong quá trình suy luận, DiT sử dụng 8-card USP kết hợp với công nghệ Layer-wise Offloading, cho phép các tham số mô hình được tải động theo từng lớp vào GPU. Điều này giúp vượt qua giới hạn bộ nhớ của một card đơn lẻ, giảm nhu cầu bộ nhớ thường trú của mô hình, đồng thời hỗ trợ triển khai các mô hình DiT quy mô lớn hơn; trong khi đó, VAE được triển khai trên GPU B70 để hoàn tất quá trình giải mã video cuối cùng. Phương án này cân bằng giữa dung lượng mô hình và hiệu suất tính toán, cung cấp một cách thức triển khai có khả năng mở rộng tốt hơn cho các mô hình tạo video quy mô lớn.

Trên cơ sở đó, đội ngũ đã kết hợp thêm các ưu điểm của Tensor Parallel (TP) và USP để phát triển phương án song song hỗn hợp 2TP×4USP. So với 8-card USP thuần túy, phương án này giảm mức độ song song của USP từ 8 xuống 4 và đưa vào 2 luồng Tensor Parallel để tăng tốc tính toán phối hợp. Việc này vừa duy trì khả năng mở rộng của mô hình, vừa giảm thiểu chi phí truyền thông do USP gây ra, đạt được sự cân bằng tối ưu giữa tải tính toán và chi phí truyền thông, từ đó nâng cao hơn nữa hiệu suất suy luận tổng thể.

IT được biết, đội ngũ còn kết hợp với tối ưu hóa XPU Kernel của dự án llm-scaler-omni, thực hiện tối ưu hóa liên tục các toán tử then chốt như nhân ma trận, attention, v.v., nhằm nâng cao hơn nữa hiệu suất tính toán của GPU, liên tục giảm độ trễ suy luận end-to-end và đạt được kết quả tối ưu hóa khả quan.

Đọc thêm:

"Mô hình video tổng quát MiniMax H3 chính thức mã nguồn mở, hỗ trợ ngữ cảnh đa phương thức, độ phân giải 2K"

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.

IntelMiniMax H3Video AIGPUTối ưu hóa
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.