Nghiên cứu
CalibAtt: Phương pháp tối ưu hóa Attention giúp tăng tốc tạo video AI lên 1,58 lần
(giờ Việt Nam)
Tóm tắt AI
Apple và Đại học Tel Aviv giới thiệu CalibAtt, kỹ thuật tinh chỉnh Attention không cần huấn luyện giúp tăng tốc tạo video lên 1,58 lần bằng cách loại bỏ các tính toán dư thừa, đảm bảo chất lượng hình ảnh mà không làm giảm độ chính xác.
Bản dịch AI

Tác giả: Shai Yehezkel†, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar
Các mô hình khuếch tán (diffusion models) gần đây cho phép tạo video chất lượng cao, nhưng lại gặp vấn đề về thời gian chạy chậm. Các backbone lớn dựa trên transformer được sử dụng trong các mô hình này bị nghẽn bởi cơ chế chú ý không-thời gian (spatiotemporal attention). Trong bài báo này, chúng tôi xác định rằng một phần đáng kể các kết nối token-to-token liên tục tạo ra các điểm số không đáng kể trên nhiều đầu vào khác nhau, và các mô hình của chúng thường lặp lại qua các truy vấn. Do đó, việc tính toán chú ý trong các trường hợp này có thể được bỏ qua mà hầu như không ảnh hưởng đến kết quả. Quan sát này vẫn đúng đối với các kết nối giữa các khối token cục bộ. Từ động lực đó, chúng tôi giới thiệu CalibAtt, một phương pháp không cần huấn luyện (training-free) giúp tăng tốc tạo video thông qua cơ chế chú ý thưa thớt đã được hiệu chỉnh (calibrated sparse attention). CalibAtt thực hiện một bước hiệu chỉnh ngoại tuyến (offline calibration) để xác định độ thưa thớt ở cấp độ khối và các mô hình lặp lại ổn định trên các đầu vào, sau đó biên dịch các mô hình này thành các thao tác chú ý được tối ưu hóa cho từng lớp, từng head và từng bước thời gian khuếch tán (diffusion timestep). Tại thời điểm suy luận (inference time), chúng tôi tính toán các kết nối phụ thuộc vào đầu vào đã chọn một cách dày đặc, và bỏ qua các kết nối không được chọn theo cách hiệu quả với phần cứng. Các thử nghiệm mở rộng trên Wan 2.1 14B, Mochi 1 và các mô hình chưng cất (distilled models) ít bước ở nhiều độ phân giải khác nhau cho thấy CalibAtt đạt tốc độ tăng tốc end-to-end lên tới 1,58 lần, vượt trội hơn các phương pháp không cần huấn luyện hiện có trong khi vẫn duy trì chất lượng tạo video và sự căn chỉnh văn bản-video.
Các bài đọc liên quan và cập nhật.
Các bộ mã hóa token hình ảnh (visual tokenizers) ánh xạ các pixel thô có chiều cao thành một biểu diễn nén để phục vụ cho việc mô hình hóa hạ nguồn (downstream modeling). Ngoài việc nén, các bộ mã hóa token còn quyết định thông tin nào được bảo toàn và cách thức tổ chức thông tin đó. Một phương pháp tiêu chuẩn thực tế để mã hóa token video là biểu diễn video dưới dạng lưới 3D không-thời gian của các token, mỗi token nắm bắt thông tin cục bộ tương ứng trong tín hiệu gốc. Điều này đòi hỏi mô hình hạ nguồn tiêu thụ…
Đọc thêm
Normalizing flows (NFs) là các mô hình tạo dựa trên xác suất (likelihood-based) end-to-end cho dữ liệu liên tục, và gần đây đã thu hút sự chú ý trở lại với những tiến bộ đáng khích lệ trong việc tạo hình ảnh. Tuy nhiên, trong lĩnh vực tạo video, nơi độ phức tạp không-thời gian và chi phí tính toán cao hơn đáng kể, các hệ thống hiện đại nhất gần như chỉ dựa vào các mô hình dựa trên khuếch tán (diffusion-based models). Trong công trình này, chúng tôi xem xét lại không gian thiết kế này bằng cách giới thiệu STARFlow-V, một…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.