Nghiên cứu chỉ ra sự mất cân bằng trong các mô hình Transformer đa phương thức, nơi video áp đảo các tín hiệu khác. Phương pháp RecCAR sử dụng cơ chế chính quy hóa KL để cân bằng lại sự tương tác, giúp cải thiện đáng kể độ chính xác về chuyển động và đồng bộ âm thanh trong video.
StepAudio 3 Music là mô hình tạo nhạc quy mô lớn, sử dụng kiến trúc Diffusion Transformer kết hợp lập kế hoạch bằng ký hiệu ABC để kiểm soát chặt chẽ cấu trúc, hòa âm và nhịp điệu của bản nhạc.
DịchMarigold V2 tối ưu hóa kiến trúc Diffusion Transformer để nâng cao độ chính xác và hiệu quả trong việc ước tính độ sâu từ ảnh đơn, mở ra tiềm năng mới cho thị giác máy tính.
Marigold V2 ứng dụng kiến trúc Diffusion Transformer để tối ưu hóa việc ước tính độ sâu, cho phép suy luận một bước với độ chính xác vượt trội trên các chi tiết phức tạp như lông thú hay tán lá, đồng thời giảm đáng kể chi phí vận hành.
LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong kiến trúc tạo ảnh, thay đổi tư duy huấn luyện truyền thống bằng cách tách biệt việc học hình ảnh và ngôn ngữ, có tính ứng dụng và tham khảo cao.
04/09
Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
LLaDA-Image là khung làm việc thống nhất kết hợp Diffusion Transformer 6B được huấn luyện từ đầu với mô-đun hiểu ngôn ngữ hình ảnh dựa trên nền tảng LLaDA2.0-Mini.
PixRestore là mô hình Diffusion Transformer hoạt động trực tiếp trên không gian pixel, loại bỏ sự phụ thuộc vào VAE để bảo toàn chi tiết ảnh sắc nét và khắc phục các lỗi sai lệch nội dung thường gặp ở các mô hình T2I.
Vì sao đáng đọc: Giải pháp sáng tạo khi từ bỏ VAE để tối ưu hóa phục hồi ảnh, giải quyết trực tiếp điểm yếu của các mô hình khuếch tán hiện nay. Rất đáng chú ý cho giới nghiên cứu thị giác máy tính.
14/08
Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
LiveAnimate là hệ thống tạo hoạt ảnh người dùng mô hình DiT 14B, cho phép tạo video dài ổn định với độ trễ thấp nhờ cơ chế PR-Sink và tối ưu hóa quy trình lấy mẫu chỉ trong 3 bước.