Nghiên cứu
Tối ưu hóa kết nối dư có cấu trúc cho Diffusion Transformers
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu đề xuất cơ chế truy xuất chủ động thay vì cộng dồn thụ động trong Diffusion Transformers, giúp cải thiện hiệu suất khử nhiễu hình ảnh thông qua việc tích hợp các kết nối dư cục bộ và đường dẫn tầm xa.
Chính văn · Bản dịch AI
Tóm tắt: Diffusion Transformers (DiTs) đã khẳng định vị thế là một cấu trúc nền tảng có khả năng mở rộng cho việc tổng hợp hình ảnh độ trung thực cao. Tuy nhiên, không giống như các mô hình khuếch tán dựa trên U-Net vốn phụ thuộc vào các kết nối tắt (skip connections) cứng nhắc được thiết kế thủ công, DiTs chủ yếu sử dụng một luồng residual đồng nhất, tích hợp tất cả các lớp trước đó thành một trạng thái nguyên khối. Trong nghiên cứu này, chúng tôi xem xét lại các kết nối residual trong diffusion transformers và đề xuất chuyển đổi chúng từ dạng cộng thụ động sang cơ chế truy xuất chủ động được tối ưu hóa cho việc khử nhiễu hình ảnh. Đầu tiên, chúng tôi tiến hành phân tích hệ thống về biểu diễn nội tại của DiT, qua đó tiết lộ sự ưu tiên tiềm ẩn đối với việc tái sử dụng đặc trưng từ các lớp sớm và sự dẫn dắt đối xứng giữa các lớp. Dựa trên cơ sở đó, chúng tôi giới thiệu một thiết kế kết nối có cấu trúc, tích hợp rõ ràng các kết nối residual cục bộ với các đường dẫn tầm xa. Thay vì các kết nối tắt tĩnh hoặc định tuyến dày đặc qua tất cả các lớp, phương pháp của chúng tôi cho phép mỗi khối transformer "chú ý" một cách chọn lọc đến các biểu diễn quan trọng từ trước đó, truy xuất linh hoạt các tín hiệu không gian và ngữ nghĩa thông qua các đường dẫn xuyên chiều sâu trực tiếp và có thể vi phân. Các thí nghiệm cho thấy kết nối thích ứng của chúng tôi giúp hội tụ nhanh hơn, với số vòng lặp huấn luyện giảm tới $1,73\times$, đồng thời đạt được những cải thiện đáng kể về chỉ số FID và chất lượng hình ảnh với chưa đầy $0,1\%$ tham số bổ sung, giúp nâng cấp mô hình REPA-XL/2 mạnh mẽ từ $5,9$ lên $4,34$ FID mà không cần hướng dẫn (guidance) và đạt $1,39$ FID với hướng dẫn không cần bộ phân loại (classifier-free guidance). Những phát hiện của chúng tôi cho thấy kết nối thích ứng xuyên lớp là một yếu tố quan trọng nhưng chưa được khai thác đúng mức trong diffusion transformers, và việc kết hợp các đường dẫn thông tin có cấu trúc mang lại một hướng đi đơn giản và hiệu quả để cải thiện các mô hình tạo sinh có khả năng mở rộng.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.33203 [cs.CV] |
| (hoặc arXiv:2609.33203v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33203 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yuhe Liu [xem email] [v1] Chủ nhật, 27 tháng 9 năm 2026 04:42:36 UTC (969 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.