Nghiên cứu
FuseReg: Giải pháp thu hẹp khoảng cách tái tạo và tạo ảnh trong Representation Autoencoders
(giờ Việt Nam)
Tóm tắt AI
FuseReg thay thế việc chọn lớp thủ công bằng phương pháp lấy mẫu ngẫu nhiên, giúp tối ưu hóa sự cân bằng giữa chi tiết pixel và chất lượng tạo ảnh trong các mô hình RAE.
Chính văn · Bản dịch AI
Tác giả: Hongyang Du, Yunfei Xie, Junjie Ye, Jiawei Yang, Xiaoyan Cong, Haodong Zhang, Yongchao Huang, Haiyu Wu, Zongxia Li, Shihang Gui, Dawei Liu, Runhao Li, Jingcheng Ni, Chen Wei, Randall Balestriero, Yue Wang
Tóm tắt: Representation autoencoders (RAEs) tái sử dụng các đặc trưng từ một visual encoder được huấn luyện trước làm không gian ẩn (latent) cho quá trình tái tạo và khuếch tán, từ đó tích hợp các biểu diễn hình ảnh mạnh mẽ vào quá trình tạo ảnh. Tuy nhiên, RAEs vẫn cần quyết định lớp encoder nào sẽ tạo thành không gian ẩn chung cho generator và pixel decoder. Lựa chọn này đòi hỏi sự đánh đổi. Các lớp nông hơn thường bảo toàn chi tiết pixel tốt hơn, trong khi các lớp sâu hơn thường mang lại các chỉ số tạo ảnh tốt hơn. Do đó, việc hợp nhất lớp theo phương pháp heuristic cố định sẽ kết hợp hai giai đoạn vốn hưởng lợi từ các loại thông tin khác nhau. Chúng tôi giới thiệu FuseReg, thay thế việc lựa chọn đặc trưng heuristic bằng cách huấn luyện trên các tập con ngẫu nhiên của các lớp encoder. Chúng tôi phân tích cơ chế nền tảng về mặt lý thuyết: việc lấy mẫu tập con giúp phạt rõ ràng độ nhạy đối với sự bất đồng giữa các lớp. Trên ImageNet-256 với DINOv3-L, một bộ giải mã FuseReg duy nhất có thể tái tạo từ các hợp nhất toàn phần, thưa và đơn lớp mà không cần huấn luyện lại, đạt chỉ số PSNR cao hơn so với các bộ giải mã chuyên biệt cho các hợp nhất cố định. Sự linh hoạt này cũng mang lại lợi ích cho quá trình tạo ảnh: chỉ riêng việc thay thế bộ giải mã đã giúp giảm 27% chỉ số gFID không hướng dẫn (unguided gFID) với generator RAEv2 DiT-XL không đổi. Nguyên tắc chính quy hóa tương tự cũng được mở rộng cho quá trình huấn luyện khuếch tán, với việc chính quy hóa đồng thời cả hai giai đoạn giúp giảm 29% chỉ số gFID không hướng dẫn trên DiT-Base. Những kết quả này cho thấy việc huấn luyện các mô hình hạ nguồn để đạt độ bền vững trong hợp nhất lớp giúp thu hẹp khoảng cách giữa tái tạo và tạo ảnh mà không cần sửa đổi visual encoder đã huấn luyện trước.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.31620 [cs.CV] |
| (hoặc arXiv:2609.31620v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.31620 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Hongyang Du [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 17:59:59 UTC (5.162 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.