Nghiên cứu
Tối ưu hóa khả năng khuếch tán trong không gian tiềm ẩn cao chiều với x0-prediction
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giải quyết vấn đề suy giảm hiệu suất của các bộ mã hóa RAE bằng cách chuyển sang tham số hóa dữ liệu sạch (x0-prediction), giúp tập trung học tập vào cấu trúc đa tạp tín hiệu thay vì nhiễu, từ đó cải thiện đáng kể chất lượng tạo ảnh từ văn bản.
Chính văn · Bản dịch AI
Tóm tắt: Representation Autoencoders (RAEs) cho phép các mô hình khuếch tán (diffusion models) hoạt động trong không gian đặc trưng của các bộ mã hóa hình ảnh (visual encoders) đã được huấn luyện trước. Tuy nhiên, nhiều bộ mã hóa có sẵn không được tối ưu hóa để tái tạo trung thực, dẫn đến việc loại bỏ các chi tiết hình ảnh tinh vi. Đúng như dự đoán, việc tinh chỉnh (finetuning) các bộ mã hóa này để tái tạo hình ảnh sẽ khôi phục được các chi tiết đó. Tuy nhiên, có lẽ trái với trực giác, quy trình này làm giảm số chiều hiệu dụng của biểu diễn thu được, và hình học bị thay đổi sẽ gây ra các tác động hạ nguồn đối với quá trình tạo ảnh. Cụ thể, chúng tôi chỉ ra rằng việc sử dụng dự đoán vận tốc tiêu chuẩn trong flow matching trong không gian nhiều chiều này đòi hỏi mô hình phải khớp với các hướng nhiễu trực giao nằm ngoài đa tạp tín hiệu (signal manifold) có số chiều thấp, khiến cho việc tối ưu hóa trở nên kém hiệu quả. Điều này thúc đẩy việc sử dụng tham số hóa dữ liệu sạch ($\boldsymbol{x}_{0}$-prediction) thay thế, giúp tập trung việc học vào đa tạp tín hiệu cơ bản. Thông qua các thử nghiệm với nhiều bộ mã hóa tái tạo mạnh mẽ, chúng tôi cho thấy rằng $\boldsymbol{x}_{0}$-prediction cải thiện hiệu suất tạo ảnh từ văn bản một cách nhất quán.
| Bình luận: | Được chấp nhận tại ECCV 2026. Trang dự án: this https URL |
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.28473 [cs.CV] |
| (hoặc arXiv:2609.28473v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.28473 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử nộp bài
Từ: Chao Feng [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 17:59:56 UTC (14.667 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.