Nghiên cứu
Kiểm soát các token ngoại lai trong Diffusion Transformer với phương pháp Dual-Stage Registers
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ Apple chỉ ra rằng các token ngoại lai gây lỗi trong mô hình DiT do làm hỏng ngữ nghĩa cục bộ. Phương pháp Dual-Stage Registers (DSR) được đề xuất để xử lý vấn đề này, giúp cải thiện đáng kể chất lượng hình ảnh trong các tác vụ tạo ảnh.
Bản dịch AI

Tác giả: Xiaoyu Wu†*, Yifei Wang†*, Tsu-Jui Fu, Liang-Chieh Chen, Zhe Gan, Chen Wei†
Chúng tôi nghiên cứu các outlier token trong Diffusion Transformers (DiTs) phục vụ cho việc tạo ảnh. Các nghiên cứu trước đây đã chỉ ra rằng Vision Transformers (ViTs) có thể tạo ra một lượng nhỏ các token có chuẩn (norm) cao, thu hút sự chú ý không cân xứng trong khi lại chứa ít thông tin cục bộ, nhưng vai trò của chúng trong các mô hình tạo sinh vẫn chưa được khám phá đầy đủ. Chúng tôi chứng minh rằng hiện tượng này xuất hiện ở cả bộ mã hóa (encoder) và bộ khử nhiễu (denoiser) của các quy trình Representation Autoencoder (RAE)-DiT hiện đại: các bộ mã hóa ViT được huấn luyện trước có thể tạo ra các biểu diễn outlier, và bản thân các DiT cũng có thể phát triển các outlier token nội bộ, đặc biệt là ở các lớp trung gian. Hơn nữa, việc chỉ đơn thuần che (mask) các token có chuẩn cao không cải thiện hiệu suất, cho thấy vấn đề không chỉ do một vài giá trị cực đoan gây ra, mà liên quan chặt chẽ hơn đến ngữ nghĩa của các patch cục bộ bị hỏng. Để giải quyết vấn đề này, chúng tôi giới thiệu Dual-Stage Registers (DSR), một phương pháp can thiệp dựa trên register cho cả hai thành phần: sử dụng các register đã được huấn luyện khi có sẵn, hoặc các register đệ quy tại thời điểm kiểm thử (test-time) trong trường hợp ngược lại, và các diffusion register cho bộ khử nhiễu. Trên ImageNet và các tác vụ tạo ảnh từ văn bản quy mô lớn, các biện pháp can thiệp này giúp giảm thiểu nhất quán các nhiễu outlier và cải thiện chất lượng tạo ảnh. Kết quả của chúng tôi nhấn mạnh việc kiểm soát outlier-token là một yếu tố quan trọng trong việc xây dựng các DiT mạnh mẽ hơn.
Các bài đọc và cập nhật liên quan.
Trong nghiên cứu này, chúng tôi thực nghiệm nghiên cứu Diffusion Transformers (DiTs) cho việc tạo ảnh từ văn bản, tập trung vào các lựa chọn kiến trúc, chiến lược điều kiện hóa văn bản (text-conditioning) và các giao thức huấn luyện. Chúng tôi đánh giá một loạt các kiến trúc dựa trên DiT—bao gồm các biến thể kiểu PixArt và MMDiT—và so sánh chúng với một biến thể DiT tiêu chuẩn xử lý trực tiếp các đầu vào văn bản và nhiễu được nối với nhau. Đáng ngạc nhiên là kết quả của chúng tôi cho thấy hiệu suất của các mô hình tiêu chuẩn…
Đọc thêm
Các nghiên cứu gần đây về khả năng tổng quát hóa của các mô hình khuếch tán (diffusion models) với bộ khử nhiễu dựa trên UNet đã tiết lộ các thiên kiến quy nạp (inductive biases) có thể được biểu diễn thông qua các cơ sở điều hòa thích ứng hình học (geometry-adaptive harmonic bases). Tuy nhiên, trên thực tế, các mạng khử nhiễu gần đây hơn thường dựa trên transformer, ví dụ như diffusion transformer (DiT). Điều này đặt ra câu hỏi: liệu các mạng khử nhiễu dựa trên transformer có thể hiện các thiên kiến quy nạp cũng có thể được biểu diễn thông qua các cơ sở điều hòa thích ứng hình học…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.