Nghiên cứuĐiểm AI 92/100
Tinh chọnLLaDA-Image: Đột phá mô hình tạo ảnh từ văn bản không cần tiền huấn luyện cặp ảnh-chữ
LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong kiến trúc tạo ảnh, thay đổi tư duy huấn luyện truyền thống bằng cách tách biệt việc học hình ảnh và ngôn ngữ, có tính ứng dụng và tham khảo cao.