Mô hình
Ant Group ra mắt LLaDA-Image: Bộ mô hình mã nguồn mở đột phá về tạo và chỉnh sửa ảnh
(giờ Việt Nam)
Tóm tắt AI
Ant Group (inclusionAI) vừa phát hành dòng mô hình LLaDA-Image, bao gồm phiên bản Base 6B và bản Turbo tối ưu hóa chỉ cần 2-4 bước lấy mẫu, hỗ trợ định dạng BF16/FP8.
Bản dịch AI
LLaDA-Image: Xây dựng các trình tạo ảnh mạnh mẽ với công thức huấn luyện hoàn toàn mở
Chào mừng bạn đến với kho lưu trữ chính thức của LLaDA-Image, một mô hình thống nhất dành cho việc tạo và chỉnh sửa hình ảnh chất lượng cao.
Tạo ảnh chân thực với ánh sáng tự nhiên, chi tiết sống động và các khung cảnh nhất quán.
Kết xuất văn bản chất lượng cao và tạo poster sáng tạo trên nhiều phong cách hình ảnh đa dạng.
Chỉnh sửa hình ảnh theo hướng dẫn với khả năng bảo toàn nội dung trung thực và thay đổi hình ảnh chính xác.
Giới thiệu
LLaDA-Image là một dòng mô hình tạo và chỉnh sửa hình ảnh thống nhất, mã nguồn mở, có tính cạnh tranh với 6 tỷ tham số. Dòng mô hình này bao gồm LLaDA-Image, một mô hình cơ sở (Base) 50 bước dành cho việc tạo ảnh từ văn bản và chỉnh sửa theo hướng dẫn chất lượng cao, và LLaDA-Image-Turbo, một mô hình chưng cất (distilled) 4 bước giúp tạo và chỉnh sửa nhanh chóng. Cả hai biến thể đều hỗ trợ tạo ảnh từ văn bản thực tế, tạo ảnh có điều kiện VQ, chỉnh sửa ảnh tham chiếu và kết xuất văn bản tiếng Trung - tiếng Anh.
Kho lưu trữ này cung cấp các checkpoint và mã suy luận dựa trên Diffusers cho dòng mô hình LLaDA-Image.
Tin tức
Điểm nổi bật
Model Zoo
Kế hoạch mã nguồn mở
Bắt đầu nhanh
1. Tạo môi trường
Bản triển khai này đã được sử dụng với Python 3.11, PyTorch 2.8, Transformers 4.57.6 và Diffusers 0.39.0.
2. Chạy suy luận
Pipeline chấp nhận một câu lệnh (prompt) và một ảnh tham chiếu tùy chọn (đối với tác vụ chỉnh sửa).
LLaDA-Image (Base)
Sử dụng checkpoint Base để tạo và chỉnh sửa với độ trung thực cao. Cấu hình lấy mẫu được khuyến nghị là 50 bước.
LLaDA-Image-Turbo
Sử dụng checkpoint Turbo để tạo và chỉnh sửa nhanh. Cấu hình lấy mẫu được khuyến nghị là 4 bước.
Các chế độ tạo ảnh
Cả hai checkpoint đều hỗ trợ các chế độ sau. Chế độ tạo ảnh từ văn bản và có điều kiện VQ yêu cầu chiều cao và chiều rộng chia hết cho 16; chế độ chỉnh sửa ảnh yêu cầu kích thước chia hết cho 32.
Chế độ tạo ảnh có điều kiện VQ sử dụng mô hình LLaDA2 để tạo các token VQ hình ảnh từ câu lệnh, sau đó SigVQ sẽ nhúng các token này trước khi thực hiện khuếch tán (diffusion). Không cung cấp ảnh đầu vào ở chế độ VQ.
Chỉnh sửa hình ảnh yêu cầu một ảnh tham chiếu:
Trích dẫn
Nếu bạn thấy LLaDA-Image hữu ích cho nghiên cứu hoặc ứng dụng của mình, vui lòng cân nhắc trích dẫn công trình của chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.