Ant Group inclusionAI: GitHub kho mã mới
Điểm AI 55/100

Mô hình

Ant Group ra mắt Ming-Image-0.1-Design: Bộ mô hình AI chuyên tạo thiết kế đồ họa

(giờ Việt Nam)

Tóm tắt AI

Ant Group công bố mã nguồn mở Ming-Image-0.1-Design, gồm hai mô hình 6B chuyên tạo thiết kế UI, poster và tách lớp đồ họa để chỉnh sửa chuyên sâu.

Chính văn · Bản dịch AI

GitHub - inclusionAI/Ming-Image

Thiết kế Ming Image 0.1

Mô hìnhLiên kết
Thiết kế🧩 ModelScope · 🤗 Hugging Face · 🖥️ Demo
Lớp (Layer)🧩 ModelScope · 🤗 Hugging Face · 🖥️ Demo

📄 Blog · 🎨 Kỹ năng thiết kế · 📊 Kỹ năng PPT

Ming-Image-0.1-Design là một chuỗi mô hình mã nguồn mở dành cho việc tạo thiết kế hình ảnh và phân tách lớp có thể chỉnh sửa.

Chuỗi này bao gồm hai mô hình 6B tham số:

  • Ming-Image-0.1-Design tạo ra các thiết kế hình ảnh hoàn chỉnh cho UI, đồ họa thông tin, áp phích và các bố cục giàu văn bản.
  • Ming-Image-0.1-Design-Layer phân tách các hình ảnh thiết kế phẳng thành các lớp trong suốt có thể chỉnh sửa độc lập.
Ming-Image-0.1-Design on the Artificial Analysis UI/UX Design leaderboard

Thư viện ảnh

Chuyển văn bản thành hình ảnh (Text-to-image)

Text-to-image showcase

Chuyển văn bản thành hình ảnh với nền trong suốt

Transparent-background text-to-image showcase

Phân tách lớp (Layer decomposition)

Six-layer card decomposition showcaseLayer-decomposition gallery

Sử dụng với các kỹ năng

  • Ling UI Design sử dụng các tham chiếu hình ảnh đã tạo và phân tách lớp để hỗ trợ tác nhân (agent) xây dựng và kiểm tra trực quan mã UI từ một câu lệnh (prompt) hoặc ảnh chụp màn hình.
  • Image to Editable PPT hỗ trợ tác nhân tái tạo một trang hoặc hình ảnh slide đã tạo thành slide PowerPoint có thể chỉnh sửa, với văn bản và các hình khối đơn giản được chuyển đổi thành các phần tử gốc.

Đây là các quy trình làm việc của tác nhân riêng biệt; hãy làm theo hướng dẫn thiết lập của từng kỹ năng để biết các phụ thuộc và dịch vụ mô hình tương thích.

Yêu cầu

  • Python 3.10 trở lên;
  • PyTorch hỗ trợ CUDA để suy luận mô hình đầy đủ;
  • Thư mục checkpoint cục bộ hoặc ID kho lưu trữ trên Hugging Face Hub.

Cài đặt các phụ thuộc runtime trong một môi trường sạch:

Mã
pip install -r requirements.txt

flash_attention_2 là tùy chọn. CLI mặc định sử dụng eager attention vì LLM chỉ triển khai các lớp attention eager và FlashAttention 2; diffusion transformer luôn sử dụng PyTorch SDPA ở bên trong. Việc chọn --attn-implementation sdpa sẽ thất bại khi tải.

Suy luận (Inference)

Đối số --model chấp nhận thư mục cục bộ hoặc ID kho lưu trữ trên HF Hub. Các mô hình trên Hub được phân giải thành một snapshot cục bộ bất biến trước khi bất kỳ thành phần nào được tải. Sử dụng --revision để ghim một nhánh, thẻ hoặc commit. Các ví dụ sử dụng ID Hub đã công bố; hãy thay thế chúng bằng các thư mục checkpoint cục bộ để suy luận ngoại tuyến.

Các mặc định lấy mẫu và các bucket độ phân giải công khai là đặc thù cho từng tác vụ:

Tác vụSố bước (Steps)CFGBucket độ phân giảiMặc định / khuyến nghị
Chuyển văn bản thành hình ảnh121.01024, 20482048
Phân tách lớp122.0512, 10241024

Truyền --steps hoặc --cfg để ghi đè rõ ràng bất kỳ giá trị nào. --resolution là tùy chọn. Một số nguyên dương được cung cấp sẽ khớp với bucket gần nhất được tác vụ đã chọn hỗ trợ, nếu bằng nhau sẽ ưu tiên bucket nhỏ hơn. Để phân tách lớp nhanh hơn, hãy truyền rõ ràng --resolution 512; sử dụng 1024 cho chất lượng đầu ra khuyến nghị. Đầu ra của Text-to-image là hình vuông tại bucket đã chọn. Phân tách lớp bảo toàn tỷ lệ khung hình của hình ảnh tham chiếu trong khi chọn kích thước làm việc được xác định trước từ bucket 1024 hoặc 512 hiệu dụng.

Triển khai mặc định và tối thiểu được xác thực là một GPU với ít nhất 80 GiB bộ nhớ, chạy ở định dạng BF16. Cấu hình này vượt qua cả hai dòng mô hình từ đầu đến cuối, và tất cả các bản demo bên dưới đều sử dụng cấu hình này theo mặc định.

Mã
export CUDA_VISIBLE_DEVICES=0

Chọn --attn-implementation flash_attention_2 khi đã cài đặt FlashAttention 2; mặc định của CLI di động vẫn là eager.

Đối với cả hai tác vụ, --prompt chấp nhận văn bản thô hoặc đường dẫn đến tệp prompt. Sử dụng --validate-only để kiểm tra hợp đồng checkpoint và sự kết hợp tác vụ mà không cần tải trọng mô hình:

Mã
python infer.py --model inclusionAI/Ming-Image-0.1-Design --task text-to-image \
  --prompt "A red circle on a white background" --validate-only

Demo chuyển văn bản thành hình ảnh

Bản demo này hiển thị một cabin cố định qua các mùa xuân, hạ, thu, đông. Nó sử dụng câu lệnh JSON có cấu trúc chính xác mà không cần sao chép đầu vào dài đó trong tệp README.

Mã
python infer.py \
  --model inclusionAI/Ming-Image-0.1-Design \
  --task text-to-image \
  --prompt assets/t2i_four_seasons_cabin_prompt.json \
  --attn-implementation flash_attention_2 \
  --resolution 2048 \
  --output-dir outputs/t2i

Viết lại câu lệnh chuyển văn bản thành hình ảnh

Một VLM tuân thủ hướng dẫn có thể biến một chú thích ngắn thành mô tả JSON có cấu trúc bố cục chính xác: các lớp kiểu Figma được sắp xếp từ sau ra trước, với tọa độ chính xác, phân cấp, thông số màu sắc và mọi chuỗi được hiển thị đều được trích dẫn nguyên văn và sở hữu chính xác một lần. Không giống như phân tách lớp, trình viết lại text-to-image mô tả toàn bộ canvas theo tỷ lệ 1:1.

Việc viết lại này là một bước tiền xử lý bên ngoài infer.py. Tăng cường câu lệnh (PE) có thể sử dụng Ling-3.0-flash-VL hoặc qwen3.8-27B; hãy chạy nó trước, sau đó truyền đầu ra của nó vào --prompt dưới dạng văn bản thô hoặc thông qua tệp tài sản.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Ant GroupMing-ImageThiết kế đồ họaMã nguồn mởAI tạo ảnh

Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: GitHub kho mã mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Ant Group ra mắt Ming-Image-0.1-Design: Bộ mô hình AI chuyên tạo thiết kế đồ họa | AIHOT.vn