Alibaba giới thiệu Qwen-Image-2.1, mô hình DiT 7B tích hợp khả năng tạo và chỉnh sửa ảnh, hỗ trợ xuất file trong suốt RGBA và xử lý tối đa 10 ảnh tham chiếu.
LynnReal-Omni là mô hình khuếch tán Transformer 32B đa năng, tích hợp toàn diện các tác vụ từ tạo video, chỉnh sửa, điều khiển cấu trúc đến phục hồi và sản xuất video dài.
Ant inclusionAI vừa phát hành LLaDA2.2-mini trên Hugging Face, một mô hình ngôn ngữ khuếch tán nhẹ với 16 tỷ tham số nhưng chỉ kích hoạt 1,4 tỷ tham số khi suy luận, giúp tối ưu hiệu suất cho các tác vụ thông minh.
Block3D tối ưu hóa việc tạo mô hình 3D bằng cách chia nhỏ chuỗi token thành các khối, kết hợp giữa giải mã tự hồi quy và khử nhiễu đồng thời để tăng tốc độ và độ chính xác, đồng thời giảm thiểu lỗi tích lũy.
Nhóm Seed của ByteDance phát hiện rằng thông tin hình ảnh trong Caption quan trọng hơn độ dài văn bản. Họ đề xuất Structured Prompt giúp cải thiện đáng kể khả năng suy luận và hiểu biết thế giới của các mô hình khuếch tán.
Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề cốt lõi trong huấn luyện mô hình tạo ảnh, đưa ra phương pháp tối ưu hóa hiệu quả thay vì chỉ chạy đua tài nguyên phần cứng.
Tổng 5 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (29 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả