Jiqizhixin
92

Nghiên cứu

LLaDA-Image: Đột phá mô hình tạo ảnh từ văn bản không cần tiền huấn luyện cặp ảnh-chữ

(giờ Việt Nam)

Tóm tắt AI

LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.

Bản dịch AI

PixArt: Mô hình chuyển văn bản thành hình ảnh chi phí thấp, sánh ngang MJ, chỉ tốn 10% thời gian huấn luyện so với SD

Ban biên tập Synced: Huấn luyện một mô hình chuyển văn bản thành hình ảnh sánh ngang MJ chỉ với 26.000 USD... Mô hình khuếch tán (diffusion model) với chất lượng tạo ảnh có thể so sánh với các trình tạo ảnh tiên tiến nhất (ví dụ:...)

Học máy và Sáng tạo nội dung bằng AI

Dựa trên DiT, hỗ trợ tạo ảnh 4K, PixArt-Σ - mô hình chuyển văn bản thành hình ảnh 0,6B của Huawei Noah đã ra mắt

Xem báo cáo của Synced: "PixArt - Mô hình chuyển văn bản thành hình ảnh với chi phí huấn luyện cực thấp đã ra mắt, hiệu quả sánh ngang MJ, chỉ tốn 10% thời gian huấn luyện so với SD". PixArt-α là DiT (Diffusion Transformer)...

Synced (Máy khí chi tâm)

Omni-Diffusion: Mô hình lớn đa phương thức đầu tiên dựa trên khuếch tán có che (masked diffusion)

Trong vài năm qua, sự phát triển của trí tuệ nhân tạo đa phương thức chủ yếu dựa vào các mô hình ngôn ngữ lớn được tiền huấn luyện mạnh mẽ... Vì các mô hình khuếch tán đã được ứng dụng trong lĩnh vực văn bản thuần túy (như Dream, LLaDA) và hình ảnh thuần túy...

Extreme-Mart (Ji-Shi)

Nhóm của Giáo sư Chu Quân (Đại học Thanh Hoa) mã nguồn mở mô hình khuếch tán đa phương thức dựa trên Transformer đầu tiên, hỗ trợ cả tạo văn bản từ ảnh, tạo ảnh từ văn bản và chỉnh sửa

Chuyên mục Synced: Ban biên tập Synced cho biết bài báo này đề xuất một khung mô hình hóa xác suất được thiết kế cho đa phương thức... kiến trúc mạng U-ViT, được huấn luyện trên tập dữ liệu văn bản-hình ảnh quy mô lớn mã nguồn mở LAION-5B...

Synced (Máy khí chi tâm)

Nhóm của Giáo sư Chu Quân (Đại học Thanh Hoa) mã nguồn mở UniDiffuser: Mô hình khuếch tán đa phương thức dựa trên Transformer đầu tiên

Synced: Bài báo này đề xuất một khung mô hình hóa xác suất được thiết kế cho đa phương thức... kiến trúc mạng U-ViT, được huấn luyện trên tập dữ liệu văn bản-hình ảnh quy mô lớn mã nguồn mở LAION-5B...

PaperWeekly

Trải nghiệm thực tế AI chuyển văn bản thành hình ảnh của Tencent! Xuất ngay phong cách Vương Giả Vinh Diệu, chơi được ngay trên Mini Program

Trước đó, ngành công nghiệp thực tế đã có khá nhiều mô hình mã nguồn mở chuyển văn bản thành hình ảnh. Tencent dựa trên... Một vấn đề khác là khả năng căn chỉnh văn bản-hình ảnh khi huấn luyện chưa tốt. Bố cục không hợp lý, ý nói đến việc tạo ra người...

QuantumBit (Liang-Zi-Wei)

Đối thoại với Trương Gia Hưng từ Viện nghiên cứu IDEA: Mô hình tiền huấn luyện sẽ trở thành "cơ sở hạ tầng" cho tương lai của AI, hỗ trợ mọi cơ hội thương mại hóa của AIGC

Ngày 9 tháng 11, tại buổi livestream giải mã kỹ thuật do Synced tổ chức, số lượng người xem đã vượt quá 10.000... Và các mô hình tiền huấn luyện với tư cách là "cơ sở hạ tầng" sẽ được triển khai như một kiến trúc nền tảng trong tương lai...

Mingliang Company

Mô hình lớn mã nguồn mở chuyển văn bản thành hình ảnh Playground v2.5 đã ra mắt, sánh ngang Midjourney v5.2!

Sau khi phát hành Playground v2.0 vào năm ngoái, Playground tiếp tục mã nguồn mở mô hình chuyển văn bản thành hình ảnh mới... Nhưng thực tế, khi chỉ huấn luyện trên hình ảnh vuông, khả năng khái quát hóa của mô hình khuếch tán đối với các tỷ lệ khung hình khác...

Kỹ sư thuật toán học máy

Bài báo xuất sắc nhất tại ICCV 2023 - ControlNet, mô hình chuyển văn bản thành hình ảnh của Đại học Stanford, đã được mã nguồn mở!

Trong thị giác máy tính và học máy, những hình ảnh bổ sung này (ví dụ: bản đồ cạnh, cơ thể người...)... Kiến trúc này đảm bảo rằng khi bắt đầu huấn luyện, các đặc trưng sâu của mô hình khuếch tán lớn sẽ không bị thêm vào...

Tiên phong thị giác máy tính

Làm chủ kỹ năng AI toàn diện! Hơn 230 bài học thực hành, bao phủ đa ngôn ngữ Python/TS/Rust

Mô hình lớn từ 0 đến 1: 14 bài học viết tay Tokenizer, tiền huấn luyện Mini GPT, làm chủ SFT... Thực hiện RAG đa phương thức, quy trình chuyển văn bản thành hình ảnh/video; Kỹ thuật tác tử (Agent): Từ đơn tác tử...

Ma-Shang-Bao-Zang

1234567 Trang tiếp theo

Tìm thấy khoảng 61 kết quả

LLaDA-ImageTạo ảnh AIDiffusion TransformerMô hình mã nguồn mởComputer Vision
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.