24/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

Xóa bỏ khoảng cách chú ý trong tạo video đa phương thức: RecCAR giúp đồng bộ hóa video với chuyển động và âm thanh

Nghiên cứu chỉ ra sự mất cân bằng trong các mô hình Transformer đa phương thức, nơi video áp đảo các tín hiệu khác. Phương pháp RecCAR sử dụng cơ chế chính quy hóa KL để cân bằng lại sự tương tác, giúp cải thiện đáng kể độ chính xác về chuyển động và đồng bộ âm thanh trong video.

16/09

Thứ Tư · 1 tin

10/09

Thứ Năm · 1 tin
AK@_akhaliq
NgànhĐiểm AI 34/100

Marigold V2: Bước tiến mới trong ước tính độ sâu đơn ảnh bằng Diffusion Transformer

Marigold V2 Revisiting Diffusion Transformers for Monocular Depth Estimation paper: https://huggin...

DịchMarigold V2 tối ưu hóa kiến trúc Diffusion Transformer để nâng cao độ chính xác và hiệu quả trong việc ước tính độ sâu từ ảnh đơn, mở ra tiềm năng mới cho thị giác máy tính.

09/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 45/100

Marigold V2: Đột phá ước tính độ sâu từ ảnh đơn bằng kiến trúc Diffusion Transformer

Marigold V2 ứng dụng kiến trúc Diffusion Transformer để tối ưu hóa việc ước tính độ sâu, cho phép suy luận một bước với độ chính xác vượt trội trên các chi tiết phức tạp như lông thú hay tán lá, đồng thời giảm đáng kể chi phí vận hành.

08/09

Thứ Ba · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnLLaDA-Image: Đột phá mô hình tạo ảnh từ văn bản không cần tiền huấn luyện cặp ảnh-chữ

LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong kiến trúc tạo ảnh, thay đổi tư duy huấn luyện truyền thống bằng cách tách biệt việc học hình ảnh và ngôn ngữ, có tính ứng dụng và tham khảo cao.

04/09

Thứ Sáu · 1 tin

19/08

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnPixRestore: Bước đột phá trong phục hồi ảnh bằng mô hình Diffusion Transformer không dùng VAE

PixRestore là mô hình Diffusion Transformer hoạt động trực tiếp trên không gian pixel, loại bỏ sự phụ thuộc vào VAE để bảo toàn chi tiết ảnh sắc nét và khắc phục các lỗi sai lệch nội dung thường gặp ở các mô hình T2I.


Vì sao đáng đọc: Giải pháp sáng tạo khi từ bỏ VAE để tối ưu hóa phục hồi ảnh, giải quyết trực tiếp điểm yếu của các mô hình khuếch tán hiện nay. Rất đáng chú ý cho giới nghiên cứu thị giác máy tính.

14/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

LiveAnimate: Hệ thống tạo video người chuyển động thời gian thực với độ ổn định cao

LiveAnimate là hệ thống tạo hoạt ảnh người dùng mô hình DiT 14B, cho phép tạo video dài ổn định với độ trễ thấp nhờ cơ chế PR-Sink và tối ưu hóa quy trình lấy mẫu chỉ trong 3 bước.

Tổng 8 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (22 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Diffusion Transformer” | AIHOT.vn