HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
88

Nghiên cứu

WorldDiT: Kiến trúc Diffusion Transformer thống nhất cho điều khiển robot và mô phỏng thế giới

(giờ Việt Nam)

Tóm tắt AI

WorldDiT là kiến trúc Diffusion Transformer đột phá giúp tạo chuỗi hành động và dự đoán khung hình mà không cần mô hình ngôn ngữ thị giác (VLM) khổng lồ, đạt hiệu suất vượt trội với dưới 1 tỷ tham số.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Marcos Villagra [xem email] [v1] Thứ Hai, 27 tháng 7 năm 2026 00:55:10 UTC (4.501 KB)

Robot họcDiffusion ModelTransformerNghiên cứu AIThị giác máy tính
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.