AV-GRPO là khung học tăng cường khuếch tán trực tuyến giúp tách biệt các ưu tiên đa phương thức thành bài toán đơn lẻ, tối ưu hóa sự đồng bộ giữa âm thanh và hình ảnh. Kết quả thực nghiệm trên JavisBench và VABench cho thấy hiệu suất vượt trội so với LTX-2.3 trong việc căn chỉnh ngữ nghĩa và chất lượng tạo nội dung.
ViRDM là phương pháp hậu huấn luyện video không cần mô hình giáo viên hay bộ phân biệt, giúp tối ưu hóa việc tạo video nhân quả chỉ với 20 bước cập nhật, đạt hiệu suất vượt trội trên VBench với chi phí tính toán thấp.
Nghiên cứu chỉ ra sự mất cân bằng trong các mô hình Transformer đa phương thức, nơi video áp đảo các tín hiệu khác. Phương pháp RecCAR sử dụng cơ chế chính quy hóa KL để cân bằng lại sự tương tác, giúp cải thiện đáng kể độ chính xác về chuyển động và đồng bộ âm thanh trong video.
More ways to build with MiniMax-H3. 🐮 Great to see model optimization and AMD inference engineerin…
DịchNunchux tối ưu hóa MiniMax-H3 trên GPU AMD MI355X, giúp rút ngắn thời gian tạo video 5 giây xuống chỉ còn 1,3 giây. Công nghệ này hỗ trợ tạo video theo luồng, cho phép người dùng thay đổi câu lệnh ngay trong quá trình phát để điều hướng nội dung.
Create cinematic shots with just one reference video using Krea Agent. learn how to make videos li…
DịchKrea Agent cho phép bạn tạo ra các đoạn phim mang phong cách điện ảnh chuyên nghiệp chỉ với một video tham chiếu duy nhất. Khám phá ngay cách thực hiện để nâng tầm nội dung sáng tạo của bạn.
PhysStream là mô hình tạo video tự hồi quy sử dụng bộ nhớ cảnh có cấu trúc và tín hiệu vận tốc để kiểm soát chuyển động chính xác, vượt trội hơn các mô hình hiện tại về độ chính xác quỹ đạo và sự ưa thích của người dùng.
RunningHub tối ưu hóa hiệu suất vượt trội, cho phép tạo video 15 giây chỉ trong 50 giây trên MiniMax H3, giúp việc triển khai cục bộ trở nên cực kỳ nhanh chóng.
Vì sao đáng đọc: Tin tức mang tính đột phá về kỹ thuật tối ưu hóa mô hình AI, giải quyết trực tiếp nỗi đau về tốc độ cho người dùng cá nhân và cộng đồng mã nguồn mở.
Video Delta Net (VDN) đạt tốc độ tạo video vượt thời gian thực nhờ cơ chế Hybrid Attention, giúp tăng tốc Minimax-H3 lên tới 90 lần. Dự án đã mã nguồn mở toàn bộ checkpoint và mã nguồn, cho phép tạo video 768p dài 14 giây chỉ trong 11 giây trên 8 GPU B200.
(1/7) Last week FastVideo released FastH3. Today we bring it local: @NVIDIA DGX Spark 💚 and @Apple …
DịchFastVideo vừa cập nhật FastH3, cho phép chạy mô hình tạo video cục bộ trên NVIDIA DGX Spark và chip Apple Silicon (qua MLX) với hiệu suất nhanh gấp 8 lần so với MiniMax H3 tiêu chuẩn.
MiniMax vừa ra mắt công nghệ tạo video siêu tốc chỉ trong 3 giây, mở ra tiềm năng ứng dụng thương mại hóa trực tiếp cho các nội dung AI thời gian thực.
Vì sao đáng đọc: Công nghệ tạo video tốc độ cao là bước tiến quan trọng, giải quyết bài toán độ trễ trong sản xuất nội dung, có tính ứng dụng thực tiễn rất cao.
Ring Forcing giải quyết bài toán duy trì sự nhất quán của vật thể và khả năng xử lý ngữ cảnh siêu dài trong tạo video tự hồi quy, giúp mô hình ghi nhớ và tái hiện chính xác các chi tiết từ quá khứ xa.
Some milestones move a leaderboard. A rare few change how you see the future. MiniMax H3 Max did bo…
DịchMiniMax ra mắt mô hình nguồn mở H3, được Fal tinh chỉnh thành H3 Max với khả năng tạo video vượt tốc độ thời gian thực, đánh dấu bước tiến mới trong việc phổ cập công nghệ AI tiên tiến cho cộng đồng.
GOOGLE 🔥: Gemini Omni 1.1 Flash has been officially announced and now available on Gemini APIs and …
DịchGoogle vừa phát hành mô hình đa phương thức Gemini Omni 1.1 Flash, cho phép người dùng tạo và chỉnh sửa video với khả năng kiểm soát chi tiết, hỗ trợ xuất chất lượng 4K và thử nghiệm nhanh ở độ phân giải 360p.
JoyAI-Echo-1.5 là hệ thống tạo video và âm thanh đột phá, giúp duy trì tính nhất quán của nhân vật trong các video dài và cho phép tương tác thời gian thực trong môi trường 3D.
Vì sao đáng đọc: Đây là nghiên cứu quan trọng giải quyết bài toán khó về tính nhất quán trong video dài và tương tác thế giới ảo, có tiềm năng ứng dụng lớn trong làm phim và game.
OpenRouter ra mắt API tạo video đồng nhất, cho phép lập trình viên dễ dàng tích hợp các mô hình như Seedance, Veo hay Wan thông qua quy trình POST và polling đơn giản.
Vì sao đáng đọc: Hướng dẫn kỹ thuật thực tế, hữu ích cho lập trình viên muốn tích hợp đa mô hình video vào ứng dụng mà không cần thay đổi cấu trúc code phức tạp.
15/08
Thứ Bảy · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
CMD giới thiệu khung làm việc DMD nhân quả, giúp đồng bộ hóa sự giám sát của giáo viên với quá trình tạo video của học sinh, từ đó tối ưu hóa hiệu suất tạo video ngắn và dài, đồng thời cải thiện khả năng kiểm soát camera theo thời gian.