Tất cả chủ đề
CHỦ ĐỀ

Đa phương thức

Khả năng xử lý ngoài văn bản: Hiểu thị giác, đồ họa, âm thanh và video của các mô hình thế hệ mới.

Hôm qua · 03/09

Runway@runwayml
92

Runway công bố GWM Worlds 2: Mô hình thế giới ảo tương tác thời gian thực

Runway giới thiệu GWM Worlds 2, mô hình thế giới ảo cho phép tạo video 720p/24fps kèm âm thanh chất lượng cao, nơi người dùng tùy chỉnh môi trường, vật lý và điều khiển diễn biến thế giới bằng văn bản mà không bị giới hạn kịch bản.

RunwayWorld ModelAI VideoMô phỏngCông nghệ mới
Hugging Face: Blog· 2 nguồn
85

H Company ra mắt NeoMME: Bộ mã hóa đa phương thức đa ngôn ngữ mã nguồn mở

H Company giới thiệu NeoMME, bộ mã hóa đa phương thức với hai phiên bản 260M và 800M, sử dụng kiến trúc Transformer thuần túy và kỹ thuật khuếch tán rời rạc để xử lý đồng thời văn bản và hình ảnh mà không cần mô hình thị giác tiền huấn luyện.

NeoMMEĐa phương thứcMô hình AIMã nguồn mởHuggingFace
AI Notes@AYi_AInotes· 6 nguồn
95

World Labs ra mắt Atlas: Mô hình thế giới đa phương thức đột phá được Fei-Fei Li bảo chứng

World Labs giới thiệu Atlas, mô hình thế giới đa phương thức đầu tiên cho phép điều khiển camera chính xác, tái tạo 3D từ ảnh đơn và mô phỏng không gian nhất quán, mở ra tiềm năng ứng dụng lớn từ kỹ xảo điện ảnh đến robot học.

World LabsAtlasMô hình thế giớiFei-Fei LiAI đa phương thức
AI Notes@AYi_AInotes
92

Atlas của nhóm Fei-Fei Li: Biến video điện thoại thành thế giới 3D tương tác để huấn luyện robot

Atlas cho phép tạo ra môi trường 3D có vật lý thực tế từ video quay bằng điện thoại, giúp giảm chi phí thu thập dữ liệu huấn luyện cho robot. Công nghệ này mở ra tiềm năng lớn trong việc xây dựng các phòng thí nghiệm ảo vô hạn cho robot thông minh.

RobotFei-Fei LiAtlasDữ liệu huấn luyệnMô phỏng 3D
NLP@dongxi_nlp
92

Ra mắt Video Delta Net (VDN): Mô hình tạo video từ văn bản thời gian thực với chất lượng gần như không suy giảm

Video Delta Net (VDN) đạt tốc độ tạo video vượt thời gian thực nhờ cơ chế Hybrid Attention, giúp tăng tốc Minimax-H3 lên tới 90 lần. Dự án đã mã nguồn mở toàn bộ checkpoint và mã nguồn, cho phép tạo video 768p dài 14 giây chỉ trong 11 giây trên 8 GPU B200.

Video AIMã nguồn mởTạo videoTối ưu hóaCông nghệ AI
Artificial Analysis@ArtificialAnlys
88

Wan 3.0 thống trị bảng xếp hạng Artificial Analysis: Đỉnh cao mới trong tạo video có âm thanh

Mô hình Wan 3.0 của Alibaba vừa vươn lên dẫn đầu bảng xếp hạng chỉnh sửa video có âm thanh của Artificial Analysis, đồng thời xếp thứ hai ở hạng mục tạo video từ văn bản. Đây là mô hình đa năng hỗ trợ xuất video 1080p dài 30 giây với khả năng tùy chỉnh sâu qua văn bản, hình ảnh và âm thanh.

Wan 3.0AlibabaVideo AIArtificial AnalysisGenerative AI
Hugging Face Daily Papers
85

Tinh chọnKBMR: Bước tiến mới trong truy vấn hình ảnh dựa trên tri thức nhờ mô hình ngôn ngữ đa phương thức

KBMR giải quyết hạn chế của các mô hình CLIP truyền thống bằng cách sử dụng MLLM để ánh xạ hình ảnh vào không gian ngữ nghĩa, giúp nhận diện thực thể chính xác hơn trong các tác vụ VQA đòi hỏi kiến thức chuyên sâu.

VQAMLLMTruy vấn tri thứcThị giác máy tínhHọc máy
Hugging Face Daily Papers
85

Tinh chọnSnapBench: Bộ tiêu chuẩn đánh giá khả năng truy xuất đa phương thức cho tương tác di động

SnapBench là bộ tiêu chuẩn đầu tiên đánh giá độ bền của các mô hình AI khi người dùng chụp ảnh và đặt câu hỏi trên thiết bị di động, giải quyết các vấn đề về ảnh mờ hoặc lỗi nhập liệu văn bản thông qua 1.145 truy vấn thực tế.

AI di độngĐa phương thứcTruy xuất thông tinSnapBenchNghiên cứu AI

T4 · 02/09

ZHO@ZHO_ZHO_ZHO
85

Zho ra mắt video AI '': Màn tri ân Ghost in the Shell đầy nghệ thuật với hiệu ứng chữ Hán

Tác giả Zho vừa trình làng video AI lấy cảm hứng từ 'Ghost in the Shell', sử dụng các khối chữ Hán làm hiệu ứng chuyển cảnh độc đáo. Tác phẩm mượn ý thơ trong 'Hoa Kính' để suy ngẫm về mối quan hệ giữa trí tuệ nhân tạo và nhân loại.

AI VideoGhost in the ShellNghệ thuật AISáng tạo nội dungZho
Baidu
85

Đối thoại cùng chuyên gia: Tương lai của mô hình thế giới trong kỷ nguyên huấn luyện quy mô lớn

Giáo sư Zhao Hao (Đại học Thanh Hoa) chia sẻ về hướng đi của mô hình thế giới dựa trên 3D/4D Token, nhấn mạnh khả năng mô phỏng không gian và vật lý thay vì chỉ tạo video đơn thuần, đồng thời ứng dụng thực tiễn trong y tế và robot kho vận.

Mô hình thế giớiAI tạo sinhRobotHuấn luyện quy mô lớnCông nghệ 3D
Testing Catalog@testingcatalog
85

Gemini 1.5 Flash hiện đã có mặt trên GCP Agent Studio

Google vừa tích hợp Gemini 1.5 Flash vào GCP Agent Studio, tối ưu hóa cho các tác vụ đa phương thức phức tạp, lập trình và kiểm thử phần mềm tự động.

GeminiGoogle CloudAgent StudioAI AgentsLập trình