IT Home ITHome
92

Nghiên cứu

Google DeepMind ra mắt GenCeption: Biến mô hình tạo video thành 'bộ não' thị giác máy tính đa năng

(giờ Việt Nam)

Tóm tắt AI

Dựa trên mô hình Wan2.1 của Alibaba, GenCeption của DeepMind cho phép một mô hình duy nhất thực hiện đồng thời các tác vụ phức tạp như ước tính độ sâu, phân đoạn ảnh và dự đoán tư thế 3D mà không cần các mô hình chuyên biệt.

Bản dịch AI

Theo tin từ IT ngày 21 tháng 7, trang tin công nghệ The Decoder đã đăng tải bài viết vào hôm qua (20 tháng 7) cho biết Google DeepMind đã ra mắt mô hình GenCeption, tái sử dụng các trình tạo video tiền huấn luyện cho những tác vụ thị giác máy tính cổ điển như ước tính độ sâu và phân đoạn hình ảnh.

Dẫn lời từ bài viết, IT giới thiệu rằng khi học cách dự đoán Token tiếp theo, các mô hình ngôn ngữ lớn (LLM) thường cần tiếp thu các nội dung như ngữ pháp, kiến thức thế giới và các mối quan hệ ngữ cảnh trong quá trình huấn luyện.

A single model generates depth, normals, segmentations, and pose from the same video based on a text prompt. Despite training mostly on synthetic data, it generalizes to real-world footage and object

Tuy nhiên, trong lĩnh vực thị giác máy tính, các mô hình thị giác lại thiếu phương pháp huấn luyện tương đương và chủ yếu bị thống trị bởi các mô hình chuyên biệt, bao gồm "Segment Anything" dùng cho phân đoạn và "Depth Anything" dùng cho ước tính độ sâu, mỗi mô hình đều sử dụng kiến trúc riêng biệt.

Để giải quyết vấn đề này, đội ngũ Google DeepMind đã đề xuất giải pháp mô hình GenCeption, thử nghiệm việc cải tiến ngược một mô hình AI "tạo video" thành một công cụ phân tích thị giác có khả năng "hiểu thế giới".

GenCeption phá vỡ khuôn mẫu "một tác vụ, một mô hình chuyên dụng" truyền thống của thị giác máy tính, chỉ với một mô hình duy nhất có thể thực hiện tốt đồng thời các tác vụ thị giác cốt lõi như ước tính độ sâu, phân đoạn hình ảnh, ước tính tư thế 3D, dự đoán pháp tuyến bề mặt và ước tính tư thế camera.

GenCeption được huấn luyện dựa trên dòng mô hình video mã nguồn mở Wan2.1 của Alibaba. Khác với các mô hình khuếch tán truyền thống cần khử nhiễu qua nhiều bước, GenCeption hoàn thành dự đoán chỉ trong một lần truyền xuôi (forward pass), từ đó nâng cao tốc độ xử lý các tác vụ thị giác. Mô hình sử dụng các gợi ý văn bản (text prompt) để chỉ định tác vụ, có thể xuất ra bản đồ độ sâu, bản đồ pháp tuyến bề mặt, mặt nạ phân đoạn và xử lý các biểu diễn chuyển động của camera.

Architecture diagram of GenCeption showing how an input video and text prompt flow through VAE and text encoders into a pre-trained DiT that produces dense task outputs as RGB video and sparse task ou

Dữ liệu huấn luyện chủ yếu là dữ liệu tổng hợp. Bài báo cho biết tập dữ liệu chỉ bao gồm 7.500 đoạn video, được tạo ra từ sự kết hợp của 800 mô hình người kỹ thuật số và 200 chuỗi bắt chuyển động (motion capture), sau đó được render thông qua Blender dưới các bối cảnh và góc máy khác nhau.

Về khả năng tổng quát hóa, GenCeption hầu như chỉ được huấn luyện trên các video tổng hợp một người, nhưng có thể xử lý các video thực tế có nhiều người, đồng thời có thể chuyển đổi sang các đối tượng là động vật và robot hình người. Bài báo cho biết, một số chi tiết đầu ra thậm chí còn vượt qua kết quả render từ Blender trong quá trình huấn luyện, có thể giữ lại được cả râu mèo và các cạnh của từng sợi tóc.

Left, a radar chart comparing GenCeption as both specialist and generalist against models like DepthAnything3, SAM3, D4RT, and VGGT-Ω across ten vision tasks. Right, a log-scale plot of depth accuracy

Về hiệu năng, bài báo đưa ra hai nhóm dữ liệu thời gian xử lý: mô hình nhỏ mất khoảng 6 giây để xử lý 81 khung hình video; mô hình lớn với 14 tỷ tham số mất khoảng 10 giây để xử lý video có cùng độ dài.

Six rows showing original video frames alongside color-coded depth maps and surface normal maps for scenes including a robot arm, electronics store, workshop, warehouse, nighttime street, and interior

Tham khảo

Video Generation Models are General-Purpose Vision Learners

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.

DeepMindThị giác máy tínhGenCeptionWan2.1AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.