Mô hình
Mô hình thế giới 'Made in China' thống trị bảng xếp hạng của đội ngũ Fei-Fei Li, hỗ trợ chip Ascend và mở mã nguồn hoàn toàn
(giờ Việt Nam)
Tóm tắt AI
Chỉ cần một hình ảnh đầu vào, mô hình này có thể tái tạo toàn bộ thế giới sống động. Dự án gây chú ý khi tối ưu hóa cho chip nội địa Ascend và công khai toàn bộ mã nguồn.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
Mô hình thế giới "cây nhà lá vườn" chiếm lĩnh vị trí dẫn đầu bảng xếp hạng của đội ngũ Li Fei-Fei! Tương thích với sức mạnh tính toán Ascend nội địa, mã nguồn và trọng số hoàn toàn mở.
24-07-2026 22:19:06 Nguồn: QbitAI
Chỉ cần một tấm ảnh, nó sẽ trả lại cho bạn cả thế giới.
Yun Zhong, đưa tin từ Ao Feisi.
QbitAI | Kênh chính thức QbitAI
Bảng xếp hạng mô hình thế giới của đội ngũ Li Fei-Fei vừa có quán quân mới.
△ Bảng xếp hạng WorldScore

Đứng đầu là UniWorld-View, sản phẩm do đội ngũ RabbitPre (Tu Zhan) phối hợp cùng Đại học Bắc Kinh và Phòng thí nghiệm Bằng Thành nghiên cứu phát triển (mô hình đã tương thích với sức mạnh tính toán Ascend nội địa):
Bạn chỉ cần quay một đoạn video tùy ý, hoặc đơn giản là cung cấp một tấm ảnh, nó sẽ trả lại cho bạn một đoạn video góc nhìn mới với "quỹ đạo camera do bạn tùy ý chỉ định"—
Từ đẩy, kéo, lia, di chuyển, cho đến cả việc "xoay 360° quanh bối cảnh" đều có thể thực hiện được, cung cấp khả năng "kiểm soát vị trí và góc quay camera chính xác theo ý muốn".
Dù là tạo 3D từ một ảnh hay tạo 4D từ video, tất cả đều sử dụng "cùng một bộ mã, cùng một mô hình".
Đúng nghĩa là Uni (thống nhất) World-View, dữ liệu huấn luyện của mô hình thế giới lần này đến từ YuanKong Intelligence, một startup thuộc hệ sinh thái Đại học Bắc Kinh, mã nguồn và trọng số cũng đã được mở hoàn toàn:
Địa chỉ chính thức: PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View
Chỉ nhìn mặt trước, vẽ ra cả phía sau đầu.
Trước hết hãy nói tại sao việc này lại khó.
Tổng hợp góc nhìn mới (Novel View Synthesis), về bản chất là để AI "tự suy luận" những góc độ chưa được ghi lại.
Và khó khăn nằm trọn ở ba chữ "đường cơ sở lớn" (large-baseline)—
Nói trắng ra là: Chỉ cho AI xem mặt trước, bắt nó vẽ ra mặt nghiêng, thậm chí là cả phía sau đầu.
Các phương pháp truyền thống như NeRF, 3DGS đi theo logic "tái tạo": Càng nhìn thấy nhiều, tái tạo càng tốt.
Nhưng với video đơn mắt quay tùy ý, độ bao phủ góc nhìn gần như bằng không. Nếu nạp dữ liệu này vào, nhẹ thì đầy rẫy lỗ hổng và nhiễu, nặng thì hệ thống trực tiếp "bỏ cuộc".
Các phương pháp tạo sinh (generative) thì dám vẽ. Nhưng hầu hết các phương pháp chỉ coi vị trí camera như một "chỉ dẫn bằng lời" (một vector điều kiện trừu tượng) nạp vào mô hình khuếch tán (diffusion model)—
Không có mô hình 3D tường minh, đi được vài bước là bị lệch, xoay góc lớn là mất kiểm soát ngay.
Vì vậy, trong hai năm gần đây đã xuất hiện con đường thứ ba:
Đầu tiên dùng mô hình hình học để dựng khung cảnh thành đám mây điểm 3D (3D point cloud), sau đó nạp hình ảnh kết xuất từ đám mây điểm của góc nhìn mục tiêu vào mô hình khuếch tán video làm điều kiện.
Hình học ra hình học, tạo sinh ra tạo sinh, việc kiểm soát camera bỗng chốc trở nên chính xác. ViewCrafter, GEN3C của NVIDIA đều đi theo con đường này.
Tuy nhiên trong quá trình nghiên cứu, đội ngũ phát hiện ra rằng, trên con đường này ẩn chứa một "cái hố" mà ai cũng từng vấp phải nhưng chưa ai thực sự lấp đầy.
Kết xuất đám mây điểm sẽ bị "lộ tẩy".
Cái hố nằm ngay ở bước kết xuất đám mây điểm.
Đám mây điểm là một tập hợp các điểm rời rạc: Không biết ai kết nối với ai, cũng không biết mặt nào hướng ra ngoài.
Khi góc nhìn xoay lớn, hình ảnh kết xuất sẽ xuất hiện hai lỗi lộ tẩy kinh điển:
Một là sự chia tách giữa tiền cảnh và hậu cảnh.
Tại các ranh giới độ sâu không có thông tin kết nối, khi góc nhìn thay đổi, kết cấu tiền cảnh bị kéo giãn như kẹo cao su sang hậu cảnh, hoặc các pixel hậu cảnh bị nhòe trực tiếp lên mặt tiền cảnh.
Hai là lỗi hở mặt sau.
Đám mây điểm không có khái niệm "bề mặt", không tự động che khuất. Khi camera xoay ra phía sau vật thể, các điểm ở mặt trước sẽ xuyên thấu qua, tương đương với việc nhìn thấy một khuôn mặt xuyên qua phía sau đầu.
Khi thay đổi góc nhìn nhỏ, những lỗi này không rõ ràng, mô hình tạo sinh vẫn có thể "lấp liếm" được.
Nhưng một khi đã lên đến đường cơ sở lớn, hình ảnh điều kiện toàn là tín hiệu hình học sai lệch, mô hình khuếch tán bị dẫn dắt sai hướng: cấu trúc biến dạng, nhiễu bay tứ tung.
Chiêu thức đầu tiên của UniWorld-View chính là nhắm vào điểm này—"Kết xuất đám mây điểm nhận diện che khuất" (Occlusion-aware Point Cloud Rendering).
Chiêu thứ nhất: Chiếu lại kép (Double-Reprojection), đặc trị lỗi chia tách.





Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.