Apple Machine Learning Research
88

Nghiên cứu

Luce: Bước tiến mới trong tạo mô hình 3D với Gaussian Splatting có thể tái chiếu sáng

(giờ Việt Nam)

Tóm tắt AI

Luce là phương pháp biểu diễn 3D mới kết hợp hình học và vật liệu PBR trong đám mây Gaussian, cho phép tái chiếu sáng linh hoạt và tích hợp mượt mà vào các quy trình dựng hình tiêu chuẩn.

Bản dịch AI

Luce: Relightable Gaussians for 3D Asset Generation

Tác giả: Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Sree Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

Việc tạo ảnh 3D độ trung thực cao đòi hỏi một biểu diễn 3D nắm bắt được cả hình học và diện mạo. Để hỗ trợ việc tái chiếu sáng (relighting) và tích hợp vào các quy trình kết xuất (rendering pipeline) tiêu chuẩn, biểu diễn này cần bao gồm các phương thức kết xuất dựa trên vật lý (PBR) như albedo, độ kim loại-độ nhám (metallic-roughness) và pháp tuyến bề mặt (surface normals). Chúng tôi đề xuất Luce, một biểu diễn 3D thống nhất hình học và vật liệu PBR trong một đám mây Gaussian đa phương thức được voxel hóa, sử dụng các nguyên hàm Gaussian chuyên biệt cho từng phương thức. Một bộ mã hóa tự động biến phân (variational autoencoder) nén biểu diễn này thành một không gian tiềm ẩn (latent space) thống nhất có nhận thức về vật liệu. Một transformer dòng chảy chỉnh lưu (rectified-flow transformer) tạo ra không gian tiềm ẩn này từ một hình ảnh duy nhất, dựa trên các đặc trưng đa lớp từ một bộ mã hóa hình ảnh đã được huấn luyện trước, giúp bảo toàn cả ngữ cảnh ngữ nghĩa và chi tiết không gian tinh vi. Sau đó, không gian tiềm ẩn được giải mã thành các Gaussian PBR có thể tái chiếu sáng và tùy chọn một lưới (mesh) có kết cấu với bản đồ pháp tuyến không gian tiếp tuyến (tangent-space normal map). Trên tập dữ liệu Toys4K, Luce đạt được hiệu suất tạo 3D từ ảnh đơn tiên tiến nhất, cải thiện chỉ số FID lên 28% so với mô hình cơ sở mạnh nhất. Chúng tôi cũng giới thiệu một bộ tiêu chuẩn đánh giá các hình ảnh do AI tạo ra, trong đó Luce cải thiện điểm số căn chỉnh hình ảnh CLIP so với mô hình cơ sở tốt nhất (0,8519 so với 0,8299). Luce tạo ra các tài sản có thể tái chiếu sáng, chính xác về hình học và trung thực về vật liệu, bảo toàn được các chi tiết tinh vi như văn bản, logo và các dòng chữ.

Các bài đọc và cập nhật liên quan.

Chúng tôi đề xuất HeadsUp, một phương pháp truyền thẳng (feed-forward) có khả năng mở rộng để tái tạo các mô hình đầu 3D Gaussian chất lượng cao từ các thiết lập đa camera quy mô lớn. Phương pháp của chúng tôi sử dụng kiến trúc bộ mã hóa-giải mã hiệu quả giúp nén các góc nhìn đầu vào thành một biểu diễn tiềm ẩn nhỏ gọn. Biểu diễn tiềm ẩn này sau đó được giải mã thành một tập hợp các Gaussian 3D được tham số hóa theo UV, neo vào một khuôn mẫu đầu trung tính. Biểu diễn UV này tách biệt số lượng Gaussian 3D…

Đọc thêm

Việc tạo nội dung 3D chất lượng cao đòi hỏi các mô hình có khả năng học được các phân phối mạnh mẽ của các cảnh phức tạp và các vật thể trong thế giới thực bên trong chúng. Các kỹ thuật tái tạo 3D dựa trên Gaussian gần đây đã đạt được những kết quả ấn tượng trong việc khôi phục các tài sản 3D độ trung thực cao từ các hình ảnh đầu vào thưa thớt bằng cách dự đoán các Gaussian 3D theo cách truyền thẳng. Tuy nhiên, các kỹ thuật này thường thiếu các tiên nghiệm (priors) sâu rộng và khả năng biểu đạt mà Diffusion mang lại…

Đọc thêm

3DGaussian SplattingAppleĐồ họa máy tínhPBR
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.