Apple Machine Learning Research
85

Nghiên cứu

RayRoPE: Phương pháp mã hóa vị trí tia chiếu cho mô hình Transformer đa góc nhìn

(giờ Việt Nam)

Tóm tắt AI

Apple và CMU giới thiệu RayRoPE, kỹ thuật mã hóa vị trí mới giúp mô hình Transformer đa góc nhìn đạt độ chính xác cao hơn trong việc tái tạo khung hình và ước tính chiều sâu, đồng thời đảm bảo tính bất biến hình học SE(3).

Bản dịch AI

RayRoPE: Projective Ray Positional Encoding for Multi-View Attention

Tác giả: Yu Wu†, Minsik Jeon†, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani†

Chúng tôi nghiên cứu các phương pháp mã hóa vị trí (positional encodings) cho các mô hình multi-view transformer xử lý các token từ một tập hợp các hình ảnh đầu vào đã biết vị trí (posed input images), đồng thời tìm kiếm một cơ chế mã hóa các patch một cách độc nhất, cho phép thực hiện cơ chế attention bất biến SE(3) với độ tương đồng đa tần số, và có khả năng thích ứng với hình học của cảnh quan cơ sở. Chúng tôi nhận thấy rằng các lược đồ mã hóa (tuyệt đối hoặc tương đối) trước đây cho cơ chế multi-view attention không đáp ứng được các yêu cầu trên, vì vậy chúng tôi giới thiệu RayRoPE để giải quyết khoảng trống này. RayRoPE biểu diễn vị trí của các patch dựa trên các tia (rays) liên quan, nhưng tận dụng một điểm được dự đoán dọc theo tia đó thay vì chỉ dựa vào hướng để tạo ra mã hóa nhận thức hình học (geometry-aware encoding). Để đạt được tính bất biến SE(3), RayRoPE tính toán tọa độ chiếu của khung truy vấn (query-frame projective coordinates) nhằm tính toán độ tương đồng đa tần số. Cuối cùng, vì điểm 3D "được dự đoán" dọc theo một tia có thể không chính xác, RayRoPE đưa ra một cơ chế để tính toán phân tích mã hóa vị trí kỳ vọng trong điều kiện không chắc chắn. Chúng tôi kiểm chứng RayRoPE trên các tác vụ tổng hợp góc nhìn mới (novel-view synthesis) và ước tính độ sâu stereo (stereo depth estimation), kết quả cho thấy nó cải thiện nhất quán so với các lược đồ mã hóa vị trí thay thế (ví dụ: cải thiện tương đối 15% về chỉ số LPIPS trong tập dữ liệu CO3D). Chúng tôi cũng chứng minh rằng RayRoPE có thể tích hợp liền mạch dữ liệu đầu vào RGB-D, mang lại mức tăng trưởng lớn hơn nữa so với các phương pháp thay thế không thể mã hóa vị trí cho loại thông tin này.

Các bài đọc liên quan và cập nhật.

Chúng tôi giải quyết sự không tương thích cơ bản của các mô hình encoder-decoder dựa trên attention (AED) với các mã hóa âm thanh dạng dài (long-form acoustic encodings). Các mô hình AED được huấn luyện trên các đoạn hội thoại đã phân đoạn học cách mã hóa các vị trí khung hình tuyệt đối bằng cách khai thác ngữ cảnh âm thanh hạn chế ngoài ranh giới phân đoạn, nhưng lại thất bại trong việc tổng quát hóa khi giải mã các phân đoạn dài nơi các tín hiệu này biến mất. Mô hình mất khả năng sắp xếp thứ tự các mã hóa âm thanh do tính bất biến hoán vị của các key và…

Đọc thêm

Triangulation đa góc nhìn (multi-view triangulation) là tiêu chuẩn vàng cho việc tái tạo 3D từ các điểm tương ứng 2D, với điều kiện đã biết thông số hiệu chuẩn và có đủ góc nhìn. Tuy nhiên, trong thực tế, các thiết lập đa góc nhìn đắt đỏ — bao gồm hàng chục, đôi khi hàng trăm camera — là cần thiết để đạt được các bản tái tạo 3D độ trung thực cao phục vụ cho các ứng dụng hiện đại. Trong công trình này, chúng tôi giới thiệu một phương pháp mới tận dụng những tiến bộ gần đây trong việc nâng cấp 2D-3D (2D-3D lifting) sử dụng các neural shape priors…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.