# TrackEverything: Đột phá theo dõi điểm dày đặc dài hạn thông qua khử trùng lặp biểu diễn cảnh 3D

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/0432553f62b8b84f
- Link gốc: https://arxiv.org/abs/2609.30222

## Tóm tắt AI

TrackEverything giải quyết bài toán theo dõi điểm bằng cách biểu diễn video dưới dạng các quỹ đạo 3D bền vững, cho phép theo dõi dài hạn mà không bị giới hạn bởi độ dài video nhờ cơ chế khử trùng lặp dựa trên voxel.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.30222) [HTML (thử nghiệm)](https://arxiv.org/html/2609.30222v1)

> Tóm tắt: Các mô hình theo dõi điểm hiện tại đang đối mặt với một sự đánh đổi cơ bản: chúng chỉ có thể theo dõi một tập hợp thưa các điểm truy vấn trong khoảng thời gian dài, hoặc theo dõi tất cả các điểm nhưng chỉ trong các đoạn video ngắn. Chúng tôi giới thiệu TrackEverything, một trình theo dõi điểm 3D giúp phá vỡ sự đánh đổi này bằng cách biểu diễn video dưới dạng các quỹ đạo cảnh 3D bền vững trong tọa độ thế giới. Dựa trên nhận định rằng video là các hình chiếu 2D của một thế giới 3D cơ bản, TrackEverything tách biệt độ phức tạp của mô hình khỏi thời lượng video, cho phép nó mở rộng quy mô dựa trên hình học cảnh vật lý độc nhất. Phương pháp của chúng tôi giới thiệu ba cải tiến chính. Thứ nhất, chúng tôi sử dụng cơ chế khử trùng lặp dựa trên voxel hóa tại các ranh giới cửa sổ trượt để hợp nhất các quỹ đạo trùng vị trí, ngăn chặn việc tích lũy dư thừa các quan sát lặp lại của cùng một bề mặt. Thứ hai, chúng tôi phân tách việc theo dõi thành một bộ tinh chỉnh điểm cuối dự đoán đích đến và phân loại tĩnh-động của từng điểm, theo sau là một bộ tinh chỉnh quỹ đạo nhẹ giúp giải mã các quỹ đạo dày đặc chỉ dành cho các điểm động. Thứ ba, chúng tôi đề xuất 3D WAFT, thay thế các khối tương quan 4D tốn bộ nhớ bằng việc lấy mẫu đặc trưng hiệu quả trong đám mây cảnh. Theo hiểu biết của chúng tôi, TrackEverything là trình theo dõi 3D đầu tiên có khả năng theo dõi tất cả các điểm hiển thị trên các video vượt quá 1000 khung hình trong phạm vi 40 GB bộ nhớ GPU. Trên TAPVid-3D, TrackEverything vượt trội hơn tất cả các trình theo dõi 3D dày đặc toàn khung hình mã nguồn mở với hơn 20% APD trên các đoạn video ngắn, đồng thời vẫn duy trì tính cạnh tranh với các trình theo dõi thưa hiện đại nhất trên các chuỗi video dài, mặc dù theo dõi số lượng điểm lớn hơn nhiều.

| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI); Robot học (cs.RO) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.30222 [cs.CV] |
|  | (hoặc arXiv:2609.30222v1 [cs.CV] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.30222 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Ayush Jain [xem email](https://arxiv.org/show-email/2a46192f/2609.30222)] [v1] Thứ Năm, 24 tháng 9 năm 2026 17:48:20 UTC (29.063 KB)
