# Xóa bỏ khoảng cách chú ý trong tạo video đa phương thức: RecCAR giúp đồng bộ hóa video với chuyển động và âm thanh

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-23 07:00 (giờ Việt Nam)
- Điểm AI: 36/100
- Link AIHOT.vn: https://aihot.vn/items/ef1e494fab1e2c27
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuf57uq00enwroodnppx1eey
- Link gốc: https://arxiv.org/abs/2609.27901

## Tóm tắt AI

Nghiên cứu chỉ ra sự mất cân bằng trong các mô hình Transformer đa phương thức, nơi video áp đảo các tín hiệu khác. Phương pháp RecCAR sử dụng cơ chế chính quy hóa KL để cân bằng lại sự tương tác, giúp cải thiện đáng kể độ chính xác về chuyển động và đồng bộ âm thanh trong video.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.27901) [HTML (thử nghiệm)](https://arxiv.org/html/2609.27901v1)

> Tóm tắt: Video là một dạng biểu diễn phong phú của một sự kiện vật lý, ghi lại hình ảnh, hình học, chuyển động và sự tiến triển theo thời gian. Các phương thức khác, chẳng hạn như chuyển động cơ thể 3D hoặc âm thanh, mã hóa các khía cạnh hẹp hơn của cùng một sự kiện đó. Chúng tôi nhận thấy rằng các mô hình diffusion transformer đa phương thức kết hợp thể hiện sự bất đối xứng tương ứng trong mối quan hệ giữa các phương thức: các phương thức đi kèm phát triển mối quan hệ chặt chẽ với video, nhưng mối quan hệ ngược lại mà qua đó chúng ràng buộc video vẫn yếu hơn đáng kể. Chúng tôi biểu diễn cả hai chiều dưới dạng các phân phối tương ứng có thể so sánh được trên các token video và định nghĩa sự bất đồng giữa chúng là khoảng cách tương ứng nghịch đảo (reciprocal correspondence gap). Chúng tôi giới thiệu RecCAR, viết tắt của Reciprocal Cross-modal Attention Regularization (Điều chuẩn chú ý đa phương thức nghịch đảo), một bộ điều chuẩn KL sử dụng mối quan hệ từ video sang phương thức đã được thiết lập vững chắc làm tham chiếu cố định và căn chỉnh mối quan hệ yếu hơn từ phương thức sang video về phía đó. Trong các tác vụ tạo video-chuyển động và video-âm thanh kết hợp, RecCAR cải thiện điểm số Human Anatomy từ 0,69 lên 0,75 và giảm độ lệch âm thanh-video từ 0,804 xuống 0,752, đồng thời cải thiện chất lượng tạo nội dung tổng thể.

| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.27901 [cs.CV] |
|  | (hoặc arXiv:2609.27901v1 [cs.CV] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.27901 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Ohad Rahamim [xem email](https://arxiv.org/show-email/31de7413/2609.27901)] [v1] Thứ Tư, 23 tháng 9 năm 2026 12:02:23 UTC (3.853 KB)
