Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

OmniEcho: Bước tiến mới trong khả năng hiểu âm thanh không gian cho robot tự hành

(giờ Việt Nam)

Tóm tắt AI

OmniEchoBench là bộ tiêu chuẩn mới giúp đánh giá khả năng nhận diện âm thanh không gian và điều hướng đa phương thức cho các tác nhân AI trong môi trường thực tế, kết hợp cùng mô hình OmniEcho giúp robot hiểu sâu hơn về sự tương quan giữa âm thanh và hình ảnh.

Chính văn · Bản dịch AI

Tác giả: Ruixun Liu, Yuxuan Wang, Jiacheng Xie, Yuhuan You, Donghua Cai, Junming Lin, Xiong-Hui Chen, Zhifang Guo, Yunfei Chu, Qize Yang, Xize Cheng, Jin Xu, Yiwu Zhong

Xem PDF HTML (thử nghiệm)

Tóm tắt: Con người có thể dễ dàng xác định hướng của nguồn âm thanh và kết hợp nó với các tín hiệu thị giác để suy luận, tuy nhiên đây vẫn là một thách thức đối với các tác nhân hiện thân (embodied agents). Đặc biệt, vẫn chưa rõ làm thế nào để đánh giá và mô hình hóa khả năng hiểu âm thanh không gian trong các môi trường hiện thân một cách hiệu quả. Để giải quyết khoảng trống này, chúng tôi giới thiệu \textbf{OmniEchoBench}, một bộ tiêu chuẩn thống nhất cho nhận thức âm thanh-thị giác không gian và điều hướng âm thanh-thị giác-ngôn ngữ. OmniEchoBench bao gồm sáu tác vụ trên 197 cảnh âm thanh-thị giác không gian thực tế, 2.972 cặp câu hỏi-trả lời và 900 mẫu điều hướng với âm thanh ambisonics bậc nhất (FOA) được thu thập từ 30 môi trường thực tế. Để cho phép giám sát đào tạo có khả năng mở rộng, chúng tôi phát triển một quy trình kết xuất có thể kiểm soát cho âm thanh không gian. Quy trình này bảo toàn tính nhất quán hình học giữa các nguồn âm thanh, quan sát thị giác và quỹ đạo của tác nhân. Dựa trên cơ sở đó, chúng tôi đề xuất \textbf{OmniEcho}, một mô hình đa phương thức toàn diện có nhận thức không gian. Nó giới thiệu một bộ mã hóa không gian FOA cùng với một đường dẫn âm thanh ngữ nghĩa đã được huấn luyện trước. Các thí nghiệm mở rộng cho thấy OmniEcho đạt được hiệu suất tiên tiến nhất về nhận thức âm thanh-thị giác không gian. Đối với điều hướng bằng âm thanh, OmniEcho đạt mức hiệu suất gần bằng với điều hướng ngôn ngữ-thị giác truyền thống. Những kết quả này chứng minh rằng âm thanh không gian có thể đóng vai trò là tín hiệu giá trị cho việc suy luận cảnh và điều hướng hiện thân, đồng thời làm nổi bật việc định vị không gian chi tiết và ước tính khoảng cách là những thách thức mở quan trọng. Mã nguồn và dữ liệu của chúng tôi sẽ có sẵn tại đường dẫn https này

Chủ đề:Âm thanh (cs.SD); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.23407 [cs.SD]
(hoặc arXiv:2609.23407v2 [cs.SD] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.23407 DOI do arXiv cấp thông qua DataCite

Lịch sử gửi bài

Từ: Ruixun Liu [xem email] v1 Chủ nhật, 20 tháng 9 năm 2026 06:45:31 UTC (30.801 KB) [v2] Thứ tư, 23 tháng 9 năm 2026 05:35:30 UTC (30.801 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

OmniEcho: Bước tiến mới trong khả năng hiểu âm thanh không gian cho robot tự hành | AIHOT.vn