Nghiên cứu
Đánh giá lại độ tương đồng giọng nói AI: Tại sao EER không còn là thước đo chuẩn xác?
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra rằng độ chính xác xác thực (EER) không phản ánh đúng cảm nhận của con người về giọng nói. Thay vào đó, cấu trúc hình học của embedding và phương pháp huấn luyện mới là yếu tố quyết định sự tương đồng trong các mô hình AI.
Chính văn · Bản dịch AI
Tóm tắt: Các mô hình xác thực người nói (SV) thường được cho là nắm bắt tốt hơn các sắc thái đặc trưng của người nói khi độ chính xác xác thực được cải thiện, dẫn đến việc chúng được sử dụng rộng rãi như các đại diện tự động cho sự tương đồng giọng nói của con người trong các tác vụ tạo giọng nói. Tuy nhiên, bằng cách thiết lập một thước đo căn chỉnh nhận thức của con người và tiến hành phân tích có hệ thống, chúng tôi chứng minh rằng sự căn chỉnh nhận thức bị chi phối bởi cách mô hình được huấn luyện (mục tiêu học tập) nhiều hơn là hiệu suất của nó (EER). Đáng chú ý, các hàm mất mát phân loại dựa trên biên độ tiêu chuẩn (ví dụ: AAM-Softmax) mang lại sự căn chỉnh nhận thức thấp hơn đáng kể so với các hàm mất mát dựa trên nguyên mẫu (prototypical metric losses), trong khi bản thân EER không theo kịp đánh giá của con người, trực tiếp thách thức giả định ngầm định của cộng đồng. Chúng tôi truy nguyên sự khác biệt này đến hình học nhúng, nơi số chiều hiệu dụng ($d_{\mathrm{eff}}$) của mô hình theo dõi sự căn chỉnh nhận thức với tương quan hạng $-0.95$, cho thấy sự phân tán chiều mà các hàm mất mát phân loại ưa chuộng về cơ bản xung đột với bản chất chiều thấp của nhận thức giọng nói con người. Việc áp đặt một nút thắt cổ chai về số chiều giúp nén $d_{\mathrm{eff}}$ và nâng cao sự căn chỉnh nhận thức ($\rho_{\mathrm{align}}$) từ 0.08 lên 0.74, thiết lập một tiêu chí hình học có nguyên tắc để đánh giá sự tương đồng giọng nói.
| Bình luận: | 5 trang. Đã gửi tới ICASSP 2027 |
| Chủ đề: | Xử lý Âm thanh và Lời nói (eess.AS); Âm thanh (cs.SD) |
| Trích dẫn là: | arXiv:2609.33999 [eess.AS] |
| (hoặc arXiv:2609.33999v1 [eess.AS] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33999 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Szu-Chi Chen [xem email] [v1] CN, 27 Thg 9, 2026 22:51:39 UTC (350 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.