Nghiên cứu
Duplex-MPE: Bộ tiêu chuẩn đánh giá khả năng hội thoại đa người dùng cho mô hình AI full-duplex
(giờ Việt Nam)
Tóm tắt AI
Duplex-MPE là bộ benchmark mới đánh giá khả năng tương tác của AI trong các cuộc hội thoại có nhiều người tham gia, tập trung vào việc quyết định khi nào nên phản hồi, giữ im lặng hoặc dừng nói để đảm bảo tính tự nhiên.
Chính văn · Bản dịch AI
Tóm tắt: Các mô hình giọng nói song công (full-duplex) thời gian thực có khả năng vừa nghe vừa nói, cho phép tương tác tự nhiên mà không cần các ranh giới lượt nói cứng nhắc. Các tiêu chuẩn đánh giá hiện tại tập trung vào việc chuyển lượt, xử lý ngắt lời và đối thoại đa vòng, nhưng chủ yếu xoay quanh một người dùng cụ thể thay vì một trợ lý tham gia vào cuộc trò chuyện chung giữa nhiều người. Chúng tôi giới thiệu Duplex-MPE để đánh giá thời điểm trợ lý nên trả lời, giữ im lặng hoặc ngừng nói. Bộ tiêu chuẩn này chứa 2.000 kịch bản với ba hoặc bốn người nói và một trợ lý, mỗi kịch bản được ghép đôi giữa cách yêu cầu trực tiếp và gián tiếp cho cùng một đề nghị. Các mô hình nhận âm thanh hội thoại liên tục mà không có bản ghi (transcript) hoặc ranh giới lượt nói được cung cấp sẵn. Bốn điểm số được sử dụng để đo lường khả năng khởi tạo phản hồi mới, độ chính xác của câu trả lời, khả năng duy trì im lặng và dừng lại khi con người đã giải quyết xong yêu cầu. Chúng tôi đánh giá năm hệ thống giọng nói mã nguồn mở: MiniCPM-o 4.5, Moshi, FLM-Audio, Voila và Freeze-Omni. MiniCPM-o 4.5 dẫn đầu ở ba khả năng được chấm điểm, trong khi các hệ thống khác thường xuyên phát âm thanh kèm theo câu trả lời không chính xác hoặc thất bại trong việc giữ im lặng. Một mô hình tham chiếu Gemini 3.1 Pro dựa trên bản ghi phản hồi thường xuyên hơn 64,3 điểm phần trăm đối với các yêu cầu trực tiếp so với gián tiếp; các bài kiểm tra ghép đôi cho thấy không có sự khác biệt đáng kể về tỷ lệ phản hồi đối với các hệ thống giọng nói.
| Bình luận: | 27 trang, 3 hình ảnh. Trang dự án: this https URL |
| Chủ đề: | Âm thanh (cs.SD); Xử lý Âm thanh và Giọng nói (eess.AS) |
| Trích dẫn là: | arXiv:2609.31948 [cs.SD] |
| (hoặc arXiv:2609.31948v1 [cs.SD] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.31948 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Chengqian Ma [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 19:53:52 UTC (3.831 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.