HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
85

Nghiên cứu

Microsoft Research ra mắt VibeVoice: Công nghệ nhận diện giọng nói theo thời gian thực tích hợp định danh người nói

(giờ Việt Nam)

Tóm tắt AI

VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.

Bản dịch AI

Tác giả: Yujie Tu, Zhiliang Peng, Jianwei Yu, Li Dong, Songchen Xu, Yaoyao Chang, Wenhui Wang, Zilong Wang, Zehua Wang, Yan Xia, Jiajun Zhang, Xie Chen, Furu Wei

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Yujie Tu [xem email] [v1] Thứ Tư, ngày 2 tháng 9 năm 2026 16:52:55 UTC (4.788 KB)

ASRLLMNhận diện giọng nóiXử lý thời gian thựcAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.