# Nvidia ra mắt mô hình mã nguồn mở Nemotron 3 Diarization: Phân tách giọng nói thời gian thực cho 8 người

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-27 18:01 (giờ Việt Nam)
- Điểm AI: 56/100
- Link AIHOT.vn: https://aihot.vn/items/01619a441f6ae3e1
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmujqnapk0q66ro9hpzs5l6vy
- Link gốc: https://the-decoder.com/nvidia-drops-a-free-100m-parameter-model-that-identifies-up-to-eight-speakers-in-real-time

## Tóm tắt AI

Nvidia vừa phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, cho phép nhận diện và phân tách giọng nói của tối đa 8 người cùng lúc trong thời gian thực, hỗ trợ cả ghi âm và luồng âm thanh trực tiếp.

## Thân bài

Chuyển đến nội dung

27 tháng 9, 2026

Nvidia đã phát hành Nemotron 3 Diarization, một mô hình AI có khả năng xác định ai là người đang nói tại bất kỳ thời điểm nào trong một cuộc hội thoại. Mô hình này có khoảng 100 triệu tham số và trọng số của nó [được cung cấp miễn phí](https://huggingface.co/nvidia/Nemotron-3-Diarization). Nó có thể phân biệt tối đa tám người nói và phát hiện khi nhiều người nói cùng một lúc. Số lượng người tham gia đông hơn, tiếng ồn nền lớn hoặc tiếng vang sẽ làm tăng tỷ lệ lỗi. Khi kết hợp với [một hệ thống nhận dạng giọng nói như Parakeet](https://the-decoder.de/nvidias-neue-open-source-spracherkennungsmodelle-schlagen-openai-whisper-v3/), mô hình có thể tạo ra các bản ghi có gắn nhãn người nói, mặc dù chỉ là các nhãn ẩn danh như "speaker_2". Nó hoạt động với cả bản ghi âm và âm thanh trực tiếp.

![Bar chart: A comparison of the twelve English dialogue synthesis models in the VoiceArena benchmark; NVIDIA Nemotron 3 achieved the best score at 14.7%.](https://the-decoder.com/wp-content/uploads/2026/09/nvidia-nemotron-3-diarization-APLexzMWO1Om9RTvX8EGN-770x469.png)

Bộ đệm âm thanh có thể được thiết lập ở bốn mức, từ 30,4 giây xuống còn 0,32 giây. Bộ đệm ngắn hơn thường làm giảm độ chính xác. Trên [Diarization-Bench từ VoiceArena](https://voicearena.com/diarization-bench), mô hình hiện đang đứng ở vị trí đầu tiên với tỷ lệ lỗi 14,72%, vượt xa hệ thống tốt thứ hai với 19,3%. Điểm chuẩn này rất nghiêm ngặt. Giọng nói chồng chéo được tính là lỗi, và ngay cả những sai lệch nhỏ nhất khi chuyển đổi người nói cũng bị tính là lỗi. So với phiên bản tiền nhiệm là Streaming Sortformer, mô hình mới giúp giảm tỷ lệ lỗi trung bình 41% trên tám kịch bản thử nghiệm khi sử dụng bộ đệm 1,04 giây.

### Tin tức AI không thổi phồng – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận.

[Đăng ký ngay](https://the-decoder.com/subscription/)
