Sản phẩm
NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena
(giờ Việt Nam)
Tóm tắt AI
NVIDIA phát hành mã nguồn mở mô hình Nemotron 3 Diarization với 100 triệu tham số, hỗ trợ tách tối đa 8 người nói và dẫn đầu bảng xếp hạng VoiceArena Diarization-Bench với tỷ lệ lỗi DER chỉ 14.72%.
Chính văn · Bản dịch AI

Chuyển đổi các cuộc hội thoại chồng chéo thành dữ liệu nhận diện người nói với một mô hình mã nguồn mở 100 triệu tham số - xếp hạng #1 trong kết quả Diarization-Bench ban đầu của Voice Arena.
Tại sao phân đoạn người nói (speaker diarization) lại quan trọng
Mỗi cuộc hội thoại mang hai lớp thông tin: nội dung được nói và ai là người nói. Nhận dạng giọng nói (speech recognition) ghi lại và chuyển đổi lời nói thành văn bản. Phân đoạn người nói phân loại ai đã nói khi nào, giúp các ứng dụng kết nối nội dung đã nói với đúng người tham gia.
Hãy xem xét một bản ghi chép từ một cuộc họp, cuộc gọi khách hàng hoặc podcast, trong đó mọi câu đều chính xác nhưng không câu nào được gán cho người nói. Bạn có thể đọc các từ, nhưng không thể xác định chắc chắn ai đã đưa ra cam kết, ai phản đối hoặc người tham gia nào đã ngắt lời. Tìm kiếm, tóm tắt, các mục hành động, phân tích hội thoại và bộ nhớ của trợ lý giọng nói đều trở nên kém hữu ích hơn.
Phân đoạn người nói xác định các khoảng thời gian mà mỗi người nói hoạt động, bao gồm cả những khoảng thời gian mọi người nói đè lên nhau. Các dấu thời gian của người nói đó sau đó có thể được kết hợp với nhận dạng giọng nói tự động (ASR) để tạo ra một bản ghi chép có gán người nói.
NVIDIA Nemotron 3 Diarization là một mô hình mã nguồn mở 100 triệu tham số, xếp hạng #1 trên bảng xếp hạng Diarization-Bench của Voice Arena với Tỷ lệ lỗi phân đoạn (DER) là 14,72%. Hỗ trợ tối đa tám người nói trong các cuộc hội thoại trực tiếp và đã ghi âm, mô hình này xử lý giọng nói chồng chéo, xử lý theo khối (chunked processing) cho độ dài bản ghi linh hoạt và độ trễ phát trực tuyến có thể tùy chỉnh.
Các mô hình trước đó như NVIDIA Streaming Sortformer đã thiết lập phương pháp này cho việc phân đoạn bốn người nói, bao gồm cả checkpoint phát trực tuyến diar_streaming_sortformer_4spk-v2.1 được sử dụng làm cơ sở so sánh bên dưới. Nemotron 3 Diarization mở rộng hỗ trợ lên tám người nói và cải thiện độ chính xác cũng như thông lượng được đo lường trong các đánh giá sau đây.
Cách thức hoạt động của Nemotron 3 Diarization
Một mô hình cho cả hội thoại ngoại tuyến và phát trực tuyến
Các hệ thống phân đoạn phải giải quyết hai vấn đề liên quan. Thứ nhất, chúng phải phát hiện giọng nói và gán nó cho đúng người nói. Thứ hai, chúng phải duy trì sự phân công đó trong suốt cuộc hội thoại, ngay cả sau những khoảng lặng, ngắt lời hoặc khoảng cách dài giữa các lượt nói của một người.
Phát trực tuyến làm cho vấn đề thứ hai trở nên khó khăn hơn. Một mô hình ngoại tuyến có thể kiểm tra toàn bộ bản ghi cùng một lúc. Một hệ thống phát trực tuyến chỉ nhận được một khối âm thanh nhỏ mới và ngữ cảnh hạn chế. Nếu không có cơ chế bộ nhớ hiệu quả, người nói được gán cho một kênh đầu ra trong khối hiện tại có thể bị gán cho một kênh khác trong khối tiếp theo.
Nemotron 3 Diarization tuân theo phương pháp Sortformer là sắp xếp các người nói đầu ra theo thời điểm họ xuất hiện lần đầu. Giọng nói mới đầu tiên trở thành kênh người nói thứ nhất, giọng nói mới tiếp theo trở thành kênh thứ hai, và cứ thế tiếp tục. Việc sắp xếp theo thời gian đến này giúp các nhãn người nói chung của mô hình ổn định và loại bỏ nhu cầu giải quyết hoán vị người nói mới cho mỗi khối.
Nemotron 3 Diarization được huấn luyện bằng dữ liệu giọng nói công khai và có bản quyền, bao gồm các cuộc hội thoại thực tế được chú thích đa người nói từ David AI. Dữ liệu âm thanh có bản quyền bổ sung từ David AI cung cấp tài liệu nguồn cho các hỗn hợp tiếng Anh và đa ngôn ngữ mô phỏng quy mô lớn trải dài 21 ngôn ngữ. Việc thêm dữ liệu David AI vào quá trình huấn luyện của chúng tôi đã giảm tỷ lệ lỗi phân đoạn (DER) tổng hợp xuống 0,77 điểm tuyệt đối, từ 11,19% xuống 10,42%, tại cả điểm vận hành kiểu ngoại tuyến và độ trễ cực thấp.
Mô hình hỗ trợ tối đa tám kênh người nói. Đây là các nhãn ẩn danh, không phải danh tính thực tế: mô hình có thể báo cáo rằng speaker_2 đã nói từ dấu thời gian này đến dấu thời gian khác, nhưng nó không xác định speaker_2 là một người cụ thể. Các ứng dụng hạ nguồn có thể ánh xạ các ID kênh ẩn danh này tới danh tính người nói cụ thể bằng cách ghép nối dấu thời gian với siêu dữ liệu cuộc họp, hồ sơ người dùng hoặc các mô hình xác minh người nói đang hoạt động.
Từ âm thanh đến hoạt động của người nói
Luồng kiến trúc cho Nemotron 3 Diarization Mô hình chấp nhận âm thanh đơn kênh 16 kHz và chuyển đổi nó thành các đặc trưng Mel-spectrogram với bước khung 10 ms. Nó xếp chồng các đặc trưng đó theo hệ số tám, tạo ra các khung 80 ms cho bộ mã hóa Transformer 31 lớp với các nhúng vị trí xoay (RoPE).

Hình 1. Nemotron 3 Diarization chuyển đổi âm thanh thành xác suất hoạt động của người nói được sắp xếp theo thứ tự đến. AOSC và ngữ cảnh FIFO hỗ trợ suy luận phát trực tuyến.
Phía trên Transformer, một lớp Conv1D lấy mẫu các dự đoán lên độ phân giải đặc trưng đầu vào. Đầu ra mặc định là một tensor dấu phẩy động [T, 8]: T bước thời gian cho tám kênh người nói có thể. Mỗi giá trị là xác suất một người nói đang hoạt động tại thời điểm đó. Bước nhảy mặc định là 10 ms và có thể được cấu hình thành bội số khác của 10 ms.
Cách biểu diễn này xử lý sự chồng chéo một cách tự nhiên. Nếu hai người nói cùng lúc, hai kênh có thể hoạt động trong cùng một khung. Xử lý hậu kỳ chuyển đổi các xác suất này thành các nhãn người nói chung với dấu thời gian bắt đầu và kết thúc.
Trong quá trình suy luận phát trực tuyến, hai dạng bộ nhớ cung cấp ngữ cảnh:
- Bộ nhớ đệm người nói theo thứ tự đến (AOSC) lưu giữ thông tin hữu ích về những người nói được quan sát trong các khối trước đó, được tổ chức theo các kênh sắp xếp theo thứ tự đến của họ.
- Hàng đợi vào trước, ra trước (FIFO) cung cấp ngữ cảnh khung gần đây trước khối hiện tại.
Bộ đệm đầu vào cũng bao gồm ngữ cảnh bên phải, là âm thanh ngay sau khối hiện tại. Nhiều ngữ cảnh bên phải hơn có thể giúp mô hình diễn giải các chuyển đổi người nói, trong khi ít ngữ cảnh bên phải hơn giúp giảm thời gian chờ đợi trước khi tạo ra kết quả. Cùng nhau, khối hiện tại, ngữ cảnh bên phải, hàng đợi FIFO và bộ nhớ đệm người nói cho phép một mô hình hoạt động ở nhiều mức độ trễ khác nhau.
Suy luận theo khối loại bỏ giới hạn thời lượng âm thanh tối đa do mô hình áp đặt. Hiệu suất vẫn có thể giảm trên các bản ghi dài bất thường hoặc âm thanh có tiếng ồn nghiêm trọng, vang, thu âm trường xa hoặc thay đổi miền.
Phân đoạn và ASR có gán người nói (ASR đa người nói) là các tác vụ khác nhau
Phân đoạn độc lập tạo ra hoạt động của người nói và dấu thời gian, không phải các từ được nói. ASR tạo ra văn bản nhưng không nhất thiết duy trì việc gán người nói. Một quy trình chuyển đổi có gán người nói kết hợp cả hai đầu ra:

Hình 2. Quy trình chuyển đổi có gán người nói từ đầu đến cuối kết hợp các dấu thời gian phân đoạn âm thanh với nhận dạng giọng nói tự động (ASR) để ánh xạ các từ được nói tới những người nói cụ thể.
Sự tách biệt đó rất quan trọng khi thiết kế hệ thống. Các lỗi phân đoạn bao gồm bỏ lỡ giọng nói, phát hiện giọng nói sai, gán sai người nói và lỗi ranh giới. Các lỗi ASR ảnh hưởng đến các từ. Các ứng dụng nên đánh giá cả hai thành phần và quy trình kết hợp trên âm thanh dự kiến của chúng.
Cân bằng độ trễ và độ chính xác
Mô hình này hỗ trợ các độ trễ bộ đệm đầu vào (input-buffer latencies) được khuyến nghị là 30,4; 1,04; 0,64 và 0,32 giây. Bộ đệm ngắn hơn giúp hệ thống phản hồi nhanh hơn, trong khi nhiều ngữ cảnh hơn thường cải thiện độ chính xác và thông lượng. Các giá trị này đo lường âm thanh được lưu vào bộ đệm trước khi suy luận; quá trình tính toán, kết nối mạng, ASR và xử lý ứng dụng sẽ cộng thêm vào độ trễ tổng thể (end-to-end latency). Mặc dù về mặt kỹ thuật, mô hình có thể sử dụng bộ đệm đầu vào 80 ms, nhưng 0,32 giây là cấu hình thấp nhất được khuyến nghị. Bảng cấu hình trong phần ["Bắt đầu"](#Ln) cho thấy cách chọn điểm vận hành.
Kết quả đánh giá (Benchmark): Xếp hạng #1 trong Diarization-Bench ban đầu của Voice Arena
Trong kết quả Diarization-Bench ban đầu của Voice Arena, NVIDIA Nemotron 3 Diarization đã xếp hạng nhất trong số 12 hệ thống và tổng cộng 17 cấu hình hệ thống được đánh giá trên 139 cuộc hội thoại tiếng Anh với tổng thời lượng khoảng 22 giờ. Với việc tính điểm cả các đoạn hội thoại chồng lấn, phát hiện hoạt động giọng nói do hệ thống tạo ra và không sử dụng boundary collar, Nemotron 3 Diarization đã đạt tỷ lệ lỗi phân đoạn (DER) là 14,72%, so với 19,3% của hệ thống xếp hạng kế tiếp - mức giảm tương đối khoảng 24%. Nó cũng xếp hạng nhất với các collar 100 ms và 250 ms, cũng như trên cả các bản ghi trực tiếp và trực tuyến. Những kết quả ban đầu này có thể thay đổi khi Voice Arena hoàn tất đánh giá Phiên bản 1 và phân tích thống kê ghép cặp.
Hình 3. Kết quả Diarization-Bench v1 của Voice Arena (tiếng Anh, collar 0 ms, DER càng thấp càng tốt), cho thấy NVIDIA Nemotron 3 Diarization xếp hạng #1 với 14,72% DER.
Hình dưới đây sử dụng các kết quả đánh giá của Nemotron 3 Diarization. Các kết quả này so sánh mô hình với Streaming Sortformer bốn người nói trước đây của NVIDIA theo các thiết lập tính điểm và thông lượng đã công bố.

Hình 4. Hiệu suất Tỷ lệ lỗi phân đoạn (DER) trên tám tiêu chuẩn đánh giá công khai ở độ trễ đầu ra 1,04 giây, cho thấy kết quả tiên tiến nhất của Nemotron 3 Diarization so với cơ sở Sortformer trước đây của NVIDIA.
Đo lường độ chính xác của phân đoạn (diarization)
Chỉ số chính được sử dụng để đánh giá mô hình là tỷ lệ lỗi phân đoạn (DER). Chỉ số này kết hợp ba loại lỗi:
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.