Sản phẩm
NVIDIA Nemotron 3 Diarization cập bến Baseten: Tùy chỉnh độ trễ linh hoạt cho nhận diện người nói
(giờ Việt Nam)
Tóm tắt AI
Baseten ra mắt dịch vụ lưu trữ cho mô hình NVIDIA Nemotron 3 Diarization, hỗ trợ ba chế độ xử lý từ batch đến thời gian thực với chi phí tối ưu chỉ 1 cent mỗi giờ âm thanh.
Chính văn · Bản dịch AI

Kiến trúc streaming đầu cuối (end-to-end)
Speaker diarization (phân đoạn người nói) chia luồng âm thanh dựa trên thời điểm mỗi người nói bắt đầu lên tiếng, xuất ra thời gian cho từng giọng nói riêng biệt và gán nhãn người nói nhất quán cho mỗi khoảng thời gian. Kết hợp với nhận dạng giọng nói (transcription), diarization có thể xác định từ ngữ được nói bởi ai trong một cuộc hội thoại.
Mô hình NVIDIA Nemotron 3 Diarization có kiến trúc dựa trên transformer với khoảng 100 triệu tham số, được xây dựng trên nền tảng NVIDIA Streaming Sortformer. Nó chuyển đổi âm thanh 16 kHz thành các khung hình 10ms và phát ra ma trận T×8 chứa xác suất hoạt động của người nói.
Hai trạng thái duy trì cuộc hội thoại xuyên suốt các đoạn (chunk): bộ nhớ đệm người nói theo thứ tự xuất hiện (speaker_0 là giọng nói đầu tiên được nghe thấy và giữ nguyên định danh đó) và hàng đợi FIFO (“Vào trước, Ra trước”) của các khung hình gần nhất, không yêu cầu nhúng (embedding) hay phân cụm cho độ dài âm thanh không giới hạn.
Cấu hình độ trễ cho các trường hợp sử dụng đa dạng
Trong khi các mô hình diarization trước đây yêu cầu cấu hình phức tạp cho nhiều tham số khác nhau hoặc hoàn toàn thiếu hỗ trợ cho các cấu hình độ trễ đa dạng, thì cùng một checkpoint Nemotron 3 Diarization có thể phục vụ mỗi yêu cầu ở bốn mức độ trễ thuật toán từ 0,32 đến 30,4 giây, tùy thuộc vào lượng âm thanh tương lai mà mô hình xem xét trước khi gán nhãn. Để đáp ứng các yêu cầu ứng dụng đa dạng từ tương tác đại lý thời gian thực đến xử lý phương tiện ngoại tuyến, Nemotron 3 Diarization hỗ trợ các thiết lập độ trễ thuật toán linh hoạt trong một checkpoint thống nhất.
Hình 1 — Các cấu hình độ trễ của một checkpoint duy nhất.

Hình 1 minh họa cách các cấu hình độ trễ này ánh xạ trực tiếp đến kích thước đoạn (chunk) và cửa sổ nhìn trước (lookahead) về phía bên phải. Việc chuyển từ cấu hình cực thấp sang cấu hình thấp tiêu chuẩn giúp đánh đổi một mức tăng độ trễ bộ đệm nhỏ để đạt được sự cải thiện chất lượng liên tục. Khả năng dự đoán này cho phép các nhà phát triển cấu hình kích thước bộ đệm linh hoạt theo từng yêu cầu mà không cần triển khai lại các instance mô hình cơ sở.
Chất lượng cao trên bốn cấu hình độ trễ có thể tùy chỉnh
Chúng tôi báo cáo tỷ lệ lỗi diarization (DER) bao gồm cả phần chồng lấp và không sử dụng collar. Nemotron 3 Diarization duy trì độ chính xác ngay cả khi độ trễ giảm. Việc chuyển từ cấu hình ngoại tuyến 30 giây sang cấu hình cực thấp 0,32 giây chỉ làm tăng DER thêm 1-2 điểm so với âm thanh đã ghi sẵn, với chất lượng được duy trì ngay cả khi có hơn bốn người nói. Trên tập dữ liệu AISHELL-4 ở cấu hình “thấp”, chúng tôi ghi nhận DER là 9,8% so với 27,2% của Streaming Sortformer v2.1, một sự cải thiện đáng kể so với phiên bản tiền nhiệm của mô hình này.
Để đánh giá độ chính xác của diarization tiêu chuẩn trên các môi trường âm thanh và số lượng người nói khác nhau, chúng tôi đã đo DER trên các tập dữ liệu chuẩn mà không áp dụng time collar.
Hình 2 — Tỷ lệ lỗi diarization theo tập dữ liệu và cấu hình độ trễ.

Kết quả kiểm chuẩn cho thấy sự ổn định nhất quán trên nhiều tập dữ liệu chuẩn bằng nhiều ngôn ngữ như NOTSOFAR, AMI, CALLHOME và AISHELL, vượt trội hơn Meta Muse Voice Transcribe trên tất cả các tập dữ liệu ngay cả ở cấu hình cực thấp và chỉ thua pyannote community-1 trên AMI. Ngay cả trong các cấu hình độ trễ cực thấp, tỷ lệ lỗi vẫn nằm trong biên độ hẹp so với các mô hình cơ sở ngoại tuyến, xác nhận khả năng phân bổ người nói mạnh mẽ trong các ràng buộc thời gian thực. Streaming diarization trên Baseten vẫn duy trì chất lượng gần với âm thanh đã ghi sẵn trên các cấu hình độ trễ đã thử nghiệm.
Hoạt động của người nói như một tín hiệu phát hiện giọng nói và lượt nói
Các phân đoạn thời gian được gán cho người nói chỉ là một cách sử dụng Nemotron 3 Diarization. Về cốt lõi, mô hình theo dõi hoạt động giọng nói của từng người nói theo đơn vị 10ms. Dữ liệu thô này có thể được các ứng dụng giọng nói sử dụng để hỗ trợ ba khả năng chính:
- Phát hiện hoạt động giọng nói: Bằng cách kết hợp dữ liệu từ tất cả các kênh âm thanh, nó phát hiện giọng nói trực tiếp từ luồng âm thanh thay vì dựa vào mức âm lượng.
- Phát hiện kết thúc lượt nói theo từng người nói: Nó theo dõi thời điểm một người nói cụ thể ngừng nói trong một khoảng thời gian nhất định. Điều này giúp AI voice agent phân biệt giữa việc người dùng chính kết thúc câu và tiếng ồn nền từ người khác trong phòng.
- Lượt nói và ngắt lời: Thứ tự xuất hiện của các giọng nói giúp xác định người nói chính. Nếu giọng nói thứ hai bắt đầu, mô hình sẽ phát hiện sự ngắt lời; nếu cả hai cùng nói, nó sẽ gắn cờ giọng nói chồng lấp, phản hồi trong khoảng 300ms ở các thiết lập độ trễ cực thấp.
Hỗ trợ ngay từ đầu (Day 0) cho nhận dạng giọng nói đã ghi sẵn, streaming và nhận dạng giọng nói theo người nói
Để hợp lý hóa việc triển khai trên các thiết kế hạ tầng âm thanh khác nhau, Baseten cung cấp mô hình thông qua ba preset phục vụ chuyên biệt. Hình 3 cung cấp cái nhìn tổng quan về kiến trúc của các preset này cùng với khối lượng công việc mục tiêu và đặc điểm thông lượng của chúng.
Hình 3 — Ba preset trên Baseten.

Các preset mô-đun này cho phép các ứng dụng giọng nói lựa chọn giữa các yêu cầu batch không trạng thái, luồng WebSocket liên tục để theo dõi người nói trực tiếp, hoặc các pipeline nhận dạng giọng nói đầu cuối kết hợp, khớp trực tiếp với các yêu cầu hạ tầng backend.
Mỗi mức độ trễ chạy như một instance sẵn sàng sử dụng riêng biệt, vì vậy bạn có thể dễ dàng chọn tốc độ theo từng yêu cầu mà không cần triển khai lại. Tùy chọn nhận dạng giọng nói thời gian thực kết hợp trình theo dõi người nói với mô hình nhận dạng giọng nói tiếng Anh 600M của NVIDIA, NVIDIA Parakeet V2 ASR, cũng thuộc dòng sản phẩm giọng nói Nemotron. Bằng cách sử dụng hoạt động của người nói để hướng dẫn nhận dạng giọng nói trên cùng một luồng âm thanh, nó ghi lại chính xác cả hai phía của cuộc hội thoại, ngay cả khi mọi người nói đè lên nhau.
Việc kết hợp nhận dạng giọng nói với diarization thường đòi hỏi quản lý các pipeline mô hình riêng biệt và căn chỉnh văn bản sau đó. Hệ thống thời gian thực của chúng tôi điều kiện hóa trực tiếp mô hình ASR dựa trên các đặc trưng hoạt động của người nói trong lượt truyền tiến (forward pass) chính. Bằng cách đưa các vector hoạt động của từng người nói trực tiếp vào các lớp encoder ban đầu của Parakeet V2, pipeline sẽ chuyển đổi các kênh âm thanh chồng lấp trong một lần truyền duy nhất, loại bỏ các bước trích xuất đặc trưng trùng lặp và bảo toàn sự căn chỉnh thời gian giữa từ ngữ và người nói.
Hiệu suất của Nemotron 3 Diarization trên Baseten
Tải được tạo từ k6 bên trong cụm với kiểm soát một luồng trên một bản sao (replica) nhàn rỗi trong mỗi lần chạy; mọi khung hình máy chủ đều được lưu trữ.
Để thiết lập các giới hạn công suất đáng tin cậy cho hạ tầng sản xuất, chúng tôi đã kiểm chuẩn tổng công suất streaming đồng thời trên mỗi GPU dưới các bài kiểm tra tải liên tục. Hình 5 minh họa hiệu suất độ trễ trên các số lượng luồng đồng thời khác nhau trên một card NVIDIA RTX PRO 6000.
Hình 4 — Số luồng thời gian thực dài một giờ đồng thời trên mỗi RTX PRO 6000.

Kết quả kiểm tra áp lực cho thấy độ trễ ổn định cho đến các điểm bão hòa phần cứng tối đa. Bằng cách quản lý tài nguyên phần cứng nghiêm ngặt trong các giới hạn sử dụng GPU có thể dự đoán được, độ trễ hệ thống vẫn ổn định gần với các giá trị cơ sở của luồng đơn cho đến khi đạt đến giới hạn công suất tối đa.
Sử dụng các tệp và phần cứng giống hệt nhau, preset phục vụ được tối ưu hóa của Baseten mang lại thông lượng xử lý batch cao hơn khoảng 1,35 lần so với thiết lập tham chiếu của NVIDIA được sử dụng trong thử nghiệm của chúng tôi. Qua kết nối HTTP, một GPU duy nhất có thể xử lý liên tục 200 tệp âm thanh dài sáu phút mỗi phút trong khi vẫn duy trì thời gian phản hồi ổn định.
Đối với tính năng chuyển đổi giọng nói thành văn bản trực tiếp, các thiết lập streaming và batch mang lại độ chính xác gần như tương đương, tái tạo thành công các bản ghi có gắn thẻ người nói trực tiếp từ mô hình nhận dạng giọng nói.
Triển khai Nemotron 3 Diarization ngay hôm nay
Nemotron 3 Diarization hiện đã có mặt trên Hugging Face và trong Thư viện mô hình Baseten dưới dạng các preset chuyển đổi giọng nói thành văn bản có phân đoạn theo batch, streaming và thời gian thực. Hãy triển khai chỉ với vài cú nhấp chuột, chọn cấu hình độ trễ cho mỗi yêu cầu và kết hợp với hệ thống ASR bạn đang sử dụng — hoặc liên hệ với các kỹ sư của chúng tôi để được tư vấn cách tối ưu hóa khối lượng công việc liên quan đến giọng nói của bạn.
Bài viết được AI dịch và tổng hợp tự động từ Baseten Blog kỹ thuật (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.