Mô hình
NVIDIA ra mắt NemotronLabs VoiceChat 11B: Mô hình giọng nói mã nguồn mở với độ trễ cực thấp
(giờ Việt Nam)
Tóm tắt AI
NVIDIA giới thiệu mô hình hội thoại giọng nói toàn phần (full-duplex) đầu tiên hỗ trợ gọi công cụ thời gian thực với độ trễ chỉ 448ms. Mô hình này tối ưu hóa trải nghiệm đàm thoại tự nhiên, hiện đã có sẵn mã nguồn cho mục đích nghiên cứu.
Bản dịch AI

NVIDIA vừa ra mắt NemotronLabs VoiceChat 11B, một mô hình speech-to-speech (chuyển đổi giọng nói sang giọng nói) end-to-end mã nguồn mở với 11 tỷ tham số, phục vụ các cuộc hội thoại thời gian thực ở chế độ full-duplex (song công). Thay vì kết hợp chuỗi ASR, LLM và TTS, mô hình này thực hiện việc hiểu và tạo giọng nói theo luồng trong một mạng lưới thống nhất. Điều này loại bỏ sự phức tạp của việc điều phối đa mô hình và chuyển giao API như các kiến trúc phân tầng truyền thống, đồng thời cắt giảm độ trễ end-to-end: độ trễ khi chuyển lượt hội thoại mượt mà đo được là 448 ms trên Full-Duplex-Bench 1.0. Mô hình có khả năng lắng nghe trong khi đang nói, cho phép người dùng ngắt lời giữa chừng và tác nhân (agent) sẽ dừng lại, với tỷ lệ tiếp quản (take-over rate) đạt 1.00 ở mức 480 ms. Đây cũng là mô hình full-duplex mã nguồn mở đầu tiên hỗ trợ gọi công cụ (tool calling) trong khi cuộc hội thoại vẫn tiếp diễn, sử dụng một kênh đầu ra riêng biệt cho các tập lệnh <TOOLCALL> cùng với các câu thoại "đang chờ" (on-hold) do người vận hành định nghĩa để lấp đầy khoảng trống trong khi API đang xử lý.
Liệu mô hình này có thể triển khai được không?
MỘT PHẦN — có thể triển khai cho các dự án thử nghiệm (pilot) ngay hôm nay, nhưng chưa sẵn sàng cho môi trường sản xuất. Các trọng số (weights) và container đều được công khai, và giấy phép sử dụng khá cởi mở. Tuy nhiên, đội ngũ NVIDIA tuyên bố checkpoint này 'chỉ dành cho mục đích nghiên cứu', và kho lưu trữ cũng ghi nhận các lỗi thực tế: giới hạn ngữ cảnh âm thanh trong hai phút, suy giảm chất lượng dẫn đến những đoạn hội thoại vô nghĩa không thể phục hồi sau vài lượt, hiện tượng tự nói chuyện không kiểm soát sau khi kết thúc lượt, và mất từ trong quá trình chuyển đổi giọng nói người dùng thành văn bản.
Kiến trúc
Mô hình là sự kết hợp giữa Mamba và Transformer, được lắp ghép từ ba thành phần hiện có của NVIDIA cùng với một đường dẫn đầu ra mới:
Các đầu ra bao gồm âm thanh của tác nhân, văn bản của tác nhân và bản ghi chép (transcription) thời gian thực của người dùng. Quá trình huấn luyện sử dụng khoảng 550.000 giờ âm thanh từ các tập dữ liệu thực và tổng hợp, dựa trên nền tảng SALM-Duplex và Audio Flamingo 3.
Gọi công cụ mà không gây ra khoảng lặng
Các lệnh gọi công cụ được phát ra trên kênh phụ dưới dạng khối <TOOLCALL>; mã của bạn sẽ trả về kết quả trong khối <TOOL_RESPONSE>. Điểm đáng chú ý là thông báo "đang chờ": với mỗi công cụ, người vận hành định nghĩa một câu thoại mà tác nhân sẽ nói ngay khi mô hình tạo ra văn bản kích hoạt lệnh gọi, nhờ đó cuộc hội thoại không bị im lặng trong khi API đang chạy.
Các ràng buộc được quy định rõ ràng. NVIDIA khuyến nghị tối đa năm công cụ mỗi phiên, mô hình không thể gọi nhiều công cụ cùng lúc một cách đáng tin cậy, và người dùng không thể ngắt lời tác nhân trong quá trình thực thi công cụ. Các câu lệnh hệ thống (system prompts) và phản hồi công cụ phải ở định dạng ASCII và tương thích với TTS.
Hiệu suất
Trên Full-Duplex-Bench 1.0: TOR (tỷ lệ chuyển lượt) mượt mà đạt 0.82 ở 448 ms, TOR khi người dùng ngắt lời đạt 1.00 ở 480 ms, và TOR xử lý khoảng dừng đạt 0.153 (dữ liệu tổng hợp) và 0.255 (Candor), với giá trị thấp hơn là tốt hơn.
Trên AU Harness BFCL-v3 về gọi công cụ bằng giọng nói: 58.5% đơn giản, 62.5% đa công cụ, 42.5% song song, 27.5% song song-đa công cụ, 89.6% không liên quan, trung bình đạt 56.1%. Trên Full-Duplex-Bench v3: 82.5% chọn đúng công cụ, 44.2% độ chính xác đối số, 33% pass@1.
NVIDIA báo cáo rằng mô hình xếp hạng #2 trong số các mô hình full-duplex mã nguồn mở trên VoiceBench và xếp hạng #2 trong số các mô hình mã nguồn mở trên Full-Duplex-Bench 1.0.
Trình giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem thẻ mô hình trên Hugging Face, GitHub (NeMo Speech) và container NGC. Ngoài ra, đừng quên theo dõi chúng tôi trên Twitter, tham gia cộng đồng ML SubReddit với hơn 150.000 thành viên và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo mang tên Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, đảm bảo cả tính kỹ thuật lẫn sự dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.