Sản phẩm
Xây dựng trợ lý giọng nói đa ngôn ngữ độ trễ thấp với NVIDIA Magpie TTS
(giờ Việt Nam)
Tóm tắt AI
NVIDIA ra mắt Magpie TTS, mô hình chuyển văn bản thành giọng nói mã nguồn mở cho phép tùy chỉnh toàn diện và triển khai linh hoạt, tối ưu cho các trợ lý ảo thời gian thực.
Bản dịch AI

Quay lại các bài viết

Mọi tương tác bằng giọng nói đều có một ngân sách độ trễ nhất định.
Vào thời điểm người dùng nghe thấy ứng dụng của bạn phản hồi, bạn đã tiêu tốn những mili giây quý giá để thu âm, chuyển đổi giọng nói thành văn bản, chạy LLM, truy xuất ngữ cảnh và tạo phản hồi. Chuyển đổi văn bản thành giọng nói (TTS) là bước cuối cùng — và cũng là bước mà người dùng chú ý nhất. Nếu quá trình tạo giọng nói chậm, toàn bộ trải nghiệm sẽ trở nên chậm chạp.
Bạn càng tự mình vận hành và tinh chỉnh được nhiều phần trong quy trình đó, bạn càng giành lại được nhiều ngân sách độ trễ hơn.
Voice AI đang phát triển rất nhanh. Các mô hình giọng nói tích hợp mang lại sự đơn giản — một lệnh gọi API, đầu vào là âm thanh, đầu ra là âm thanh — nhưng chúng đánh đổi khả năng tinh chỉnh từng thành phần cho lĩnh vực của bạn, khả năng thay thế bằng các mô hình tốt hơn khi chúng ra mắt, khả năng thực thi lưu trữ dữ liệu và khả năng hiểu chính xác độ trễ đến từ đâu. Để có nhiều quyền kiểm soát hơn, một kiến trúc phân tầng (cascaded architecture) — với các thành phần ASR, TTS và LLM chuyên dụng chạy cùng nhau — giúp mỗi lớp có thể được điều chỉnh độc lập và triển khai trên cơ sở hạ tầng mà bạn sở hữu.
NVIDIA Magpie Multilingual TTS được xây dựng cho mục đích đó. Với trọng số mở (open weights), NVIDIA NIM sẵn sàng cho sản xuất và hỗ trợ 12 ngôn ngữ, bạn có thể triển khai giọng nói đa ngôn ngữ bên trong cơ sở hạ tầng của riêng mình, tối ưu hóa độ trễ cho khối lượng công việc của bạn và tùy chỉnh mô hình cho lĩnh vực của bạn — từ đầu đến cuối, trong môi trường của riêng bạn.
Bản phát hành mới nhất mở rộng phạm vi đa ngôn ngữ với tiếng Ả Rập chuẩn hiện đại, tiếng Hàn và tiếng Bồ Đào Nha (Brazil), đồng thời cải thiện chất lượng trên nhiều ngôn ngữ hiện có thông qua dữ liệu huấn luyện được cập nhật và các cải tiến mô hình.
Cho dù bạn đang xây dựng các tác nhân hỗ trợ khách hàng, trợ lý chăm sóc sức khỏe, copilot doanh nghiệp, hệ thống dịch thuật hay các ứng dụng AI hội thoại, Magpie cung cấp một nền tảng mở cho Voice AI trong sản xuất.
Voice AI đang trở thành đa ngôn ngữ theo mặc định
Các ứng dụng giọng nói ngày nay không chỉ phục vụ một ngôn ngữ duy nhất.
Hỗ trợ khách hàng toàn cầu, trợ lý doanh nghiệp, tài liệu chăm sóc sức khỏe, tự động hóa bán lẻ và quy trình dịch thuật ngày càng đòi hỏi các cuộc hội thoại tự nhiên bằng nhiều ngôn ngữ — tất cả đều phải duy trì độ trễ thấp.
Hỗ trợ nhiều ngôn ngữ hơn chỉ là một phần của thách thức. Các nhà phát triển cũng cần khả năng:
Các mô hình mở thay đổi những gì có thể thực hiện được trên mỗi khía cạnh này.
Một mô hình mở, mười hai ngôn ngữ
Magpie TTS Multilingual là một mô hình trọng số mở với 364 triệu tham số hỗ trợ:
Tiếng Anh · Tiếng Tây Ban Nha · Tiếng Pháp · Tiếng Đức · Tiếng Ý · Tiếng Việt · Tiếng Quan Thoại · Tiếng Hindi · Tiếng Nhật · Tiếng Ả Rập chuẩn hiện đại (mới) · Tiếng Hàn (mới) · Tiếng Bồ Đào Nha (Brazil) (mới)
Mỗi ngôn ngữ bao gồm giọng nói nam và nữ thông qua một biểu diễn người nói đa ngôn ngữ được chia sẻ.
Bản phát hành này cũng cải thiện tính linh hoạt đa ngôn ngữ với khả năng hỗ trợ chuyển đổi mã (code-switching) mở rộng cho tiếng Hindi và tiếng Nhật, được kích hoạt thông qua xử lý chuyển đổi từ ký tự sang âm vị (grapheme-to-phoneme) IPA và các từ điển phát âm tùy chỉnh — giúp phát âm chính xác tên riêng, thuật ngữ kỹ thuật và nội dung đa ngôn ngữ dễ dàng hơn.
Thay vì duy trì các mô hình TTS riêng biệt cho các khu vực khác nhau, các nhà phát triển có thể xây dựng các ứng dụng đa ngôn ngữ trên một nền tảng mở duy nhất.
Độ trễ mà người dùng của bạn thực sự nhận thấy
Trong AI hội thoại, chuyển đổi văn bản thành giọng nói là giai đoạn cuối cùng trước khi người dùng nghe thấy phản hồi. Điều đó khiến Thời gian đến âm thanh đầu tiên (TTFA) — khoảng trễ giữa lúc bắt đầu tạo giọng nói và âm thanh đầu tiên đến tai người dùng — trở thành một trong những chỉ số độ trễ quan trọng nhất trong quy trình giọng nói.
Vì Magpie TTS có thể được triển khai bên trong môi trường của riêng bạn, độ trễ mà bạn đo lường là độ trễ phía máy chủ mà bạn thực sự kiểm soát, không bao gồm các vòng lặp dịch vụ được quản lý.
Nguồn: Tài liệu hiệu năng NVIDIA TTS NIM (v26.07), trung bình của ba lần thử nghiệm, on-prem. TTFA = độ trễ đến âm thanh đầu tiên; RTFX = thông lượng dưới dạng bội số của thời gian thực.
Với 32ms trên B200, TTFA của Magpie để lại phần còn lại của ngân sách độ trễ cho quá trình xử lý ASR và LLM — giữ cho tổng độ trễ từ đầu đến cuối nằm trong ngưỡng dưới 200ms mà hội thoại tự nhiên yêu cầu. Trên các GPU NVIDIA, Magpie cung cấp âm thanh đầu tiên trong 32–79ms trên một luồng đơn. Tại 64 luồng đồng thời, B200 đạt TTFA 239ms trong khi cung cấp thông lượng gấp 320 lần thời gian thực — tạo âm thanh nhanh hơn gấp 300 lần so với tốc độ phát lại, ngay cả dưới tải trọng đồng thời.
Bảng trên cho thấy Magpie được phục vụ dưới dạng NVIDIA NIM, đo lường on-prem — container được tối ưu hóa chạy trên GPU của riêng bạn. Checkpoint mở trên Hugging Face là cùng một mô hình và là con đường để bạn nghiên cứu và tinh chỉnh; NIM là ngăn xếp phục vụ đã được tinh chỉnh tạo ra các độ trễ sản xuất này. Cả hai đều chạy trên phần cứng mà bạn kiểm soát.
Vì mô hình chạy trên cơ sở hạ tầng của riêng bạn, bạn có thể đo điểm chuẩn hiệu năng trực tiếp, tinh chỉnh nó cho việc triển khai của mình và mở rộng quy mô theo khối lượng công việc. Đối với các tác nhân giọng nói thời gian thực, đó là sự khác biệt giữa các cuộc hội thoại mang lại cảm giác phản hồi nhanh và các cuộc hội thoại mang lại cảm giác bị trễ.
Tối ưu hóa cho việc tạo giọng nói thời gian thực
Độ trễ thấp không phải là ngẫu nhiên. Magpie giới thiệu hai cải tiến kiến trúc bổ sung giúp giảm thời gian suy luận trong khi vẫn duy trì chất lượng giọng nói.
Xếp chồng khung (Frame stacking). Bộ giải mã dự đoán hai khung âm thanh trong mỗi bước giải mã thay vì một. Điều này cắt giảm một nửa số lần lặp của bộ giải mã, rút ngắn thời gian tạo và cải thiện thông lượng.
Transformer cục bộ (Local transformer). Chỉ riêng việc xếp chồng khung sẽ làm giảm chất lượng âm thanh bằng cách tạo ra các phụ thuộc giữa các token codebook được tạo đồng thời. Transformer cục bộ mô hình hóa các phụ thuộc đó và tinh chỉnh âm thanh được tạo, khôi phục chất lượng mà việc xếp chồng khung có thể làm mất đi.
Cùng với nhau, các kỹ thuật này mang lại cả khả năng tạo nhanh hơn và tổng hợp giọng nói tự nhiên. Kiến trúc này được mô tả trong bài báo "Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation" (ICASSP 2026).
Nhanh hơn sẽ không quan trọng nếu nó không nghe tự nhiên
Bản phát hành này không chỉ thêm ngôn ngữ — nó còn cải thiện chất lượng tổng hợp trên nhiều ngôn ngữ hiện có. So với bản phát hành trước, Magpie cho thấy tỷ lệ lỗi ký tự (CER) giảm và độ tương đồng người nói (SSIM) cao hơn trên một số ngôn ngữ, với những cải thiện rõ rệt nhất trên tiếng Pháp và tiếng Tây Ban Nha:
Nguồn: Thẻ mô hình Magpie TTS Multilingual. CER thấp hơn là tốt hơn; SSIM cao hơn là tốt hơn.
Các mô hình tiếng Ả Rập (1,62% CER), tiếng Hàn (2,69%) và tiếng Bồ Đào Nha (Brazil) (2,91%) mới được thêm vào thiết lập chất lượng cơ sở cho các cải tiến trong tương lai.
Trong khi các chỉ số khách quan giúp đo lường tiến độ, chất lượng giọng nói cuối cùng vẫn là cảm nhận. Bạn có thể tự mình nghe sự khác biệt trên NVIDIA Build hoặc bản demo trên Hugging Face.
Tại sao trọng số mở lại quan trọng
Độ trễ mà bạn có thể đo lường là hữu ích. Độ trễ mà bạn có thể kiểm soát thậm chí còn tốt hơn.
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.