MarkTechPost
92

Mô hình

Meta ra mắt Muse Voice Transcribe: Mô hình thời gian thực tích hợp ASR, phân tách giọng nói và phát hiện điểm cuối

(giờ Việt Nam)

Tóm tắt AI

Meta Superintelligence Labs giới thiệu Muse Voice Transcribe, mô hình tự hồi quy đầu tiên xử lý đồng thời nhận diện giọng nói, phân tách hơn 20 người nói và phát hiện điểm cuối mà không cần hậu xử lý.

Bản dịch AI

Meta Superintelligence Labs Releases Muse Voice Transcribe: One Real-Time Model for Streaming ASR, Diarization, and Endpointing

Hầu hết các hệ thống xử lý giọng nói trong sản xuất hiện nay đều là sự kết hợp của ba hệ thống riêng biệt. Một mô hình thực hiện chuyển đổi giọng nói thành văn bản (transcribe), mô hình thứ hai phân tách người nói (speaker diarization), và một bộ phát hiện quyết định thời điểm người dùng ngừng nói. Mỗi bước chuyển tiếp đều làm tăng độ trễ và tạo ra nguy cơ lỗi mới.

Muse Voice Transcribe, được Meta Superintelligence Labs công bố trong tuần này, đã hợp nhất ba công việc đó vào một mô hình tự hồi quy (autoregressive) duy nhất. Meta gọi đây là mô hình nhận thức âm thanh thời gian thực đầu tiên của họ. Nó thực hiện đồng thời ASR (nhận dạng giọng nói tự động) dạng luồng, phân tách người nói cho hơn 20 người và xác định điểm kết thúc trong một lần xử lý duy nhất mà không cần hậu xử lý.

Liệu nó có thể triển khai được không? Có, nhưng chỉ dưới dạng API được lưu trữ (hosted API). Nó hiện đã có mặt trên Meta Model API với tên gọi muse-voice-transcribe-1.0, có giá 3,00 USD cho mỗi 1.000 phút âm thanh (0,18 USD mỗi giờ), và đã hỗ trợ tính năng đọc chính tả trong Meta AI cho Mac và Muse Code. Hiện chưa có trọng số (weights) nào được công bố, vì vậy không có tùy chọn tự lưu trữ (self-hosted).

ASR dạng luồng là nền tảng

Muse Voice Transcribe là một mô hình đa phương thức tự hồi quy thuộc dòng Muse Spark. Âm thanh được đưa vào theo các đoạn 80ms ở tần số 12,5 Hz. Mỗi đoạn được chuyển đổi thành một token mềm (soft token) duy nhất.

Sau mỗi đoạn, mô hình đưa ra một lựa chọn nhị phân. Nó hoặc dự đoán một token <|next_audio|> và tiếp tục lắng nghe, hoặc xuất ra một token văn bản. Khi mô hình dự đoán <|next_audio|>, token đó sẽ được thay thế bằng đoạn âm thanh tiếp theo thực tế trong đầu vào. Khi luồng kết thúc, một token <|empty_audio|> được chèn vào và mô hình sẽ xuất toàn bộ văn bản còn lại mà không yêu cầu thêm âm thanh.

Việc lắng nghe và viết được chia sẻ chung một vòng lặp giải mã (decoder loop), vì vậy không có giai đoạn căn chỉnh riêng biệt nào gây ra hiện tượng lệch (drift).

Độ trễ thích ứng, được huấn luyện bằng RL

Vì mô hình kiểm soát thời điểm nó lắng nghe, nó cũng kiểm soát lượng ngữ cảnh âm thanh nằm phía sau mỗi từ. Meta gọi khoảng cách đó là 'độ trễ' (delay). Độ trễ dài hơn đồng nghĩa với bản ghi chính xác hơn nhưng độ trễ thời gian lại cao hơn.

Thay vì cố định sự đánh đổi đó, Meta huấn luyện mô hình để tự điều chỉnh. Học tăng cường (Reinforcement learning) kết hợp phần thưởng dựa trên tỷ lệ lỗi từ (word error rate) và phần thưởng dựa trên độ trễ theo cách nhân, tạo ra một chính sách thay đổi độ trễ cho mỗi từ tùy theo độ khó. Meta báo cáo rằng điều này đưa mô hình lên đường biên Pareto về tốc độ so với độ chính xác, đo bằng thời gian hoàn thành bản ghi cuối cùng, vượt qua các hệ thống tiên phong trước đó như Soniox, Cartesia và ElevenLabs.

Phân tách người nói và xác định điểm kết thúc là các token bổ sung

Meta không thêm mô hình thứ hai để xác định người nói. Họ đã thêm các token đặc biệt vào cùng một luồng dữ liệu.

Đối với việc phân tách người nói, token <|start_of_turn|> đánh dấu khả năng chuyển đổi người nói và thẻ <|speaker_{A-Z}|> xác định danh tính người nói. Token chuyển lượt được kích hoạt ngay khi có khả năng chuyển đổi, trong khi thẻ người nói bị trì hoãn đến cuối đoạn. Âm thanh từ một người nói có thể được chia thành nhiều phân đoạn nhưng tất cả đều quy về cùng một thẻ.

Đối với việc xác định điểm kết thúc, <|speech_onset|> đánh dấu thời điểm bắt đầu nói và <|speech_endpoint|> đánh dấu thời điểm người dùng kết thúc. Cả hai tác vụ này đều được huấn luyện cùng với ASR dạng luồng, sử dụng các phần thưởng bổ sung được xếp chồng lên trên phần thưởng ASR.

Các khả năng

Mô hình được huấn luyện trên hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ đã được xác minh kỹ lưỡng và khuyến nghị sử dụng khi ra mắt. Khả năng chuyển đổi ngôn ngữ (code-switching) được hỗ trợ tự nhiên, cả trong một câu và giữa các câu, điều này rất quan trọng đối với những người nói song ngữ thường trộn lẫn ngôn ngữ ngay trong mệnh đề. Độ chính xác có thể được cải thiện hơn nữa bằng cách điều chỉnh theo ngôn ngữ, từ khóa và ngữ cảnh.

Khả năng xử lý ngữ cảnh dài là một điểm khác biệt thực tế. Meta tuyên bố mô hình hỗ trợ tự nhiên đầu vào âm thanh vượt quá một giờ và hơn 20 người nói mà không cần bước hậu xử lý.

Các điểm chuẩn (Benchmarks)

Meta báo cáo vị trí dẫn đầu trên Artificial Analysis về chuyển đổi giọng nói thành văn bản dạng luồng và trên các điểm chuẩn phân tách người nói công khai, tính đến ngày 1 tháng 9 năm 2026.

Trên bảng xếp hạng Artificial Analysis AA-WER Streaming, Muse Voice Transcribe ghi nhận tỷ lệ lỗi từ (WER) bản ghi cuối cùng là 3,1% tại thời điểm 0,16 giây sau khi kết thúc giọng nói. Cartesia Ink-2 với các điểm kết thúc ngữ nghĩa đạt 3,4% tại 0,43 giây. ElevenLabs Scribe v2 Realtime đạt 3,6% tại 0,14 giây. Cartesia Ink-2 với các điểm kết thúc bên ngoài là nhanh nhất ở mức 0,07 giây nhưng ít chính xác nhất ở mức 4,0%. Đối với bản ghi một phần đầu tiên, Muse Voice Transcribe ghi nhận 3,6% WER tại 0,13 giây.

Về phân tách người nói, Meta báo cáo tỷ lệ lỗi phân tách trung bình là 17,5% trên các tập dữ liệu AMI-IHM, AMI-SDM và VoxConverse. Năm hệ thống khác trong cùng biểu đồ có tỷ lệ dao động từ 21,1% đến 28,6%.

Giá cả là một yếu tố cạnh tranh khác. Với mức 3,00 USD cho mỗi 1.000 phút, nó rẻ hơn mức 4,00 USD của Cartesia Ink-2 và chưa bằng một nửa mức 6,50 USD của ElevenLabs Scribe v2 Realtime và Deepgram Flux.

Công cụ giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem blog Meta AI Research, AI at Meta trên X, Artificial Analysis và trang mô hình Meta Model API. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi cũng như đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.