Sản phẩm
Meta ra mắt Muse Voice Transcribe: Mô hình chuyển đổi giọng nói thời gian thực với khả năng tách lời siêu việt
(giờ Việt Nam)
Tóm tắt AI
Meta giới thiệu Muse Voice Transcribe, mô hình xử lý âm thanh thời gian thực có khả năng nhận diện, chuyển đổi văn bản và tách biệt giọng nói của hơn 20 người cùng lúc với độ trễ cực thấp.
Bản dịch AI
Các phòng thí nghiệm Superintelligence Labs của Meta vừa ra mắt mô hình nhận diện âm thanh thời gian thực đầu tiên của họ. Mô hình này có khả năng chuyển đổi giọng nói thành văn bản, phân biệt các người nói và phát hiện ranh giới câu trong các cuộc hội thoại trực tiếp.
Mô hình thuộc dòng Spark này chia âm thanh đầu vào thành các đoạn 80 mili giây. Sau mỗi đoạn, nó sẽ quyết định xem nên tiếp tục lắng nghe hay xuất ra từ tiếp theo dưới dạng văn bản, qua đó kiểm soát lượng ngữ cảnh cần thu thập trước khi đưa ra bản ghi.
Chờ đợi lâu hơn đồng nghĩa với độ chính xác cao hơn nhưng độ trễ cũng lớn hơn. Theo Meta, Muse Voice Transcribe điều chỉnh thời gian chờ một cách linh hoạt cho từng từ dựa trên độ khó. Các từ dễ sẽ được xuất ra nhanh hơn, trong khi các từ khó sẽ có thêm thời gian để mô hình "lắng nghe". Meta đã huấn luyện hành vi này bằng học tăng cường (reinforcement learning), thưởng cho mô hình khi đạt được tỷ lệ lỗi thấp và độ trễ ngắn cùng một lúc.

Phân biệt người nói và phát hiện câu mà không cần hệ thống bổ trợ
Meta tích hợp các tính năng còn lại vào cùng một mô hình mà không cần các hệ thống riêng biệt. Đối với việc xác định người nói, mô hình đánh dấu sự thay đổi người nói trong văn bản đang chạy và gắn thẻ mỗi đoạn với một định danh từ A đến Z. Đối với ranh giới câu, nó đánh dấu điểm bắt đầu và kết thúc của mỗi phát ngôn. Cả hai tác vụ này đều được huấn luyện đồng thời cùng với khả năng nhận diện giọng nói.
Mô hình có thể phân biệt hơn 20 người nói cùng lúc và xử lý các bản ghi dài hơn một giờ mà không cần hậu xử lý. Theo Meta, trong một bản demo với tám người trong phòng, hệ thống đã gán các từ cho từng người nói theo thời gian thực.
Hỗ trợ đa ngôn ngữ là điểm bán hàng then chốt
Meta cho biết Muse Voice Transcribe đã được huấn luyện trên hơn 70 ngôn ngữ, với 25 ngôn ngữ được kiểm thử chuyên sâu. Mô hình cũng xử lý tốt việc chuyển đổi mã (code-switching), khi người nói chuyển đổi giữa hai ngôn ngữ ngay trong một câu. Các gợi ý về ngôn ngữ, từ khóa và ngữ cảnh có thể giúp tăng độ chính xác hơn nữa, đặc biệt là đối với các danh từ riêng như "Meta", "Muse" hoặc "Menlo Park".

Artificial Analysis đã xác nhận các tuyên bố của Meta trong một đánh giá độc lập. Muse Voice Transcribe đạt tỷ lệ lỗi từ (word error rate) là 3,1% đối với tiếng Anh trong vòng 0,16 giây sau khi người nói kết thúc câu. ElevenLabs Scribe v2 Realtime đạt 3,6% trong 0,14 giây, AssemblyAI Universal-3.5 Pro Realtime đạt 4,0%. Cartesia Ink-2 đạt mức 3,4% hoặc 4,0%, tùy thuộc vào việc mô hình tự phát hiện kết thúc câu hay dựa vào hệ thống bên ngoài. Sự cạnh tranh đang rất khốc liệt. OpenAI đã phát hành GPT-Realtime-Whisper cho cùng mục đích vào tháng 5 và cắt giảm giá các mô hình chuyển đổi văn bản vào tháng 7.
Meta gắn kết đợt ra mắt này với tầm nhìn của CEO Mark Zuckerberg về "siêu trí tuệ cá nhân". Trong một bản demo được dàn dựng, các nhân viên của Meta lập luận rằng nhận diện giọng nói đáng tin cậy là nền tảng cho các tác nhân AI cá nhân có thể lắng nghe các cuộc hội thoại thực tế thông qua kính AI. Tại Đức, lệnh cấm đối với kính camera của Meta đã được thảo luận gần đây, mặc dù Cơ quan Mạng lưới Liên bang Đức đã quyết định không theo đuổi lệnh cấm này.
Khả năng tiếp cận
Muse Voice Transcribe hiện cung cấp năng lượng cho tính năng đọc chính tả bằng giọng nói trong Meta AI và Muse Code, đồng thời khả dụng thông qua Meta Model API. Người dùng có thể dùng thử bằng cách giữ phím "Fn" trong bất kỳ ứng dụng nào.
Meta đang đưa ra mức giá cạnh tranh hơn so với thị trường. Với 0,18 USD mỗi giờ, hoặc 3 USD cho mỗi 1.000 phút âm thanh, mức giá này thấp hơn so với Cartesia Ink-2 (4 USD) và ElevenLabs Scribe v2 Realtime cùng Deepgram Flux (6,50 USD mỗi loại).
Điều này tiếp nối chiến lược từ Muse Spark 1.1 và Muse Spark 1.2, nơi Meta cạnh tranh về giá thay vì hiệu suất đỉnh cao. Công ty chưa tiết lộ số lượng tham số của mô hình, khối lượng dữ liệu huấn luyện hay các nguồn dữ liệu âm thanh, và họ cũng không phát hành trọng số (weights) của mô hình.
Meta đã tái cơ cấu bộ phận AI của mình vào mùa hè năm 2025 dưới sự quản lý của Superintelligence Labs, tuyển dụng các nhà nghiên cứu hàng đầu từ OpenAI, Google DeepMind và Apple với các gói đãi ngộ lên tới 300 triệu USD trong bốn năm. Không phải tất cả họ đều ở lại. Một số người đã quay trở lại OpenAI chỉ sau vài tuần.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.