Mô hình
Meta ra mắt Muse Voice Transcribe: Mô hình AI nhận diện giọng nói thời gian thực, hỗ trợ tách lời hơn 20 người
(giờ Việt Nam)
Tóm tắt AI
Meta giới thiệu Muse Voice Transcribe, mô hình AI tích hợp nhận diện giọng nói, tách lời và phát hiện điểm dừng theo thời gian thực với chi phí 3 USD/1000 phút.
Bản dịch AI
Theo tin từ IT ngày 2 tháng 9, trang tin công nghệ 9to5Mac hôm qua (1 tháng 9) đã đăng tải bài viết cho biết Meta vừa ra mắt Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực đầu tiên của hãng.
Các nhà phát triển có thể truy cập tính năng này thông qua Meta Model API với mức giá 3 USD cho mỗi 1.000 phút âm thanh (tương đương khoảng 20,2 Nhân dân tệ theo tỷ giá hiện tại), tức là 0,18 USD mỗi giờ (tương đương khoảng 1,2 Nhân dân tệ).

Mô hình này tích hợp khả năng nhận diện giọng nói tự động dạng luồng (streaming), phân tách người nói và phát hiện điểm kết thúc trong cùng một quy trình. Khi người dùng nói, hệ thống có thể xuất văn bản đồng thời mà không cần chờ đợi toàn bộ bản ghi âm kết thúc mới xử lý riêng biệt.
Lưu ý từ IT: "Dạng luồng" (streaming) nghĩa là vừa nói vừa chuyển đổi văn bản, mô hình không cần đợi hết đoạn âm thanh mới đưa ra kết quả mà sẽ liên tục xuất văn bản theo từng đoạn nhỏ, nhờ đó độ trễ thấp hơn, phù hợp cho các tác vụ như đọc chính tả thời gian thực, ghi chép cuộc họp và phụ đề cuộc gọi.
Muse Voice Transcribe có thể phân tách các diễn giả khác nhau trong bản ghi âm chứa hơn 20 người nói, đồng thời nhận diện được khi nào người nói kết thúc để tự động xác định ranh giới của một đoạn đầu vào.
Mô hình được huấn luyện trên hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ đã được kiểm chứng tại thời điểm ra mắt. Mô hình hỗ trợ các đoạn âm thanh có độ dài hơn 1 giờ, cũng như hỗ trợ chuyển đổi ngôn ngữ tự nhiên trong câu hoặc giữa các câu. Các nhà phát triển còn có thể cải thiện hiệu quả nhận diện trong các ngôn ngữ, thuật ngữ hoặc ngữ cảnh cụ thể thông qua việc tùy chỉnh ngôn ngữ, từ khóa và ngữ cảnh (bias).
Về mặt kỹ thuật, để cân bằng giữa phản hồi thời gian thực và độ chính xác, Meta đã giới thiệu cơ chế ra quyết định động gọi là "độ trễ thích ứng" (adaptive delay). Hệ thống không áp dụng sự đánh đổi cố định giữa tốc độ và độ chính xác cho tất cả các từ, mà thay vào đó, nó đánh giá xem cần nhận thêm bao nhiêu âm thanh nữa cho mỗi từ trước khi xuất kết quả nhận diện.
Đối với những giọng nói dễ nhận diện, hệ thống có thể gửi kết quả chuyển đổi nhanh hơn. Đối với những từ phát âm không rõ, nhiều thuật ngữ chuyên môn hoặc ngữ cảnh phức tạp, hệ thống sẽ sử dụng thêm thông tin âm thanh từ ngữ cảnh xung quanh. Cơ chế này nhằm mục đích đạt được sự cân bằng tối ưu.
Meta cho biết, tính đến ngày 1 tháng 9 năm 2026, Muse Voice Transcribe đang đứng vị trí số 1 trên bảng xếp hạng chuyển đổi giọng nói thành văn bản dạng luồng của Artificial Analysis.




Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.