MarkTechPost
Điểm AI 47/100

Mô hình

Sarvam AI ra mắt Saaras V4: Mô hình chuyển đổi giọng nói thành văn bản hỗ trợ 22 ngôn ngữ Ấn Độ và tiếng Anh toàn cầu

(giờ Việt Nam)

Tóm tắt AI

Sarvam AI vừa giới thiệu Saaras V4, mô hình nhận diện giọng nói đạt độ chính xác SOTA trên toàn bộ 22 ngôn ngữ chính thức của Ấn Độ, đồng thời bổ sung khả năng xử lý đa dạng các giọng tiếng Anh quốc tế.

Chính văn · Bản dịch AI

Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English

Sarvam AI đã phát hành Saaras V4, thế hệ mới nhất của mô hình nhận dạng giọng nói của họ. Mô hình này bao phủ tất cả 22 ngôn ngữ chính thức của Ấn Độ cộng với tiếng Anh, hiện đã bao gồm cả các giọng tiếng Anh toàn cầu. Sarvam báo cáo độ chính xác đạt chuẩn tiên tiến trên tất cả 22 ngôn ngữ.

Có thể triển khai được không? Có, thông qua API của Sarvam ngay hôm nay, sử dụng model="saaras:v4". Trọng số mô hình không được công khai và tài liệu tự lưu trữ trên SageMaker của Sarvam hiện chỉ bao gồm Saaras v3.

Bên trong Saaras V4 có gì

Saaras V4 là một hệ thống encoder-decoder. Một bộ mã hóa âm thanh (audio encoder) chuyển đổi dạng sóng thành các embedding mang thông tin chi tiết về ngữ âm và âm học. Sau đó, một bộ điều hợp giảm lấy mẫu theo thời gian (temporal-downsampling adapter) sẽ rút ngắn chuỗi đó và chiếu nó vào không gian embedding của mô hình ngôn ngữ. Điều này giúp giữ các bản ghi âm dài nằm trong giới hạn ngữ cảnh của bộ giải mã (decoder).

Bộ giải mã là Sarvam-3B, một mô hình ngôn ngữ không gian trạng thái lai (hybrid state-space language model) với 3 tỷ tham số được huấn luyện từ đầu nội bộ. Nó đọc các đặc trưng âm thanh cùng với một câu lệnh văn bản (text prompt). Sau đó, nó xuất ra bản ghi chép theo cơ chế tự hồi quy (autoregressively), đưa từng token ngược lại làm đầu vào cho token tiếp theo.

Kết quả đánh giá (Benchmark)

  • Tiếng Anh: Sarvam đã đánh giá 7 tập dữ liệu tiếng Anh. Sáu tập đến từ Open ASR Leaderboard của Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech và VoxPopuli. Tập thứ bảy là Svarah với giọng Ấn Độ của AI4Bharat. Việc chấm điểm tuân theo mã chuẩn hóa của bảng xếp hạng. Saaras V4 đạt WER trung bình thấp nhất trong số các mô hình mà Sarvam đã đánh giá.
  • Ngôn ngữ Ấn Độ: Trên Vistaar, Sarvam báo cáo kết quả trên 10 ngôn ngữ Ấn Độ sử dụng cả WER và LLM-WER. LLM-WER bổ sung thêm kiểm tra ngữ nghĩa. Nó tách biệt các lỗi về ý nghĩa thực sự khỏi các biến thể chính tả hoặc định dạng vô hại thường gặp trong các hệ thống chữ viết Ấn Độ.
  • Âm thanh nhiễu: Trên Kathbath Noisy, được đo bằng LLM-WER, Sarvam cho biết tỷ lệ lỗi của Saaras V4 thấp hơn một nửa so với Deepgram Nova-3 và GPT-4o Transcribe. Tập dữ liệu này bao gồm các bản ghi âm bị nén, bị cắt xén và có nhiều tiếng ồn nền.
  • Nhận dạng ngôn ngữ: Trên các đoạn hội thoại đã xác thực của IndicVoices, tỷ lệ lỗi nhận dạng ngôn ngữ là 2,9% trên 10 ngôn ngữ Ấn Độ hàng đầu. Tỷ lệ này là 5,22% trên tổng số 22 ngôn ngữ.

Cần lưu ý rằng tất cả các con số trên đều do nhà cung cấp báo cáo. Việc kiểm chứng độc lập vẫn chưa được công bố.

5 Chế độ đầu ra từ 1 Mô hình

Cùng một tệp âm thanh có thể trả về 5 dạng biểu diễn, được chọn thông qua tham số mode:

  • transcribe (mặc định): chữ viết bản địa với số và ngày tháng đã được chuẩn hóa.
  • verbatim: từng từ như được nói, giữ nguyên các từ đệm và số được đọc.
  • codemix: chữ viết bản địa, với các từ tiếng Anh được giữ nguyên bằng tiếng Anh.
  • translit: toàn bộ nội dung bằng chữ Latinh.
  • translate: bản dịch tiếng Anh với số đã được chuẩn hóa.

Lập luận của Sarvam rất đơn giản. Việc xử lý những yêu cầu này ngay bên trong mô hình sẽ loại bỏ các bước hậu xử lý vốn có thể làm tăng thêm lỗi.

Gợi ý từ khóa (Keyterm Prompting)

Gợi ý từ khóa là tính năng mới trong V4 và chỉ hoạt động với saaras:v4. Bạn truyền một danh sách JSON dưới mục keyterms, với tối đa 50 thuật ngữ, mỗi thuật ngữ dài 64 ký tự. Các từ khóa giúp định hướng nhận dạng; chúng không đảm bảo kết quả đầu ra. Hãy sử dụng chế độ codemix khi một thương hiệu như PhonePe cần được giữ nguyên bằng chữ Latinh.

Trên IndicContextEval (bài báo, Interspeech 2026), Saaras V4 báo cáo WER 16,03% trong thiết lập gợi ý từ khóa L5. Sarvam cho biết đó là điểm số thấp nhất trên bảng đánh giá này.

Truyền phát (Streaming), Âm thanh dài và Giá cả

  • Streaming: WebSocket với kết quả từng phần và thời gian phản hồi token đầu tiên (TTFT) dưới 150 ms.
  • REST: Ghi chép đồng bộ cho các đoạn clip dài tối đa 30 giây.
  • Batch: Các tác vụ bất đồng bộ lên đến 2 giờ mỗi tệp, với tùy chọn phân tách người nói (speaker diarization).
  • SDK: Python 3.9+ và Node.js 18+, cộng với các tích hợp LiveKit Agents, Pipecat và Vercel AI SDK.
  • Giá: Sarvam niêm yết giá chuyển đổi giọng nói thành văn bản là ₹30 mỗi giờ cho thời gian thực, streaming và batch, và ₹45 mỗi giờ nếu có phân tách người nói.

Saaras v3 vẫn là mô hình mặc định. V4 sử dụng cùng cấu trúc yêu cầu, vì vậy việc chuyển đổi chỉ cần thay đổi 1 dòng mã.

Saaras V4 so với các đối thủ cạnh tranh gần nhất

Đây là 3 hệ thống mà Sarvam đã sử dụng để đánh giá đối chiếu. Các số liệu lấy từ tài liệu công khai và trang giá của từng nhà cung cấp, được kiểm tra vào ngày 26 tháng 9 năm 2026.

Tính năngSarvam Saaras V4Deepgram Nova-3ElevenLabs Scribe v2OpenAI GPT-4o Transcribe
Ngôn ngữ chính thức của Ấn Độ (trong số 22)221114Không liệt kê theo từng ngôn ngữ
Tổng số ngôn ngữ23 (22 ngôn ngữ Ấn Độ + tiếng Anh)45+90+Đa ngôn ngữ
Định hướng bằng từ khóa (Keyterm biasing)Tối đa 50 thuật ngữCó, tính năng trả phí bổ sungTối đa 1.000 (batch), 50 (thời gian thực), tính năng trả phí bổ sungCâu lệnh văn bản tự do
Các chế độ đầu ra tích hợp5 (transcribe, verbatim, codemix, translit, translate)Bản ghi chép cộng với Định dạng thông minhVerbatim hoặc no_verbatimBản ghi chép
Truyền phát thời gian thựcWebSocket, TTFT dưới 150 ms (theo tuyên bố của nhà cung cấp)Có (WebSocket)Scribe v2 Realtime, khoảng 150 msTruyền phát tệp; trực tiếp qua Realtime API
Phân tách người nóiBatch APICóTối đa 32 người nóiMô hình gpt-4o-transcribe-diarize riêng biệt
Giá niêm yết30 ₹/giờ0,0052 $/phút (đa ngôn ngữ, ghi âm sẵn)0,22 $/giờ (xử lý hàng loạt)~0,006 $/phút
Tự lưu trữ (Self-hosting)Chưa hỗ trợ cho V4 (v3 trên SageMaker)CóCloud APICloud API

Những điểm chính

  • Saaras V4 bao phủ tất cả 22 ngôn ngữ Ấn Độ cộng với tiếng Anh toàn cầu trong 1 mô hình duy nhất.
  • Một bộ giải mã không gian trạng thái lai 3B, được huấn luyện từ đầu, nằm phía sau một bộ mã hóa âm thanh.
  • Tính năng gợi ý thuật ngữ chính (Keyterm prompting) chấp nhận tối đa 50 thuật ngữ và đạt 16,03% WER trên IndicContextEval L5.
  • 5 chế độ đầu ra và thời gian TTFT phát trực tuyến dưới 150 ms đều đến từ cùng một mô hình.
  • Hiện chỉ có API với giá 30 ₹ mỗi giờ; tài liệu tự lưu trữ vẫn đang áp dụng cho v3.

Xem Chi tiết kỹ thuật. Mọi tín dụng thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC trang Hugging Face HOẶC bản phát hành sản phẩm HOẶC hội thảo trực tuyến, v.v. của bạn? Kết nối với chúng tôi

Asif Razzaq

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người dùng.

Sarvam AISaaras V4Nhận diện giọng nóiAI đa ngôn ngữCông nghệ âm thanh

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Sarvam AI ra mắt Saaras V4: Mô hình chuyển đổi giọng nói thành văn bản hỗ trợ 22 ngôn ngữ Ấn Độ và tiếng Anh toàn cầu | AIHOT.vn