IT Home
85

Mô hình

StepStar ra mắt dòng mô hình âm thanh StepAudio 3: Đa năng từ Realtime đến tạo nhạc

(giờ Việt Nam)

Tóm tắt AI

StepStar vừa trình làng bộ 5 mô hình StepAudio 3 bao gồm Realtime, ASR, TTS, Gen và Music, hiện đã chính thức có mặt trên nền tảng mở của hãng.

Bản dịch AI

Theo tin từ IT ngày 15 tháng 9, hôm nay StepOne đã chính thức ra mắt dòng mô hình StepAudio3, bao gồm StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen và StepAudio3Music. Trong đó, nhiều mô hình đã vươn lên vị trí số 1 toàn cầu trên bảng xếp hạng Artificial Analysis. Cả năm mô hình này hiện đều đã có mặt trên nền tảng mở của StepOne.

Theo công bố chính thức, dòng StepAudio 3 hướng tới các nhóm kịch bản cốt lõi: tạo giọng nói cấp độ người thật, tạo nội dung âm thanh hoàn chỉnh, tương tác giọng nói thời gian thực, hiểu giọng nói trong các kịch bản phức tạp và sáng tạo âm nhạc.

IT đính kèm giới thiệu chi tiết về các mô hình từ phía nhà sản xuất như sau:

StepAudio 3 Realtime: Không chỉ "biết ngắt lời", mà còn biết thấu hiểu, suy nghĩ và hành động.

Ngày nay, ngày càng nhiều sản phẩm giọng nói Realtime hỗ trợ song công toàn phần (full-duplex), ngắt lời và tương tác độ trễ thấp. Điều thực sự tạo nên sự khác biệt về trải nghiệm không chỉ là "có thể nghe và nói cùng lúc hay không", mà là liệu mô hình có thể vừa nghe vừa hiểu, phán đoán thời điểm tiếp lời, đồng thời hoàn thành suy luận và thực thi tác vụ trong một cuộc đối thoại liên tục hay không.

StepAudio 3 Realtime tập trung vào mục tiêu này để nâng cao hơn nữa khả năng tương tác thời gian thực, hỗ trợ đối thoại thời gian thực song công toàn phần nguyên bản.

Trên bảng xếp hạng Conversational Dynamics của Artificial Analysis, StepAudio 3 Realtime đứng số 1 toàn cầu với tổng điểm 98,9%, thể hiện khả năng tương tác giọng nói thời gian thực vượt trội. Điều này có nghĩa là mô hình không chỉ có thể "nghe hiểu" và "trả lời", mà còn có thể phán đoán nhịp điệu đối thoại như một con người thực thụ — biết khi nào nên phản hồi, khi nào nên chờ đợi, cũng như cách xử lý các tình huống ngắt lời đột ngột và phản hồi liên tục từ người dùng.

图片

Đồng thời, StepAudio 3 Realtime cũng đứng số 1 toàn cầu trên bảng xếp hạng Speech Reasoning của Artificial Analysis với độ chính xác suy luận giọng nói đạt 99,7%. Speech Reasoning tập trung vào khả năng mô hình trực tiếp hiểu âm thanh và hoàn thành các tác vụ suy luận phức tạp, đây là một trong những tiêu chuẩn đánh giá bên thứ ba uy tín nhất trong ngành dành cho "mô hình giọng nói nguyên bản".

图片

Mô hình còn có thể đồng thời hiểu ngữ nghĩa, tông giọng, cảm xúc, ngôn ngữ phụ (paralanguage) và âm thanh môi trường, giúp tương tác thời gian thực không chỉ dựa vào nội dung văn bản mà còn tận dụng thông tin âm thanh đầy đủ hơn để hiểu ý định người dùng.

Đối mặt với các câu hỏi phức tạp, StepAudio 3 Realtime hỗ trợ song song việc suy luận và tạo giọng nói, giúp phản hồi nhanh chóng trong khi vẫn tiếp tục tổ chức và đào sâu câu trả lời tiếp theo.

Không chỉ vậy, Tool Call (gọi công cụ) và các tác vụ dài có thể được thực thi bất đồng bộ mà không làm gián đoạn phiên hội thoại hiện tại. Trong thời gian tác vụ chạy, người dùng vẫn có thể tiếp tục giao tiếp, và khi kết quả hoàn tất sẽ tự nhiên quay lại ngữ cảnh hiện tại.

Điều này giúp mô hình giọng nói Realtime không chỉ là "trò chuyện tự nhiên hơn", mà còn có thể thực hiện nghe, nói, suy nghĩ và hành động trong cùng một cuộc đối thoại liên tục.

StepAudio 3 ASR: Từ nghe rõ, đến nghe hiểu.

Nhận dạng giọng nói truyền thống chủ yếu giải quyết vấn đề "đã nghe thấy gì", nhưng giọng nói trong thế giới thực thường chứa phương ngữ, giọng địa phương, thuật ngữ chuyên ngành, từ đồng âm và ngữ cảnh phức tạp. Một mô hình ASR thực sự hữu dụng không chỉ cần chuyển đổi âm thanh thành văn bản chính xác mà còn cần hiểu được ý nghĩa mà người nói muốn truyền đạt.

StepAudio 3 ASR kết hợp nhận dạng giọng nói độ chính xác cao với khả năng hiểu ngữ cảnh, kiến thức và suy luận của mô hình ngôn ngữ lớn, đưa nhận dạng giọng nói từ "nhận diện âm thanh" tiến xa hơn tới "thấu hiểu ngữ cảnh".

Nó hỗ trợ nhận dạng trong nhiều kịch bản như tiếng Trung, tiếng Anh, phương ngữ, nói chêm tiếng Trung - Anh, âm thanh dài và các lĩnh vực chuyên môn, có thể thích ứng với các môi trường ngôn ngữ và cách diễn đạt khác nhau. Đồng thời, dựa vào khả năng hiểu kiến thức từ mô hình ngôn ngữ lớn, StepAudio 3 ASR có thể nhận diện chính xác hơn các nội dung phức tạp như tên người, địa danh, thuật ngữ chuyên ngành, từ đó nâng cao hiệu quả nhận dạng trong các lĩnh vực y tế, pháp luật, tài chính, ô tô, lập trình, v.v.

Mô hình cũng có thể xử lý các đầu vào phức tạp như giọng nói nhỏ, tốc độ nói nhanh, nói líu lưỡi, tiếng hát và nhạc nền, giúp giọng nói trong môi trường thực tế được nhận diện và sử dụng chính xác hơn.

Điều này có nghĩa là mô hình ASR không còn chỉ là một công cụ chuyển đổi âm thanh, mà là một công cụ có thể hiểu, truy xuất và sử dụng chính xác từng đoạn nội dung giọng nói. Trong các kịch bản như biên bản cuộc họp, phụ đề video và hiểu nội dung livestream, chăm sóc khách hàng thông minh, tương tác trên xe hơi, hồ sơ y tế, dịch vụ tài chính và sản xuất nội dung chuyên nghiệp, nó đều có thể hoàn thành tác vụ một cách chính xác.

StepAudio 3 ASR đạt tỷ lệ lỗi từ (WER) chỉ 1,7% trên bảng xếp hạng độ chính xác nhận dạng giọng nói không phát trực tuyến (non-streaming) của Artificial Analysis, đồng hạng nhất toàn cầu.

图片

StepAudio 3 TTS: Không chỉ đọc văn bản, mà còn biểu đạt như người thật.

Âm thanh không chỉ mang thông tin văn bản mà còn chứa đựng các chi tiết biểu đạt phong phú như tông giọng, nhịp điệu, khoảng nghỉ và cảm xúc. Làm thế nào để giọng nói do AI tạo ra gần gũi với giao tiếp thực tế luôn là hướng đi quan trọng của các mô hình tạo giọng nói.

StepAudio 3 TTS là mô hình tạo giọng nói cấp độ người thật hướng tới các kịch bản tương tác thời gian thực, cam kết đưa giọng nói AI từ "phát âm chính xác" tiến tới "biểu đạt tự nhiên".

Mô hình có độ tương thích cao với các mô hình ngôn ngữ tự nhiên của con người về nền tảng âm sắc, tầng bậc ngữ điệu, nhịp điệu và cách lấy hơi, ngắt nghỉ. Nó không chỉ có thể tạo ra giọng nói tương ứng với văn bản mà còn tái hiện được các biểu hiện ngôn ngữ phụ trong giao tiếp thực tế như tiếng cười, sự do dự, nói lắp, lặp từ, sửa lời, giúp giọng nói tổng hợp gần gũi hơn với giọng người thật.

Đồng thời, StepAudio 3 TTS có thể kết hợp hiểu ngữ nghĩa để biểu đạt ý định, tự điều chỉnh cảm xúc và thay đổi tông giọng, giúp biểu đạt âm thanh phù hợp hơn với từng kịch bản cụ thể. Về tương tác thời gian thực, mô hình dựa trên kiến trúc tạo luồng (streaming), thực hiện đồng bộ hóa giữa tạo và phát, đáp ứng nhu cầu của các ứng dụng giọng nói thời gian thực.

StepAudio 3 Gen: Giọng người, hiệu ứng âm thanh, môi trường, âm nhạc, tạo tất cả trong một lần.

Sản xuất nội dung âm thanh truyền thống thường là một chuỗi quy trình rất dài. Lồng tiếng nhân vật, âm thanh môi trường, hiệu ứng âm thanh, nhạc nền cần được sản xuất riêng biệt, sau đó qua chỉnh sửa, căn chỉnh và hòa âm mới tạo thành tác phẩm cuối cùng.

StepAudio 3 Gen nỗ lực hợp nhất các khâu vốn phân tán này vào một mô hình duy nhất.

Nó có thể dựa trên mô tả ngôn ngữ tự nhiên và âm thanh tham chiếu để tạo đồng bộ giọng người, hiệu ứng âm thanh, âm thanh môi trường và nhạc nền. Người dùng chỉ cần mô tả nhân vật, bối cảnh và cốt truyện mà không cần huấn luyện thêm cho nhân vật hoặc bối cảnh cụ thể, là có thể trực tiếp tạo ra nội dung âm thanh với các tầng âm thanh hoàn chỉnh.

Quan trọng hơn, những âm thanh này không chỉ đơn thuần là chồng lấp lên nhau.

StepAudio 3 Gen hỗ trợ kiểm soát tinh vi các đặc điểm như âm sắc, cách nói, tông giọng, cảm xúc, phương ngữ của nhiều nhân vật, cũng như các đặc điểm ngôn ngữ phụ như tiếng cười, tiếng thở, khoảng nghỉ, đồng thời có thể chỉ định thời gian và thứ tự xuất hiện của lời thoại, hiệu ứng âm thanh, âm thanh môi trường và nhạc nền.

Điều này có nghĩa là mô hình không chỉ "tạo ra âm thanh" mà còn bắt đầu tham gia vào thiết kế âm thanh và sắp xếp trình tự thời gian cho toàn bộ nội dung.

Đối với những người sáng tạo phim ảnh, hoạt hình, trò chơi, kịch truyền thanh, sách nói và video ngắn, quy trình sản xuất âm thanh vốn cần thu thập tư liệu, phối hợp nhiều công cụ và xử lý hậu kỳ nặng nề, nay có cơ hội được rút gọn thành một lần tạo và lặp lại liên tục.

StepAudio 3 Music: Không chỉ tạo nhạc, mà còn tham gia sáng tác.

Các mô hình tạo nhạc đã ngày càng thành thạo trong việc "tạo một bài hát từ một câu lệnh". Nhưng sáng tạo âm nhạc thực sự không nên chỉ là "bốc thăm may rủi" như vậy. Người sáng tạo có thể đã có sẵn một đoạn lời bài hát, một đoạn hát chay, một câu giai điệu, một bản nhạc hoặc một bản Demo, và hy vọng AI sẽ tiếp tục hoàn thiện phần phối khí, cải biên và sản xuất.

Do đó, StepAudio 3 Music không chỉ hỗ trợ tạo từ con số không, mà còn hỗ trợ sáng tạo tương tác nhiều vòng dựa trên sự kiểm soát của ký hiệu âm nhạc ABC.

Mô hình hỗ trợ nhiều chức năng như sáng tác bài hát, phối nhạc cho hát chay, hát cover, v.v. Người dùng có thể cung cấp lời bài hát, hát chay, bài hát tham chiếu, ký hiệu ABC và nhiều đầu vào khác để mô hình tiếp tục tạo và hoàn thiện tác phẩm dựa trên những gì đã có.

Đồng thời, người dùng có thể trực tiếp kiểm soát phong cách nhạc, giọng hát, giai điệu, nhịp điệu, nhạc cụ, cảm xúc, đoạn nhạc và chất lượng sản xuất thông qua ngôn ngữ tự nhiên.

StepAudioAI âm thanhStepStarMô hình ngôn ngữCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.