StepFun ra mắt dòng mô hình ngôn ngữ âm thanh StepAudio 3, với nhiều phiên bản đứng đầu bảng xếp hạng toàn cầu của Artificial Analysis
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
StepFun đã công bố dòng mô hình âm thanh StepAudio 3 bao gồm 5 phiên bản: StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen và StepAudio3Music, đáp ứng các nhu cầu về tương tác thời gian thực, nhận diện giọng nói, chuyển văn bản thành giọng nói, tạo âm thanh và sáng tác nhạc. Theo đưa tin từ IT ngày 15 tháng 9, cả 5 mô hình này đều đã được đưa lên nền tảng mở của StepFun. Tài khoản chính thức của StepFun gọi đây là "gia đình mô hình âm thanh mới" dành cho các tác vụ tương tác giọng nói thời gian thực, nhận diện, tạo giọng nói, tạo âm thanh và âm nhạc, đồng thời xác nhận các mô hình này hiện đã sẵn sàng để sử dụng.
Theo IT, StepAudio 3 Realtime hỗ trợ đối thoại thời gian thực toàn song công (full-duplex) nguyên bản, xếp hạng nhất thế giới trên bảng xếp hạng Artificial Analysis Conversational Dynamics với tổng điểm 98,9%, và đứng đầu bảng xếp hạng Speech Reasoning với độ chính xác suy luận giọng nói đạt 99,7%. StepAudio 3 ASR đạt tỷ lệ lỗi từ (WER) là 1,7% trên bảng xếp hạng độ chính xác nhận diện giọng nói không phát trực tuyến của Artificial Analysis, đồng hạng nhất thế giới. Báo cáo cho biết mô hình này hỗ trợ tiếng Trung, tiếng Anh, phương ngữ, trộn lẫn Trung-Anh, xử lý âm thanh dài và nhận diện trong các lĩnh vực chuyên môn như y tế, pháp luật, tài chính, ô tô và lập trình. StepAudio 3 TTS được mô tả là mô hình tạo giọng nói như người thật dành cho các kịch bản tương tác thời gian thực, dựa trên kiến trúc tạo luồng để đồng bộ hóa việc tạo và phát âm thanh. StepAudio 3 Gen có thể tạo giọng người, hiệu ứng âm thanh, âm thanh môi trường và nhạc nền dựa trên mô tả ngôn ngữ tự nhiên và âm thanh tham chiếu. StepAudio 3 Music hỗ trợ sáng tác từ con số không và sáng tác tương tác nhiều vòng thông qua ký hiệu âm nhạc ABC, hỗ trợ viết bài hát, phối nhạc cho giọng hát và cover bài hát.
Tài khoản bên thứ ba là Hong Ming trên X đã dẫn lại thông tin cho biết StepFun ra mắt dòng StepAudio 3 với nhiều mô hình đứng đầu bảng xếp hạng Artificial Analysis. Một bài đăng khác của tài khoản này cũng lưu ý rõ rằng các bảng xếp hạng liên quan đến từ phía nhà sản xuất, do đó người dùng vẫn nên kiểm chứng dựa trên ngôn ngữ, độ nhiễu và các kịch bản tác vụ cụ thể.
Tiếp nối sự kiện, StepFun và ACE Studio đã cùng ra mắt StepAudio 3 Music. Đây được gọi là mô hình nền tảng tạo nhạc đầu tiên của StepFun, có khả năng chuyển đổi câu lệnh và lời bài hát thành bài hát hoàn chỉnh. Mô hình này được vận hành bởi ABC-COT, giúp lập kế hoạch cấu trúc âm nhạc và phối khí trước khi tổng hợp, đồng thời hỗ trợ tạo phiên bản mới, viết lại câu lệnh, chỉnh sửa ký hiệu âm nhạc ABC và lặp lại quá trình sáng tạo.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T5 · 17/09 · 08:26.
Diễn biến mới nhất
StepFun và ACE Studio vừa hợp tác ra mắt StepAudio 3 Music. Đây được giới thiệu là mô hình nền tảng tạo nhạc đầu tiên của StepFun, có khả năng chuyển đổi câu lệnh (prompt) và lời bài hát thành một ca khúc hoàn chỉnh. Mô hình này được vận hành bởi công nghệ ABC-COT, cho phép lập kế hoạch cấu trúc âm nhạc và phối khí trước khi tiến hành tổng hợp.
Chính chủ · 3 bài
Nghe trực tiếp từ bên liên quan
- X: StepFun (@StepFun_ai)StepFun và ACE Studio ra mắt mô hình nền tảng tạo nhạc StepAudio 3 Music
- X: StepFun (@StepFun_ai)StepFun ra mắt dòng StepAudio 3 gồm 5 mô hình âm thanh
Dòng thời gian đưa tin
Đang hiện 6 bài · tất cả · mới trước
T5 · 17/09
Bản tin sáng BestBlogs: Gradium với tính năng thoại song công (full-duplex) và GKE Agent
X: Hongming (@hongming731)Bản tin sáng BestBlogs ngày 17/09 với 3 nội dung tiêu điểm: Gradium sử dụng mô hình ngôn ngữ đa luồng để hiện thực hóa tính năng thoại song công, cho phép người dùng và hệ thống cùng mô hình hóa âm thanh qua hai luồng dữ liệu. Hệ thống ưu tiên kiến trúc kết hợp giữa lớp xử lý giọng nói nhẹ và mô hình văn bản ở tầng sau để giải quyết các tác vụ suy luận phức tạp và gọi công cụ.
Bản tin sáng BestBlogs: StepAudio 3, nền tảng Agent và 10 tin tức khác
X: Hongming (@hongming731)Bản tin sáng BestBlogs ngày 17/09 tổng hợp 10 tin tức AI: StepStar ra mắt dòng mô hình giọng nói StepAudio 3, bao phủ các tính năng tương tác thời gian thực, nhận diện giọng nói, TTS, tạo âm thanh và sáng tác nhạc. Nhiều mô hình trong dòng này hiện đang đứng đầu thế giới trên bảng xếp hạng Artificial Analysis.
StepFun và ACE Studio ra mắt mô hình nền tảng tạo nhạc StepAudio 3 Music
X: StepFun (@StepFun_ai)Chính chủStepFun và ACE Studio ra mắt StepAudio 3 Music, mô hình nền tảng tạo nhạc đầu tiên của StepFun, có khả năng tạo ca khúc hoàn chỉnh từ câu lệnh và lời bài hát. Mô hình hỗ trợ 4 quy trình làm việc: tạo bài hát, tạo nhạc không lời, hát cover và phối nhạc từ giọng hát. Dựa trên công nghệ ABC-COT để lập kế hoạch cấu trúc nhạc trước khi tổng hợp, người dùng có thể sửa đổi câu lệnh, chỉnh sửa ký hiệu ABC để tinh chỉnh. Bản demo tương tác đã ra mắt và API ABC-COT sẽ sớm được phát hành.
T4 · 16/09
StepFun ra mắt dòng StepAudio 3 gồm 5 mô hình âm thanh
X: StepFun (@StepFun_ai)Chính chủStepFun ra mắt dòng StepAudio 3 gồm 5 mô hình âm thanh, bao gồm: đàm thoại thời gian thực, nhận diện giọng nói, tạo giọng nói, tạo âm thanh và tạo nhạc. Trên Artificial Analysis, Realtime đạt 98,9% ở hạng mục Conversational Dynamics và 99,7% ở hạng mục Speech Reasoning, đều xếp vị trí thứ nhất; ASR đạt tỷ lệ lỗi từ 1,7%, ngang bằng với kết quả tốt nhất trên bảng xếp hạng.
T3 · 15/09
StepOne công bố dòng mô hình ngôn ngữ âm thanh StepAudio 3, bao gồm 5 phiên bản: Realtime, ASR, TTS, Gen và Music
IT HomeStepOne ra mắt dòng mô hình âm thanh StepAudio 3, bao gồm StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen và StepAudio3Music; tất cả hiện đã có mặt trên nền tảng mở của StepOne.
StepFun ra mắt dòng mô hình ngôn ngữ âm thanh StepAudio 3, với nhiều phiên bản đứng đầu bảng xếp hạng toàn cầu của Artificial Analysis
Công chúng hào: StepFun (Step)Chính chủStepOne phát hành dòng StepAudio 3 gồm 5 mô hình: Realtime, ASR, TTS, Gen và Music, hiện đã được triển khai trên nền tảng mở của hãng.