Mô hình
iFlytek ra mắt Spark-Audio-1.0-Preview: Mô hình nền tảng âm thanh huấn luyện hoàn toàn trên chip nội địa
(giờ Việt Nam)
Tóm tắt AI
iFlytek vừa giới thiệu Spark-Audio-1.0-Preview, mô hình âm thanh kết hợp bộ mã hóa 0.65B với kiến trúc MoE 30B, được huấn luyện trên 13 triệu giờ dữ liệu bằng hạ tầng tính toán hoàn toàn của Trung Quốc.
Bản dịch AI
Theo tin từ IT ngày 16 tháng 9, iFlytek hôm nay đã công bố ra mắt Spark-Audio-1.0-Preview, một mô hình ngôn ngữ lớn nền tảng về âm thanh được huấn luyện dựa trên năng lực tính toán hoàn toàn nội địa.
Trước đây, các mô hình lớn xử lý âm thanh chủ yếu sử dụng phương pháp phân tầng: trước tiên chuyển đổi giọng nói thành văn bản, sau đó mới đưa cho mô hình lớn để xử lý. Cách làm này có hai nhược điểm rõ rệt:
Mất mát thông tin. Văn bản chỉ có thể ghi lại nội dung được nói, làm mất đi các thông tin quan trọng như ngữ điệu, cảm xúc và âm thanh môi trường vốn có trong giọng nói, dẫn đến việc mô hình đánh giá bối cảnh không đầy đủ, từ đó ảnh hưởng đến kết quả cuối cùng.
Sự đứt gãy trong chuỗi xử lý. Hệ thống này chia nhỏ các khả năng như chuyển đổi giọng nói, nhận diện dấu vân giọng (voiceprint), dịch thuật giọng nói thành các mô-đun độc lập để vận hành nối tiếp. Giữa các mô-đun tồn tại những điểm ngắt, không chỉ dễ tích tụ lỗi mà còn gây ra độ trễ và giật lag trong trải nghiệm sử dụng.
Theo tìm hiểu của IT, mô hình lớn nền tảng âm thanh đã giải quyết được những vấn đề nêu trên: nó không chỉ dừng lại ở việc chuyển đổi giọng nói thành văn bản mà trực tiếp hiểu được giọng nói. Mô hình lớn nền tảng âm thanh có thể hiểu ngay lập tức giọng người, âm thanh môi trường, âm nhạc, v.v., đồng thời hiểu được ngữ nghĩa, cảm xúc và bối cảnh ẩn chứa trong âm thanh.


Spark-Audio-1.0-Preview ra mắt lần này sử dụng bộ mã hóa âm thanh 0.65B (cấu trúc Dense), kết hợp với mô hình ngôn ngữ lớn 30B-A3B (cấu trúc MoE), được huấn luyện trên 13 triệu giờ dữ liệu âm thanh cùng lượng lớn dữ liệu văn bản, hoàn thiện dựa trên cụm năng lực tính toán thuần nội địa. Đây là mô hình lớn nền tảng âm thanh nội địa chính gốc; trong cùng một mô hình có thể nhập cả hai phương thức văn bản và giọng nói, hỗ trợ các tác vụ như chuyển đổi giọng nói, dịch đa ngôn ngữ, nhận diện đa phương ngữ, nhận diện âm thanh môi trường, nhận diện người nói, phân tích cảm xúc và hỏi đáp âm thanh phức tạp, giúp máy móc tiến xa hơn từ việc "nghe rõ" đến "nghe hiểu".
Phía chính thức cho biết, Spark-Audio-1.0-Preview đạt hiệu quả tương đương và vượt trội trong một số tác vụ đánh giá giọng nói, đặc biệt dẫn đầu rõ rệt trong các tác vụ ứng dụng thực tế như môi trường phức tạp có độ nhiễu cao hoặc giọng nói nhỏ; so với các mô hình nền tảng âm thanh đóng có kích thước lớn hơn, hiệu suất của Spark-Audio-1.0-Preview cũng rất sát sao. Tương tự như hệ thống 1+N của mô hình lớn iFlytek Spark, trên mô hình lớn nền tảng âm thanh này cũng có thể thực hiện tinh chỉnh (fine-tuning) để phát triển các mô hình hoặc hệ thống chuyên dụng như nhận diện giọng nói, thông dịch giọng nói, tương tác giọng nói, từ đó triển khai vào các nghiệp vụ liên quan đến âm thanh.
Spark-Audio-1.0-Preview hỗ trợ nhận diện 99 ngôn ngữ và 202 phương ngữ. Trong nhiều tác vụ, so với Qwen3.5-omni-flash (35B-A3B) cùng kích thước, mô hình thể hiện ưu thế về nhận diện giọng nói đa ngôn ngữ và đa phương ngữ; hiệu quả đạt được gần tương đương với Qwen3.5-omni-plus, vốn có kích thước lớn hơn một bậc.
Trong các tác vụ đánh giá nhận diện giọng nói tiếng Trung, tiếng Anh, đa ngôn ngữ và đa phương ngữ như Fleurs, Kespeech, LibriSpeech, điểm số của Spark-Audio-1.0-Preview cao hơn Gemini-3.1 Pro; trong tập kiểm thử Fleurs-tiếng Trung, Spark-Audio-1.0-Preview đã đạt được SOTA.
Hướng tới các kịch bản ứng dụng thực tế hơn, Spark-Audio-1.0-Preview cũng có ưu thế dẫn đầu khá rõ rệt trong các tác vụ đánh giá nhận diện giọng nói dưới điều kiện phức tạp như môi trường nhiễu cao, âm lượng nhỏ.
Spark-Audio-1.0-Preview được phát hành lần này không cho thấy sự suy giảm trí tuệ đáng kể trong các tác vụ kiến thức chung, toán học và lập trình, đồng thời vẫn còn dư địa để cải thiện và bắt kịp trong các tác vụ tuân thủ chỉ dẫn, đối thoại và hiểu âm thanh. Bước tiếp theo, chúng tôi sẽ vừa củng cố, phát huy ưu thế, vừa khắc phục những điểm yếu để mang lại kết quả tốt hơn nữa.




* Lưu ý: Các tác vụ liên quan đến ASR (nhận diện giọng nói) trong tập kiểm thử sử dụng WER / CER làm chỉ số đánh giá, giá trị càng thấp hiệu quả càng tốt; tác vụ dịch thuật giọng nói S2TT sử dụng điểm BLEU làm chỉ số đánh giá; các tác vụ khác đều sử dụng độ chính xác làm chỉ số, giá trị càng cao hiệu quả càng tốt.
Hiện tại, Spark-Audio-1.0-Preview đã chính thức mở trải nghiệm, API sẽ sớm được ra mắt trên nền tảng mở iFlytek.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.