# Kyutai ra mắt Voice of Reason: Mô hình AI giọng nói giải toán trực tiếp bằng học tăng cường

- Nguồn: MarkTechPost
- Thời gian phát hành: 2026-09-23 13:33 (giờ Việt Nam)
- Điểm AI: 68/100
- Link AIHOT.vn: https://aihot.vn/items/b6d687265ca1d8e9
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmudqxom4041eroghcofthea6
- Link gốc: https://www.marktechpost.com/2026/09/22/kyutai-releases-voice-of-reason-a-speech-native-model-that-solves-spoken-math-with-reinforcement-learning

## Tóm tắt AI

Kyutai giới thiệu Voice of Reason, bộ đôi mô hình giọng nói-sang-giọng nói dựa trên GLM-4-Voice-9B, có khả năng giải toán bằng lời nói mà không cần chuyển đổi văn bản hay dùng LLM trung gian.

## Thân bài

![Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken Math with Reinforcement Learning](https://www.marktechpost.com/wp-content/uploads/2026/09/blog111-1-3.png)

Kyutai vừa ra mắt Voice of Reason, 2 mô hình speech-to-speech (chuyển đổi giọng nói sang giọng nói) có trọng số mở, có khả năng giải các bài toán bằng cách nói thành lời. Cả hai đều được phát triển dựa trên GLM-4-Voice-9B, kết hợp với supervised fine-tuning (SFT) và reinforcement learning (RL). Hệ thống này không cần bước chuyển đổi thành văn bản (transcription) và không sử dụng text LLM riêng biệt trong quy trình. Trên tập dữ liệu GSM8K dạng nói, độ chính xác đã tăng từ 27,3% ở mô hình cơ sở lên 77,1%.

Liệu có thể triển khai được không? Có, nếu bạn tự lưu trữ (self-hosting). Kyutai đã chạy cả hai checkpoint BF16 trên một GPU H100 duy nhất. Bạn cũng cần kho lưu trữ GLM-4-Voice để lấy bộ mã hóa (tokenizer) và bộ giải mã (decoder) giọng nói. Các trọng số kế thừa giấy phép của GLM-4-Voice và hiện chưa có nhà cung cấp dịch vụ suy luận (inference provider) nào trên Hugging Face lưu trữ chúng.

### Tại sao các mô hình giọng nói lại hạn chế trong toán học

Các quy trình dạng chuỗi (speech-to-text, text LLM, text-to-speech) vẫn chiếm ưu thế về khả năng suy luận. Tuy nhiên, mỗi giai đoạn đều làm tăng độ trễ và quy trình này làm mất đi các tín hiệu cận ngôn ngữ (paralinguistic cues) như ngữ điệu. Các mô hình speech-native (gốc giọng nói) phải phát ra âm thanh theo những khoảng thời gian đều đặn để duy trì tính tương tác. Điều đó giới hạn số lượng token suy luận ẩn mà chúng có thể sử dụng.

Mô hình GLM-4-Voice cơ sở đạt 27,3% trên GSM8K. Phương pháp STITCH trước đó đã nâng con số này lên 58,7% bằng cách thêm các đoạn suy luận. Nhóm nghiên cứu gọi công trình của họ là ứng dụng đầu tiên của RL vào suy luận toán học trong các mô hình speech-native.

### Cách thức huấn luyện hoạt động

GLM-4-Voice xen kẽ đầu ra của nó: 13 token văn bản, sau đó là 26 token âm thanh, và lặp lại.

Các phần thưởng được tập trung trong mỗi nhóm, tạo thành mục tiêu REINFORCE tương đối theo nhóm (group-relative). Phương pháp này liên quan đến GRPO nhưng loại bỏ việc cắt tỉa PPO (PPO clipping) và điều chuẩn KL (KL regularization). Quá trình huấn luyện được thực hiện trên 16 GPU H100, với 1.500 lần cập nhật RL.

2 lựa chọn thiết kế quan trọng nhất:

### Kết quả

Điểm số trong bài báo sử dụng giải mã top-k 50, lấy trung bình trên 3 hạt giống (seeds). Việc loại bỏ top-k mang lại kết quả 70,3% và 77,1%. Các checkpoint được phát hành tương ứng với các lần chạy này. Các hệ thống omni và hệ thống dạng chuỗi là những tiêu chuẩn cao hơn, không phải là các so sánh tương đương.

Các phát hiện khác:

Âm thanh đánh giá được lấy từ GPT-4o-mini-TTS, một hệ thống TTS khác với âm thanh huấn luyện. GPT-4o đóng vai trò là giám khảo đánh giá.

### Những điểm chính cần lưu ý

Hãy xem qua Bài báo, mô hình trực tiếp và mô hình Stitch. Mọi công lao đều thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn, v.v.? Hãy kết nối với chúng tôi.

![](https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-150x150.png)

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với người xem.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.marktechpost.com/2026/09/22/kyutai-releases-voice-of-reason-a-speech-native-model-that-solves-spoken-math-with-reinforcement-learning>
