SteerDuplex là mô hình hội thoại song công (full-duplex) đột phá, cho phép người dùng điều chỉnh linh hoạt tông giọng, phong cách và tốc độ nói thông qua các hướng dẫn trực tiếp, giúp tương tác tự nhiên và thông minh hơn.
Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề quan trọng về khả năng tùy biến trong hội thoại thời gian thực, kết hợp kỹ thuật RL tiên tiến, rất có giá trị cho tương lai của trợ lý ảo.
iFlytek vừa giới thiệu Spark-Audio-1.0-Preview, mô hình âm thanh kết hợp bộ mã hóa 0.65B với kiến trúc MoE 30B, được huấn luyện trên 13 triệu giờ dữ liệu bằng hạ tầng tính toán hoàn toàn của Trung Quốc.
🇹🇷🎙️ Kahya-TTS is live - a great example of fine-tuning VoxCPM2 with ~100 hours of natural Turkis…
DịchKahya-TTS là mô hình TTS tiếng Thổ Nhĩ Kỳ được tinh chỉnh từ VoxCPM2 với 100 giờ dữ liệu giọng nói tự nhiên, mang lại chất lượng âm thanh vượt trội cho cộng đồng mã nguồn mở.
AuK là mô hình nền tảng đa năng cho phép tạo và chỉnh sửa giọng nói thông qua ngôn ngữ tự nhiên, được huấn luyện trên quy mô dữ liệu khổng lồ. Phiên bản AuK-Flash tối ưu hóa tốc độ suy luận nhanh gấp 4.5 lần, mở ra tiềm năng ứng dụng lớn cho các nhà phát triển.
FireRedTTS3 tích hợp khả năng sao chép giọng nói zero-shot, thiết kế âm thanh qua mô tả văn bản và chỉnh sửa giọng nói chính xác trong một mô hình duy nhất, đạt hiệu suất dẫn đầu ngành trên nhiều bảng xếp hạng.
Vì sao đáng đọc: Đây là bước tiến đột phá trong công nghệ TTS khi hợp nhất ba tác vụ phức tạp vào một mô hình, có tính ứng dụng thực tế cao và hiệu suất vượt trội so với các đối thủ hiện nay.
Superwhisper vừa phát hành S1-mini, mô hình 0.6B tham số dựa trên Qwen3, chuyên dùng để làm sạch văn bản từ nhận diện giọng nói bằng cách loại bỏ từ thừa và tự động thêm dấu câu.