Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Mô hình

Ra mắt Inflect-Micro-v2: Mô hình giọng nói toàn diện chỉ với 9,36 triệu tham số

(giờ Việt Nam)

Tóm tắt AI

Inflect-Micro-v2 vừa xuất hiện trên HuggingFace, chứng minh khả năng tạo giọng nói ấn tượng dù sở hữu quy mô tham số cực nhỏ, mở ra hướng đi mới cho các mô hình AI tối ưu tài nguyên.

Bản dịch AI

owensong/Inflect-Micro-v2 · Hugging Face

Inflect-Micro-v2

Tổng hợp giọng nói từ văn bản sang dạng sóng (text-to-waveform) hoàn toàn cục bộ với dưới 10 triệu tham số. TTS tiếng Anh với giọng cố định, sử dụng các hạt giống (seed) tất định, hỗ trợ xử lý văn bản dài và suy luận trên CPU hoặc CUDA.

Đôi lời từ Owen

Tôi đã tự xây dựng và tài trợ cho Inflect v2 một cách độc lập. Nếu bản phát hành này nhận được sự quan tâm thực sự, tôi muốn tiếp tục dự án với phiên bản v3 mở rộng hơn, có thể bao gồm nhiều ngôn ngữ, giọng nói hơn và cải thiện độ ổn định. Nếu mô hình này hữu ích với bạn, việc nhấn "like" trên Hugging Face sẽ thực sự giúp nhiều người biết đến nó hơn.

9.356.513 tham số có thể triển khai · 37,53 MB FP32 · đầu ra mono 24 kHz

Inflect v2 sử dụng một API công khai cho hai kích thước: Micro ưu tiên chất lượng với dưới 10 triệu tham số; Nano ưu tiên dung lượng với dưới 4 triệu tham số.

Nghe thử

Đây là các đoạn văn bản được tạo ra từ tập dữ liệu kiểm thử (held-out), không phải là tái tạo từ âm thanh huấn luyện. Mỗi bản ghi được hiển thị chính xác như cách nó được gửi đến giao diện người dùng công khai.

Đánh giá

Không có thước đo đơn lẻ nào phản ánh đầy đủ chất lượng TTS. Inflect v2 báo cáo riêng biệt về mức độ ưu tiên của con người, độ tự nhiên dự đoán, khả năng hiểu của đa mô hình ASR, tổng dung lượng và thời gian chạy, thay vì gộp chúng thành một điểm số không thể kiểm chứng.

Hàng tiêu đề luôn đề cập đến Inflect-Micro-v2. Kết quả chi tiết của các đối thủ cạnh tranh và các giới hạn giao thức được giữ hiển thị bên dưới.

Tập hợp so sánh. Kết quả bao gồm KittenTTS Nano, Piper Low và Supertonic 3, đây là các hệ thống TTS cục bộ hoặc nhỏ gọn đã được thiết lập với dung lượng trọng số triển khai lớn hơn cả hai phiên bản Inflect. Kích thước trọng số được so sánh ở cấp độ gói và không có thước đo đơn lẻ nào được coi là bằng chứng cho sự vượt trội tổng thể.

1. Mức độ ưu tiên mù của con người

Inflect-Micro-v2 đạt tỷ lệ ưu tiên 66,2% (21 thắng · 10 thua · 3 hòa) trong nghiên cứu cộng đồng ẩn danh cuối cùng. Các hệ thống được ẩn danh, thứ tự trái/phải được ngẫu nhiên hóa và các kết quả hòa được tính là nửa trận thắng. Đây là bằng chứng mô tả từ cộng đồng, không phải là chỉ số MOS chính thức.

2. Độ tự nhiên dự đoán so với dung lượng

Lần chạy UTMOS22 sử dụng 500 câu lệnh (prompt) chưa từng thấy giống hệt nhau cho mỗi giọng nói. KittenTTS và Piper là giá trị trung bình của hai giọng nói có trọng số bằng nhau; phạm vi giọng nói quan sát được hiển thị dưới dạng các râu (whiskers). Supertonic 3-step được báo cáo bên dưới phạm vi biểu đồ thay vì làm phẳng mọi hệ thống khác.

Inflect-Micro-v2: 4,395 UTMOS22, khoảng tin cậy bootstrap 95% là 4,381–4,408. UTMOS22 là một trình dự đoán được học, không phải là MOS của con người.

3. Khả năng hiểu trên văn bản chưa từng thấy

Điểm số tiêu đề là giá trị trung bình trọng số bằng nhau của Qwen3-ASR và Nemotron 3.5 corpus WER cho mọi hệ thống. Whisper bị loại trừ nhất quán khỏi tiêu đề vì nó tạo ra các lỗi ảo giác (hallucinations) chèn thêm từ trên một tập hợp con các đoạn clip Supertonic 8-step vốn có thể hiểu được. Nó không bị xóa: bằng chứng đầy đủ từ ba mô hình ASR vẫn được giữ lại bên dưới.

Đối với Inflect-Micro-v2, kết quả riêng lẻ là 2,52% Qwen3-ASR, 5,45% Nemotron 3.5 và 2,73% Whisper large-v3. Giá trị trung bình của ba mô hình trước đó, 3,57%, chỉ được giữ lại như một giá trị kiểm định mô tả và không được sử dụng làm điểm số tiêu đề.

Những góc nhìn này là các chẩn đoán, không phải là bảng xếp hạng bổ sung. Chúng cho thấy nơi các trình nhận dạng không đồng nhất và những danh mục câu lệnh nào vẫn tạo ra các lỗi phiên âm có thể khôi phục.

4. Thời gian chạy trên CPU

Cả hai phiên bản Inflect đều tổng hợp nhanh hơn thời gian thực một cách thoải mái trên CPU. Lần chạy tham chiếu được quản lý sử dụng phiên bản Hugging Face CPU Upgrade (8 vCPU, 32 GB RAM) với bốn luồng framework, thời gian từ văn bản sang dạng sóng toàn diện và 100 câu lệnh Modern400 cố định. Ba lượt chạy hoàn chỉnh đã được ghi lại; lượt đầu tiên dùng để xây dựng bộ nhớ đệm đã bị loại trừ và bảng tổng hợp kết quả của lượt hai và ba.

Đây là kết quả ở cấp độ gói từ runtime PyTorch công khai, không phải là tuyên bố rằng Inflect là hệ thống TTS nhỏ gọn nhanh nhất. Phần cứng, hành vi giao diện, framework, biên dịch và chính sách luồng đều ảnh hưởng đến các phép đo mô hình nhỏ.

Chính sách CPU và bốn luồng được quản lý tương tự đã được sử dụng cho một lượt so sánh ngắn hơn: tiền tố 50 câu lệnh giống hệt nhau, lặp lại hai lần. KittenTTS và Piper được gộp công việc bằng nhau trên hai giọng nói được kiểm tra của chúng.

Vì Inflect sử dụng lượt chạy trạng thái ổn định 100 câu lệnh lớn hơn trong khi các hàng so sánh sử dụng lượt xác nhận 50 câu lệnh ngắn hơn, bảng này mang tính chất ngữ cảnh triển khai hơn là một bảng xếp hạng tốc độ được so khớp hoàn hảo. Một số đối thủ cạnh tranh cũng sử dụng runtime ONNX được tối ưu hóa, trong khi điểm chuẩn Inflect được công bố ở trên sử dụng runtime PyTorch chính thống. Đường dẫn Inflect ONNX được phát hành riêng biệt chưa được thay thế vào các con số điểm chuẩn đó.

5. Tổng dung lượng trọng số

Các biến thể giọng nói chia sẻ cùng trọng số được hợp nhất. Tổng dung lượng của Inflect bao gồm cả bộ giải mã dạng sóng tích hợp.

Chọn Inflect phù hợp

Inflect-Micro-v2 là thành viên tập trung vào chất lượng của dòng sản phẩm này. Cả hai mô hình đều sử dụng cùng một API công khai và đóng gói từ văn bản sang dạng sóng hoàn chỉnh.

Chạy cục bộ

Cài đặt

Cách này sử dụng trình tải xuống nhận biết phiên bản của Hub và truy xuất toàn bộ kho lưu trữ. Lệnh Git clone cũng hoạt động, nhưng hf download là cách được khuyến nghị để cài đặt mô hình thông thường.

Python

Tải xuống thông qua Hub

Kết quả là dạng sóng float32 mono 24 kHz. Đầu vào dài được chia tại các ranh giới nhận biết dấu câu, tổng hợp theo từng đoạn và nối lại với các khoảng dừng được kiểm soát.

ONNX Runtime

Bản xuất FP32 đã được xác minh chính thức được công bố riêng biệt dưới dạng Inflect-Micro-v2-ONNX. Nó hỗ trợ độ dài động, lựa chọn nhà cung cấp CPU/CUDA/DirectML, các hạt giống tất định và cùng một trình bao bọc văn bản dài mà không cần nhập PyTorch:

Mô hình thần kinh được chia thành duration.onnx và decode.onnx; cùng nhau, chúng chứa toàn bộ đường dẫn từ văn bản sang dạng sóng đã được học. Giao diện eSpeak-ng tiếng Anh vẫn là mã phía CPU. Xem kho lưu trữ ONNX để biết các hợp đồng đồ thị, nguồn gốc, phép đo tương đương, triển khai trên trình duyệt và hướng dẫn xuất lại.

AI giọng nóiMô hình nhỏTối ưu hóa AIHuggingFace
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.