Mô hình
Superwhisper ra mắt S1-mini: Mô hình chuẩn hóa văn bản mã nguồn mở chỉ 462MB
(giờ Việt Nam)
Tóm tắt AI
Superwhisper vừa phát hành S1-mini, mô hình 0.6B tham số dựa trên Qwen3, chuyên dùng để làm sạch văn bản từ nhận diện giọng nói bằng cách loại bỏ từ thừa và tự động thêm dấu câu.
Bản dịch AI

Superwhisper vừa ra mắt dòng mô hình S1: S1-Voice, S1-Language và S1-mini. S1-Voice là mô hình chuyển đổi giọng nói thành văn bản trên nền tảng đám mây, còn S1-Language là mô hình tuân thủ chỉ dẫn trên đám mây dùng để làm sạch và định dạng văn bản. Điểm thú vị nhất đối với người dùng bên ngoài ứng dụng chính là S1-mini, được phát hành với trọng số mở trên Hugging Face. S1-mini là một mô hình chuẩn hóa văn bản 0.6B, không phải là mô hình chuyển đổi giọng nói hay mô hình trò chuyện. Nó hoạt động sau quá trình nhận dạng giọng nói tự động (ASR), giúp viết lại các bản ghi thô thành văn bản sạch: loại bỏ các từ đệm, sửa lỗi nói vấp, áp dụng dấu câu và viết hoa, đồng thời chuyển đổi các con số, ngày tháng, tiền tệ và địa chỉ email sang dạng văn bản viết. Mô hình này được tinh chỉnh từ Qwen/Qwen3-0.6B, chỉ hỗ trợ tiếng Anh trong bản phát hành v1 và được điều khiển hoàn toàn bằng một dòng điều khiển ba trục đặt phía trên bản ghi. Superwhisper báo cáo độ chính xác token đạt 94.8% trên tập dữ liệu kiểm thử gồm 7,519 trường hợp, được đo lường theo phương pháp greedy trên bản dựng đã lượng tử hóa.
Có thể triển khai được không?
Có, nhưng chỉ với S1-mini. S1-mini được công bố trên Hugging Face theo giấy phép Apache 2.0 kèm theo điều khoản về đặt tên. S1-Voice và S1-Language là các dịch vụ do Superwhisper lưu trữ, vì vậy chúng chỉ có thể sử dụng dưới dạng dịch vụ, không thể tự lưu trữ (self-host).
S1-mini làm được gì?
S1-mini là một mô hình chuẩn hóa văn bản, không phải là mô hình chuyển đổi giọng nói hay mô hình trò chuyện. Nó hoạt động sau quá trình nhận dạng giọng nói tự động:
âm thanh → ASR (Whisper, Parakeet, …) → S1-mini → văn bản sạch
Nó loại bỏ các từ đệm, giải quyết các lỗi nói vấp và tự sửa lỗi để đưa về nội dung người nói thực sự muốn truyền đạt, áp dụng dấu câu, viết hoa và chuyển đổi các con số, ngày tháng, thời gian, tiền tệ và địa chỉ email sang dạng văn bản. Ví dụ, khi bạn nói “support at superwhisper dot com”, kết quả nhận được sẽ là [email protected].

Mô hình này được tinh chỉnh từ Qwen/Qwen3-0.6B. Nó có 596 triệu tham số duy nhất (0.44B không tính embedding), 28 lớp, 16 đầu truy vấn (query heads) và 8 đầu khóa/giá trị (key/value heads) với GQA, cùng trọng số BF16. Thanh bên của Hub báo cáo 0.8B vì embedding liên kết được lưu trữ hai lần; thẻ mô hình đã giải thích rõ ràng về sự khác biệt này. Bản phát hành v1 chỉ hỗ trợ tiếng Anh và đầu vào khuyến nghị là khoảng 1,000 token.
Dòng điều khiển là toàn bộ giao diện
S1-mini nhận một system prompt cố định, sau đó là một dòng điều khiển, và cuối cùng là bản ghi thô:
Trục Styling (Phong cách) có các tùy chọn: casual (thông thường), semi-casual (bán thông thường), semi-formal (bán trang trọng) hoặc formal (trang trọng). Trục Structure (Cấu trúc) có: prose (văn xuôi) hoặc lists (danh sách). Trục Context (Ngữ cảnh) có: general (chung) hoặc email. Cả ba trục đều độc lập và mọi tổ hợp đều đã được huấn luyện. Nếu gửi các giá trị nằm ngoài các tập hợp này hoặc viết lại system prompt, đầu ra có thể bị suy giảm chất lượng hoặc bị lỗi. Lưu ý một điểm nhỏ cần biết: ứng dụng Superwhisper hiển thị thanh trượt tông giọng năm mức, bổ sung thêm cài đặt trước “balanced” (cân bằng), trong khi tài liệu về trọng số mở chỉ đề cập đến bốn giá trị Styling đã được huấn luyện.
Mô hình cũng bị giới hạn bởi thiết kế. Nó không tự thêm nội dung bạn không nói, không sửa lỗi thực tế, không làm nhẹ bớt ngôn từ thô tục và không viết lại phương ngữ. Đầu vào chỉ chứa từ đệm sẽ trả về chuỗi rỗng, và các tích hợp nên coi đó là một kết quả hợp lệ.
Hai cài đặt làm hỏng hầu hết các tích hợp
Thứ nhất, bắt buộc phải đặt enable_thinking=False. Mẫu trò chuyện (chat template) là của Qwen3, không thay đổi, và Qwen3 mặc định bật tính năng suy nghĩ (thinking). S1-mini được huấn luyện khi tắt tính năng này, vì vậy lượt phản hồi của trợ lý phải bắt đầu bằng một khối <think> trống. Nếu bỏ qua cờ này, bạn thường sẽ không nhận được đầu ra khả dụng nào.
Thứ hai, hãy giải mã theo phương pháp greedy. Tệp generation_config.json mặc định để do_sample: false. Các bản dựng GGUF vẫn mang theo siêu dữ liệu kế thừa từ Qwen3 là temp = 0.6, top_p = 0.95 và top_k = 20, vì vậy hãy truyền tham số temperature 0 một cách rõ ràng trong mọi yêu cầu. Trong llama.cpp, hãy sử dụng --jinja với --chat-template-kwargs '{"enable_thinking":false}' thay vì --reasoning-budget 0, vì điều đó sẽ làm giảm chất lượng đầu ra.
Đánh giá được báo cáo
Superwhisper đã đánh giá S1-mini trên tập dữ liệu kiểm thử gồm 7,519 trường hợp từ 104 bản ghi. Độ chính xác token đạt 94.8%, đo lường theo phương pháp greedy trên bản dựng Q4_K_M, với tỷ lệ lỗi chỉnh sửa văn bản là 11.6%. Đối với văn bản định dạng email, mô hình xác định dòng chào hỏi chính xác 99.3% và dòng kết thúc 97.9%. Nó khớp với cấu trúc đầu ra mong muốn (danh sách so với đoạn văn) 97.6% thời gian và tạo ra địa chỉ email chính xác trong 92% trường hợp. Dưới 1% các kết quả tạo ra bị lặp hoặc cắt bớt, và mô hình từ chối đưa ra đầu ra chính xác 98.6% thời gian khi không có nội dung nào cần chuyển đổi. Đây là các con số do nhà cung cấp báo cáo trên tập kiểm thử nội bộ, không phải kết quả từ bên thứ ba.
Hai mô hình đám mây
S1-Voice là mô hình chuyển đổi giọng nói thành văn bản được lưu trữ trên đám mây. Superwhisper báo cáo tốc độ chuyển đổi nhanh gấp 46 lần thời gian nói, với hầu hết các bản đọc chính tả dưới 30 giây xuất hiện chỉ 0.32 giây sau khi bạn dừng nói. Trên tám tập dữ liệu bao gồm âm thanh cuộc họp và các cuộc gọi báo cáo thu nhập, mô hình đạt tỷ lệ lỗi từ (WER) trung bình là 6.8% và giảm xuống còn 2.2% trên LibriSpeech. Superwhisper cho biết mức trung bình 6.8% là thấp nhất trong số 15 mô hình mà họ đã thử nghiệm, và S1-Voice đạt 83/100 điểm trên thước đo tổng hợp của họ so với 76 điểm của WisprFlow.
S1-Language là mô hình tuân thủ chỉ dẫn trên đám mây dùng để làm sạch, định dạng và tóm tắt, xuất hiện trong trình chọn mô hình cùng với các mô hình từ Anthropic, OpenAI và Groq. Các cấu hình mặc định được khuyến nghị là Cohere Transcribe kết hợp với S1-mini ngoại tuyến, hoặc S1-Voice kết hợp với S1-Language trên đám mây.
Công cụ giải thích tương tác
Phần nhúng bên dưới cho phép bạn chuyển đổi từng trục điều khiển và quan sát sự thay đổi của đầu ra. Mọi cặp đầu vào/đầu ra đều được lấy nguyên văn từ thẻ mô hình.
Những điểm chính cần lưu ý
Hãy xem qua Trọng số mô hình (Model Weights) và Chi tiết kỹ thuật. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.