IT Home
85

Mô hình

Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển giọng nói thành văn bản thông minh, tự động lọc từ thừa

(giờ Việt Nam)

Tóm tắt AI

Gemini 3.5 Transcribe giúp loại bỏ các từ đệm như "ừ", "à" và tự sửa lỗi nói vấp, tăng tốc độ xử lý 70% so với thế hệ cũ. Mô hình hỗ trợ 85 ngôn ngữ và hiện đã được tích hợp vào tính năng Rambler trên bàn phím Gboard của Pixel 11.

Bản dịch AI

Theo tin từ IT ngày 27 tháng 8, trong khi dư luận vẫn đang chờ đợi sự ra mắt của Gemini 3.5 Pro, Google đã bất ngờ tung ra một mô hình khác thuộc dòng 3.5. Hôm nay, công ty đã công bố Gemini 3.5 Transcribe, một mô hình AI chuyển đổi giọng nói thành văn bản được thiết kế để tối ưu hóa trải nghiệm nhập liệu bằng giọng nói. Mô hình này có khả năng tự động loại bỏ các từ đệm như "ừm", "à" cũng như các nội dung nói sai sau khi người dùng tự sửa lỗi, từ đó tạo ra văn bản trôi chảy và chỉn chu hơn.

IT lưu ý rằng mô hình này hiện đã hỗ trợ tính năng "Rambler" trên bàn phím Gboard của Pixel 11 và sẽ sớm được tích hợp vào nhiều sản phẩm, dịch vụ khác của Google trong thời gian tới.

Google cho biết, so với công cụ chuyển đổi giọng nói thành văn bản trước đây có tên là Chirp 3, Gemini 3.5 Transcribe đã có những cải tiến vượt bậc về cả tốc độ lẫn độ chính xác. Tốc độ tổng thể từ lúc người dùng bắt đầu nói đến khi tạo ra văn bản hoàn chỉnh dự kiến tăng khoảng 70%; trong các tình huống đàm thoại thời gian thực, tỷ lệ lỗi đã giảm xuống còn 5,5%.

Tuy nhiên, mức độ cải thiện về độ chính xác không quá lớn. Theo dữ liệu từ Google, tỷ lệ lỗi của Chirp 3 là 7,32%. Dù vậy, đối với những người dùng thường xuyên sử dụng tính năng nhập liệu bằng giọng nói, việc giảm bớt dù chỉ vài lỗi chính tả cũng đồng nghĩa với việc ít phải chỉnh sửa thủ công hơn, vì vậy đây vẫn là một cải tiến thiết thực.

Khả năng của Gemini 3.5 Transcribe không chỉ dừng lại ở việc "nghe rõ" người dùng nói gì, mà nó còn cố gắng hiểu ý nghĩa thực sự mà người dùng muốn truyền đạt. Trong quá trình nói, mô hình có thể tự động xóa các từ đệm như "ừm", "à" gây ảnh hưởng đến độ trôi chảy của câu. Nếu người dùng nói sai và sửa lại ngay lập tức, mô hình cũng có thể điều chỉnh văn bản đã tạo trong thời gian thực. Ngoài ra, người dùng còn có thể cung cấp danh sách từ vựng tùy chỉnh để giúp mô hình nhận diện tốt hơn các thuật ngữ chuyên môn và từ ngữ thuộc các lĩnh vực đặc thù.

Mô hình hiện hỗ trợ 85 ngôn ngữ và có thể xử lý các tệp âm thanh ghi sẵn với tối đa 3 người nói.

Tất nhiên, tính năng này cũng tồn tại một vấn đề rõ ràng: người dùng cần phải tin tưởng rằng AI có thể hiểu chính xác những gì họ thực sự muốn diễn đạt. Ít nhất là đối với các văn bản ngắn, dựa trên trải nghiệm thực tế với tính năng Rambler, mô hình thực sự có khả năng làm sạch các cách diễn đạt thiếu nhất quán và các lỗi vấp váp khi nói, giúp văn bản trông tự nhiên hơn.

Tuy nhiên, đồng thời, Gemini 3.5 Transcribe không chỉ đơn thuần là chuyển đổi giọng nói thành văn bản. Trong quá trình xử lý nội dung, AI thực tế có thể thay đổi cách diễn đạt gốc của người dùng. Do đó, trong một số tình huống yêu cầu phải giữ nguyên lời nói gốc và không được phép tự ý thay đổi cách diễn đạt, kiểu "tinh chỉnh thông minh" này có thể sẽ không phù hợp để sử dụng.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.