Google AI: DEV
92

Thủ thuật

Hướng dẫn toàn tập về Gemini 3.5 Transcribe: Giải pháp chuyển đổi giọng nói thành văn bản tối ưu

(giờ Việt Nam)

Tóm tắt AI

Google ra mắt Gemini 3.5 Transcribe, mô hình chuyên biệt cho chuyển đổi giọng nói với độ chính xác cao, hỗ trợ hơn 85 ngôn ngữ, tách lời người nói và tùy chỉnh từ vựng chuyên ngành.

Bản dịch AI

Stop Wrestling with ASR: The Complete Guide to Gemini 3.5 Transcribe 🎙️

Có lẽ bạn đã từng sử dụng Gemini để phân tích hàng giờ video, tóm tắt podcast hoặc trả lời các câu hỏi từ những cuộc họp đã ghi âm (nếu chưa thì bạn nên thử, nó cực kỳ hữu ích!). Nhưng khi tất cả những gì bạn cần là một bản ghi chép sạch sẽ, chính xác tuyệt đối và có cấu trúc từ âm thanh, việc khởi chạy một mô hình suy luận khổng lồ với các câu lệnh (prompt) phức tạp thường giống như dùng dao mổ trâu để giết gà.

Xin giới thiệu Gemini 3.5 Transcribe (gemini-3.5-transcribe).

Đây là mô hình chuyển đổi giọng nói thành văn bản chuyên dụng của Google, được xây dựng trên nền tảng hiểu âm thanh cốt lõi của Gemini, tối ưu hóa đặc biệt cho việc ghi chép nhanh, chính xác và tiết kiệm chi phí. Cho dù bạn muốn một bản ghi chép chính xác như thư ký tòa án với dấu thời gian (timestamp) đến từng mili giây, hay một bản tóm tắt tối ưu cho việc đọc đã loại bỏ tất cả các từ đệm "ừm", "à" khó chịu, mô hình này đều xử lý một cách tự nhiên mà không cần bất kỳ kỹ thuật đặt câu lệnh phức tạp nào.

🚀 Bắt tay vào thực hành: Nếu bạn muốn bắt đầu chạy mã nguồn ngay lập tức, hãy mở notebook Gemini Transcribe Colab tương tác! Nó đã sẵn sàng để chạy để bạn có thể trực tiếp trải nghiệm cách mô hình hoạt động.

Bạn thích giao diện trực quan không cần lập trình? Bạn cũng có thể kiểm tra khả năng nhận dạng giọng nói trực tiếp trong Google AI Studio.

Dưới đây là những gì bạn sẽ tìm thấy trong hướng dẫn này:

0. Tại sao cần một mô hình ghi chép chuyên dụng?

Trước khi xem mã nguồn, hãy làm rõ tư duy này. Bạn có thể tự hỏi: "Tôi không thể chỉ tải một tệp MP3 lên Gemini 3.7 và yêu cầu 'Ghi chép lại cái này' sao?"

Bạn có thể làm vậy, nhưng đây là lý do tại sao gemini-3.5-transcribe lại khác biệt:

Mẹo chuyên gia: Nếu bạn cần đặt câu hỏi về những gì đã xảy ra trong tệp âm thanh ("Hành động cần thực hiện cho Alice là gì?"), hãy sử dụng mô hình đa phương thức như Gemini 3.7. Nếu bạn cần chính bản ghi chép, phụ đề hoặc các ghi chú đọc chính tả đã được làm sạch, hãy sử dụng Gemini Transcribe!

1. Thiết lập & Files API

Mô hình Gemini 3.5 Transcribe chạy trên Google GenAI SDK hiện đại (google-genai v2.0+) sử dụng Interactions API.

Đầu tiên, hãy cài đặt SDK:

Chuyển sang chế độ toàn màn hình Thoát chế độ toàn màn hình

Đảm bảo bạn đã có khóa API từ Google AI Studio, đặt nó làm GEMINI_API_KEY, và hãy xem cách âm thanh được truyền đến mô hình:

Chuyển sang chế độ toàn màn hình Thoát chế độ toàn màn hình

Xem video demo bên dưới để thấy bản ghi chép cơ bản hoạt động như thế nào—xử lý giọng nói tự nhiên và chuyển đổi ngôn ngữ (code-switching) song ngữ một cách dễ dàng:

Tại sao nên sử dụng Files API?

Khi xử lý âm thanh và video, bạn không bao giờ nên chèn trực tiếp các byte âm thanh thô dưới dạng base64 vào các yêu cầu API của mình—nó làm tăng kích thước tải trọng lên 33%, dễ gây ra lỗi quá thời gian chờ mạng (network timeout) và yêu cầu tải lại cùng một lượng dữ liệu nếu bạn muốn chạy lại truy vấn.

Files API giải quyết vấn đề này một cách gọn gàng:

2. Điều hướng ngôn ngữ & Chuyển đổi ngôn ngữ (85+ ngôn ngữ)

Như bạn đã thấy trong video trên, Gemini Transcribe tự động nhận diện các ngôn ngữ được nói ngay lập tức và xử lý mượt mà việc chuyển đổi ngôn ngữ (khi ai đó trộn nhiều ngôn ngữ trong cùng một câu—giống như việc chuyển đổi giữa tiếng Pháp và tiếng Anh giữa chừng, điều mà tôi thường xuyên gặp phải!).

Tuy nhiên, nếu bạn biết âm thanh của mình chỉ sử dụng một ngôn ngữ hoặc phương ngữ cụ thể, bạn có thể truyền các mã ngôn ngữ BCP-47 rõ ràng vào transcription_config để ưu tiên nhận dạng:

Chuyển sang chế độ toàn màn hình Thoát chế độ toàn màn hình

Lưu ý: Để trống language_codes=[] (hoặc bỏ qua nó) sẽ kích hoạt tính năng tự động phát hiện toàn diện trên hơn 85 ngôn ngữ và khu vực được hỗ trợ. Hãy xem Tài liệu về Chuyển đổi âm thanh (Audio Transcription Documentation) để biết danh sách đầy đủ các mã ngôn ngữ.

3. Từ vựng tùy chỉnh: Không bao giờ viết sai thuật ngữ kỹ thuật nữa

Mọi lập trình viên đều từng khổ sở vì mô hình ASR (nhận dạng giọng nói tự động) viết sai tên riêng, nhầm lẫn các thư viện chuyên biệt với các từ thông dụng trong từ điển (biến "ScaNN" thành "scan", hoặc "Qdrant" thành "quadrant"), hoặc tự tạo ra các thuật ngữ có âm thanh tương tự ("Sitsi" thay vì "CitC", "Thiago" thay vì "Tiago").

Với custom_vocabulary, bạn có thể truyền một danh sách lên đến 1.000 thuật ngữ chuyên ngành mà mô hình sẽ ưu tiên nhận diện:

Chuyển sang chế độ toàn màn hình Thoát chế độ toàn màn hình

Xem video so sánh song song bên dưới để thấy mô hình hoạt động như thế nào khi có và không có ưu tiên từ vựng tùy chỉnh:

Hãy chú ý cách nhận dạng giọng nói mặc định quay về các phỏng đoán từ điển theo ngữ âm (Vernat, Scan, Quadrant, Syllium, Thiago, Sitsi, Spacey). Ngược lại, việc cung cấp custom_vocabulary đảm bảo rằng tên của các thành viên trong nhóm, các công cụ chuyên biệt, cơ sở hạ tầng nội bộ và các thư viện mã nguồn mở được ghi chép với độ chính xác 100%.

Mẹo chuyên gia: Đừng chỉ đưa các từ viết tắt vào từ vựng tùy chỉnh của bạn. Hãy thêm tên riêng của các thành viên trong nhóm, tên mã dịch vụ nội bộ, đường dẫn kho lưu trữ GitHub, tên thương hiệu sản phẩm và thuật ngữ chuyên ngành hẹp.

4. Tính năng "sát thủ": Ghi chép thông minh (Smart Transcription) so với Chế độ nguyên văn (Verbatim Mode)

Đây chắc chắn là khả năng yêu thích nhất của tôi trên Gemini 3.5 Transcribe.

Theo mặc định, các mô hình chuyển đổi giọng nói thành văn bản hoạt động ở chế độ nguyên văn: chúng viết lại mọi thứ, bao gồm cả những lần ấp úng, hắng giọng, bắt đầu sai và các từ đệm.

Khi bạn đang ghi chép lại một buổi diễn tập bài phát biểu, phỏng vấn hoặc bản ghi nhớ giọng nói, việc đọc văn bản nguyên văn thô rất mệt mỏi:

Chuyển sang chế độ toàn màn hình Thoát chế độ toàn màn hình

Nếu bạn chuyển sang chế độ mode={"type": "smart"}, mô hình sẽ thực hiện tối ưu hóa đọc thông minh:

Đây là cách bạn bật tính năng đó:

Cover image for Stop Wrestling with ASR: The Complete Guide to Gemini 3.5 Transcribe 🎙️Google AI profile imageGuillaume Vernade
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google AI: DEV. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.