Mô hình
Microsoft thử nghiệm MAI Realtime: Mô hình AI đàm thoại thời gian thực hỗ trợ 16 ngôn ngữ
(giờ Việt Nam)
Tóm tắt AI
Microsoft đang thử nghiệm MAI Realtime, mô hình AI hỗ trợ đàm thoại hai chiều tự nhiên mà không cần chờ đợi lượt. Hệ thống hỗ trợ 16 ngôn ngữ với hai tùy chọn giọng nói, hiện đang được triển khai thử nghiệm giới hạn trên nền tảng MAI Playground.
Bản dịch AI
Theo tin từ IT ngày 4 tháng 8, trang tin công nghệ TestingCatalog đã đăng tải bài viết vào ngày 2 tháng 8, cho biết Microsoft đang thử nghiệm mô hình giọng nói thời gian thực gốc đầu tiên của mình mang tên MAI Realtime. Mô hình này hỗ trợ 16 ngôn ngữ, 2 tùy chọn giọng nói, cho phép nghe và nói song song trong khi hội thoại, đồng thời hỗ trợ tự động nhận diện và chuyển đổi ngôn ngữ giữa chừng.
Về khâu thử nghiệm, các nguồn tin cho biết Microsoft đã mời một số đối tác trải nghiệm mô hình này trên nền tảng MAI Playground. Hiện vẫn chưa rõ khi nào mô hình sẽ được ra mắt trên Microsoft Foundry cũng như khi nào được mở rộng sang các tính năng giọng nói của Copilot.
Về cơ chế vận hành, MAI Realtime sử dụng phương thức tương tác hai chiều, song công (full-duplex), không cần tuân thủ nghiêm ngặt quy tắc "người dùng nói xong, mô hình mới trả lời", mà hỗ trợ nghe và phản hồi đồng thời.
Về khả năng hỗ trợ ngôn ngữ, mô hình MAI Realtime hỗ trợ 16 ngôn ngữ bao gồm cả tiếng Trung. IT trích dẫn bài viết gốc và liệt kê các ngôn ngữ được hỗ trợ như sau:
Tiếng Anh
Tiếng Đức
Tiếng Tây Ban Nha
Tiếng Pháp
Tiếng Ý
Tiếng Bồ Đào Nha
Tiếng Nhật
Tiếng Hàn
Tiếng Trung
Tiếng Hà Lan
Tiếng Hindi
Tiếng Indonesia
Tiếng Ả Rập
Tiếng Nga
Tiếng Thổ Nhĩ Kỳ
Tiếng Việt
Tiếng Thái
Về phong cách giọng nói, các nguồn tin cho biết bản thử nghiệm của mô hình cung cấp hai tùy chọn giọng nói là Victoria và Grant, mang lại cảm giác tự nhiên hơn so với các chế độ giọng nói hiện tại của Copilot. Người dùng có thể chủ động chỉ định ngôn ngữ hoặc bật tính năng tự động phát hiện.


Mô hình này không hỗ trợ hát hoặc tạo ra các hiệu ứng âm thanh phi giọng nói, vì định hướng vẫn là một hệ thống hội thoại. Bảng điều khiển gỡ lỗi (debug panel) có thể hiển thị độ trễ thời gian thực, nội dung suy nghĩ của mô hình và các bước xử lý. Tính năng chia sẻ mẫu thử có thể sẽ được mở cho người dùng nền tảng sau khi quyền truy cập thử nghiệm được mở rộng.

Ghi chú của IT: Giọng nói song công (Full-duplex voice) nghĩa là hệ thống có thể vừa tiếp nhận giọng nói của người dùng vừa xuất phản hồi cùng một lúc mà không cần đợi một bên nói xong hoàn toàn. Cơ chế này dựa vào việc phát hiện điểm cuối (endpoint detection) để nhận diện thời điểm bắt đầu, tạm dừng và kết thúc câu nói, đồng thời cần điều chỉnh đầu ra khi người dùng ngắt lời.
Các mô hình giọng nói MAI mà Microsoft phát hành trước đây đều là mô hình đơn hướng, bao gồm MAI-Voice-2 và phiên bản Flash dùng cho tổng hợp giọng nói, cùng với MAI-Transcribe-1.5 dùng cho nhận diện giọng nói.
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian chọn lọc. Kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết trên IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.