Mô hình
PolyAI ra mắt Dialog-RSN-1: Mô hình hội thoại âm thanh thuần túy tích hợp đa tác vụ
(giờ Việt Nam)
Tóm tắt AI
PolyAI giới thiệu Dialog-RSN-1, mô hình xử lý trực tiếp âm thanh từ người gọi thay vì qua văn bản, kết hợp hoàn hảo khả năng nhận diện giọng nói, điều phối lượt hội thoại và thực thi hàm trong thời gian thực.
Bản dịch AI

PolyAI vừa giới thiệu Dialog-RSN-1, một mô hình hội thoại có khả năng cảm nhận trực tiếp âm thanh từ người gọi thay vì đọc bản ghi chép (transcript). Mô hình này tích hợp việc chuyển lượt nói, nhận dạng giọng nói, gọi hàm (function calling) và tạo phản hồi vào một mô hình thuần âm thanh (audio-native) duy nhất, và hiện đã được đưa vào xử lý các cuộc gọi thực tế.
Những điểm chính
Mô hình này có thể triển khai được không và bởi ai?
Có, nhưng chỉ thông qua PolyAI: hiện chưa có trọng số mở (open weights) và chưa có API công khai. Các khách hàng hiện tại có thể kích hoạt ngay hôm nay; khách hàng mới có thể yêu cầu quyền truy cập sớm.
Kiến trúc
Hiện có hai kiến trúc chiếm ưu thế, và mỗi loại đều có những hạn chế riêng. Kiến trúc xếp tầng (cascaded stack) chỉ gửi dự đoán tốt nhất của ASR tới LLM, do đó các yếu tố như tông giọng, sự ngập ngừng và độ không chắc chắn trong nhận dạng đều bị loại bỏ trước khi LLM kịp xử lý. Việc tinh chỉnh đòi hỏi phải điều chỉnh thủ công các tham số end-pointing và độ chệch (biasing) của ASR, vốn hiếm khi áp dụng hiệu quả cho mọi trường hợp sử dụng. Các mô hình speech-to-speech như GPT Realtime và Gemini Live giữ lại âm thanh nhưng lại tích hợp giọng nói vào mô hình, làm hạn chế khả năng kiểm soát cách phát âm, đồng thời các biến thể full-duplex luôn bật sẽ chiếm dụng GPU trong suốt thời gian cuộc gọi.
Dialog-RSN-1 chỉ nhận biết âm thanh ở đầu vào: một mô hình suy luận dựa trên âm thanh thô và chuyển việc tạo phản hồi cho một hệ thống TTS riêng biệt có thể tùy chỉnh bằng prompt. Mô hình này được truy vấn theo yêu cầu thay vì truyền phát liên tục: một bộ VAD (Voice Activity Detection) có độ thu hồi cao cùng với một vài bộ đếm thời gian sẽ quyết định thời điểm chạy mô hình, và token đầu tiên của phản hồi sẽ quyết định liệu tác nhân (agent) có nên nói hay không. Các tín hiệu âm thanh đơn giản chỉ đóng vai trò chọn thời điểm đặt câu hỏi; còn mô hình, với đầy đủ ngữ cảnh, sẽ đưa ra quyết định chuyển lượt nói thực tế.
Cách thức xây dựng
PolyAI đã hậu huấn luyện (post-trained) các mô hình đa phương thức có trọng số mở bằng phương pháp tinh chỉnh có giám sát và tinh chỉnh tăng cường (RFT) trên dữ liệu nội bộ. Quy trình này về cơ bản không phụ thuộc vào mô hình nền; PolyAI đã đánh giá Gemma, GPT-OSS, Qwen và Mistral. Việc nhắm tới độ trễ dưới 300ms trên GPU A100 đưa các ứng viên vào phạm vi từ 8B tham số dày (dense) đến 30B tham số thưa (sparse). Công việc tối ưu độ trễ bao gồm: nạp trước bộ nhớ đệm chú ý (attention cache) trong khi người dùng đang nói, sử dụng mẫu prompt chỉ thêm (append-only) để giảm thiểu việc vô hiệu hóa bộ nhớ đệm, định tuyến mỗi người gọi vào cùng một GPU, sử dụng bộ dự thảo suy đoán (speculative drafter) đã tinh chỉnh với mức chấp nhận trung bình là 3.9 token, và khả năng tự suy luận được học trong quá trình RFT. Việc chuyển âm (transcription) được thực hiện sau cùng, sau khi phản hồi hoặc lệnh gọi công cụ đã hoàn tất, song song với quá trình tạo giọng nói.
Kết quả
PolyAI đã đánh giá trên Dialog-Eval, một bộ tiêu chuẩn nội bộ mà họ dự định sẽ mã nguồn mở. Mỗi ví dụ là một cuộc gọi bị cắt tại một điểm quyết định, chấm điểm một bước tiếp theo duy nhất thay vì toàn bộ quá trình. PolyAI báo cáo Dialog-RSN-1 là mô hình có khả năng thời gian thực đạt điểm số cao nhất, đặt ngưỡng trần cho các hệ thống xếp tầng Audio-score ở mức gần 77, và lưu ý rằng GPT Realtime 2.1 có điểm số ngang bằng với các hệ thống xếp tầng trên các ví dụ nhận biết âm thanh. Về phần chuyển âm, chỉ số WER của gpt-4o-transcribe đã cải thiện từ 7.8% xuống 6.9% khi được cung cấp cùng ngữ cảnh, và Dialog-RSN-1 thậm chí còn đạt kết quả thấp hơn nữa.
Trong bản phát hành này, PolyAI tập trung vào tiếng Anh; Raven 3.5 vẫn là khuyến nghị của họ cho các ngôn ngữ khác tiếng Anh và các tác vụ chat web phong phú. Một báo cáo kỹ thuật và một bài nghiên cứu về Dialog-Eval đang được lên kế hoạch.
Xem chi tiết kỹ thuật tại đây. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng 150k+ ML SubReddit của chúng tôi và đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.