Mô hình
Tencent ra mắt Gander: Mô hình AI vừa trò chuyện vừa xử lý tác vụ phức tạp
(giờ Việt Nam)
Tóm tắt AI
Đội ngũ Tencent Hunyuan giới thiệu Gander, mô hình sử dụng cấu trúc 'tiểu não' để đối thoại thời gian thực và 'đại não' để xử lý tác vụ nền, hỗ trợ đa phương thức và khả năng ngắt lời linh hoạt.
Bản dịch AI

Mô hình nghiên cứu Gander của Tencent kết hợp khả năng hội thoại thời gian thực với các tính năng của AI agent. Một "tiểu não" (cerebellum) đảm nhận việc duy trì cuộc trò chuyện, trong khi một "bộ não" (brain) có thể thay thế sẽ xử lý các tác vụ phức tạp. Người dùng có thể ngắt lời bất cứ lúc nào, nhưng các thử nghiệm cho thấy sự đánh đổi giữa thời điểm hội thoại và độ chính xác của tác vụ.
Đội ngũ Hunyuan Speech của Tencent cùng các nhà nghiên cứu tại một số trường đại học đã giới thiệu Gander, một mô hình AI được thiết kế để duy trì trò chuyện trong khi vẫn xử lý các tác vụ phức tạp. Theo báo cáo kỹ thuật, mô hình này tiếp nhận đồng thời cả giọng nói, hình ảnh và văn bản.
Các nhà nghiên cứu cho rằng, các trợ lý giọng nói hiện nay chủ yếu hoạt động theo kiểu luân phiên với người dùng. Trong các cuộc hội thoại thực tế, con người thường ngắt lời nhau, đưa ra phản hồi nhanh và lắng nghe ngay cả khi đang nói. Gander được thiết kế để xử lý sự tương tác qua lại đó bằng cách liên tục xử lý video, giọng nói và văn bản, ngay cả khi nó đang nói. Người dùng có thể tham gia vào bất cứ lúc nào, và mô hình có thể đặt câu hỏi tiếp nối hoặc cập nhật tiến độ mà không cần được nhắc nhở.

Gander duy trì cuộc trò chuyện trong khi "bộ não" của nó làm việc.
Hội thoại đòi hỏi phản hồi nhanh, nhưng việc tìm kiếm tệp tin hoặc viết mã nguồn lại cần thời gian để lập kế hoạch. Các nhà nghiên cứu lập luận rằng một mô hình đơn lẻ phải cân bằng giữa tốc độ và khả năng suy luận, vì vậy Gander chia công việc thành hai vai trò riêng biệt.
Mượn ý tưởng từ giải phẫu học con người, họ gọi các thành phần này là "tiểu não" và "bộ não". Tiểu não xử lý hội thoại thời gian thực, trong khi bộ não đảm nhận việc suy luận và các tác vụ phức tạp ở chế độ nền.
Bộ não có thể được thay thế bằng các hệ thống agent như Codex hoặc Claude Code mà không cần huấn luyện lại mô hình hội thoại. Trong các thử nghiệm, một mô hình không xác định thuộc dòng GPT-5.6 của OpenAI đã đảm nhận vai trò này. Khi mô hình nền tảng được cải thiện, toàn bộ hệ thống cũng sẽ được hưởng lợi.

Gander đạt được thời điểm phản hồi chính xác nhưng lại tụt hậu về độ chính xác của tác vụ.
Gander chia các cuộc hội thoại thành các phân đoạn một giây để tiểu não có thể quyết định khi nào nên lắng nghe, nói hoặc dừng lại nếu người dùng ngắt lời. Nó đưa ra các quyết định đó mà không cần một mô-đun riêng biệt để phát hiện thời điểm bắt đầu và kết thúc lời nói, bằng cách sử dụng khoảng hai phút hội thoại gần nhất làm bộ nhớ.
Do chưa có bài kiểm tra chuyên biệt cho các mô hình như Gander, các nhà nghiên cứu đã chuyển sang sử dụng các tiêu chuẩn đánh giá (benchmark) đã được thiết lập. Báo cáo cho biết Gander đạt thời điểm phản hồi tốt nhất trên Full-Duplex-Bench v3, một bài kiểm tra các trợ lý giọng nói qua nhiều kịch bản tác vụ khác nhau.
Gander bắt đầu nói đúng thời điểm trong tất cả 100 kịch bản và ngắt lời người dùng trong 8% trường hợp. Con số này so với 13,5% của GPT-Realtime và gần 48% của đối thủ yếu nhất. Theo báo cáo, Gander sử dụng một mô hình tương đối nhỏ để cạnh tranh với các hệ thống thương mại bao gồm GPT-Realtime, Gemini Live và Grok.

Gander hơi tụt hậu về độ chính xác của tác vụ. Các nhà nghiên cứu cho rằng điều đó một phần là do bài kiểm tra đánh giá toàn bộ hệ thống, vì vậy các lỗi nhận dạng giọng nói và lỗi đầu ra đều bị tính vào kết quả. Bộ não đạt điểm cao hơn nhiều khi được cung cấp văn bản trực tiếp.
Khả năng hiểu video và âm thanh cũng bị ảnh hưởng: Gander hoạt động kém hơn so với mô hình cơ sở của nó trong một bài kiểm tra, điều mà các nhà nghiên cứu cho là do quá trình huấn luyện ưu tiên sự trôi chảy trong hội thoại hơn là khả năng nhận thức chính xác. Điều này bao gồm các tác vụ như đếm đối tượng và xác định vị trí của chúng trong hình ảnh.
Tencent có kế hoạch phát hành trọng số và dữ liệu huấn luyện của Gander.
Theo báo cáo, Gander đã được huấn luyện trên khoảng 2,7 triệu ví dụ. Một số ví dụ dạy nó giữ im lặng khi có tiếng ồn nền hoặc khi không có ai trong nhóm đang nói chuyện với nó.
Các nhà nghiên cứu cho biết công trình này vẫn còn ở giai đoạn đầu. Làm thế nào để mở rộng quy mô Gander vẫn là một câu hỏi mở, và hiện chưa có phương pháp tiêu chuẩn nào để đánh giá các hệ thống như vậy.
Nhóm nghiên cứu dự định công bố trọng số và dữ liệu huấn luyện sau khi hoàn tất "quy trình phát hành mã nguồn mở". Một kho lưu trữ trên GitHub cho mã nguồn đã tồn tại, cùng với các bản demo trên trang dự án.
Ngày càng nhiều công ty chia nhỏ công việc của agent trên các mô hình khác nhau.
Gander nối tiếp đợt phát hành Hy3 vào tháng 7 của Tencent, một mô hình ngôn ngữ mở được cho là đã thu hẹp khoảng cách với các đối thủ, đặc biệt là trong các tác vụ agent. Hy3 hiện đã chạy trong WorkBuddy, Yuanbao và WeChat. Công ty cũng đang đàm phán để nắm giữ cổ phần lớn nhất tại startup về agent là Manus sau khi Bắc Kinh chặn thương vụ mua lại của Meta. Công ty coi thỏa thuận này phù hợp với các kế hoạch của riêng mình, bao gồm một agent được tích hợp trong WeChat.
Các công ty khác đang sử dụng các trình điều phối (orchestrator) để ủy quyền tác vụ cho nhiều mô hình. GPT-Live của OpenAI tách biệt hội thoại khỏi suy luận, chuyển các tác vụ tìm kiếm web và tác vụ agent cho một mô hình nền trong khi cuộc trò chuyện vẫn tiếp tục. Fugu của Sakana AI là một mô hình ngôn ngữ riêng biệt có khả năng gọi các mô hình khác từ một nhóm có thể mở rộng. OpenAI cũng đang thử nghiệm các agent chủ động, tự tạo ra các tác vụ tiếp nối và liên hệ với người dùng mà không cần được yêu cầu.
Việc xử lý các lần ngắt lời và tránh độ trễ vẫn là những mối quan tâm thực tế. Một phân tích của Anthropic cho thấy những người dùng có kinh nghiệm ngắt lời Claude Code trong khoảng 9% các bước công việc, so với khoảng 5% ở những người mới bắt đầu. Theo một cuộc khảo sát, các đội ngũ xây dựng trợ lý giọng nói và chat hội thoại thường xuyên báo cáo về các vấn đề độ trễ.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người.
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.