MarkTechPost
85

Mô hình

ByteDance ra mắt SeedRealtime: Mô hình AI đa phương thức xử lý âm thanh và hình ảnh thời gian thực

(giờ Việt Nam)

Tóm tắt AI

SeedRealtime của ByteDance là mô hình AI toàn diện, tích hợp khả năng nghe, nhìn và phản hồi trong một kiến trúc duy nhất, giúp tương tác tự nhiên hơn mà không cần các bộ lọc phụ trợ. Hiện mô hình đã được tích hợp vào ứng dụng Doubao.

Bản dịch AI

ByteDance Seed Introduces SeedRealtime: a Native Audio-Visual Full-Duplex LLM That Watches, Listens and Speaks in One Model

Đội ngũ Seed của ByteDance vừa giới thiệu SeedRealtime, một mô hình ngôn ngữ lớn (LLM) song công (full-duplex) nghe-nhìn nguyên bản. Mô hình này hợp nhất âm thanh, video và văn bản vào một kiến trúc thống nhất duy nhất. Nó tương tác theo thời gian thực thông qua các luồng đa phương thức liên tục, thay vì từng lượt một. Seed định vị đây là một bước tiến tới tương tác đa phương thức toàn diện (omni-modal) và tuyên bố đạt được ba đột phá: hiểu biết kết hợp nghe-nhìn, tương tác chủ động và thời điểm hội thoại tự nhiên. Mục tiêu kiến trúc là thay thế mô hình thác nước (cascade): các mô-đun ASR, VLM và TTS được xâu chuỗi với nhau thường gây ra độ trễ và mất mát thông tin giữa các giai đoạn. Thay vào đó, SeedRealtime vận hành việc nhận thức, thấu hiểu, ra quyết định và biểu đạt song song bên trong một mô hình end-to-end duy nhất. Việc chuyển lượt hội thoại cũng được đưa vào bên trong mô hình, thay thế cho bộ phát hiện hoạt động giọng nói (voice-activity detector) bên ngoài mà hầu hết các hệ thống thời gian thực hiện nay vẫn đang phụ thuộc vào.

Liệu nó có thể triển khai được không?

Nó có thể triển khai một phần.

SeedRealtime hiện đã hoạt động bên trong ứng dụng Doubao, trợ lý người dùng của ByteDance. Đối với mô hình cụ thể này, ByteDance chưa công bố báo cáo kỹ thuật, số lượng tham số, trọng số mở, hay bất kỳ điểm cuối (endpoint) nào trên Volcano Engine hoặc BytePlus. Với tư cách là một bên thứ ba, bạn chưa thể tích hợp nó vào lúc này. Điều có thể triển khai ngay bây giờ chính là ý tưởng: một kiến trúc tham chiếu đã được kiểm chứng và một tiêu chuẩn mới cho bất kỳ ai đang phát triển các sản phẩm kết hợp giọng nói và camera thời gian thực.

Giải thích tương tác

Những điểm thực sự mới trong các bản demo

Seed đã công bố bảy kịch bản. Trong đó, bốn kịch bản đóng vai trò chủ chốt.

Những điểm chính cần lưu ý

Hãy xem bài đăng ra mắt của ByteDance Seed và trang mô hình Seed. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter, tham gia cộng đồng 150k+ ML SubReddit và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.

ByteDanceSeedRealtimeAI đa phương thứcLLMCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.