Seed: Research Feed (Dữ liệu nhúng trên web)
92

Mô hình

ByteDance ra mắt SeedRealtime: Mô hình AI song công âm thanh-hình ảnh cho tương tác thời gian thực

(giờ Việt Nam)

Tóm tắt AI

ByteDance giới thiệu SeedRealtime, mô hình hợp nhất âm thanh, hình ảnh và văn bản trong một kiến trúc duy nhất, giúp giảm 50% độ trễ hội thoại. Công nghệ này đã được tích hợp trên ứng dụng Doubao, đánh dấu bước tiến lớn trong tương tác AI đa phương thức.

Bản dịch AI

Hôm nay, chúng tôi chính thức ra mắt SeedRealtime, mô hình lớn (large model) toàn phần (full-duplex) âm thanh và hình ảnh nguyên bản.

Là bước tiến quan trọng hướng tới tương tác đa phương thức toàn diện, SeedRealtime sử dụng kiến trúc thống nhất để tích hợp nguyên bản âm thanh, hình ảnh và văn bản, cho phép tương tác thời gian thực trên luồng thông tin đa phương thức liên tục, mang lại trải nghiệm hoàn toàn mới: “vừa xem, vừa nghe, vừa nói”. Mô hình này đã đạt được ba đột phá cốt lõi sau:

Hiểu đồng thời âm thanh và hình ảnh: Hỗ trợ nguyên bản việc tích hợp sâu sắc âm thanh, hình ảnh và thông tin trình tự thời gian. Mô hình vừa có thể kết hợp bối cảnh để giải quyết sự mơ hồ của các từ đồng âm, vừa có thể hiểu chính xác các chỉ dấu thời gian trong hình ảnh, giúp những gì nhìn thấy, nghe thấy và nói ra hòa làm một.

Khả năng tương tác chủ động: Sở hữu khả năng nhận thức môi trường liên tục và biểu đạt chủ động. Mô hình có thể chủ động nhắc nhở khi phát hiện sự thay đổi trạng thái hình ảnh (ví dụ: mục tiêu quan trọng xuất hiện) và có thể gọi các công cụ để hỗ trợ biểu đạt, giúp tương tác nâng cấp từ phản hồi thụ động sang cộng tác chủ động.

Nhịp điệu tương tác mượt mà: Có khả năng nhận biết thời gian thực trạng thái hội thoại và nhịp điệu giao tiếp của người dùng, tự nhiên tiếp lời, tạm dừng và phản hồi vào thời điểm thích hợp; đồng thời có khả năng chống nhiễu mạnh mẽ, phân biệt được cuộc trò chuyện của người xung quanh và tiếng ồn nền, không bị kích hoạt nhầm bởi các yếu tố gây nhiễu, duy trì sự trôi chảy và mạch lạc trong giao tiếp.

Kết quả đánh giá từ con người theo phương thức end-to-end cho thấy, so với các mô hình phân tầng (cascaded models), các vấn đề về nhịp điệu hội thoại âm thanh - hình ảnh của SeedRealtime đã giảm một nửa — mô hình nắm bắt thời điểm nói tự nhiên hơn, các hiện tượng như “bị ngắt lời khi chưa nói xong, phản hồi chậm trễ khi đã nói xong, hoặc bị kích hoạt nhầm bởi tiếng ồn nền và trò chuyện xung quanh” đã giảm đáng kể; đồng thời, xác suất thực hiện một cuộc hội thoại trôi chảy, trọn vẹn cũng tăng lên rõ rệt.

Hiện tại, SeedRealtime đã được triển khai toàn diện trên ứng dụng Doubao, là đơn vị tiên phong trong ngành hiện thực hóa việc ứng dụng quy mô lớn công nghệ toàn phần âm thanh - hình ảnh, chào đón mọi người trải nghiệm.

Trang chủ dự án:

https://seed.bytedance.com/seedrealtime

Cổng trải nghiệm:

Cập nhật ứng dụng Doubao lên phiên bản mới nhất, chọn “Gọi điện” trong khung chat để vào giao diện cuộc gọi video và trải nghiệm.

Tương tác âm thanh - hình ảnh nguyên bản, hướng tới đa phương thức toàn diện, hiện thực hóa việc vừa xem, vừa nghe, vừa nói.

Tương tác thời gian thực âm thanh - hình ảnh trước đây vốn bị mắc kẹt giữa hai hình thái: hệ thống phân tầng phụ thuộc vào nhiều mô-đun như ASR, VLM, TTS kết nối nối tiếp, khiến độ trễ bị cộng dồn và thông tin bị hao hụt qua từng cấp; mô hình end-to-end tuy mượt mà hơn nhưng nhiều giải pháp vẫn phụ thuộc vào VAD bên ngoài để xác định lượt nói, về bản chất vẫn gần với tương tác bán song công (half-duplex) kiểu hỏi - đáp.

Đột phá cốt lõi của SeedRealtime nằm ở việc thống nhất âm thanh, hình ảnh, trình tự thời gian và biểu đạt vào cùng một mô hình end-to-end. Nó không phải là nghe xong, xem xong rồi mới trả lời, mà là trên luồng âm thanh - hình ảnh liên tục, để việc nhận thức, hiểu, ra quyết định và biểu đạt diễn ra đồng bộ, giúp “những gì nghe được” và “những gì nhìn thấy” cùng tham gia vào mỗi lần phán đoán thời gian thực.

Khó khăn đầu tiên nằm ở nhịp điệu hội thoại. Giọng nói tự nhiên có những khoảng dừng, có thể dựa vào đó để xác định khi nào tiếp lời; trong khi hình ảnh luôn trực tuyến và thay đổi liên tục. Mô hình vừa phải liên tục hiểu những gì đang xảy ra trong hình ảnh, vừa không được can thiệp thường xuyên do nhiễu nền, mà phải liên tục phán đoán nên tập trung vào đối tượng nào, nên nghe ai nói và liệu lúc này có nên phản hồi hay không.

Thách thức sâu sắc hơn nằm ở việc mô hình hóa kết hợp âm thanh - hình ảnh và căn chỉnh trình tự thời gian. Khi người dùng nói “cái này làm thế nào”, mô hình cần kết hợp hình ảnh hiện tại, cử chỉ, ánh nhìn và hành động lịch sử để phán đoán “cái này” cụ thể chỉ vào cái gì; khi gặp từ đồng âm hoặc giọng nói mơ hồ, cũng phải nhờ vào bối cảnh thị giác để giải quyết sự mơ hồ. Chỉ khi mô hình hóa thống nhất âm thanh, hình ảnh và thông tin trình tự thời gian, mô hình mới có thể thực sự đối chiếu những gì nhìn thấy, nghe thấy và nói ra. Khi xem, nghe, nói được đưa vào cùng một hệ thống ra quyết định thời gian thực, mô hình không còn chỉ chờ người dùng đặt câu hỏi, mà có thể liên tục hiểu sự thay đổi của bối cảnh và chủ động lên tiếng vào thời điểm thích hợp.

Tiếp theo, chúng ta hãy cùng xem hiệu suất của SeedRealtime trong các tình huống thực tế thông qua 7 ví dụ cụ thể.

Hiểu đồng thời âm thanh và hình ảnh, hiểu được hình ảnh, phân biệt được đối tượng.

SeedRealtime có thể căn chỉnh và hiểu hình ảnh, âm thanh và trình tự thời gian trong môi trường thực tế đông người, ồn ào và cởi mở.

Bốn người bạn tụ tập ăn tối, đông người và nhiều lời. Người dùng lần lượt giới thiệu những người có mặt, SeedRealtime có thể khớp tên với người dựa trên đặc điểm ngoại hình — nhận ra Qiqi tóc sáng màu, Julia đeo kính, và chủ động chào Lele; trong các cuộc trò chuyện sau đó, luôn khớp được giọng nói và danh tính của từng người.

Sau đó mọi người cùng trò chuyện về du lịch: có người muốn đi biển chụp ảnh, đi thủy cung, có người sợ nóng sợ mệt, lại có người dị ứng hải sản. SeedRealtime có thể phân biệt mỗi câu nói xuất phát từ ai và dựa trên cuộc trò chuyện của mọi người để đưa ra một kế hoạch du lịch đáp ứng nhu cầu của từng người. Nhận diện người, phân biệt giọng nói, hiểu nhu cầu của từng cá nhân, tất cả đều được hoàn thành thời gian thực bởi một mô hình trong cùng một cuộc hội thoại.

Tại một quán ăn Tứ Xuyên, thực khách nước ngoài lúng túng trước thực đơn tiếng Trung. SeedRealtime trực tiếp nhận diện món ăn từ hình ảnh, gợi ý bằng tiếng Anh, thậm chí còn giải thích theo bối cảnh văn hóa “tại sao ‘cá hương thịt sợi’ (Yuxiang Rousi) lại không có cá”, “trứng bắc thảo được làm như thế nào”.

Khi nhân viên phục vụ mang món ăn lên và nói “rất đưa cơm”, nó có thể kết hợp với món ăn trong hình ảnh để hiểu câu nói này và dịch lại cho khách nghe. Thông tin thị giác không cần chuyển thành văn bản rồi mới hiểu, mà được căn chỉnh với giọng nói trong cùng một mô hình, thấy gì thì trả lời nấy.

Khả năng tương tác chủ động, quan sát liên tục, can thiệp đúng lúc.

Mô hình sẽ tự phán đoán xem có cần chủ động can thiệp hay không dựa trên sự thay đổi liên tục của hình ảnh thời gian thực, thay vì mỗi lần đều phải đợi người dùng lên tiếng trước.

Khi đi tham quan Bảo tàng Hà Bắc, người dùng dặn một câu “thấy bệ đỡ hình hổ ăn hươu bằng đồng khảm vàng bạc thì nhắc tôi”, SeedRealtime sẽ chú ý đến hình ảnh trong quá trình ống kính liên tục di chuyển, và lên tiếng nhắc nhở khi quét qua hiện vật đó.

Sau đó, nó kết hợp các chi tiết hình ảnh để thuyết minh về các bảo vật trấn bảo tàng như bệ đỡ bốn rồng bốn phượng bằng đồng khảm vàng bạc, đèn cung Trường Tín, cũng như nhiều kỹ thuật như đúc, khảm vàng bạc, hàn. Việc lưu trữ nhiệm vụ trong ngữ cảnh, mục tiêu xuất hiện là nhắc nhở, chính là sự thể hiện của khả năng nhận thức thị giác liên tục và can thiệp chủ động.

Trong quá trình vận hành một chiếc máy pha cà phê phức tạp, mô hình có thể thực hiện sửa lỗi và phản hồi thời gian thực dựa trên sự thay đổi trạng thái thị giác.

Khi quan sát thấy người dùng đổ trực tiếp hạt cà phê nguyên hạt vào tay cầm chiết xuất, mô hình nhanh chóng chỉ ra: “Không thể đổ trực tiếp hạt vào, phải xay thành bột mịn trước”; sau khi chiết xuất xong, dựa trên phân tích thị giác về màu sắc và lượng dầu trong tách, nó chủ động đưa ra gợi ý điều chỉnh “lần sau rút ngắn thời gian chiết xuất 2-3 giây”. Không cần người dùng hỏi từng bước, mô hình có thể đưa ra nhận xét dựa trên tình huống thực tế.

Khi nghiên cứu bài báo về ResNet, mô hình kết hợp sơ đồ cấu trúc mạng để giải thích rõ cách kết nối tắt (skip connection) làm giảm sự biến mất của gradient; khi người dùng nói “giúp tôi theo dõi, lật đến phần tham số huấn luyện thì nhắc tôi”, nó sẽ liên tục xem hình ảnh trong quá trình lật trang nhanh, nhận diện chính xác đoạn “3.4 Implementation” và chủ động dừng lại, sau đó báo cáo các cấu hình huấn luyện quan trọng như tốc độ học, động lượng, suy giảm trọng số. Việc nhận diện mục tiêu trong luồng hình ảnh liên tục và chủ động dừng lại đã thể hiện khả năng cộng tác chủ động trong tương tác thực tế.

Nhịp điệu tương tác mượt mà, phán đoán khi nào nên lên tiếng trong môi trường nhiễu.

Việc phán đoán lượt nói không còn giao cho các quy tắc VAD bên ngoài, mà do SeedRealtime liên tục ra quyết định dựa trên thông tin đa phương thức: không do dự khi cần tiếp lời, không ngắt lời khi cần im lặng, duy trì nhịp điệu giao tiếp tự nhiên hơn ngay cả trong môi trường phức tạp.

Sân bay Đại Hưng đông đúc, môi trường ồn ào. Khi bạn đồng hành trò chuyện tiện miệng nhắc đến “chuyến bay của ông Lý”, mô hình không bị kích hoạt phản hồi bởi câu trò chuyện không liên quan này; khi người dùng chính thức hỏi, ngay cả khi thông tin chuyến bay đã di chuyển ra khỏi hình ảnh, nó vẫn có thể kết hợp thông tin màn hình lớn đã thấy trước đó để trả lời thời gian đến thực tế và cung cấp vị trí băng chuyền hành lý qua mạng.

Sau đó hai người vừa đi vừa trò chuyện về chuyện cũ, nó liên tục xem hình ảnh trước mắt, khi quét đến biển chỉ dẫn xe công nghệ thì tự nhiên tiếp lời, đưa ra chỉ dẫn lộ trình đến điểm đón xe. Môi trường ồn ào không còn là nhiễu bắt buộc phải lọc, thông tin quan trọng trong những cuộc trò chuyện phiếm cũng có thể được lưu giữ thích hợp và sử dụng khi cần.

Mẹ đang bận việc khác bên cạnh, để SeedRealtime cùng con gái học tiếng Anh về động vật. Trong nền, bố đang nghe điện thoại, tiếng người liên tục, nhưng mô hình không bị cuốn theo đoạn hội thoại không liên quan này, luôn theo sát hướng tay của cô bé để chỉnh âm và đặt câu ví dụ thời gian thực. Mô hình không do dự khi cần lên tiếng, không chệch hướng khi bị nhiễu.

Tổng kết và triển vọng.

Sự ra mắt của SeedRealtime đánh dấu một bước tiến quan trọng trong tương tác âm thanh - hình ảnh. Thông qua kiến trúc thống nhất tích hợp nguyên bản âm thanh, hình ảnh và văn bản, mô hình có thể liên tục hiểu bối cảnh, phán đoán nhịp điệu và phản hồi trong luồng đa phương thức liên tục. Từ đó, “vừa xem, vừa nghe, vừa nói” thực sự trở thành trải nghiệm tương tác có thể sử dụng hàng ngày.

Tuy nhiên, giao tiếp âm thanh - hình ảnh trong môi trường thực tế rất phức tạp và liên tục: nền ồn ào, tiếng người chồng chéo, hình ảnh thay đổi, người dùng cũng sẽ tạm dừng, bổ sung hoặc ngắt lời bất cứ lúc nào. Đối mặt với những thách thức trong các tình huống thực tế này, trong tương lai chúng tôi sẽ tiếp tục đột phá ở các khía cạnh sau:

Độ trễ thấp hơn và nhịp điệu tự nhiên hơn: Tiếp tục nén độ trễ end-to-end “nghe - hiểu - phản hồi”, để những nhịp điệu tinh tế trong hội thoại thực như ngắt lời, tranh lời, phụ họa và tạm dừng được khôi phục tự nhiên, không chỉ nhanh hơn mà còn đúng lúc, đúng chỗ hơn.

Nhận thức và ra quyết định chủ động hơn: Dựa trên sự hiểu biết liên tục về hình ảnh và âm thanh, chủ động phán đoán khi nào cần nhắc nhở, khi nào cần bổ sung, khi nào cần cung cấp thông tin người dùng đang cần, để mô hình không chỉ “nói khi cần nói” mà còn “hành động khi cần hành động”.

ByteDanceSeedRealtimeAI đa phương thứcCông nghệ thời gian thựcDoubao
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Seed: Research Feed (Dữ liệu nhúng trên web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.