36 36Kr
85

Sản phẩm

Từ ứng dụng 60 triệu người dùng đến robot gia đình: Bước đi táo bạo của Xinyan Group

(giờ Việt Nam)

Tóm tắt AI

Sau thành công của ứng dụng tâm lý 'Cece', Xinyan Group vừa ra mắt robot Buboo 1, tập trung vào khả năng chủ động cảm nhận không gian và tương tác cảm xúc tự nhiên thay vì chỉ phản hồi lệnh thoại.

Bản dịch AI

6000万用户的情感陪伴APP,营收数亿后做了款家庭机器人|产品观察-36氪

Tác giả | Hoàng Nam

Biên tập | Viên Tư Lai

Vào thời điểm ứng dụng của công ty tạo ra doanh thu hàng trăm triệu nhân dân tệ mỗi năm và có hàng triệu người dùng truy cập mỗi ngày, nhà sáng lập kiêm CEO của Xinyan Group, ông Nhậm Vĩnh Lượng, đã đưa ra một quyết định mà ai cũng cho là "phi lý trí": nhồi nhét khả năng đồng hành cảm xúc của AI vào một khuôn mẫu phần cứng — chế tạo robot.

Sản phẩm nổi tiếng nhất của Xinyan Group có tên là Cece, ra đời từ kỷ nguyên internet trước, được tung ra thị trường vào năm 2013, chủ yếu cung cấp các kiến thức phổ thông về tâm lý, đánh giá tâm lý và đồng hành cảm xúc trực tuyến, từng nhận được khoản đầu tư vòng B từ Tencent. Đến năm 2025, Cece đã có hơn 60 triệu người dùng.

Tuy nhiên, chỉ dựa vào một sản phẩm đồng hành cảm xúc trực tuyến đã 12 năm tuổi, rõ ràng không thể tiến xa hơn trong kỷ nguyên AI này. Ông Nhậm Vĩnh Lượng nhận thấy mô hình tương tác trực tuyến tồn tại những giới hạn năng lực không thể bù đắp.

Đối thoại qua màn hình là hình thức giao tiếp đơn phương, rời rạc, khó nắm bắt được thông tin vật lý ba chiều, không thể đáp ứng các nhu cầu phức hợp như đồng hành cùng con cái, xoa dịu cảm xúc người già, hay tương tác sinh hoạt thường ngày tại gia. Trong khi đó, nhìn vào các thiết bị thông minh chủ lưu trên thị trường, hoặc là ngưỡng tương tác quá cao, hoặc chỉ có các tính năng làm nũng đơn giản, luôn thiếu đi một thực thể hiện thân (embodied agent) có khả năng tự chủ đọc hiểu bầu không khí gia đình.

Sự thiếu hụt này đã giúp ông Nhậm Vĩnh Lượng nhìn thấy "cửa sổ cơ hội" cho phần cứng tương tác cảm xúc. Khi ngành công nghiệp vẫn đang mải mê so kè về khớp mô phỏng sinh học và các động tác biểu diễn, ông cho rằng điều mà bối cảnh gia đình thực sự cần là một thực thể hiện thân có khả năng đọc hiểu bầu không khí, biết tiến biết lùi để cung cấp sự "hiện diện" về mặt cảm xúc.

Gần đây, robot đồng hành thông minh chủ động dành cho gia đình của Xinyan Group mang tên Buboo (Buboo 1) đã lần đầu tiên mở trải nghiệm tương tác ngoại tuyến tại WAIC 2026.

Tại gian hàng, không có các màn trình diễn kích hoạt bằng giọng nói ồn ào, người tham quan chỉ cần dừng chân quan sát, Buboo sẽ chủ động chậm rãi tiến lại gần và khẽ khàng bắt chuyện; khi đối phương giơ tay ra hiệu kết thúc tương tác, nó lại lặng lẽ lùi về góc và trở về trạng thái chờ. Toàn bộ quá trình không cần từ khóa đánh thức, vẫn có thể hoàn thành nhiều vòng giao tiếp tự nhiên theo kiểu "quan sát sắc mặt".

Robot đồng hành thông minh chủ động dành cho gia đình Buboo 1 (Nguồn ảnh/Doanh nghiệp)

Ông Nhậm Vĩnh Lượng nhận định, ngành công nghiệp đang trong giai đoạn chuyển mình từ "đồ chơi điện tử dạng trình diễn" sang "thực thể thông minh gia đình có cảm giác hiện diện". Cuộc cạnh tranh giai đoạn tiếp theo sẽ là năng lực nhận thức chủ động đa phương thức, tích lũy dữ liệu gốc từ bối cảnh gia đình theo chiều dọc, và xây dựng mô hình ký ức cảm xúc dài hạn.

Hiện tại, trên thị trường chưa thực sự có một mẫu robot gia đình nào thành công. Trên đường đua chưa có đáp án chuẩn này, Buboo đang cố gắng trả lời câu hỏi: Khi AI cuối cùng đã có cơ thể, nó nên phản hồi nhu cầu cảm xúc của con người như thế nào?

Robot tương tác chủ động

Để hiểu về Buboo, trước hết cần làm rõ sự phân định thuộc tính giữa nó và phần lớn các loại robot tiêu dùng khác.

Loa thông minh, thú cưng AI để bàn, các loại đồ chơi đồng hành bằng bông, v.v., hầu hết các sản phẩm đều tuân theo một logic tương tác: dựa vào từ khóa đánh thức của người dùng để kích hoạt, máy nghe lệnh tương ứng rồi phản hồi. Mô hình này phù hợp với các bối cảnh sử dụng phân mảnh như điện thoại thông minh hay trên xe hơi, nhưng một khi đưa vào không gian gia đình cần túc trực 24/7, vấn đề sẽ nhanh chóng bộc lộ: nếu người dùng quên sạc, lười lên tiếng hoặc muốn ở một mình, thiết bị sẽ bị bỏ xó trong thời gian dài và cuối cùng trở thành vật trang trí bám bụi.

Buboo đang cố gắng thoát khỏi khung kích hoạt này.

"Mục tiêu đầu tiên của chúng tôi là loại bỏ từ khóa đánh thức, để robot có thể chủ động khởi xướng tương tác." Nhà sáng lập kiêm CEO của Xinyan Group, ông Nhậm Vĩnh Lượng, chia sẻ với Hard: "Khi nó nhận thấy biểu cảm khuôn mặt, cử chỉ cơ thể, thậm chí là sự thay đổi khoảng cách không gian của người dùng, tất cả đều là tín hiệu đầu vào hiệu quả mà Buboo có thể đọc được, hệ thống sẽ tự chủ đánh giá tình huống hiện tại và đưa ra phản hồi."

Nhưng "tương tác chủ động" này tồn tại một giới hạn quan trọng: nó không phải là bắt chuyện liên tục không phân biệt, mà sẽ khớp với sở thích tương tác của từng người dùng, dựa vào mô hình ký ức tại thiết bị (end-side memory model) để điều chỉnh tần suất tương tác một cách linh hoạt.

Khi người dùng nói với Buboo "muốn nghỉ ngơi", bối cảnh tương tác đó sẽ được hệ thống ghi lại. Sau này khi nhận diện được trạng thái tương tự, Buboo sẽ chủ động giảm xác suất bắt chuyện. Trong mắt ông Nhậm Vĩnh Lượng và đội ngũ, sự chừng mực này là năng lực thiết yếu của robot gia đình: nếu thiết bị gia dụng túc trực 24/7 mà không phân biệt bối cảnh, cứ liên tục phát âm thanh, đèn báo hay cửa sổ bật lên, sẽ chỉ tạo thêm gánh nặng tâm lý cho người dùng. "Nó phải biết im lặng đúng lúc thì mới nắm bắt tốt ranh giới tương tác," ông Nhậm nói.

Thiết kế tinh tế về ranh giới tương tác này cũng xác định định vị vai trò của Buboo: trở thành một người bạn mới trong gia đình, biết đọc hiểu cảm xúc, biết lúc nào nên hiện diện và lúc nào nên rút lui.

Phản ánh ở khía cạnh ngoại hình sản phẩm, toàn bộ thân máy Buboo được thiết kế bo tròn không góc cạnh sắc nhọn, lớp ngoài phủ vải nhung thân thiện với da, kết hợp với tạo hình đôi mắt nhân hóa kích thước lớn. Chiều cao của nó là 65 cm, đây không phải là thông số ngẫu nhiên, mà là kích thước thân máy tối ưu mà đội ngũ đã tính toán cho không gian gia đình.

Tương tác chủ động (Nguồn ảnh/Doanh nghiệp)

Ông Nhậm Vĩnh Lượng giải thích rằng, chiều cao 65 cm vừa vặn với tầm nhìn ngang của một đứa trẻ 3 tuổi. Nếu thân máy quá thấp, các vật dụng dưới sàn hay đồ nội thất thấp sẽ liên tục che khuất tầm nhìn, khiến tính toàn vẹn của thông tin môi trường mà robot thu thập được bị giảm sút đáng kể; trong khi đó, với thân máy đứng mang lại tầm nhìn bao quát, khả năng phán đoán không gian về môi trường và con người của robot cũng được nâng cao hiệu quả.

Đồng thời, ông Nhậm Vĩnh Lượng cho rằng, để robot "nhìn thấy" thế giới vật lý thôi là chưa đủ, nó còn cần một "bộ não" đủ thông minh để hiểu những gì đang diễn ra trước mắt — ai là chủ nhà, khi nào có khách đến, nụ cười của trẻ là vì vui hay vì nghịch ngợm, người già im lặng là vì mệt mỏi hay tâm trạng sa sút. Độ phức tạp của những vấn đề này vượt xa những gì một mô hình lớn (LLM) thông thường cộng với một giao diện giọng nói có thể giải quyết.

Cao 65 cm, có thể khớp với tầm nhìn ngang của trẻ 3 tuổi (Nguồn ảnh/Doanh nghiệp)

Dựa trên hàng nghìn tỷ dữ liệu ngôn ngữ cảm xúc tích lũy hơn mười năm qua của Cece, mô hình lớn Xinyuan (Xinyuan LLM) do Xinyan Group tự phát triển đã xây dựng cho Buboo một nền tảng kỹ thuật ba tầng tiến hóa.

Tầng dưới cùng là mô hình ngôn ngữ lớn Xinyuan, tích hợp Multi-Agents, truy xuất RAG và mô-đun ký ức dài hạn. Nhiệm vụ cốt lõi của nó không phải là hỏi đáp kiến thức, mà là hiểu ngữ cảnh, ví dụ như giọng điệu người dùng có gấp gáp hay không, lý do tại sao lại lặp lại một từ nhiều lần, v.v. Đây là những tư liệu bối cảnh (Context) mà các mô hình truyền thống không thể học được từ dữ liệu công khai.

Tầng giữa là mô hình lớn đa phương thức Xinyuan, bao phủ suy luận thị giác, nhận diện giọng nói xa/gần và tổng hợp giọng nói nhân hóa, chịu trách nhiệm chuyển đổi hình ảnh, âm thanh, thông tin khoảng cách mà robot thu thập được thành các tín hiệu ngữ nghĩa mà mô hình có thể hiểu.

Tầng trên cùng là mô hình hiện thân Xinyuan xyVLA, thông suốt toàn bộ chuỗi từ "nhìn thấy — hiểu — hành động". Một kịch bản tiêu biểu là khi trẻ cầm bức tranh chạy đến trước mặt Buboo mà không nói lời nào, tầng xyVLA trước tiên điều động mô-đun thị giác để nhận diện nội dung bức tranh, sau đó gọi mô hình ngôn ngữ để tạo ra các câu đối thoại mang tính khích lệ, cuối cùng thông qua mô-đun điều khiển chuyển động để Buboo nghiêng đầu, tiến lại gần và phát ra phản hồi bằng giọng nói nhân hóa. Toàn bộ chuỗi hành động này được hoàn thành liên tục trong vài giây.

"Nhiều người nghĩ rằng để robot cất tiếng nói là rất dễ," ông Nhậm Vĩnh Lượng nói, "nhưng khi nào mở lời, mở lời với ai, nội dung đầu ra có phù hợp với bối cảnh hiện tại hay không, mới là những điểm khó về kỹ thuật mà ngành công nghiệp thường khó vượt qua."

Sự khác biệt bản chất giữa hệ thống mô hình Xinyuan và các mô hình lớn thông thường chủ lưu nằm ở chỗ: mô hình thông thường chỉ dựa vào dữ liệu văn bản trực tuyến để huấn luyện, thiếu đi các bối cảnh ba chiều như thực tế gia đình, biểu cảm vi mô trên khuôn mặt, cử chỉ cơ thể; trong khi mô hình của Buboo thích ứng nguyên bản với môi trường thực tế của gia đình, có thể đồng bộ đọc hiểu hình ảnh, cảm xúc, thông tin không gian rồi mới hoàn thành đầu ra đối thoại, bù đắp những thiếu sót của LLM khi ứng dụng vào bối cảnh gia đình.

Thiết bị AI vật lý gia đình

Dữ liệu chính thức của Xinyan Group cho thấy, ứng dụng Cece có hơn 60 triệu người dùng đăng ký, trong đó 80% là nữ giới, mỗi ngày có hơn một triệu người mở ứng dụng để kiểm tra trạng thái cảm xúc. Sản phẩm này đã mang lại cho công ty mẹ doanh thu hàng trăm triệu nhân dân tệ mỗi năm và lợi nhuận bền vững.

Kể từ khi mảng kinh doanh robot của Xinyan được thành lập, không ít ý kiến thắc mắc: tại sao một doanh nghiệp internet tập trung vào dịch vụ cảm xúc trực tuyến và đã đạt được doanh thu ổn định lại chọn lấn sân sang đầu tư chi phí cao để tự nghiên cứu phần cứng.

Tuy nhiên, ông Nhậm Vĩnh Lượng quan sát thấy một đường cong vòng đời người dùng rõ ràng: một khi người dùng bước vào hôn nhân, xây dựng gia đình, tần suất mở ứng dụng và thời gian trực tuyến của họ sẽ giảm đáng kể.

Mặc dù nhu cầu trút bầu tâm sự trong giai đoạn yêu đương đã được đáp ứng trực tuyến, nhưng những nỗi đau về cảm xúc trong các bối cảnh ngoại tuyến sau khi kết hôn như sự thiếu hụt đồng hành, lo âu nuôi dạy con cái, rào cản giao tiếp giữa các thế hệ, hay người già sống một mình, là điều mà mô hình tương tác văn bản trên điện thoại hoàn toàn không thể bao phủ được.

Robot gia đìnhAI cảm xúcXinyan GroupBuboo 1Tương tác chủ động
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ 36 36Kr. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.