36 36Kr
92

Tin ngành

Startup 'Motion Brain' gọi vốn gần 100 triệu NDT: Tham vọng trang bị 'bộ não' cho 1 tỷ robot

(giờ Việt Nam)

Tóm tắt AI

Được sáng lập bởi các chuyên gia từ Fudan và Intel, Motion Brain đang gây chú ý với mô hình 'World Motion Model' giúp robot tự học và thực hiện các chuyển động tự nhiên, thay vì lập trình thủ công.

Bản dịch AI

硬氪首发 | 复旦教授、前英特尔首席科学家做端侧具身大脑,「眸深智能」完成近亿元Pre-A轮追加融资-36氪

Tác giả | Khâu Hiểu Phân (Qiu Xiaofen)

Biên tập | Viên Tư Lai (Yuan Silai)

Hard (Yingke) được biết, "Motion Brain" (Mâu Thâm Trí Năng) đã hoàn tất vòng gọi vốn bổ sung Pre-A với số tiền gần 100 triệu nhân dân tệ. Các nhà đầu tư trong vòng này bao gồm một công ty dịch vụ bất động sản hàng đầu Trung Quốc, Jinyue Investment (nền tảng đầu tư công nghiệp được thành lập bởi sự hợp tác giữa các tập đoàn tài chính Hồng Kông và nhiều công ty niêm yết), Chuanghehui Capital, cùng cổ đông cũ Xuhui Capital.

Đây là lần thứ hai "Motion Brain" nhận được đầu tư trong vòng hai tháng, sau vòng Pre-A trị giá 300 triệu nhân dân tệ vào tháng 5 năm 2026. Ngoài ra, vòng gọi vốn Pre-A+ trị giá gần 500 triệu nhân dân tệ của công ty cũng đang trong quá trình hoàn tất giao dịch. Công ty tiết lộ rằng kể từ nửa đầu năm nay, định giá của "Motion Brain" đã tăng hơn 10 lần, trở thành một trong những doanh nghiệp về "bộ não hiện thân" (embodied brain) có tốc độ phát triển nhanh nhất trong ngành.

"Motion Brain" được thành lập vào tháng 1 năm 2025, định vị là công ty sở hữu bộ não hiện thân tự tiến hóa am hiểu về chuyển động nhất thế giới, với sứ mệnh "trang bị bộ não thông minh nguyên bản cho 1 tỷ robot".

Công ty được đồng sáng lập bởi Giáo sư Trần Đào (Chen Tao) - Giám đốc Phòng thí nghiệm Học sâu Đại học Phúc Đán, Tiến sĩ Trương Ích Dân (Zhang Yimin) - cựu Giám đốc khoa học của Intel Trung Quốc, và doanh nhân khởi nghiệp liên tục Mục Trạch Lâm (Mu Zelin). Đội ngũ nòng cốt sở hữu nền tảng từ ba "gã khổng lồ" chip là HiSilicon, Intel và NVIDIA, là một trong số ít các đội ngũ mô hình lớn hiện thân tại Trung Quốc có năng lực thích ứng ở cấp độ toán tử (operator-level).

Mặc dù mới thành lập vào năm 2025, nhưng sự tích lũy công nghệ của "Motion Brain" đã bắt đầu từ năm 2022. Về lộ trình kỹ thuật, "Motion Brain" chọn một con đường khác biệt so với VLA (Vision-Language-Action) truyền thống – đó là "Mô hình chuyển động thế giới" (World Motion Model) lấy chuyển động làm cốt lõi.

(Nguồn ảnh/Doanh nghiệp)

Từ năm 2022, đội ngũ "Motion Brain" đã công bố MLD (Latent Diffusion Model for 3D Human Motion). Vào thời điểm đó, xu hướng chủ đạo của ngành là coi chuyển động như các tín hiệu rời rạc, dẫn đến các chuyển động được tạo ra bị cứng nhắc và thiếu đa dạng. Đội ngũ "Motion Brain" là đơn vị đầu tiên trên thế giới đề xuất ánh xạ chuyển động vào không gian ẩn (Latent Space) và giới thiệu mô hình khuếch tán (Diffusion Model).

MLD tương đương với việc giúp AI học cách "tự học" để tạo ra chuyển động: không cần phải dạy robot cách đi bộ từng khung hình một, mà để mô hình giống như một họa sĩ khử nhiễu, khôi phục tư thế con người tự nhiên và mạch lạc từ một khối nhiễu ngẫu nhiên.

Nếu MLD giải quyết vấn đề "làm thế nào để tạo ra chuyển động", thì "Motion Brain" lại tiếp tục tập trung vào việc làm thế nào để "điều khiển chuyển động". Tháng 9 năm 2023, đội ngũ đã sáng tạo ra MotionGPT. Tương tự như các nét cơ bản trong chữ Hán, đội ngũ đã phân tách tư thế con người thành khoảng 3.000 "đơn vị chuyển động" (action primitives). Giống như cách các mô hình ngôn ngữ lớn (LLM) tạo ra câu bằng cách dự đoán token tiếp theo, MotionGPT tạo ra các hành vi phức tạp bằng cách dự đoán "token chuyển động" tiếp theo.

Cách xử lý rời rạc hóa các chuyển động liên tục này không chỉ nâng cao đáng kể khả năng hiểu các nhiệm vụ chuỗi dài của mô hình, mà quan trọng hơn, nó giúp robot có khả năng tổng quát hóa Zero-Shot (không cần mẫu) – ngay cả với các lệnh chuyển động chưa từng thấy, robot vẫn có thể hiểu và thực hiện thông qua việc tái cấu trúc các từ vựng chuyển động. Đây cũng là mô hình lớn hiện thân đầu tiên trên thế giới biến chuyển động thành token, được công bố tại NeurIPS 2023.

Đến năm 2026, đội ngũ đã tích lũy công bố 7 thế hệ mô hình. Dựa trên những tích lũy trước đó, đội ngũ "Motion Brain" đã tiếp tục ra mắt mô hình lớn hiện thân STI-WM (Space-Time Integrated World Motion Model).

Mô hình chuyển động thế giới tích hợp không gian-thời gian STI-WM là khung trí tuệ hiện thân nguyên bản được xây dựng hoàn toàn cho việc lập kế hoạch chuỗi dài, điều khiển vòng lặp kín trực tuyến và tương tác vật lý thực tế của robot, đạt được sự thống nhất bốn chiều: cấu trúc không gian, tiến hóa thời gian, tính nhất quán vật lý và độ bền thực thi.

Theo giới thiệu, bước đột phá cốt lõi của STI-WM nằm ở việc thoát khỏi sự phụ thuộc nặng nề của các mô hình VLA truyền thống vào dữ liệu máy thật khổng lồ. Họ áp dụng công thức huấn luyện "80% video internet + 10% dữ liệu bắt chuyển động (motion capture) + 10% dữ liệu máy thật", đồng thời sử dụng từ điển chuyển động được thiết lập bởi MotionGPT để học các quy luật vật lý từ lượng lớn video không nhãn, sau đó dùng một lượng nhỏ dữ liệu bắt chuyển động để hiệu chỉnh các đặc điểm cơ sinh học, và cuối cùng chỉ dùng 10% dữ liệu máy thật để hoàn tất việc căn chỉnh vòng lặp kín.

Nói cách khác, mô hình huấn luyện dữ liệu hoàn toàn mới này đã giảm nhu cầu về dữ liệu máy thật xuống 90%, đồng thời nâng độ chính xác của chuyển động lên 99%.

Đồng thời, T²MB (Task*Task Motion Brain) mà đội ngũ "Motion Brain" đề xuất vào tháng 3 năm nay cũng giúp robot có khả năng tự tiến hóa ngoại tuyến. Khi mô hình được triển khai tại thiết bị đầu cuối (edge), không cần kết nối mạng để truyền dữ liệu, chỉ cần tương tác cục bộ là có thể liên tục tối ưu hóa hiệu suất, độ chính xác thực thi nhiệm vụ tăng tối đa 25%, giải quyết nỗi đau phải mang robot về nhà máy nâng cấp khi phát hiện lỗi sau khi triển khai.

Đáng chú ý, phòng thí nghiệm DAIR của NVIDIA trong mô hình ARDY mới nhất đã trích dẫn hai công nghệ gốc của "Motion Brain" là MLD và MotionGPT – đây là lần thứ tư lộ trình công nghệ của công ty này được các mô hình chuyển động thế hệ thứ ba của NVIDIA tham chiếu trong hai năm qua.

Tuy nhiên, điều thực sự quyết định liệu bộ não này có thể mở rộng quy mô hay không, ngoài lộ trình kỹ thuật, còn có chi phí tính toán tại thiết bị đầu cuối (edge computing), đây cũng là một rào cản cạnh tranh lớn của "Motion Brain". Theo giới thiệu, từ thế hệ mô hình đầu tiên, "Motion Brain" đã đồng thời thúc đẩy hai hướng – nén mô hình và thích ứng với chip nội địa.

Một mặt, thông qua các giải pháp kỹ thuật như chưng cất mô hình (model distillation), nén tham số dư thừa, "Motion Brain" đã nén mô hình cấp hàng nghìn tỷ tham số xuống cấp hàng chục tỷ, giảm khoảng 75% số lượng tham số trong các kịch bản cụ thể, độ trễ suy luận tại thiết bị đầu cuối giảm từ khoảng 200ms xuống còn khoảng 10ms; mặt khác, đồng thời thích ứng với các nền tảng chip nội địa như HiSilicon (Ascend 310/910), Horizon Robotics, Iluvatar CoreX (S60), đạt được suy luận tại thiết bị đầu cuối với mức tiêu thụ điện năng thấp, thời gian thực cao và chi phí siêu thấp.

Cách tiếp cận phối hợp phần cứng và phần mềm này mang lại kết quả trực tiếp là chi phí suy luận tại thiết bị đầu cuối giảm từ 200.000 nhân dân tệ xuống còn 10.000 nhân dân tệ, thời lượng pin của bộ não tăng 10 lần mà độ chính xác và hiệu suất không hề giảm. Công trình nén này cũng đã giúp đội ngũ giành được giải thưởng Bài báo xuất sắc nhất thế giới tại IJCAI 2025, cũng là đội ngũ duy nhất từ Trung Quốc đại lục đạt được giải thưởng này trong 5 năm qua.

Dựa vào năng lực này, "Motion Brain" có thể hoàn thành việc thích ứng một mô hình lớn hiện thân từ thực thể này sang thực thể khác trong vòng hai tuần, bao gồm "Quang Hoa 1" (Guanghua 1) do Đại học Phúc Đán tự phát triển, Unitree G1, cũng như "Thanh Long" (Qinglong) và "Linh Long" (Linglong) của Trung tâm Đổi mới Robot hình người Thượng Hải.

(Nguồn ảnh/Doanh nghiệp)

Nhà sáng lập kiêm CEO của "Motion Brain", Mục Trạch Lâm, cho biết ngành công nghiệp trí tuệ hiện thân trong nước thường áp dụng giải pháp huấn luyện trên chip nước ngoài rồi mới chuyển đổi thích ứng sang chip nội địa, dẫn đến các vấn đề về suy giảm hiệu suất và tương thích. Trong tương lai, "Motion Brain" sẽ phát triển nguyên bản dựa trên chip tính toán nội địa trong toàn bộ quy trình huấn luyện và suy luận mô hình, hiện thực hóa việc kiểm soát hoàn toàn độc lập về ngăn xếp công nghệ.

Về mặt thương mại hóa, "Motion Brain" cũng là một trong số ít các công ty về bộ não trí tuệ hiện thân tại Trung Quốc hiện có doanh thu. Mục Trạch Lâm chia sẻ với Hard rằng doanh thu kiểm toán năm 2025 của công ty đạt hàng chục triệu nhân dân tệ, nửa đầu năm 2026 đạt 30 triệu nhân dân tệ, dự kiến quy mô doanh thu năm nay đạt trên 50 triệu nhân dân tệ.

Hiện tại, khách hàng của công ty bao phủ các lĩnh vực như kiểm định công nghiệp, bất động sản, vệ sinh môi trường, v.v. Trong quý 1 năm 2026, "Motion Brain" đã bàn giao sản phẩm robot cho một công ty bất động sản niêm yết tại Hồng Kông và một tập đoàn vệ sinh môi trường hàng đầu niêm yết trên sàn chứng khoán A-share; đồng thời đang thúc đẩy nghiên cứu các kịch bản ứng dụng robot hình người với các tập đoàn bán lẻ chuỗi hàng đầu và các nhà máy sản xuất thiết bị gia dụng lớn.

Dưới đây là nội dung ghi chép cuộc trao đổi giữa Hard và Mục Trạch Lâm (đã lược bớt)

Hard: Chuyển động làm thế nào để trở thành Token? Đây có phải là điểm khó của ngành không?

Mục Trạch Lâm: Đây thực sự là điểm nghẽn của ngành. Chúng ta có thể hiểu chuyển động là "tư thế kỹ thuật số": giống như một trang trong cuốn truyện tranh là một tư thế tĩnh, lật liên tục các trang sẽ thành hoạt hình. Thời kỳ đầu, chúng tôi đã huy động đội ngũ hàng chục người gắn nhãn thủ công hàng chục nghìn tư thế, định nghĩa hơn 3.000 token chuyển động cơ bản, tương tự như 3.000 chữ Hán thông dụng, khi kết hợp lại có thể bao phủ mọi hành vi của con người.

Quan trọng hơn là để mô hình học được mối liên hệ giữa các chuyển động: giống như các mô hình ngôn ngữ lớn nắm vững quy luật sắp xếp từ ngữ thông qua việc học lượng lớn văn bản, chúng tôi để mô hình xem hàng triệu giờ video trên internet (phim ảnh, giám sát, Vlog, v.v.), học các logic nhân quả của chuyển động như "khi uống nước tay sẽ đưa lên miệng", "sau khi khoanh tay thì xác suất cao sẽ dang tay ra". Đồng thời kết hợp với 10% dữ liệu bắt chuyển động và 10% dữ liệu máy thật để hiệu chỉnh, cuối cùng đạt được khả năng tạo chuyển động Token từ đầu đến cuối (end-to-end) – hỗ trợ chuyển đổi từ văn bản, hình ảnh, đám mây điểm 3D sang chuyển động, tức là khả năng đa phương thức nguyên bản.

Hard: Việc kết hợp các Token chuyển động có dẫn đến sự bùng nổ về nhu cầu tính toán không? Làm thế nào để tối ưu hóa?

Mục Trạch Lâm: Chúng tôi không cần liệt kê tất cả các chuyển động, mà là học quy luật sắp xếp của chúng. Việc tối ưu hóa chủ yếu có hai hướng: một là ở cấp độ dữ liệu, 80% sử dụng video internet (đã qua lọc tiền đề vật lý để đảm bảo phù hợp với quy luật thực tế), giảm sự phụ thuộc vào dữ liệu bắt chuyển động/máy thật chi phí cao; hai là ở cấp độ nén mô hình, chúng tôi có sự tích lũy sâu sắc trong việc triển khai tại thiết bị đầu cuối, từng giành giải bài báo xuất sắc nhất tại hội nghị hàng đầu thế giới – thông qua các kỹ thuật như cắt tỉa Token (pruning), lượng tử hóa (quantization), tối ưu hóa động, có thể giảm lượng tính toán tại thiết bị đầu cuối xuống 62 lần, độ trễ suy luận nén từ 200ms xuống 10ms, số lượng tham số mô hình giảm 80% trong khi độ chính xác không giảm mà còn tăng (một số nhiệm vụ tăng 3%-6%).

Hard: Hiện nay lộ trình kỹ thuật trong lĩnh vực trí tuệ hiện thân đang phân hóa, có bên chú trọng vào bộ nhớ, bên các bạn chú trọng vào chuyển động, ông nhìn nhận thế nào về sự phân hóa này?

Mục Trạch Lâm: Quay lại nguyên lý cơ bản: sự thành công của các mô hình ngôn ngữ lớn về bản chất là kiến trúc Transformer đã hiện thực hóa việc tạo ra sự sắp xếp của các Token. Trí tuệ hiện thân cũng nên tuân theo logic này, cốt lõi là giải quyết vấn đề "tầng thực thi" – để robot có thể hoàn thành nhiệm vụ một cách ổn định.

Đối với các vấn đề tầng thấp hơn như tối ưu hóa bộ nhớ, tôi cho rằng trong ngắn hạn rất khó để các công ty khởi nghiệp đột phá, cần sự khám phá lâu dài của các "gã khổng lồ" như DeepSeek, OpenAI về lưu trữ chip và kiến trúc tính toán trong bộ nhớ (compute-in-memory). Chúng tôi thực tế hơn: giải quyết vấn đề thực thi nhiệm vụ mới thông qua khả năng tổng quát hóa của Token chuyển động (Zero-Shot), ví dụ robot từng học cách cầm chai nước khoáng, chưa học cách cầm điện thoại, cũng có thể thông qua việc di chuyển chuỗi chuyển động để hoàn thành với độ chính xác 80%, 20% còn lại có thể hiệu chỉnh thông qua một lượng nhỏ hậu huấn luyện hoặc học tăng cường.

Hard: Tại sao chọn thích ứng với chip nội địa thay vì sử dụng card NVIDIA trưởng thành hơn?

Mục Trạch Lâm: Về lâu dài, GPU nội địa là lựa chọn tất yếu – card NVIDIA sẽ ngày càng đắt đỏ và nguồn cung bị hạn chế. Lợi thế cốt lõi của chúng tôi là "am hiểu chip": đội ngũ có nền tảng từ ba "gã khổng lồ" chip là HiSilicon, Intel và NVIDIA, là đội ngũ mô hình lớn hiện thân duy nhất tại Trung Quốc có năng lực thích ứng ở cấp độ toán tử. Hiện tại đã thông suốt việc triển khai trên các chip nội địa như Iluvatar S60, Ascend 310/910, mục tiêu nửa cuối năm là chinh phục việc huấn luyện trên cụm chip nội địa quy mô hàng nghìn card, hiện thực hóa giải pháp huấn luyện mô hình lớn thuần nội địa.

RobotAIStartupĐầu tưMotion Brain
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ 36 36Kr. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.