36 36Kr
92

Tin ngành

Startup AI từ UCLA gọi vốn gần 500 tỷ đồng cho mô hình nền tảng robot hình người

(giờ Việt Nam)

Tóm tắt AI

Delta Intelligence, startup do các tiến sĩ UCLA sáng lập, vừa huy động thành công gần 500 triệu NDT để phát triển mô hình nền tảng cho robot hình người, tập trung vào khả năng vận hành toàn thân trong môi trường công nghiệp thực tế.

Bản dịch AI

UCLA博士团队创业做人形机器人基础模型,拿下近5亿元天使++轮融资|硬氪首发-36氪

Tác giả | Hoàng Nam

Biên tập | Viên Tư Lai

Theo thông tin từ Hard, công ty mô hình nền tảng robot hình người Delta Intelligence gần đây đã hoàn tất vòng gọi vốn Angel++ với số tiền gần 500 triệu nhân dân tệ. Các nhà đầu tư trong vòng này bao gồm nhiều đơn vị công nghiệp thuộc các công ty niêm yết và các tổ chức đầu tư tài chính hàng đầu. Nguồn vốn sẽ chủ yếu được sử dụng để liên tục lặp lại các mô hình nền tảng cho robot hình người, đẩy nhanh quá trình sản xuất hàng loạt thiết bị thu thập dữ liệu tự phát triển và xây dựng vòng lặp dữ liệu khép kín, đồng thời mở rộng đội ngũ nghiên cứu và phát triển cốt lõi nhằm thúc đẩy việc triển khai kỹ thuật và xác thực công nghệ trong các kịch bản công nghiệp thực tế.

Đây cũng là vòng gọi vốn thứ sáu mà công ty hoàn thành trong vòng nửa năm kể từ khi thành lập. Trước đó, các nhà đầu tư bao gồm các nhà sản xuất robot hình người như Viện Nghiên cứu Trí tuệ Nhân tạo Tổng quát Bắc Kinh (BIGAI), Agibot, Leju Robotics, Starship AI; các tổ chức tài chính như Hillhouse Ventures, Oriza Holdings, Fosun RZ Capital, Huaying Capital, Lenovo Capital; cùng các nguồn vốn trong lĩnh vực ô tô và bán dẫn.

Delta Intelligence được thành lập vào tháng 1 năm 2026, tập trung nghiên cứu các mô hình nền tảng robot hình người đa năng nguyên bản (HFMs - Humanoid Foundation Models), hướng tới mục tiêu cuối cùng là hiện thực hóa khả năng phối hợp toàn thân đa năng (Loco-Manipulation) cho robot hình người, thúc đẩy trí tuệ hiện thân (Embodied AI) tiến tới các ứng dụng thực tế trong công nghiệp và gia đình. Lấy robot hình người làm vật mang, công ty đang đẩy nhanh sự ra đời của Trí tuệ nhân tạo vật lý tổng quát (Physical AGI).

Ba nhà sáng lập cốt lõi đều có bằng Tiến sĩ từ UCLA, với nền tảng học thuật từ bậc đại học tại Thanh Hoa và giảng dạy tại Đại học Bắc Kinh. Chuyên môn kỹ thuật của đội ngũ bao gồm học máy cho robot, học máy quy mô lớn, hệ thống robot và trí tuệ hiện thân. Kinh nghiệm nghiên cứu và công nghiệp của họ trải dài qua Google Robotics, NVIDIA Research, DeepMind, Meta, Đại học Bắc Kinh và Viện Nghiên cứu Trí tuệ Nhân tạo Tổng quát Bắc Kinh, đồng thời từng tham gia nhiều dự án robot của DARPA, ONR và NSF tại Hoa Kỳ. Các hướng nghiên cứu đa dạng cùng sự tích lũy thực tiễn xuyên suốt giữa giới học thuật và công nghiệp đã giúp đội ngũ hình thành năng lực phần cứng và phần mềm toàn diện, từ nghiên cứu tiên phong đến triển khai kỹ thuật.

Đường đua trí tuệ hiện thân đang tăng tốc chuyển mình từ trình diễn vận động sang tác nghiệp vật lý. Sự ra đời của đội ngũ Delta Intelligence bắt nguồn từ việc khám phá một lộ trình kỹ thuật rõ ràng: mô hình nền tảng cho robot hình người hai chân phải được xây dựng ngay từ đầu cho "trí tuệ toàn thân", thay vì di chuyển, sao chép hoặc lấp đầy trên các khung có sẵn.

Một thực tế phải đối mặt là sau khi bước ra khỏi phòng thí nghiệm, robot hình người phải đối mặt với không gian vật lý thực tế có bậc thang, ngưỡng cửa, cầu thang và các địa hình đặc biệt khác. Trong những kịch bản này, robot vừa phải di chuyển, vừa phải thao tác, đồng thời cần duy trì sự cân bằng và đưa ra quyết định trong môi trường động. Để đạt được sự phối hợp toàn thân, tiền đề là thiết bị phải có nhận thức đủ chính xác về không gian mà nó đang ở – sự hiểu biết không gian này phải là ba chiều, thời gian thực và không mơ hồ.

Tuy nhiên, trong các mô hình trí tuệ hiện thân chủ lưu hiện nay, nhận thức không gian vẫn được xây dựng dựa trên biểu diễn thị giác hai chiều. Khi robot bước vào các môi trường phức tạp thực tế như sản xuất công nghiệp, vận hành bảo trì năng lượng, dịch vụ gia đình và kiểm tra ngoài trời, biểu diễn thị giác hai chiều dễ dẫn đến thiếu hụt chiều sâu không gian thực, các mối quan hệ hình học tồn tại sự mơ hồ, và vấn đề bùng nổ ngữ cảnh trong các kịch bản lớn, từ đó hạn chế khả năng hiểu môi trường và tác nghiệp an toàn của robot.

Ví dụ, khi robot đứng trước cửa, biểu diễn hai chiều thường khó xác định chính xác khoảng cách tay nắm cửa, hướng mở cửa và cách thay đổi không gian cơ thể để tạo khoảng trống mở cửa. Sự phán đoán mơ hồ này khi thiết bị đi vào kịch bản thực tế dễ tích tụ và khuếch đại sai số hành động, dẫn đến việc không thể hoàn thành các tác vụ liên tục dài hạn.

Để loại bỏ độ lệch cấu trúc này, Delta Intelligence chọn xây dựng một bộ công cụ thế giới ba chiều nguyên bản, lấy biểu diễn ba chiều làm cốt lõi của mô hình, có thể trực tiếp xử lý đám mây điểm (point cloud), Gaussian Splatting và các biểu diễn cảnh ba chiều khác, nhằm đạt được sự hiểu biết, suy luận và dự đoán trạng thái môi trường tương lai một cách nguyên bản.

Thu thập dữ liệu toàn thân toàn cảnh của con người và học kỹ năng toàn thân (Nguồn ảnh/Doanh nghiệp)

Sự vận hành của bộ công cụ cần nguồn cung cấp dữ liệu liên tục làm tiền đề. Delta Intelligence đã tự phát triển một bộ thiết bị thu thập dữ liệu toàn thân toàn cảnh, sử dụng kiến trúc thu thập thuần thị giác, có thể đồng thời nắm bắt quỹ đạo chuyển động của các khớp xương người ở mọi chiều như tay, chân, eo, vai, và tái tạo cảnh ba chiều toàn cục theo thời gian thực dựa trên luồng video từ góc nhìn thứ nhất.

Trong đó, mỗi lần thu thập có thể xuất ra hai loại tư liệu huấn luyện cốt lõi: một là dữ liệu khung xương toàn thân của con người, khôi phục các logic tương tác thực tế như phối hợp tay chân, chuyển trọng tâm, mượn lực thao tác; hai là dữ liệu cảnh ba chiều độ chính xác cao, ghi lại các tham số vật lý môi trường như vật cản, bậc thang, mặt bàn thao tác.

Về thiết kế lộ trình thu thập, Delta Intelligence đã lập kế hoạch phân tầng cho các giai đoạn phát triển khác nhau, bao gồm thu thập từ xa (teleoperation) gắn trên thân robot, và các chế độ bắt chuyển động không cần robot thực thể như UMI, Ego-centric. Thu thập không cần thân máy có hiệu suất cao hơn, chi phí phần cứng thấp hơn, có thể áp dụng để tích lũy quy mô lớn các mẫu tương tác toàn thân đa năng; thu thập từ xa được sử dụng để tinh chỉnh máy thật và căn chỉnh độ chính xác ở giai đoạn sau. Hai chế độ phối hợp sử dụng giúp cân bằng tốt hơn giữa quy mô dữ liệu, chi phí thu thập và độ chính xác khi thích ứng với máy thật.

"Hầu hết các giải pháp thu thập dữ liệu trên thị trường chỉ có thể thu thập các hành động cục bộ như tay, các mô hình huấn luyện dựa trên đó khó có thể hiểu đầy đủ sự tương tác giữa người và môi trường, cũng như khó nắm vững các tác vụ phức tạp phụ thuộc vào sự phối hợp toàn thân như leo thang, đẩy kéo cửa nặng." Mã Hiểu Kiện, người sáng lập kiêm CEO của Delta Intelligence, cho rằng logic học tập của robot hình người nên lấy con người làm chuẩn, phải thu thập đầy đủ hành vi tương tác toàn thân với môi trường thì mới có thể xây dựng mô hình thế giới không có độ lệch nhận thức.

Trực quan hóa dữ liệu toàn thân toàn cảnh (Nguồn ảnh/Doanh nghiệp)

Việc hiểu chính xác không gian ba chiều chỉ là nền tảng của tầng nhận thức, liệu robot có thể chuyển đổi ý định tác vụ cấp cao thành chuyển động cơ thể chính xác đến từng mili giây hay không, là một ngưỡng cửa cốt lõi khác để triển khai tác nghiệp. Thân máy hình người có bậc tự do cao sở hữu hàng chục khớp nối liên kết, một lệnh cấp cao đơn lẻ không thể trực tiếp điều khiển sự cân bằng, phát lực, dịch chuyển toàn thân, độ phức tạp của chuỗi điều khiển tầng dưới là cực kỳ cao.

Cách làm phổ biến trước đây là gửi trực tiếp các lệnh từ mô hình lập kế hoạch xuống bộ điều khiển tầng dưới. Cách này vẫn khả thi trên cánh tay máy có bậc tự do thấp, nhưng đối với robot hình người có bậc tự do cao, mô-đun điều chỉnh phối hợp toàn thân bị thiếu ở giữa sẽ trực tiếp dẫn đến hiện tượng khựng hành động, mất kiểm soát lực hoặc thậm chí mất cân bằng và ngã.

Để giải quyết vấn đề đứt gãy này, Delta Intelligence đã xây dựng kiến trúc phối hợp nguyên bản ba tầng "Não bộ + Tiểu não + Hỗn hợp lực vị". Ba tầng mô hình phân công rõ ràng, liên kết khép kín. Mô-đun não bộ trang bị bộ công cụ thế giới ba chiều tự phát triển, chịu trách nhiệm nhận thức môi trường, lập kế hoạch tác vụ dài hạn, xuất ý định tương tác cấp cao; tiểu não là mạng thần kinh được huấn luyện dựa trên học tăng cường mô phỏng quy mô lớn, tiếp nhận các lệnh cấp cao thưa thớt từ não bộ, chuyển đổi thành tín hiệu điều khiển tinh vi cho động cơ toàn thân ở tần số hàng chục đến hàng trăm Hz, điều chỉnh trọng tâm động theo thời gian thực, phối hợp lực phát của tứ chi, giải quyết bài toán khó về điều khiển cân bằng thân máy có bậc tự do cao, cuối cùng thông qua lớp hỗn hợp lực vị để xuất ra sự điều khiển mượt mà.

Giá trị khác biệt của kiến trúc phân tầng não bộ - tiểu não này sẽ được phát huy tối đa trên các thiết bị có bậc tự do cao như robot hình người kích thước đầy đủ, bàn tay khéo léo năm ngón. Tiểu não dựa vào dữ liệu tương tác toàn thân toàn cảnh để liên tục lặp lại, có thể thích ứng tự động với các loại tác vụ toàn thân phức hợp.

Thu thập toàn thân và tác nghiệp trong kịch bản logistics của robot hình người (Nguồn ảnh/Doanh nghiệp)

Mã Hiểu Kiện nhận định, cùng với sự tăng tốc công nghiệp hóa trí tuệ hiện thân, sự phối hợp sâu sắc giữa các doanh nghiệp mô hình thuật toán và nhà sản xuất phần cứng sẽ trở thành mô hình phát triển chủ lưu. Dựa vào hệ thống kỹ thuật nền tảng hoàn chỉnh, đội ngũ Delta Intelligence đã thiết lập quan hệ hợp tác lâu dài với các nhà sản xuất robot hình người hàng đầu như Agibot, Leju, Starship AI, Unitree, dựa vào quy trình thích ứng thân máy tiêu chuẩn hóa để hiện thực hóa việc di chuyển nhanh mô hình giữa các nền tảng phần cứng khác nhau. Với tư cách là nhà cung cấp mô hình nền tảng trong hệ sinh thái robot hình người, công ty cam kết cung cấp nền tảng trí tuệ toàn thân có thể triển khai và mở rộng cho các loại thân máy, trở thành mắt xích quan trọng kết nối nền tảng phần cứng và ứng dụng tầng trên.

Dưới đây là trích đoạn phỏng vấn giữa Hard và người sáng lập kiêm CEO của Delta Intelligence, Mã Hiểu Kiện (đã qua biên tập):

Hard: Dựa trên kiến trúc não bộ - tiểu não nguyên bản, chiến lược phân bổ dữ liệu thực và dữ liệu mô phỏng là gì? Cân nhắc đằng sau đó ra sao?

Mã Hiểu Kiện: Trước hết nói về khái niệm "phân bổ", chúng tôi không đặt trong một bể dữ liệu thống nhất để chia bao nhiêu cho não bộ, bao nhiêu cho tiểu não, mà là hai hệ thống huấn luyện hoàn toàn độc lập, phục vụ cho các mục tiêu tối ưu hóa khác nhau. Căn nguyên nằm ở chỗ các tác vụ mà não bộ và tiểu não đảm nhận có thuộc tính hoàn toàn khác nhau, các quy luật tương tác vật lý tương ứng cũng khác nhau.

Não bộ chịu trách nhiệm hiểu môi trường toàn cục, lập kế hoạch tác vụ dài hạn và quyết định thao tác toàn thân, chúng tôi không phụ thuộc vào dữ liệu mô phỏng. Lý do căn bản nằm ở chỗ khả năng mô hình hóa tiếp xúc của hệ thống mô phỏng còn thiếu sót. Trong các tác nghiệp thực tế như kiểm tra công nghiệp, vận chuyển vật liệu, leo thang, robot hình người sẽ đồng thời xảy ra các tiếp xúc phức hợp đa điểm như kẹp tay, chịu lực chân, mượn lực thân, mà trình mô phỏng rất khó tái hiện chính xác các tương tác phức tạp như biến dạng linh hoạt, ma sát trượt, lực tác động đa tiếp điểm.

Nếu não bộ học chiến lược tác vụ dựa trên tín hiệu mô phỏng bị sai lệch, cái học được sẽ là logic thao tác trong thế giới mô phỏng, khi triển khai lên máy thật rất dễ thất bại. Do đó, việc huấn luyện não bộ của Delta phải dựa vào dữ liệu tương tác nguyên bản từ máy thật.

Tác nghiệp tác vụ phối hợp toàn thân dài hạn trong kịch bản việc nhà (Nguồn ảnh/Doanh nghiệp)

Tiểu não chịu trách nhiệm phối hợp toàn thân tầng dưới và điều khiển cân bằng động, tình hình hoàn toàn ngược lại, chúng tôi lấy môi trường mô phỏng làm vật mang huấn luyện cốt lõi. Điều khiển cân bằng về bản chất là một bài toán tối ưu hóa từ trạng thái liên tục đến hành động, mấu chốt nằm ở độ chính xác của mô hình trọng lực và động lực học khớp nối, mà hai việc này các công cụ vật lý đã làm rất tốt. Tiểu não thực hiện thử sai quy mô lớn thông qua học tăng cường trong trình mô phỏng, chỉ sử dụng một lượng nhỏ dữ liệu bắt chuyển động từ máy thật để hiệu chỉnh tinh chỉnh ở giai đoạn cuối.

Nói đơn giản, não bộ cần học thao tác tương tác phức hợp, yêu cầu vật lý tiếp xúc thực tế cực cao, chỉ có thể lấy dữ liệu máy thật làm cốt lõi; tiểu não cần học cân bằng động, chỉ cần dựa vào quy tắc vật lý là có thể lặp lại, mô phỏng có thể cung cấp các mẫu thử sai vô hạn với chi phí thấp. Chuỗi dữ liệu và mục tiêu huấn luyện của hai bên được tách biệt tự nhiên, không tồn tại tiêu chuẩn phân bổ thống nhất.

Hard: Các thông số phần cứng thân máy hình người hai chân, ràng buộc khớp nối, đặc tính động lực học của mỗi nhà khác nhau khá lớn, mô hình nền tảng hình người đa năng của Delta Intelligence làm thế nào để hoàn thành việc thích ứng nhanh chéo thân máy?

Mã Hiểu Kiện: Đối với thân máy hình người của các nhà sản xuất khác nhau, chúng tôi đã đúc kết một quy trình thích ứng tiêu chuẩn hóa, chia thành bốn khâu: thu thập dữ liệu bắt chuyển động toàn thân, chuyển hướng chuyển động chéo thân máy, học tăng cường mô phỏng tiểu não, tinh chỉnh nhanh não bộ. Mỗi khâu đều có rào cản kỹ thuật đáng kể, cũng là sự tích lũy liên tục của chúng tôi trong nhiều năm về thị giác ba chiều và phối hợp toàn thân hình người.

Lấy khâu chuyển hướng làm ví dụ, cơ thể người có hàng chục bậc tự do, trong khi bậc tự do, kích thước, giới hạn khớp nối, phân bố trọng tâm của mỗi thân máy đều khác nhau, sự khác biệt phần cứng tự nhiên làm tăng độ khó của việc ánh xạ hành động.

Thuật toán chuyển hướng của Delta Intelligence dựa trên tối ưu hóa đa ràng buộc để giải quyết vấn đề này. Một mặt, tất cả giá trị chuyển động của khớp nối phải nằm nghiêm ngặt trong khoảng giới hạn của thân máy, tránh va chạm và khựng; mặt khác, phải giữ lại trọn vẹn logic phát lực cốt lõi của hành động gốc, như các hành động phối hợp toàn thân như mượn lực mở cửa, leo thang, quỹ đạo trọng tâm và quỹ đạo tay không được xuất hiện sai lệch, nếu không robot sẽ không thể tái hiện cách phát lực của con người.

Robot hình ngườiAI tạo sinhĐầu tư công nghệPhysical AGIStartup AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ 36 36Kr. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.