# Cặp bài trùng từ Huawei khởi nghiệp: Đi tìm Scaling Law cho thế giới vật lý

- Nguồn: QbitAI
- Thời gian phát hành: 2026-09-25 13:14 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/a0b663979539982a
- Link gốc: https://www.qbitai.com/2026/09/497070.html

## Tóm tắt AI

Hai chuyên gia từ đội ngũ mô hình lớn của Huawei bắt tay khởi nghiệp, đặt mục tiêu giải mã Scaling Law trong các tương tác với thế giới thực.

## Thân bài

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-09-25 14:14:07 Nguồn: [QbitAI](https://www.qbitai.com/)

Một cuộc thử nghiệm mô hình nền tảng cho thế giới vật lý

> Cheng Qian, đưa tin từ Aofeisi, QbitAI | Tài khoản chính thức QbitAI

Hàng trăm triệu nhân dân tệ đã được rót vào một cuộc thử nghiệm mô hình nền tảng cho thế giới vật lý.

Công ty khởi nghiệp Physical AI - Xirang Kaiwu thông báo rằng họ đã hoàn tất liên tiếp các vòng gọi vốn hạt giống và thiên thần với tổng số tiền lên tới hàng trăm triệu nhân dân tệ.

Vòng gọi vốn được dẫn dắt bởi Dunhong Capital, cùng sự tham gia của các tổ chức danh tiếng như Huakong Fund, Sanhua Holding, Ginkgo Valley Capital, Zeran Capital, Benjian Fund, Angel Foundation, Biaopu Investment, với mức định giá đạt 500 triệu USD.

Đứng sau Xirang Kaiwu là bộ đôi "song tử tinh" về mô hình lớn của Huawei:

Nhà sáng lập kiêm CEO Li Yin, cựu CTO mảng mô hình lớn của Huawei Cloud, thành viên nòng cốt trong giai đoạn 0-1 của mô hình lớn Huawei;

Đồng sáng lập, Giáo sư Zhang Hanwang, cựu nhà khoa học trưởng về đa phương thức của Huawei.

Sự hợp tác lần này của cả hai nhắm vào một bài toán nền tảng chưa có lời giải trong lĩnh vực trí tuệ hiện thân (Embodied AI).

"Sau mô hình ngôn ngữ lớn (LLM), liệu chúng ta có cần một mô hình nền tảng cho giai đoạn tiếp theo hướng tới thế giới vật lý hay không?"

Trong vài năm qua, LLM đã tích hợp các tác vụ hỏi đáp, viết lách và lập trình vào cùng một mô hình thông qua việc tiền huấn luyện trên khối lượng văn bản khổng lồ.

Ngược lại, robot vẫn phụ thuộc nặng nề vào các thực thể, bối cảnh và tác vụ cụ thể để thu thập dữ liệu và huấn luyện bổ sung.

Vì lý do đó, Xirang muốn tạo ra LPM (Large Physics Model - Mô hình vật lý lớn).

Nghĩa là tiền huấn luyện một mô hình nền tảng vật lý từ khối lượng video, quỹ đạo robot và tương tác thực tế khổng lồ, sau đó đưa nó vào các thực thể và tác vụ khác nhau.

Nói thì dễ, nhưng thực hiện lại vô cùng khó khăn.

Ngoài việc tin tưởng vào Li Yin, Zhang Hanwang và đội ngũ, tại sao các nhà đầu tư lại sẵn sàng đặt cược vào câu trả lời "phi đồng thuận" này khi mô hình còn chưa hoàn tất tiền huấn luyện?

LPM là gì?

Theo định nghĩa của Xirang, mô hình ngôn ngữ lớn (LLM) đại diện cho kỷ nguyên AI 1.0, chủ yếu học những kiến thức đã được con người trừu tượng hóa thành ngôn ngữ, mã nguồn và công thức.

Physical AI, hay còn gọi là "AI 2.0" theo cách gọi của Xirang, có sự khác biệt về chất.

Ở giai đoạn này, AI sẽ nhận thức sâu sắc một điều mà loài vượn cổ đại đã phát hiện ra từ hàng chục nghìn năm trước:

Hóa ra thế giới này biến đổi liên tục, có thể bị thay đổi bởi hành động, và đằng sau mỗi hành động luôn tồn tại vô vàn khả năng khác...

Sự phức tạp hỗn loạn và tiến hóa liên tục này là điều mà các LLM - vốn chỉ dự đoán xác suất trong các chuỗi Token rời rạc - không thể chịu đựng được.

△ Các chuyển động liên tục chỉ có thể trở thành chuỗi dữ liệu mà mô hình đọc được sau khi đã bị cắt nhỏ.

Trong thế giới vật lý, không có sẵn một bộ biểu diễn trừu tượng nào đã được con người sắp xếp để có thể sử dụng ngay lập tức.

Biểu diễn (representation) là việc dùng "một hình thức nào đó" thay thế cho một đối tượng, giúp hệ thống có thể nhận diện, so sánh, suy luận hoặc hành động dựa trên đối tượng đó.

Giống như bản đồ biểu diễn thành phố, chim bồ câu biểu diễn hòa bình, con người nhận thức thế giới thông qua quan niệm, hình ảnh và khái niệm.

Một số biểu diễn rất trực diện, nhưng một số khác lại không có đáp án duy nhất.

Một người nhíu mày nhưng khóe miệng lại nhếch lên, đó là sự cạn lời, cười khổ, mỉa mai hay đang cố chịu đau? Không ai biết, thế giới vật lý chỉ cung cấp các pixel, âm thanh, vị trí và sự thay đổi lực tác động.

△ Biểu diễn không có đáp án duy nhất.

Trong vô vàn những thay đổi và tổ hợp thay đổi đó, có lẽ chỉ có một tín hiệu duy nhất đáng để nắm bắt. Và mô hình chỉ có thể tự tìm ra câu trả lời từ hàng tỷ lần quan sát, hành động và phản hồi.

Đây chính là LPM, Large Physics Model, nhiệm vụ mà "Mô hình vật lý lớn" sẽ phải hoàn thành.

Tương đương với việc tái tạo lại đại não và tiểu não.

Mặc dù độ khó rất cao, Xirang cho rằng bước này là cần thiết.

Lý do phần lớn xuất phát từ việc đội ngũ đã nhận thức sâu sắc về những hạn chế của lộ trình VLA (Vision-Language-Action) trong các dự án công nghiệp trước đây.

Mặc dù VLA đã chứng minh rằng thông tin thị giác và ngôn ngữ có thể được ánh xạ thêm thành các hành động của robot, nhưng trong triển khai thực tế, phần lớn các mô hình vẫn phải huấn luyện bổ sung cho từng thực thể và tác vụ cụ thể.

Nếu robot muốn tiến sâu hơn vào các bối cảnh gia đình và dịch vụ công cộng, mô hình cần phải có năng lực tổng quát, giữ lại được những kiến thức vật lý đã học khi bước vào môi trường mới.

LPM chính là nền tảng năng lực mà Xirang muốn cung cấp.

Hiện tại, nghiên cứu của Xirang về hướng LPM đã có những tín hiệu khả quan.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.qbitai.com/2026/09/497070.html>
