Mô hình
Vượt mặt π0, mô hình 1 tỷ tham số của đội ngũ Trung Quốc thống trị bảng xếp hạng trí tuệ hiện thân
(giờ Việt Nam)
Tóm tắt AI
Trí tuệ hiện thân (Embodied AI) đang chuyển dịch từ cuộc đua về quy mô tham số sang cuộc đua về kiến trúc tối ưu.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
23/07/2026 14:36:08 Nguồn: QbitAI
Trí tuệ hiện thân (Embodied AI) đang chuyển dịch từ "cuộc đua tham số" sang "cuộc đua kiến trúc".
Tian Yanlin, đưa tin từ Aofeisi.
QbitAI | Kênh chính thức QbitAI.
Ai có thể ngờ rằng, trong bảng xếp hạng hàng đầu thế giới về khả năng vận hành của trí tuệ hiện thân, mô hình đánh bại chuẩn mực quốc tế π0 lại là một mô hình hạng nhẹ với tham số chỉ ở mức 1B.
Gần đây, Evo-SOTA, một trong những bảng xếp hạng công khai được quan tâm nhất trong lĩnh vực trí tuệ hiện thân toàn cầu, đã cập nhật thứ hạng.
FabriVLA do YOUIBOT phát triển đã vươn lên vị trí dẫn đầu trong tiêu chuẩn cốt lõi về thao tác đa nhiệm Meta-World MT50 với tỷ lệ thành công trung bình (tier-average) đạt 90,0%, vượt qua hàng loạt mô hình nổi tiếng quốc tế, bao gồm cả π0.

Không cần chồng chất hàng chục tỷ tham số, mô hình "nhỏ mà có võ" này đã đạt SOTA (trạng thái tốt nhất) trong các bài kiểm tra độ khó toàn diện, đồng thời thiết kế nhẹ của nó cũng tạo nền tảng cho việc triển khai tại các thiết bị biên của robot.
Các thao tác như gắp, đặt, mở cửa, cắm rút... trong Meta-World MT50 có sự trùng khớp cao với các quy trình cơ bản trong môi trường công nghiệp, qua đó kiểm chứng khả năng đa nhiệm và độ ổn định khi vận hành trong các tình huống khác nhau.
Và đây chính xác là năng lực mà môi trường công nghiệp coi trọng nhất.
Kết quả bảng xếp hạng chứng minh hiệu suất thuật toán, nhưng điều mà ngành công nghiệp thực sự cần là khả năng ứng dụng vào môi trường thực tế.
Trong 9 năm qua, YOUIBOT đã hoàn thành hơn 800 dự án triển khai thực tế trong các ngành như bán dẫn, năng lượng hóa chất, pin lithium, v.v.
Gần đây, công ty này tiếp tục thừa thắng xông lên khi ra mắt mô hình lớn trí tuệ hiện thân công nghiệp "Zhihe" (FabriX) và robot hình người thuần công nghiệp "Xifeng", đồng thời đưa ra một khẩu hiệu cực kỳ táo bạo:
Trong vòng 3 năm, hỗ trợ 10.000 hiện trường công nghiệp.
Ban đầu, thế giới bên ngoài cho rằng bước đi này quá lớn, nhưng ngay trong ngày ra mắt, "Xifeng" đã nhận được 4.000 đơn đặt hàng dự kiến.
Giờ đây, việc FabriVLA giành được SOTA toàn cầu càng làm rõ hơn logic đằng sau 4.000 đơn hàng này:
Điều mà khách hàng công nghiệp coi trọng chưa bao giờ là tham số lớn đến mức nào, mà là ai sử dụng hiệu quả hơn.
Làm thế nào mô hình 1B có thể đứng đầu bảng xếp hạng trí tuệ hiện thân?
Việc FabriVLA đứng đầu tuyệt đối không phải là một sự may mắn ngẫu nhiên.

Là một trong những bảng xếp hạng đánh giá công khai quan trọng trong lĩnh vực trí tuệ hiện thân toàn cầu, Evo-SOTA quy tụ các mô hình chủ đạo từ các trường đại học và công ty công nghệ trên toàn thế giới.
Tất cả kết quả đều dựa trên các bài báo khoa học đã công bố, mang lại giá trị tham khảo cực cao cho ngành.
Trong tiêu chuẩn Meta-World MT50 mà bảng xếp hạng này lựa chọn, có tới 50 nhiệm vụ khác nhau, bao gồm các thao tác phức tạp như gắp, đặt, đẩy, mở cửa, cắm rút, v.v.
Nó không kiểm tra giới hạn của robot trong việc học vẹt một hành động cụ thể, mà là khả năng đa nhiệm để nắm vững 50 nhiệm vụ khác nhau cùng một lúc.
Điều này hoàn toàn trùng khớp với nhu cầu thực tế tại các dây chuyền công nghiệp.
Các linh kiện trên dây chuyền sản xuất luôn thay đổi liên tục; nếu cánh tay robot "đình công" mỗi khi thay đổi phôi, đó sẽ là thảm họa đối với nhà máy.
Việc FabriVLA giành vị trí số 1 đồng nghĩa với việc các mô hình VLA hạng nhẹ hoàn toàn có thể sở hữu khả năng vận hành trí tuệ hiện thân đỉnh cao, cung cấp nền tảng mô hình cho việc ứng dụng trí tuệ hiện thân vào công nghiệp.
Tuy nhiên, điều này khiến nhiều người tò mò: Tại sao một mô hình 1B tham số lại có thể đánh bại các mô hình lớn hơn?

FabriVLA đã chọn cách thiết kế lại kiến trúc mạng thần kinh xoay quanh các nhiệm vụ vận hành của robot.
Các mô hình VLA truyền thống thường rơi vào bẫy tăng tham số một cách mù quáng, dựa vào việc học thuộc lòng góc khớp để đối phó với các tình huống phức tạp.
Trong khi đó, FabriVLA đề xuất hai đổi mới then chốt:
Đối với robot, nhìn thấy một vật thể chỉ là bước đầu tiên.
Nó không chỉ cần biết "đây là cái gì", mà còn cần biết "nên thao tác như thế nào".
Ví dụ như việc nhặt một linh kiện.
Thông tin thị giác cấp cao giúp robot hiểu mục tiêu là gì.
Chi tiết thị giác cấp thấp giúp robot phán đoán vị trí, hình dạng và tư thế cụ thể.
Nếu chỉ có hiểu biết về ngữ nghĩa, robot có thể biết đây là một linh kiện, nhưng lại không biết tay nên vươn tới đâu.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.