QbitAI
85

Mô hình

Mô hình VLA mã nguồn mở 1.5B: Bước tiến đột phá trong lĩnh vực trí tuệ hiện thân

(giờ Việt Nam)

Tóm tắt AI

Model MiniCPM-Robot mới từ ModelBest chính thức ra mắt, đánh dấu cột mốc quan trọng trong việc đưa các mô hình ngôn ngữ - hành động (VLA) vào thực tế.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

20:20-07-20 11:36:20 Nguồn: QbitAI

Model MiniCPM-Robot series chính thức được MiniMax (Mianbi Intelligence) ra mắt

Kim Lỗi đưa tin từ Thượng Hải

QbitAI | Kênh thông tin chính thức QbitAI

Một mô hình VLA "cây nhà lá vườn" mới vừa ra đời, và nó chỉ có 1.5B tham số.

Kích thước nhỏ như vậy liệu có hiệu quả không?

Nào, không dài dòng nữa, chúng ta hãy cùng xem kết quả thực tế:

Địa chỉ video: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw

Trong video demo thực tế ở trên, hai cánh tay robot bắt đầu làm món sandwich trên bàn. Chúng phối hợp nhịp nhàng: đầu tiên lấy bánh mì, sau đó kẹp rau diếp, thịt nguội và trứng, xếp chồng từng lớp lên nhau.

Hãy cùng xem một đoạn demo khác:

Địa chỉ video: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw

Một chú chó robot Unitree sau khi nhận lệnh "theo sát người phía trước" đã bắt đầu bám theo mục tiêu trên suốt quãng đường.

Từ ngoài trời đi vào tòa nhà văn phòng, rồi vào thang máy và xuống bãi đỗ xe dưới hầm, chú chó robot vẫn không hề làm mất dấu. Ngay cả khi có nhiều người qua lại xung quanh, môi trường và ánh sáng thay đổi liên tục, nó vẫn nhận diện chính xác người đã được chỉ định từ đầu.

Quan trọng hơn, khả năng này được xử lý trực tiếp ngay trên thiết bị (local) của chú chó robot!

Thang máy và bãi đỗ xe dưới hầm thường là những nơi có tín hiệu mạng kém. Ngay cả khi rơi vào môi trường mạng yếu hoặc không có mạng, chú chó robot vẫn có thể tiếp tục nhận diện mục tiêu, lập kế hoạch hành động và duy trì việc bám theo.

Đằng sau hai đoạn Demo này chính là dòng model MiniCPM-Robot được MiniMax chính thức ra mắt và mã nguồn mở tại WAIC.

Hiện tại bao gồm hai mô hình:

Cùng với đó là khung suy luận trí tuệ hiện thân (embodied AI) mã nguồn mở PhyAI, chịu trách nhiệm giúp các mô hình này thích ứng với phần cứng nhanh hơn và vận hành trên robot thực tế.

Nói một cách đơn giản, một bên chịu trách nhiệm giúp robot "thực hiện thao tác", một bên giúp robot "nhận diện và bám theo", kết hợp với một nền tảng suy luận hiệu quả.

Những gì MiniMax mang đến lần này đã là một bộ giải pháp trí tuệ hiện thân đang dần hoàn thiện.

Lọt vào nhóm dẫn đầu, độ trễ giảm gần một nửa

Trước tiên hãy xem MiniCPM-RobotManip.

Mặc dù chỉ có 1.5B tham số, nhưng trong các bài kiểm tra VLA phổ biến như LIBERO, Calvin, RoboTwin2, hiệu suất tổng thể của nó đã lọt vào nhóm dẫn đầu, ngang tầm với các mô hình như π0.5.

Điều thực sự tạo nên sự khác biệt chính là bài kiểm tra về "trí nhớ" của robot.

Nhiều mô hình VLA khi thực hiện hành động chủ yếu dựa vào phán đoán từ khung hình hiện tại.

Ví dụ: yêu cầu robot nhấn vào nút thứ hai trên màn hình 5 lần.

Nếu nó không nhìn thấy các khung hình trước đó và không nhớ mình đã nhấn bao nhiêu lần, nó rất dễ dừng lại sau một lần nhấn hoặc cứ nhấn liên tục không dừng.

MiniCPM-RobotManip sẽ đưa các quan sát lịch sử và các hành động đã thực hiện trước đó vào phán đoán. Nó biết nhiệm vụ đã tiến triển đến đâu và biết khi nào nên dừng lại.

Trong RMBench - bài kiểm tra chuyên biệt về trí nhớ ngữ cảnh, điểm số của π0.5 đạt khoảng 10 điểm (gần mức ngẫu nhiên), trong khi MiniCPM-RobotManip đạt khoảng 53 điểm.

Khả năng này rất quan trọng đối với robot thực tế.

Gấp quần áo, dọn bàn, làm sandwich nghe có vẻ là những việc vặt hàng ngày, nhưng khi phân tách ra lại bao gồm một chuỗi các hành động. Nếu robot chỉ nhìn vào hiện tại, nó rất dễ bị "mất trí nhớ" giữa chừng; chỉ khi ghi nhớ được trạng thái trước đó, nó mới có cơ hội hoàn thành trọn vẹn các nhiệm vụ dài.

Ngoài việc ghi nhớ, robot còn phải phản ứng nhanh.

Trong bảng so sánh suy luận đơn khung mà MiniMax đưa ra, trên card đồ họa H100 và độ chính xác bf16, độ trễ ra quyết định đơn lẻ của MiniCPM-RobotManip là khoảng 120ms, trong khi π0.5 là khoảng 234ms, con số của mô hình trước gần bằng một nửa so với mô hình sau.

"Chi phí giảm một nửa" ở đây chủ yếu thể hiện ở độ trễ suy luận và khối lượng tính toán.

Với mô hình trò chuyện, người dùng thường có thể đợi thêm một giây, nhưng với cánh tay robot, mỗi bước dừng lại một giây sẽ khiến chuyển động trở nên cứng nhắc và thời gian hoàn thành toàn bộ nhiệm vụ sẽ bị kéo dài.

Đối với VLA, khả năng xuất ra hành động tiếp theo một cách nhanh chóng trong điều kiện tính toán hạn chế cũng quan trọng không kém gì điểm số trên bảng xếp hạng.

VLARobotMiniCPMMã nguồn mởTrí tuệ hiện thân
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.