Mô hình
Mô hình thế giới giờ đã có xúc giác: Đột phá với 500.000 giờ video huấn luyện
(giờ Việt Nam)
Tóm tắt AI
Các nhà nghiên cứu vừa giới thiệu mô hình thế giới hành động ẩn đầu tiên có khả năng cảm nhận xúc giác, được huấn luyện từ kho dữ liệu khổng lồ lên tới 500.000 giờ video.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
28-07-2026 13:25:31 Nguồn: QbitAI
Henry đưa tin từ Aofei Temple
QbitAI | Kênh chính thức QbitAI
Vừa qua, BeingBeyond đã công bố mô hình hành động thế giới xúc giác ẩn đầu tiên dựa trên dữ liệu video con người—
Being-H0.8.
Là một bộ mô hình thế giới - hành động ẩn có tích hợp xúc giác, Being-H0.8 được huấn luyện để dạy robot cách phán đoán trước việc tiếp xúc với vật thể, đồng thời điều chỉnh hành động kịp thời dựa trên phản hồi xúc giác sau khi tiếp xúc thực tế.
So với các mô hình thế giới trước đây vốn quyết định hành động dựa trên hình ảnh, Being-H0.8 đã đưa xúc giác vào chu trình hoàn chỉnh gồm “dự đoán - thực thi - phản hồi”:
Mô hình dựa trên hình ảnh hiện tại để dự đoán trước các tiếp xúc có thể xảy ra, sau đó trong quá trình thực thi sẽ đọc dữ liệu xúc giác mới nhất để tái tạo phân đoạn hành động tiếp theo.
Cụ thể, để đạt được điều này, Being-H0.8 triển khai đồng thời trên ba tầng: dữ liệu, mô hình và điều khiển.
Dựa trên phương pháp này, Being-H0.8 đã thực hiện thành công các tác vụ tinh vi đòi hỏi xúc giác cao trong các thí nghiệm robot hai tay thực tế, như lấy đồ trong túi, viết thư pháp, nặn kem đánh răng và gắp khoai tây chiên.
Mô hình hành động thế giới xúc giác ẩn đầu tiên dựa trên dữ liệu video con người
Điểm đáng chú ý nhất của Being-H0.8 lần này chính là kiến trúc mô hình hành động thế giới xúc giác ẩn đầy sáng tạo và bộ dữ liệu khổng lồ lên tới hơn 500.000 giờ. Hãy cùng xem xét ở cấp độ mô hình.

Đối với các mô hình hiện thân (embodied models), xúc giác không chỉ liên quan đến các thao tác tinh vi mà còn giúp robot hoàn thành các suy luận tiếp xúc mà chỉ thị giác đơn thuần khó có thể thực hiện được.
Do đó, trong hai năm qua, giới học thuật đã có nhiều nghiên cứu xoay quanh việc làm thế nào để xúc giác hỗ trợ các mô hình nền tảng hiện thân, với sự tham gia của các nhà nghiên cứu như Lý Phi Phi (Fei-Fei Li), Từ Đan Phi (Danfei Xu), Wenzhen Yuan, Tống Thư Nhiên (Shuran Song), v.v.
Tuy nhiên, nếu chúng ta tập trung sâu hơn vào vấn đề mô hình thế giới, sẽ thấy rằng: làm thế nào để tích hợp xúc giác vào mô hình thế giới vẫn là một bài toán mở.

Một mặt, các mô hình thế giới hiện nay chủ yếu lấy thị giác làm cốt lõi. Chúng có thể quan sát vật thể di chuyển hay biến dạng, nhưng rất khó để phán đoán chính xác liệu tiếp xúc có xảy ra hay không, xảy ra ở đâu và vật thể đang chịu lực tác động như thế nào.
Mặt khác, dù cảm biến xúc giác rất đa dạng, nhưng định dạng dữ liệu và phương thức biểu diễn lại không thống nhất. Vấn đề thực tế hơn là đại đa số các tập dữ liệu video con người và robot quy mô lớn vốn không ghi lại đồng bộ thông tin xúc giác.
Điều này có nghĩa là, để huấn luyện một mô hình thế giới có khả năng xúc giác, chúng ta không chỉ thiếu các biểu diễn xúc giác thống nhất mà còn thiếu cả dữ liệu huấn luyện có thể mở rộng quy mô.
Being-H0.8 chính là lời giải mà BeingBeyond đưa ra cho vấn đề này.
Trên nền tảng mô hình thế giới - hành động ẩn Being-H0.7, Being-H0.8 lần đầu tiên đưa phương thức xúc giác vào biểu diễn không gian ẩn, mở rộng phương thức mô hình hóa vốn chủ yếu dựa trên dự đoán thị giác thành mô hình hành động thế giới xúc giác ẩn (Latent Tactile World-Action Model), đồng thời mở rộng việc huấn luyện trước xúc giác sang dữ liệu video con người góc nhìn thứ nhất có thể mở rộng quy mô.
Điểm mấu chốt ở đây là Being-H0.8 không cố gắng tái tạo hoàn chỉnh hình ảnh tương lai ở cấp độ pixel, mà dự đoán các hệ quả tương tác thực sự liên quan đến tác vụ trong không gian ẩn, chẳng hạn như liệu có xảy ra tiếp xúc hay không, tiếp xúc có thể mang lại thay đổi trạng thái nào, và sử dụng các trạng thái tiềm ẩn đã dự đoán để điều chỉnh việc tạo hành động.
Nói cách khác, Being-H0.8 cố gắng giúp robot không chỉ “nhìn thấy” điều gì sẽ xảy ra tiếp theo mà còn học được cách phán đoán ẩn về kết quả tiếp xúc và lực tác động từ các video con người không có chú thích xúc giác rõ ràng.

Cụ thể, Being-H0.8 bao gồm bốn mô-đun cốt lõi: Mixture of Transformers (MoT) chịu trách nhiệm dự đoán hệ quả tương tác, chuyên gia hành động chậm - nhanh chịu trách nhiệm thực thi và điều chỉnh thời gian thực, bộ mã hóa xúc giác tổng quát chịu trách nhiệm thống nhất đầu vào xúc giác, và TopoHand chịu trách nhiệm thống nhất không gian hành động.
Trong đó, bộ mã hóa xúc giác tổng quát trước tiên chuyển đổi các tín hiệu xúc giác thu thập được từ các cảm biến khác nhau thành các token xúc giác thống nhất, từ đó giảm thiểu sự khác biệt giữa các thiết bị và định dạng dữ liệu khác nhau.
Còn chuyên gia hành động chậm - nhanh chịu trách nhiệm cân bằng giữa hiệu suất suy luận và phản hồi tiếp xúc.
Nhờ đó, robot không cần phải tính toán lại toàn bộ kế hoạch mỗi khi nhận được thay đổi xúc giác, mà vẫn có thể điều chỉnh hành động kịp thời dựa trên sự trượt, thay đổi lực hoặc lệch tiếp xúc.
Trong giai đoạn huấn luyện, các token xúc giác ở thời điểm tương lai sẽ đi vào nhánh hậu nghiệm của MoT, giúp mô hình hiểu được trạng thái thế giới sẽ thay đổi như thế nào sau khi tiếp xúc thực tế xảy ra.
Đến giai đoạn triển khai, MoT chịu trách nhiệm dự đoán trước hệ quả tương tác, luồng chậm duy trì ngữ cảnh tổng thể, còn luồng nhanh thực hiện điều chỉnh sai lệch theo thời gian thực dựa trên dữ liệu xúc giác mới nhất.
Như vậy, xúc giác không còn chỉ là phản hồi bổ sung sau khi hành động hoàn tất, mà đã tham gia đồng thời vào quá trình “dự đoán, thực thi và điều chỉnh” của robot.
Kho dữ liệu hơn 500.000 giờ
Sau khi bàn về mô hình, một câu hỏi tự nhiên được đặt ra là: Vậy dữ liệu để huấn luyện mô hình đến từ đâu?
Đây là lúc cần đề cập đến một công việc quan trọng khác của Being-H0.8 — dữ liệu.
Là một trong những doanh nghiệp đầu tiên tại Trung Quốc sử dụng video con người quy mô lớn để huấn luyện trước các mô hình nền tảng hiện thân, BeingBeyond luôn kiên trì theo đuổi lộ trình huấn luyện trước bằng video con người để tích lũy dữ liệu và ứng dụng vào việc huấn luyện mô hình nền tảng hiện thân.
Nền tảng dữ liệu của Being-H0.8 chính là kết quả của quá trình tích lũy lâu dài theo lộ trình này.

Trải qua quá trình lặp lại liên tục từ Being-H0 đến Being-H0.8, BeingBeyond đã tập hợp được hơn 500.000 giờ dữ liệu video góc nhìn thứ nhất và hợp tác với hàng chục nhà cung cấp dữ liệu.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.