Mô hình
Dạy robot làm việc không chỉ cần 'cày' dữ liệu: Lingchu tập trung vào chất lượng để tối ưu hóa hành động
(giờ Việt Nam)
Tóm tắt AI
Lingchu giải quyết triệt để vấn đề lệch pha giữa hành động của con người và robot thông qua việc kiểm soát nghiêm ngặt chất lượng dữ liệu huấn luyện.
Chính văn · Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
Dạy robot làm việc, chỉ "cày giờ học" là chưa đủ! Linchen lần này chú trọng vào chất lượng dữ liệu.
24-09-2026 13:45:20 Nguồn: QbitAI
Chuyên trị lỗi lệch pha hành động giữa người và máy.
Yunzhong, đưa tin từ Aofeisi, QbitAI | Tài khoản chính thức QbitAI.
"Sự thị phạm của con người" để dạy robot làm việc, hóa ra không phải do con người thực hiện?
Hãy xem nhóm video đối chiếu này: một bên là thao tác bằng tay người, một bên là thao tác bằng tay máy. Thoạt nhìn, cứ tưởng con người làm trước một lần, rồi robot bắt chước theo. Nhưng trình tự lại hoàn toàn ngược lại — đoạn tay máy mới là bản ghi thực tế, còn đoạn tay người là do AI tạo ra dựa trên đó.
△ Psi-W0 chuyển đổi sự thị phạm của tay người thành quỹ đạo thao tác mà tay máy có thể thực hiện.
Để robot học theo con người, tại sao lại phải bắt đầu từ hành động của robot? Điều này nghe có vẻ vòng vo, nhưng lại chỉ ra một vấn đề rất thực tế: con người làm việc mỗi ngày, làm thế nào để truyền đạt những kinh nghiệm này cho robot?
Ngay tuần trước, Figure đã phát hành Helix 2.5, sử dụng tập dữ liệu hành vi con người Index để tiền huấn luyện. Sau khi hoàn tất việc thích ứng với ba loại tác vụ gia đình, họ đã đưa robot vào thử nghiệm tại 30 hộ gia đình chưa từng được thu thập dữ liệu.
Nghiên cứu này quan tâm đến việc liệu khả năng học hỏi từ kinh nghiệm con người có thể giúp robot đối phó với môi trường mới hay không.
Linchen Intelligence lần này đặt ra câu hỏi sâu hơn: Dữ liệu con người đưa vào mô hình không đồng nghĩa với việc kinh nghiệm thao tác của con người có thể được robot sử dụng trực tiếp. Vậy, còn thiếu điều gì ở giữa?
Trên nền tảng tích lũy dữ liệu hàng trăm nghìn giờ, mô hình Psi-R2.5 của Linchen Intelligence tiếp tục cải thiện chất lượng dữ liệu và phương pháp căn chỉnh dữ liệu người-máy, đồng thời thúc đẩy việc thích ứng với các tác vụ cụ thể. Nó không chỉ tập trung vào việc cho robot xem nhiều thao tác hơn, mà còn bao gồm cách biến những thao tác đó thành tài liệu huấn luyện hiệu quả, cũng như cách dạy robot dễ dàng hơn khi đối mặt với các tác vụ mới.
Và cách làm có vẻ vòng vo ở phần đầu, thực chất lại là để tránh đi đường vòng.
Dạy robot học theo người, lần này hãy làm ngược lại.
Con người và robot đều có thể cầm một chai Coca. Nhưng nếu đặt hai đoạn video "cầm Coca" cạnh nhau, liệu có thể dạy robot làm theo được không?
Trong đó vẫn tồn tại những vấn đề "cũ rích": tay người và tay máy không chỉ khác nhau về hình dáng, mà cấu trúc khớp và điều kiện ma sát khi tiếp xúc với vật thể cũng khác nhau. Cộng thêm sai số trong việc ước tính tư thế tay người, một hành động mà con người có thể hoàn thành suôn sẻ, khi chuyển đổi thành chuyển động khớp của robot, chưa chắc đã thành công.
Vì vậy, việc cho robot hiểu "đây là đang cầm Coca" và cung cấp một dữ liệu hành động "có thể cầm Coca theo cách này" là hai việc hoàn toàn khác nhau.
Linchen gọi dữ liệu mà con người và robot thực hiện các tác vụ tương tự, chủ yếu tương ứng về ý nghĩa tác vụ, là "dữ liệu ghép cặp yếu" (weakly paired data). Họ mong muốn đạt được một mối quan hệ tương ứng khác: ngoại trừ việc con người và robot là hai thực thể khác nhau, bối cảnh hai bên cơ bản là nhất quán, trình tự hành động tương ứng từng khung hình, và hành động phía robot có thể phát lại thành công trực tiếp trên máy thật, đây chính là "dữ liệu ghép cặp mạnh" (strongly paired data).
△ So sánh giữa cặp yếu (weak Pair) và cặp mạnh (strong Pair).
Dữ liệu ghép cặp mạnh nhấn mạnh vào sự căn chỉnh, không chỉ yêu cầu con người và robot "đều làm cùng một việc", mà là "đoạn thao tác này của con người tương ứng với đoạn hành động có thể thực thi này của robot".
Nhưng loại dữ liệu này rất khó thu thập trực tiếp.
Để con người và robot cùng làm một lần, rất khó đảm bảo bối cảnh và trình tự hành động tương ứng từng khung hình. Việc sao chép trực tiếp quỹ đạo của con người cũng chưa chắc thành công, vì cấu trúc khớp và điều kiện ma sát của cả hai không giống nhau.
Tháng 4 năm nay, Linchen đã thử nghiệm để Psi-R2 phối hợp với mô hình thế giới Psi-W0, thông qua suy diễn quỹ đạo và học tăng cường để chuyển đổi thao tác của con người thành dữ liệu robot có thể thực thi. Vấn đề là quy trình này liên quan đến sự phối hợp của nhiều mô hình và tối ưu hóa chiến lược, khiến quá trình sản xuất dữ liệu khá nặng nề.
Linchen đã khéo léo thay đổi hướng đi: Tại sao nhất thiết phải bắt đầu từ thao tác của con người, rồi mới tốn công tạo ra một hành động robot có thể thành công?
Ngược lại, hình ảnh và hành động từ thao tác thực tế của robot vốn dĩ đã có thể sử dụng được. Lấy chúng làm điểm khởi đầu để tạo ra dữ liệu con người tương ứng, chẳng phải sẽ có được một mẫu đối chiếu mới sao?
Theo hướng tư duy này, Linchen sử dụng ngược Psi-W0, bắt đầu từ dữ liệu robot thực tế để tạo ra dữ liệu thao tác tay người tương ứng, sau đó dùng dữ liệu ghép cặp chất lượng cao này để huấn luyện bộ chuyển đổi end-to-end. Đầu vào của bộ chuyển đổi này là dữ liệu thao tác của con người, còn đầu ra là hình ảnh và hành động robot tương ứng.
△ Video ghép cặp chất lượng cao giữa tay máy và tay người.
△ Chỉ cần dùng điện thoại ghi lại một đoạn video thao tác tay người trong bối cảnh hàng ngày, là có thể chuyển đổi thành dữ liệu robot tương ứng thông qua mô hình.
Cần phân biệt rằng, bộ chuyển đổi không phải là mô hình chiến lược quyết định bước tiếp theo của robot, mà là một mô hình chỉnh sửa video có đầu ra hành động. Việc nó cần làm không chỉ là thay thế tay người trong khung hình bằng tay máy, mà còn phải đồng thời thu được dữ liệu hành động mà robot có thể sử dụng.
Vậy làm sao để đánh giá việc chuyển đổi có hữu ích hay không?
Linchen thiết lập hai phương thức xác thực: một là phát lại trực tiếp quỹ đạo đã chuyển đổi trên robot để xem có hoàn thành được tác vụ tương tự hay không; hai là sử dụng dữ liệu đã chuyển đổi để hậu huấn luyện (post-training), rồi xem mô hình được huấn luyện có hoàn thành được các tác vụ liên quan hay không.
Tiêu chuẩn đánh giá không còn chỉ là "video tạo ra có giống hay không", mà là dữ liệu có hỗ trợ được thao tác thực tế hay không. Theo Linchen, dữ liệu sau chuyển đổi đã được xác thực trong hai loại thử nghiệm nêu trên. Tuy nhiên, một số tác vụ đặc biệt phức tạp vẫn chưa thể hoàn thành trực tiếp, việc chuyển đổi dữ liệu không đồng nghĩa với việc mọi tác vụ đều đã được giải quyết.
Theo hướng tư duy này, Psi-R2.5 cũng đã sắp xếp lại chất lượng của chính dữ liệu. Linchen giảm bớt sự chồng chéo lặp lại của cùng một tác vụ, tăng tính đa dạng của tác vụ, và thông qua đường ống gắn nhãn tự động, phân tách tác vụ thành các hành động nguyên tử chi tiết hơn, sau đó mới tiến hành gắn nhãn và kiểm duyệt.
Suy cho cùng, giá trị của dữ liệu không chỉ tính theo giờ, mà còn phải xem nó bao phủ được bao nhiêu loại tác vụ và robot có thể sử dụng được bao nhiêu.
△ Hiệu quả đánh giá đa tác vụ của Psi-R2.5.
Video cũng có thể trở thành prompt cho robot.
Nếu một đoạn thao tác của con người đã có thể chuyển đổi thành tài liệu tham khảo mà robot dễ sử dụng hơn, thì có lẽ nó cũng có thể có một công dụng khác: không chỉ đưa vào tập huấn luyện, mà còn có thể trở thành gợi ý cho tác vụ hiện tại.
Điều này cũng có nghĩa là không cần phải viết tất cả yêu cầu thành một đoạn chỉ dẫn dài, mà chỉ cần đưa cho robot một ví dụ — "làm theo cái này".
Đây là khả năng học trong ngữ cảnh (In-Context Learning, viết tắt là ICL) mà Linchen đang tiếp tục khám phá trong Psi-R2.5. Trong các tác vụ được trình diễn, robot không cần cập nhật tham số mô hình, mà dựa vào các manh mối được cung cấp trong ngữ cảnh hiện tại để suy luận xem nên làm gì và làm như thế nào.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.