Mô hình
Mô hình Embodied AI hot nhất Thung lũng Silicon: Học ngay sau một lần xem, không cần hậu huấn luyện
(giờ Việt Nam)
Tóm tắt AI
Bước tiến đột phá của trí tuệ nhân tạo hiện thân (Embodied AI), đánh dấu thời khắc 'GPT' cho lĩnh vực robot học.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
Mô hình thể hiện (embodied model) hot nhất Thung lũng Silicon hôm nay! Không cần hậu huấn luyện (post-training), xem một lần là học được ngay.
26-08-2026 18:07:09 Nguồn: QbitAI
Trí tuệ thể hiện (Embodied AI) đang tiến tới khoảnh khắc GPT.
henry đưa tin từ QbitAI | Tài khoản chính thức QbitAI.
Bước tiến lớn của Trí tuệ thể hiện sắp xuất hiện!!!
Kể từ khi Generalist ra mắt Gen 1.5 - bộ não thể hiện có khả năng học các hành động từ 3 đến 12 giây vào tuần trước
Vừa mới đây, startup về trí tuệ thể hiện tại Bắc Mỹ là Skild AI đã công bố mô hình nền tảng robot hoàn toàn mới mang tên S1, trực tiếp nâng độ dài ngữ cảnh (context length) cho các tác vụ học tập của robot lên trên 10 phút.
Điểm nhấn của S1 lần này chính là khả năng học trong ngữ cảnh (in-context learning - ICL):
Không cần phải học các dữ liệu thao tác mới trong giai đoạn hậu huấn luyện, chỉ cần xem một đoạn video minh họa từ con người, robot có thể "bắt chước" và hoàn thành trực tiếp toàn bộ quy trình thao tác phức tạp mà nó chưa từng thấy trước đây.
Trong bản demo chính thức, robot đã hoàn thành các tác vụ dài hơi như làm bánh kếp, pha cà phê, thay chậu cho cây cảnh và lắp ráp thiết bị. Hơn nữa, đối với các tác vụ chưa từng gặp, tỷ lệ thành công đạt tới 66%, vượt xa so với VLA dựa trên gợi ý ngôn ngữ (chỉ đạt 9%).
Ngoài ra, ngay cả khi đi theo con đường tinh chỉnh (fine-tuning) hậu huấn luyện truyền thống, để đạt được hiệu quả tương đương với việc S1 chỉ cần xem một lần demo, người ta có thể phải nạp vào khoảng 380 lần minh họa tác vụ.
Thật kinh ngạc!
Có thể nói, làn sóng các công trình tập trung vào học trong ngữ cảnh gần đây đã thắp lại hy vọng về trí tuệ thể hiện cho rất nhiều người.
Một người dùng trên Twitter cho biết, robot đa năng có thể xuất hiện sau hai năm nữa, thay vì bảy năm như dự đoán.

Một số người dùng khác cũng bày tỏ, từ Rhoda, đến Generalist tuần trước, và giờ là tác vụ 10 phút của Skild S1, khoảnh khắc GPT thực sự của robot dường như đang dần xuất hiện.

Bởi vì một khi khả năng này thực sự được phổ quát hóa, việc phát triển các kỹ năng cho robot trong tương lai có thể sẽ trở nên giống như việc viết Prompt cho ChatGPT vậy.

Liệu có thực sự thần kỳ đến thế? Hãy cùng chúng tôi tìm hiểu.
Từ kỷ nguyên BERT, tiến tới kỷ nguyên GPT.
Để hiểu rõ khả năng học trong ngữ cảnh của S1 lần này rốt cuộc là như thế nào, trước hết chúng ta phải xem cách robot truyền thống học một kỹ năng mới ra sao.
Trong quy trình (pipeline) truyền thống, việc học của robot thực tế khá giống với các mô hình ngôn ngữ lớn (LLM):
Đầu tiên là tiền huấn luyện (pre-training) trên dữ liệu khổng lồ để học các khả năng cơ bản; sau đó khi đến các tình huống cụ thể, sẽ thu thập dữ liệu cho một tác vụ nhất định và thông qua hậu huấn luyện để giúp robot học các kỹ năng chuyên biệt.

Chỉ có điều vấn đề nằm ở chỗ, dù quy trình của robot và mô hình lớn khá giống nhau, nhưng chi phí dữ liệu lại hoàn toàn khác biệt.
Dữ liệu tiền huấn luyện của các mô hình lớn phần lớn đến từ Internet; ngay cả khi đến các lĩnh vực chuyên biệt như lập trình hay Agent, nhiều dữ liệu hậu huấn luyện cũng có thể thu được nhanh chóng trên mạng, thậm chí là tự động tạo ra.
Nhưng với robot thì lại khá chật vật. Dữ liệu tiền huấn luyện phải được thu thập trong thế giới thực, và dữ liệu hậu huấn luyện cũng vẫn phải thu thập trong thế giới thực.
Vì vậy, trong blog kỹ thuật của mình, Skild AI đã thẳng thắn chia sẻ:
Nếu một mô hình nền tảng robot vẫn cần hàng chục, hàng trăm giờ dữ liệu thực tế để học mỗi tác vụ mới, rồi lại phải hậu huấn luyện lại từ đầu, thì tôi xin hỏi, "mô hình nền tảng" này có nền tảng ở đâu?
Họ thậm chí còn trích dẫn các nghiên cứu hiện có để chỉ ra rằng, nếu dữ liệu cho một tác vụ mới đã đủ nhiều, thì một mô hình được huấn luyện từ con số 0 thậm chí có thể bắt kịp mô hình nền tảng đã qua tiền huấn luyện và tinh chỉnh.
Vậy, ý nghĩa thực sự của tiền huấn luyện trong trí tuệ thể hiện là gì?
Đối với vấn đề này, câu trả lời mà Skild đưa ra là: Học trong ngữ cảnh (in-context learning).
Để có một hệ quy chiếu, Skild đã lấy lộ trình phát triển của các mô hình lớn ra làm đối chứng.
BERT thời kỳ đầu đã rất mạnh, nhưng mỗi khi gặp một tác vụ mới, thường vẫn phải chuẩn bị lại dữ liệu và tinh chỉnh thêm một lần nữa.
Điều thực sự thay đổi cuộc chơi chính là khả năng học trong ngữ cảnh dần xuất hiện sau GPT-3:
Không cần thay đổi trọng số mô hình, chỉ cần đưa ra vài ví dụ trong Prompt, mô hình có thể tạm thời "học" được một tác vụ mới.

Dựa trên điều này, Skild cho rằng robot hiện vẫn đang bị mắc kẹt trong kỷ nguyên BERT, và điều họ thực sự muốn là giúp robot hoàn thành một cuộc chuyển đổi mô hình tương tự.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.