Mô hình
Bước ngoặt GPT-3 cho robot: Chỉ cần xem 3 giây là học được kỹ năng mới
(giờ Việt Nam)
Tóm tắt AI
Công nghệ robot mới cho phép máy móc sao chép hành động chỉ sau 3 giây quan sát, đánh dấu bước tiến đột phá trong khả năng tự học của AI.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
21/08/2026 15:17:58 Nguồn: QbitAI
Robot có thể học được chỉ sau 3 giây quan sát demo
Meng Yao đưa tin từ Aofei Temple
QbitAI | Tài khoản chính thức QbitAI
Cứu tôi với... Khoảnh khắc GPT-3 của giới robot, dường như đã thực sự đến rồi!?
Khả năng học một nhiệm vụ mới chỉ bằng cách xem vài ví dụ của GPT-3 năm nào, giờ đây đang được tái hiện trực tiếp trên robot—
Ngay cả với những công việc chưa từng học qua, chỉ cần cho robot xem một đoạn demo hành động dài 3-12 giây, giây tiếp theo nó đã có thể bắt tay vào làm ngay!!!

Thậm chí nó còn biết suy luận từ một ra ba.
Bạn dạy robot cầm chổi quét dọn, sau đó đổi chiếc chổi thành một quả chuối, nó vẫn thản nhiên cầm quả chuối đó để quét tiếp—

Vẫn chưa đủ ư? Vậy thì đưa thêm cho nó một cái hốt rác xem sao~
Nhìn kìa, lần này thậm chí còn chưa dạy thao tác hoàn chỉnh, nó đã tự mày mò ra cách phối hợp hai tay: một tay quét, một tay hứng, thật kỳ diệu:

Đây chính là mô hình nền tảng robot vừa được Generalist AI công bố — GEN-1.5.
Một mô hình robot tập trung vào One-shot Learning, thông qua việc tiền huấn luyện trên dữ liệu vật lý quy mô lớn, giúp robot nhanh chóng học được nhiệm vụ mới chỉ sau vài giây quan sát.
Ngoài ra, mô hình này còn có thể ghép hai đoạn demo giảng dạy khác nhau để học, xem trong trình mô phỏng một lần, quay sang thế giới thực là có thể bắt tay vào làm ngay.
Toàn bộ quá trình huấn luyện thậm chí có thể đạt mức 0 cập nhật gradient, 0 tinh chỉnh (fine-tuning).
Thậm chí, những khả năng này hoàn toàn không có ai cầm tay chỉ việc, mà là do mô hình tự "ngộ" ra trong quá trình tiền huấn luyện với Physical Data quy mô lớn...

Thế là xong, mô hình vừa ra mắt, cư dân mạng lập tức nhớ về thời điểm sáu năm trước:
Khoảnh khắc GPT-3 của giới robot, có lẽ đã thực sự đến rồi.

Prompt Engineering phiên bản vật lý đã xuất hiện: Robot có thể học được chỉ sau 3 giây quan sát demo!
Không biết mọi người còn nhớ không.
Một trong những khả năng của GPT-3 từng khiến người ta "sững sờ" năm nào, chính là In-Context Learning.
Cung cấp cho mô hình một hoặc vài ví dụ, nó không cần huấn luyện lại, chỉ cần nhìn vào ngữ cảnh là có thể tạm thời nắm bắt được cách thực hiện một nhiệm vụ mới.
Và điều mà Generalist làm lần này, chính là đá thẳng lối chơi đó vào "thế giới vật lý"—
GEN-1.5 là thế hệ mô hình nền tảng robot mới mà đội ngũ đã dày công tiền huấn luyện liên tục trong hơn 8 tháng.
Nền tảng vẫn là bộ khung cũ, tiếp tục "ngấu nghiến" dữ liệu tương tác vật lý trong thế giới thực, nhưng lần này một kỹ năng mới then chốt đã xuất hiện:
Những hành động vừa mới xảy ra cũng có thể đi vào Context (ngữ cảnh)!!!

Hãy lấy ví dụ về trò "Xếp chồng nắp cốc" dưới đây.
Con người demo trước 3-12 giây, trong suốt quá trình không hề có cập nhật gradient, cũng không có bất kỳ tinh chỉnh nào, GEN-1.5 sau khi xem xong đoạn Physical Prompt này, quay sang là có thể tự thực hiện.
Kiểu như bạn vừa demo xong, chú robot nhỏ liền đáp: Được thôi, mời bạn xem đây~
Thậm chí tôi đã tính toán sơ qua, từ lúc học kỹ năng đến khi hoàn thành nhiệm vụ, chỉ mất khoảng "nửa phút"???
Hơn nữa, điểm thần kỳ nhất của GEN-1.5 nằm ở chỗ, trong thế giới quan của GEN-1.5, các demo giảng dạy khác nhau thậm chí còn có thể "ghép lại để dùng"...
Ví dụ, cho nó xem đoạn hành động A, rồi xem tiếp đoạn hành động B, mô hình có thể tự kết nối hai kỹ năng thành một nhiệm vụ liên hoàn.
Những động tác kết nối ở giữa mà chưa ai từng demo, nó cũng phải tự mình giải quyết.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.