‹ Quay lạiTinh chọnĐiểm AI 92/100
QbitAI
Tinh chọnĐiểm AI 92/100

Nghiên cứu

Sau GPT-6, tương lai robot thông minh đi về đâu? GLOW của Noein giúp robot 'học một biết mười'

(giờ Việt Nam)

Tóm tắt AI

Báo cáo kỹ thuật GLOW từ Noein cho thấy khả năng đột phá: chỉ cần con người làm mẫu một lần, robot có thể thực hiện và tái sử dụng tác vụ linh hoạt trong nhiều môi trường khác nhau.

Chính văn · Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

24/09/2026 16:20:12 Nguồn: QbitAI

Chỉ cần con người làm mẫu một lần, robot có thể tái sử dụng tác vụ trên các bối cảnh khác nhau

Từ trước đến nay, để robot học được một tác vụ mới, người ta thường phải thu thập lại dữ liệu, viết quy trình cố định hoặc thực hiện huấn luyện chuyên biệt. Những phương pháp này có thể giải quyết các tác vụ có tính xác định cao, nhưng khó bao phủ được các vật thể, môi trường và nhu cầu luôn thay đổi trong bối cảnh thực tế.

Gần đây, sự ra đời của mô hình lớn đa năng thế hệ mới GPT-6 Astra đã làm dấy lên những cuộc thảo luận và suy ngẫm sâu rộng trong ngành về lộ trình công nghệ trí tuệ hiện thân (Embodied AI). Nhiều quan điểm cho rằng, các mô hình lớn đa năng đang thể hiện khả năng điều khiển robot, có thể gây tác động đến các lộ trình trí tuệ hiện thân hiện có; đồng thời, ngành công nghiệp cũng dần hình thành sự đồng thuận: kiến trúc tự hồi quy (autoregressive) đang trở thành hướng hội tụ của kiến trúc mô hình, và cốt lõi cạnh tranh của trí tuệ hiện thân sẽ chuyển dịch sang dữ liệu và phương thức học tập.

Ngày 24 tháng 9, Knowin đã công bố báo cáo kỹ thuật về kiến trúc học tập tạo sinh GLOW dành cho trí tuệ hiện thân đa năng (Link báo cáo: https://knowinai.com/tech.html#section-2), giới thiệu toàn diện về kiến trúc kỹ thuật tổng thể được nâng cấp mới của GLOW, trình bày một lộ trình khả thi nhằm chuyển đổi khả năng nhận thức đa năng thành hành động vật lý đáng tin cậy, với đột phá cốt lõi là đạt được khả năng học tác vụ "dạy một lần là biết".

Báo cáo đề xuất rằng GLOW sẽ thay đổi cách robot học tác vụ mới: bằng cách hiểu toàn bộ thao tác của con người, môi trường hiện tại, trạng thái của chính robot và lịch sử thực thi trong cùng một chuỗi liên kết, giúp robot không chỉ "nhìn thấy" hình ảnh hành động, mà còn đồng thời nắm bắt được vật thể, mối quan hệ không gian, trình tự hành động và sự thay đổi trạng thái, từ việc "đã xem qua" tiến tới "đã học được", sở hữu khả năng tái sử dụng đa năng trên các vật thể, môi trường và tác vụ khác nhau.

Đồng thời, báo cáo cũng tiết lộ nhiều kết quả đánh giá của GLOW. Từ thực thi tác vụ vật lý đến hiểu bối cảnh hiện thân, Knowin đã liên tiếp giành ba vị trí dẫn đầu, khẳng định tính tiên phong của lộ trình công nghệ tự hồi quy mà họ kiên trì theo đuổi lâu nay: huấn luyện mô hình bằng kinh nghiệm vật lý quy mô lớn, phối hợp nhận thức và hành động bằng kiến trúc thống nhất, thích ứng với thay đổi môi trường bằng thực thi vòng lặp kín, từ đó tiến vào thế giới vật lý với năng lực hiện thân hoàn chỉnh.

"Dạy một lần là biết": Chỉ cần con người làm mẫu một lần, robot có thể tái sử dụng tác vụ trên các bối cảnh khác nhau.

Mục tiêu của GLOW là giúp robot đạt được năng lực hiện thân đa năng có thể tái sử dụng trên các vật thể, môi trường và tác vụ khác nhau, thay vì phải học riêng một bộ chiến lược cho mỗi tác vụ. Người dùng không cần phải phân tách nhu cầu thành các lệnh máy móc, cũng không bị giới hạn bởi danh sách chức năng có sẵn khi xuất xưởng. Robot có thể hiểu tác vụ thông qua một lần thao tác hoàn chỉnh, sau đó chuyển đổi hình ảnh, mối quan hệ vật thể, sự thay đổi trạng thái và phản hồi thực thi thành hành động. Từ việc mở hộp cất đồ, tưới cây, đến lau bàn, pha chế rượu và các công việc gia đình khác, năng lực này đều đã được kiểm chứng:

Mở hộp cất đồ: Thay hộp, thay vật phẩm, vẫn hoàn thành trọn vẹn các thao tác.

Mở hộp cất đồ bao gồm ba bước cốt lõi: mở nắp, đặt vật phẩm, đóng nắp. GLOW sẽ định vị nắp hộp, vật phẩm và khu vực bên trong hộp dựa trên hình ảnh thời gian thực, hoàn thành toàn bộ thao tác theo logic vận hành của con người. Thao tác của con người chỉ xác định mục tiêu tác vụ và trình tự thực hiện; khi thực thi thực tế, robot sẽ điều chỉnh tư thế và đường đi dựa trên kích thước hộp và vị trí vật phẩm tại hiện trường. Ngay cả khi thay đổi hộp hoặc vật phẩm khác, robot vẫn có thể hoàn thành việc cất đồ một cách trơn tru mà không cần dạy lại.

Tưới cây: Thay bình tưới, hành động vẫn có thể di chuyển chính xác.

Trong tác vụ tưới cây, con người dùng bình tưới vòi nhỏ màu đen để dạy, nhưng khi thực thi thực tế lại thay bằng bình tưới màu xanh, robot vẫn hoàn thành suôn sẻ. GLOW sẽ ánh xạ các logic cốt lõi như cách cầm nắm, góc nhắm, độ nghiêng trong quá trình con người làm mẫu sang dụng cụ mới trước mắt, từ đó tự điều chỉnh vị trí cầm nắm và tư thế hành động. Mỗi bước hoàn thành đều cập nhật trạng thái dựa trên hình ảnh thời gian thực, các hành động tiếp theo sẽ được điều chỉnh linh hoạt theo tình hình tại hiện trường.

Lau bàn: Người lau hình trái tim, robot cũng học được cách lau hình trái tim.

Trong tác vụ lau bàn, người dùng di chuyển khăn lau theo quỹ đạo hình trái tim; sau khi robot xem qua một lần, nó có thể tái hiện lại hành động lau hình trái tim tương tự. Điều này có nghĩa là GLOW không chỉ học được tác vụ "lau bàn", mà còn nắm bắt được đặc điểm thao tác cá nhân hóa là "lau như thế nào". Người dùng chỉ cần dạy một lần là có thể truyền đạt sở thích thao tác của mình cho robot, giúp robot hoàn thành việc nhà theo thói quen của chính mình.

Pha chế rượu: Quy trình phức tạp với nhiều ly và nhiều bước cũng có thể hoàn thành liên tục theo trình tự.

Đối với bối cảnh pha chế nhiều ly rượu, GLOW có thể nhận diện đối tượng thao tác, mối quan hệ rót và trình tự trước sau từ thao tác của con người, sau đó kết hợp với hình ảnh tại hiện trường để tìm đúng ly rượu tương ứng, hoàn thành trọn vẹn quy trình lấy ly, rót, dựng thẳng và đặt lại. Hành vi của con người chỉ cung cấp logic trình tự tác vụ, khi thực thi thực tế, robot sẽ tự động khớp với bối cảnh hiện tại, đảm bảo các tác vụ nhiều bước được tiến hành liên tục, không bị nhầm lẫn.

Phối hợp bốn mô-đun: Cấu thành chuỗi liên kết hoàn chỉnh từ học tập kinh nghiệm, hiểu tác vụ đến phản hồi hành động.

Đằng sau khả năng "dạy một lần là biết" là lộ trình kỹ thuật được nâng cấp hoàn toàn của GLOW. Bằng cách thống nhất năng lực Brain và Act ban đầu vào mô hình tự hồi quy đa phương thức KnowinGLOW, cho phép hiểu thị giác, suy luận không gian, lập kế hoạch tác vụ và tạo hành động được phối hợp hoàn thành trong cùng một mô hình; KnowinDream chịu trách nhiệm tạo kinh nghiệm tương tác vật lý, KnowinWorld dùng để mô phỏng kết quả có thể xảy ra từ hành động, còn KnowinAgent tổ chức thực thi xoay quanh bộ nhớ tác vụ, gọi công cụ, phản hồi và lập kế hoạch lại. Nhờ đó, GLOW hình thành chuỗi liên kết hoàn chỉnh từ học tập kinh nghiệm, hiểu tác vụ đến phản hồi hành động.

KnowinGLOW: Mô hình tự hồi quy đa phương thức thống nhất, tạo ra "bộ não cốt lõi" kết nối nhận thức và hành động.

Là trung tâm cốt lõi của toàn bộ kiến trúc, KnowinGLOW áp dụng thiết kế tự hồi quy thống nhất nguyên bản, tích hợp hiểu thị giác, phân tích ngữ nghĩa, suy luận không gian, lập kế hoạch tác vụ và tạo hành động vào cùng một mô hình, thay vì giải pháp ghép nối "mô-đun thị giác + mô-đun hành động". Việc hiểu và hành động chia sẻ chung một hệ thống biểu diễn, giúp kết nối trơn tru hơn, thông tin không bị hao hụt, đặt nền tảng kỹ thuật cho robot "dạy một lần, suy rộng ra nhiều".

KnowinDream: Công cụ tổng hợp kinh nghiệm hiện thân, giúp robot "thấy nhiều biết rộng".

KnowinDream lấy trải nghiệm tương tác hoàn chỉnh làm đơn vị huấn luyện, ghi lại trạng thái thế giới, quá trình hành động và hậu quả vật lý. Nó tổ chức điều kiện huấn luyện theo Home×Event×Future: Home định nghĩa thế giới nơi tương tác xảy ra, Event định nghĩa những thay đổi trong thế giới, Future triển khai kết quả sau khi robot thực hiện hành động. Đồng thời, nó còn thay đổi ánh sáng, chất liệu, kết cấu và bối cảnh, đưa tương tác vào các gia đình, góc máy ảnh và cấu hình robot khác nhau, giúp robot nhìn thấy đủ loại thế giới và thay đổi đa dạng ngay trong giai đoạn huấn luyện.

KnowinWorld: Suy diễn thế giới trong điều kiện hành động, giúp robot "học cách dự đoán".

Hiểu thế giới không chỉ bao gồm quyết định hành động đối với môi trường hiện tại, mà còn bao gồm dự đoán về hậu quả của hành động. Là đơn vị suy diễn quy luật vật lý, KnowinWorld có thể suy diễn các hành động ứng viên khác nhau dựa trên trạng thái hiện tại, suy diễn các ràng buộc vật lý như rủi ro va chạm, độ ổn định tiếp xúc, khả năng tiếp cận đường đi, từ đó đánh giá các hậu quả có thể xảy ra. Trong giai đoạn huấn luyện, nó có thể thay thế máy thật để hoàn thành lượng lớn suy diễn thử sai, giảm đáng kể chi phí huấn luyện; trong giai đoạn vận hành, nó có thể dự đoán rủi ro trước khi thực thi hành động, loại bỏ các đường đi không hiệu quả, vừa nâng cao tính an toàn khi thực thi tác vụ, vừa cải thiện hiệu quả ra quyết định.

KnowinAgent (Harness): Hệ thống vận hành tác vụ dựa trên ngữ cảnh, giúp các tác vụ dài hạn không bị "ngắt quãng".

Harness chịu trách nhiệm quản lý toàn bộ tiến độ tác vụ, phản hồi thực thi và điều chỉnh linh hoạt. Nó liên tục ghi lại các nút thực thi, nhận phản hồi thời gian thực, khi xuất hiện sai lệch có thể sửa chữa ngay tại chỗ trên tiến độ hiện tại mà không cần khởi động lại tác vụ từ đầu; khi tiếp cận các khu vực thao tác tinh vi như miệng chai, vành bát, tay nắm ngăn kéo, nó tự động chuyển sang chế độ tinh chỉnh nhỏ, vừa quan sát vừa hiệu chỉnh, đảm bảo các tác vụ dài hạn được hoàn thành một cách liên tục, ổn định và chính xác.

Dựa trên chuỗi liên kết này, sau khi người dùng hoàn thành một thao tác, hệ thống sẽ mã hóa toàn bộ quá trình thành thông tin kỹ năng có thể tái sử dụng. Khi thực thi tác vụ mới, mô hình không cần huấn luyện lại hoặc cập nhật tham số, mà kết hợp môi trường trước mắt, trạng thái robot, tiến độ tác vụ và phản hồi lịch sử để phán đoán bước tiếp theo trong thời gian thực. Thứ nó học không phải là cánh tay người đã đi qua những vị trí nào, mà là tác vụ cần đạt được mục tiêu gì, giữa các vật phẩm tồn tại mối quan hệ nào, và sau khi môi trường thay đổi thì nên tiếp tục hoàn thành tác vụ như thế nào.

Kiểm tra hiệu năng thực tế: Vượt qua GPT-6 trong nhiều bài đánh giá tác vụ hiện thân.

Báo cáo tiết lộ thành tích của GLOW trong các bài đánh giá như RoboDojo, LIBERO-Pro và Embodied Arena. Kết quả thực nghiệm cho thấy, GLOW không chỉ có khả năng hiểu bối cảnh vật lý mà còn có thể chuyển đổi sự hiểu biết này thành thực thi tác vụ hiệu quả. Trong thiết lập đánh giá của báo cáo này, GLOW đạt thành tích dẫn đầu trong nhiều bài đánh giá hiện thân chủ lưu quốc tế, thể hiện năng lực trong hiểu không gian, tương tác vật lý và thực thi tác vụ.

Tác vụ mô phỏng RoboDojo: Tỷ lệ thành công trung bình đứng vị trí thứ nhất.

Trong 18 tác vụ mô phỏng của RoboDojo, GLOW đạt tỷ lệ thành công trung bình 62,2% và điểm trung bình 71,1 điểm, cao hơn lần lượt 40 điểm phần trăm và 41,3 điểm so với đường cơ sở GPT-6 (Robocurve).

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Robot thông minhGLOWNoeinEmbodied AIHọc máy

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Sau GPT-6, tương lai robot thông minh đi về đâu? GLOW của Noein giúp robot 'học một biết mười' | AIHOT.vn