Mô hình
Generalist AI ra mắt GEN-1.5: Mô hình robot học tác vụ mới chỉ từ 3-12 giây demo
(giờ Việt Nam)
Tóm tắt AI
GEN-1.5 là mô hình nền tảng cho robot có khả năng học tác vụ mới thông qua ngữ cảnh mà không cần tinh chỉnh. Mô hình đạt tỷ lệ thành công 59% chỉ với một lần demo và tăng lên 83% sau khi cập nhật nhẹ, mở ra bước tiến lớn trong tự động hóa.
Bản dịch AI

Generalist AI vừa ra mắt GEN-1.5, một mô hình nền tảng (foundation model) cho robot có khả năng học một tác vụ vật lý mới chỉ từ một lần trình diễn duy nhất. Chỉ cần đưa 3–12 giây dữ liệu cảm biến-vận động (sensorimotor) vào cửa sổ ngữ cảnh 30 giây của nó, robot sẽ thực hiện tác vụ đó. Không cần cập nhật gradient, không cần tinh chỉnh (fine-tuning), không cần lập trình riêng cho từng tác vụ. Trên 10 tác vụ thao tác đa dạng, phương pháp nhắc lệnh trong ngữ cảnh (in-context prompting) một lần này đạt tỷ lệ thành công trung bình 59% (độ lệch chuẩn ±10%) ngay từ mô hình tiền huấn luyện. Mười bước gradient trên năm phút dữ liệu cho mỗi tác vụ đã nâng tỷ lệ này lên 83% (±9%). Generalist gọi cơ chế này là "nhắc lệnh vật lý" (physical prompting) và khẳng định họ chưa từng huấn luyện mô hình cho việc này: không thay đổi kiến trúc, không có vòng lặp meta-learning, không có mục tiêu phụ trợ. Khả năng này xuất hiện sau hơn tám tháng tiền huấn luyện liên tục trên dữ liệu tương tác vật lý. Các tác vụ này đơn giản và có phạm vi ngắn, và công ty cũng thừa nhận điều đó một cách thẳng thắn. Tuy nhiên, đây là mô hình đầu tiên mà đội ngũ của họ biết đến, nơi khả năng học kỹ năng vật lý chỉ sau một lần thử (one-shot learning) đã xuất hiện ở quy mô lớn.
Liệu nó có thể triển khai thực tế không?
Chưa — đây là bản phát hành phục vụ nghiên cứu. Hiện chưa có trọng số công khai, chưa có API, chưa có trang giá và chưa có sản phẩm tự phục vụ. Generalist AI vận hành GEN-1.5 trên đội ngũ robot và công cụ dữ liệu của riêng họ. Bất kỳ ai muốn sử dụng ngay lúc này đều phải thông qua quan hệ đối tác trực tiếp.
GEN-1.5 là gì?
GEN-1.5 là một mô hình đa phương thức lớn (large multimodal model) tiếp nhận đầu vào từ video, cảm biến, ngôn ngữ và cảm thụ bản thể (proprioceptive), lưu giữ bộ nhớ trong 30 giây và phát ra các quỹ đạo hành động ở tần số 100 Hz. Nó đã được tiền huấn luyện liên tục trong hơn tám tháng trên dữ liệu tương tác vật lý thu thập tại các hộ gia đình, nhà kho và nhà máy.
Cơ chế chính là nhắc lệnh vật lý. Một ví dụ về cảm biến-vận động — bao gồm các luồng cảm biến cộng với quỹ đạo hành động — được đưa vào cửa sổ ngữ cảnh 30 giây thông qua giao diện kéo-thả. Phần còn lại của cửa sổ chứa các quan sát luân phiên. Sau đó, mô hình thực hiện tác vụ ngay lập tức mà không cần bước gradient nào và không cần tinh chỉnh.
Điều quan trọng là, không có yếu tố nào trong số này được thiết kế từ đầu. Generalist tuyên bố không có thay đổi kiến trúc nào để thúc đẩy học trong ngữ cảnh, không có vòng lặp meta-learning và không có mục tiêu phụ trợ nào khuyến khích sự ứng biến. Khả năng này xuất hiện từ quy mô tiền huấn luyện, giống như cách mà khả năng nhắc lệnh một lần (one-shot prompting) xuất hiện trong GPT-3.
Các con số
Trên 10 tác vụ đa dạng, phương pháp nhắc lệnh trong ngữ cảnh một lần đạt tỷ lệ thành công trung bình 59% (độ lệch chuẩn ±10%) từ mô hình tiền huấn luyện mà không cần bất kỳ quá trình huấn luyện nào. Mười bước gradient trên năm phút dữ liệu mỗi tác vụ — tương đương khoảng 50 lần trình diễn — đã nâng tỷ lệ đó lên 83% (±9%). Trong trường hợp cực đoan, một bước gradient trên một phút dữ liệu đạt 66,5% trên một tác vụ chưa từng thấy, mà không cần quét siêu tham số thích ứng cụ thể.
Câu chuyện về tính toán mới là phần thú vị. Việc thích ứng các chính sách robot thường tiêu tốn hàng chục nghìn bước gradient. Ở đây, mười bước chỉ làm thay đổi trọng số mô hình trên các tác vụ chưa từng thấy dưới 0,15%, cho thấy việc tinh chỉnh chỉ là cấu hình lại kiến thức mà mô hình đã có thay vì xây dựng các biểu diễn mới. Generalist coi đây là quá trình huấn luyện tại thời điểm kiểm thử (test-time training) trong môi trường cực kỳ ít dữ liệu.
Ba kết quả chuyển đổi đáng chú ý
Khả năng tổng quát hóa cũng xuất hiện sau khi tinh chỉnh nhẹ. Sau khi được huấn luyện trong năm phút về việc dùng chổi quét một khối gỗ vào bát, mô hình đã sử dụng một quả chuối như chiếc chổi tạm thời, và dùng hốt rác để nâng và đổ khối gỗ thay thế — một trình tự tiếp xúc hoàn toàn khác. Nó cũng tự loại bỏ một tờ giấy che trên bát và làm việc khéo léo bằng cả hai tay khi các bản trình diễn trước đó chỉ sử dụng một tay.
Trình giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem bài viết nghiên cứu về GEN-1.5 và chuỗi thông báo của @GeneralistAI. Đừng ngần ngại ghé thăm trang GitHub của chúng tôi để xem các hướng dẫn, mã nguồn và Notebook.
Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter, đừng quên tham gia cộng đồng 150k+ ML SubReddit và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo công chúng. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.