Mô hình
Startup tham chiến mảng Embodied ICL: Khi ngữ cảnh trở thành đường đua Scaling mới
(giờ Việt Nam)
Tóm tắt AI
Các startup đang tập trung phát triển khả năng học trong ngữ cảnh (ICL) cho robot, giúp chúng xử lý dữ liệu đa phương thức dài hơn để thực hiện các tác vụ phức tạp.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
06/09/2026 19:44:21 Nguồn: QbitAI
Giúp robot học cách tận dụng Context đa phương thức dài hơn
Heng Yu, đưa tin từ trụ sở QbitAI | Tài khoản chính thức QbitAI
Năm 2020, GPT-3 đã làm chấn động giới NLP nhờ khả năng "chỉ cần xem vài ví dụ là thực hiện được nhiệm vụ mới"; sáu năm sau, câu chuyện tương tự đang diễn ra trong lĩnh vực trí tuệ nhân tạo hiện thân (Embodied AI).
Đúng vậy, đó chính là In-Context Learning (Học trong ngữ cảnh).
Giữa tháng 8, Skild AI đã ra mắt mô hình nền tảng cho robot mang tên S1. Chỉ cần cho robot xem một video minh họa nhiệm vụ, nó có thể thử thực hiện các nhiệm vụ mới chưa từng được huấn luyện trước đó mà không cần tinh chỉnh (fine-tuning) hay thực hiện thêm bất kỳ bước post-training nào. Thời lượng nhiệm vụ có thể kéo dài tới 10 phút, bao gồm hàng chục bước thao tác.
Skild đã so sánh ICL video Prompt với VLA (Vision-Language-Action) sử dụng ngôn ngữ Prompt truyền thống trên cả những nhiệm vụ đã thấy và chưa thấy trong dữ liệu huấn luyện.
Kết quả kiểm tra cho thấy, khi dữ liệu huấn luyện chỉ có 1000 giờ, ngôn ngữ Prompt mang lại hiệu quả tốt hơn, nhưng khi quy mô dữ liệu tăng lên, ICL bắt đầu vượt lên. Đối với các nhiệm vụ chưa từng thấy, sau khi thêm ngữ cảnh video, hiệu suất của mô hình cải thiện khoảng 7 lần so với việc chỉ sử dụng chỉ dẫn bằng ngôn ngữ.
Một tuần trước khi S1 ra mắt, Generalist AI đã công bố GEN-1.5, cũng lấy One-Shot Learning làm năng lực cốt lõi. Robot chỉ cần xem một lần minh họa là có thể học nhiệm vụ mới trong vài giây mà không cần cập nhật gradient hay tinh chỉnh, đồng thời hỗ trợ từ minh họa của con người đến thực thi của robot, tổng quát hóa kết hợp và chuyển đổi Sim-to-Real.
Cả hai bước tiến này đều đang nỗ lực giúp robot học cách tận dụng Context đa phương thức dài hơn.
Con đường In-Context Learning (ICL) đã được kiểm chứng trong lĩnh vực LLM và trở thành một mắt xích vô cùng quan trọng.
Năm 2020, OpenAI đã đề xuất ICL trong bài báo "Language Models are Few‑Shot Learners" của GPT-3, định nghĩa nó là một năng lực – không cần thực hiện bất kỳ cập nhật tham số nào cho mô hình (không tinh chỉnh, không huấn luyện lan truyền ngược), chỉ cần cung cấp một số ví dụ nhiệm vụ (demonstrations/examples) trong prompt đầu vào, mô hình có thể nhận diện và thực hiện nhiệm vụ mới đó ngay trong một lần suy luận (forward inference).

Trong ba năm qua, ngữ cảnh đã mở rộng từ 4K lên 1M, cho phép mô hình xử lý trọn vẹn một cuốn sách hoặc một kho mã nguồn cùng lúc, và động cơ chính đằng sau đó chính là ICL.
Khác với LLM, các mô hình hiện thân phải đối mặt với ngữ cảnh phức hợp đan xen giữa quan sát thị giác, chỉ dẫn ngôn ngữ và chuỗi hành động, hơn nữa các nhiệm vụ thực tế là phi Markov – "việc cần làm tiếp theo" phụ thuộc vào "những gì đã làm vài phút trước".
Nói một cách đơn giản, ngữ cảnh mà mô hình hiện thân phải đối mặt là hàng chục khung hình quan sát thị giác mỗi giây, cộng với trạng thái cơ thể và chuỗi hành động, lượng thông tin cao hơn vài bậc độ lớn.
Phải đến ngày 16 tháng 7 năm nay, RoboTTT – mô hình chiến lược ngữ cảnh dài và phương án huấn luyện cho robot do Lý Phi Phi (Fei-Fei Li), Jim Fan, Yuke Zhu và các cộng sự đồng tác giả – mới lần đầu tiên đưa lộ trình "scaling ngữ cảnh" vào chiến lược thị giác-vận động của robot một cách hệ thống.
Tháng 8, Generalist và Skild lần lượt công bố thành quả.
Mặc dù hai công ty chỉ trình diễn hiệu quả mô hình dưới dạng công bố thành quả và chưa công khai đầy đủ chi tiết kỹ thuật, nhưng trong lĩnh vực hiện thân, các cuộc thảo luận về ICL đã ngay lập tức tăng vọt.
Liệu con đường này có thực sự khả thi trong lĩnh vực hiện thân hay không còn phụ thuộc vào một loạt các vấn đề kỹ thuật chưa được giải quyết.
Chính vì vậy, chúng tôi nảy sinh sự tò mò cụ thể hơn:
Nếu trí tuệ nhân tạo hiện thân thực sự muốn tiếp tục tiến xa hơn dọc theo hướng Long Context và ICL, thì robot rốt cuộc phải hiểu ngữ cảnh phức tạp như vậy bằng cách nào?
Các minh họa, ngôn ngữ, lịch sử hành động, thậm chí là sự điều chỉnh từ con người, sẽ được đưa vào mô hình như thế nào?
Vì vậy, chúng tôi đã tìm đến COCO Matrix, một công ty khởi nghiệp trong nước chuyên tâm biến In-Context Learning thành mô hình nền tảng cho trí tuệ nhân tạo hiện thân.
Công ty này được thành lập vào tháng 4 năm 2026.
Tuy nhiên, nhà sáng lập kiêm CEO Cao Vũ Tường (Gao Yuxiang) cho tôi biết, khi thảo luận sâu về các vấn đề khởi nghiệp vào tháng 1 năm nay, anh và người đồng sáng lập đã nhất trí rằng đây là thời điểm để bắt đầu đặt cược vào ICL.
Cao Vũ Tường năm nay 30 tuổi, xuất thân từ lớp tài năng trẻ của Đại học Giao thông Tây An, bỏ dở chương trình Tiến sĩ tại Đại học Johns Hopkins (JHU), trong thời gian học anh đã thực hiện nghiên cứu về tương tác người-máy.
Cao Vũ Tường cho biết, khi GPT-3 thể hiện năng lực học trong ngữ cảnh, anh – lúc đó vẫn đang học Tiến sĩ tại JHU – đã suy nghĩ liệu năng lực "không cập nhật tham số, chỉ cần xem ví dụ là biết làm nhiệm vụ mới" này có thể chuyển sang cho robot hay không?
Năm năm sau đó, anh bỏ học, về nước khởi nghiệp, gia nhập ngành công nghiệp và khởi nghiệp lần nữa.
Trong thời gian này, Cao Vũ Tường đã dẫn dắt đội ngũ tại Fourier thiết lập toàn bộ chuỗi liên kết từ điều khiển từ xa (teleoperation), thu thập dữ liệu đến triển khai mô hình cho robot hình người toàn diện, và từ tháng 5 đến tháng 8 năm 2025, với chi phí hơn một triệu, anh đã huấn luyện thành công mô hình thế giới có khả năng tổng quát hóa nhất định trên robot hình người hai chân toàn diện.

https://about.yuxiang.io/
Tháng 4 năm nay, COCO Matrix chính thức thành lập, bắt đầu biến những vấn đề mà anh đã tiếp cận từ khi còn ở trường đại học thành định hướng khởi nghiệp.
Khác với Generalist và Skild, tư duy của COCO Matrix là đưa ICL từ giai đoạn hậu huấn luyện (post-training) lên giai đoạn tiền huấn luyện (pre-training).
Vì vậy, xoay quanh các tiến bộ kỹ thuật, khó khăn khi triển khai và những tranh cãi trong ngành về ICL hiện thân, tôi đã có một cuộc đối thoại chuyên sâu với Cao Vũ Tường tại Thượng Hải.
(Dưới đây là nội dung ghi chép cuộc đối thoại, đã được lược bớt và chỉnh sửa đôi chút mà không làm ảnh hưởng đến ý nghĩa gốc)
Tại sao trí tuệ nhân tạo hiện thân cần thay đổi lộ trình Scaling?
QbitAI: Trong một thời gian dài, trí tuệ nhân tạo hiện thân đều đi theo con đường Scale dữ liệu của các mô hình lớn. Tại sao mọi người tin rằng chỉ cần chồng chất thêm dữ liệu là có thể Scale được năng lực của robot?
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.