Thủ thuật
Unitree tăng vọt 629% cùng ngày ra mắt GEN 1.5: Phải chăng 'thời khắc ChatGPT' của robot đã đến?
(giờ Việt Nam)
Tóm tắt AI
Việc Unitree tăng giá sốc ngay khi trình làng GEN 1.5 được ví như 'đêm trước của ChatGPT' trong ngành robot, báo hiệu bước ngoặt bùng nổ cho trí tuệ nhân tạo hiện thân.
Bản dịch AI

Mọi người luôn đánh giá quá cao sự thay đổi trong hai năm tới, và đánh giá quá thấp sự thay đổi trong mười năm tới.

👦🏻 Tác giả: DeKox
🥷 Biên tập: Koji
🧑🎨 Dàn trang: NCon
Ngày 19 tháng 8, tại Thượng Hải, Unitree đã ra mắt trên thị trường STAR Market, tăng vọt tới 629% trong phiên — các thị trường vốn đang đặt cược tất tay vào "thân xác" của robot.
Cùng ngày hôm đó, ở phía bên kia đại dương, tại văn phòng của Generalist ở Cambridge, Massachusetts, một robot hai tay vừa quan sát vài giây thao tác của con người: mở ví, lấy tiền mặt ra.
Đến lượt nó. Tay phải vươn tới — trượt.
Nó không hề bị đơ, không lặp lại máy móc cùng một chuyển động, cũng không chờ đợi lập trình viên can thiệp. Thay vào đó, nó đã làm một việc nhỏ để lại ấn tượng mạnh mẽ cho các phóng viên có mặt: chuyển sang tay trái và lấy được tiền ra.
Đây là những gì phóng viên Will Knight của WIRED đã chứng kiến tại chỗ[1]. Bản demo tương tự còn có nhiều ví dụ về khả năng "thích nghi ngay lập tức": khi được chỉ cách dùng chổi quét các khối vào bát, và chiếc chổi bị lấy đi, nó đã chộp lấy cái hốt rác thay thế; khi chỉ còn lại một quả chuối trước mặt, nó đã dùng quả chuối làm chiếc chổi tạm thời.

Một con số đáng chú ý: robot này đang chạy mô hình mới GEN-1.5, với tỷ lệ thành công trung bình chỉ 59% trên các tác vụ mới; trong khi phiên bản tiền nhiệm, GEN-1, đạt mức 99%+.
Tại sao lại coi trọng một mô hình có tỷ lệ thành công "lao dốc"? Bởi vì thứ thực sự thay đổi không phải là độ tin cậy — mà là chi phí biên để học một tác vụ mới, lần đầu tiên bắt đầu tiến gần về mức bằng không.
Và đó là nguồn gốc của câu hỏi trong tiêu đề: Thời khắc "ChatGPT của ngành robot" có lẽ thực sự đã cận kề.
01 Robot cuối cùng đã có "câu lệnh" (prompt) của riêng mình
Ngày 19 tháng 8, Generalist đã phát hành mô hình nền tảng robot thế hệ tiếp theo, GEN-1.5.
Chúng tôi đã sử dụng AI để tạo ra hai hình ảnh nhằm giúp mọi người hiểu rõ hơn về GEN-1.5:

Điều quan trọng nhất về GEN-1.5 — một người thực hiện thao tác mở ví và lấy tiền mặt một lần, và vài giây chuyển động đó trở thành một dải phim mà robot "đọc" bằng mắt — chính là đại diện cho chuỗi cảm biến-hành động được đặt vào cửa sổ ngữ cảnh (context window).
Hãy chú ý đến nơi dải phim đi vào: nó không đi vào bất kỳ quy trình huấn luyện nào để viết lại các tham số mô hình. Thay vào đó, giống như việc dán một ví dụ vào khung chat, nó nằm lại trong "cuộc hội thoại".
Nắm bắt được điều này, bạn sẽ hiểu sự khác biệt cốt lõi giữa Physical Prompting (Câu lệnh vật lý) và các phương pháp truyền thống: trước đây là "viết lại bộ não", còn bây giờ là "chỉ cho nó thấy một lần".

Physical Prompting có ba bước. Bước một: con người thực hiện thao tác "quét các khối lại với nhau bằng chổi" một lần, với đồng hồ bấm giờ nhắc nhở bạn rằng chi phí chỉ mất 3–12 giây. Bước hai: thao tác này được mã hóa thành một chuỗi cảm biến-hành động, chèn như một dải phim vào "cửa sổ ngữ cảnh" của robot. Bước ba: robot thực hiện ngay tại chỗ.
Chi tiết thú vị nhất nằm ở khung hình thứ ba: các khối trước mặt nó đã thay đổi màu sắc, thay đổi cách sắp xếp — chúng không giống hệt với cảnh demo. Điều này cho thấy robot không phải đang sao chép một đoạn video, mà là đang sao chép "chính tác vụ đó".
Hãy nhìn vào ba bộ số liệu từ bài viết kỹ thuật chính thức của Generalist[2]:
Tháng 4 vừa qua, GEN-1 đã kể một câu chuyện công nghiệp: nạp khoảng một giờ dữ liệu cho một tác vụ, thực hiện hậu huấn luyện, đánh bóng tỷ lệ thành công lên 99%+ — giống như đào tạo một công nhân mà các chuyển động luôn đạt chuẩn.
GEN-1.5 đã thực hiện một sự đánh đổi hoàn toàn khác: không cập nhật tham số, không huấn luyện lại, chỉ cần một lần demo kéo dài 3–12 giây, và nó có thể bắt đầu thực hiện một tác vụ chưa từng thấy trước đây. Generalist gọi phương pháp này là Physical Prompting: không phải lập trình viên viết kịch bản chuyển động cho robot, không phải huấn luyện lại cho mỗi công việc, mà con người làm mẫu một lần, và robot đặt chuỗi cảm biến-hành động này vào cửa sổ ngữ cảnh khoảng 30 giây, hiểu ngay tại chỗ giống như một mô hình lớn đọc các ví dụ few-shot. Nếu bạn sẵn sàng dành thêm 5 phút, thực hiện khoảng 50 lần demo, cộng thêm 10 bước gradient, tỷ lệ thành công sẽ tăng lên 83%.
GEN-1 đã giải quyết bài toán "liệu robot có thể làm chủ một thứ"; GEN-1.5 cố gắng giải quyết bài toán "liệu robot có thể học ngay lập tức một thứ mới".
02 Tại sao 59% có thể quan trọng hơn 99%
Thoạt nhìn, thật khó để liên tưởng 59% với "đột phá".
Nhưng thứ quyết định hình thái của ngành công nghiệp robot chưa bao giờ là tỷ lệ thành công tại một điểm đơn lẻ — mà là "hàm chi phí của việc thêm một tác vụ mới".
Mức 99% của GEN-1 đại diện cho khả năng "mài giũa một tác vụ thành một quy trình vận hành tiêu chuẩn (SOP) có độ tin cậy cao", với tư duy gần giống các nhà máy tự động hóa: ít tác vụ, độ ổn định cực cao;
Mức 59% của GEN-1.5 đại diện cho khả năng "biến một tác vụ lạ lẫm thành thứ có thể thử nghiệm", giống như một người học việc: làm đúng sơ bộ trước, sau đó cải thiện dần qua thực hành.
Và nhu cầu thực tế không bao giờ chỉ là 10 tác vụ — mà là 100.000 tác vụ đuôi dài (long-tail). Rào cản lớn nhất đối với việc triển khai robot trong những năm gần đây không phải là một số tác vụ không thể thực hiện được, mà là mỗi tác vụ thêm vào đều đòi hỏi phải trả phí lại từ đầu: dữ liệu đắt đỏ, huấn luyện đắt đỏ, triển khai đắt đỏ, bảo trì đắt đỏ — cuối cùng là "có thể làm được, nhưng không có hiệu quả kinh tế về quy mô". Khi chi phí học tập giảm xuống mức "học bằng cách quan sát", robot mới có cơ hội đảm nhận những tác vụ nhỏ trong dịch vụ, sản xuất và gia đình mà không ai muốn viết chương trình chuyên biệt cho chúng.
Chúng ta thực sự đã thấy con đường này một lần trước đây: các mô hình lớn đã chuyển phần mềm từ "viết quy tắc cho mọi tác vụ" sang "đưa ra một câu lệnh, vài ví dụ và thích nghi ngay tại chỗ".
Giờ đây, cơ chế tương tự đang chuyển từ thế giới văn bản sang thế giới vật lý.
03 Đây không phải là robot one-shot đầu tiên
Khả năng bắt chước one-shot (học một lần) trong robot học không phải mới xuất hiện hôm nay:
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.