elsewhere:
65

Thủ thuật

FreesFund đối thoại cùng Yuanlu Tech: Khi robot làm thí nghiệm và bước ngoặt hiệu suất của AI for Science

(giờ Việt Nam)

Tóm tắt AI

Cuộc đối thoại giữa FreesFund và Yuanlu Tech thảo luận về tác động của robot tự động hóa trong phòng thí nghiệm và cách công nghệ này tạo ra bước ngoặt về hiệu suất cho lĩnh vực AI for Science.

Bản dịch AI

When Robots Start Running Experiments, AI for Science Hits an Inflection Point | A Conversation with Wenzhao Lian of Yuanluo Technology

Tháng 8 vừa qua là một tháng đầy sự kiện đối với ngành công nghiệp robot: Hội nghị Robot Thế giới (WRC) và Giải đấu Robot Hình người (Humanoid Robot Games) đã được tổ chức liên tiếp tại Bắc Kinh, và Unitree đã chính thức niêm yết trên thị trường STAR Market. Trước khi những tiếng vang này kịp lắng xuống, Ủy ban Cải cách và Phát triển Quốc gia đã đưa ra cảnh báo về việc "ngăn chặn tình trạng chạy theo phong trào và tâm lý đám đông một cách mù quáng". Giữa những lời tung hô và sự thận trọng, một câu hỏi đã trở nên cấp thiết: chính xác thì ngành công nghiệp này đang đứng ở đâu?

Chúng tôi đã mời trở lại một vị khách quen thuộc: Wenzhao Lian, nhà sáng lập của Yuanluo Technology. Khi ông trò chuyện với Feng Li hai năm trước, lĩnh vực robot vẫn chưa thực sự bùng nổ và thuật ngữ "vật lý trực giác" (intuitive physics) của ông vẫn còn khá xa lạ; ngày nay, nó được gọi là "mô hình thế giới" (world model) và đã trở thành hướng đi khởi nghiệp "nóng" nhất. Khi đó, ông đã sử dụng "tam giác bất khả thi" để mô tả khó khăn trong việc triển khai robot và nêu rõ ưu tiên của mình: giữa độ tin cậy, khả năng tổng quát hóa và tốc độ, ông chọn không quá chú trọng vào tốc độ mà ưu tiên hai yếu tố đầu tiên. Hiện tại, Yuanluo đang bắt đầu đưa ra những minh chứng ứng dụng theo hướng đó.

Lian có một hồ sơ năng lực khác biệt: sau khi lấy bằng Tiến sĩ tại Đại học Duke, ông chuyển từ startup AGI tại Thung lũng Silicon là Vicarious sang Intrinsic — dự án robot tại Google X — và sau đó là công ty robot hình người Figure. Năm 2023, ông trở về Trung Quốc để thành lập Yuanluo Technology, bỏ qua các màn trình diễn gấp quần áo hay rót cà phê để đi sâu vào các môi trường phòng thí nghiệm tổng quát, sử dụng các nhiệm vụ thí nghiệm khoa học có trình tự dài, độ linh hoạt cao và độ chính xác cao làm nơi huấn luyện cho robot. Ông hiện cũng là giáo sư tại Trường Trí tuệ Nhân tạo, Đại học Giao thông Thượng Hải.

Cuộc trò chuyện này bắt đầu với những cảm nhận thực tế tại WRC năm nay, đi qua nhu cầu thực tế về việc đưa robot ra thị trường toàn cầu, xu hướng hội tụ của các mô hình thế giới, và những tiến bộ thực sự trong phần cứng và phần mềm AI hiện thân (embodied AI) trong hai năm qua, để rồi kết thúc bằng một luận điểm đầy hứa hẹn: khi AI thay đổi mô hình khám phá khoa học, nút thắt cổ chai sẽ chuyển sang các thí nghiệm tại phòng thí nghiệm ướt (wet lab) — và robot có thể chính là giao diện vật lý giúp khép kín "vòng lặp khô-ướt" (dry-wet loop).

Dưới đây là toàn văn cuộc trò chuyện. Chúng tôi hy vọng nó mang đến những góc nhìn và hiểu biết mới mẻ. Bạn cũng có thể tìm thấy bản ghi âm đầy đủ trên ứng dụng Xiaoyuzhou hoặc Apple Podcasts bằng cách tìm kiếm và đăng ký kênh Gao Neng Liang.

Feng Li: Ngành công nghiệp robot đã nóng lên được hai năm nay, và tuần này Unitree vừa mới lên sàn chứng khoán. Mặc dù hiệu suất của nó kể từ đó có nhiều biến động, nhưng dù sao đây cũng là một sự kiện mang tính bước ngoặt. Kết hợp với Hội nghị Robot Thế giới đang diễn ra tại Bắc Kinh, chúng tôi đã mời trở lại một vị khách CEO từng ghi hình với chúng tôi hơn hai năm trước: Wenzhao Lian. Wenzhao, anh vui lòng giới thiệu ngắn gọn về bản thân và Yuanluo Technology.

Wenzhao Lian: Chúng tôi là một startup về robot AI. Chúng tôi xây dựng các nền tảng phần cứng — robot hình người, và hiện nay là các kiến trúc phần cứng ngày càng đa dạng hơn. Đồng thời, chúng tôi đang đầu tư ngày càng nhiều vào mảng mô hình thuật toán não bộ, thúc đẩy mô hình vật lý tự nhiên lấy đối tượng làm trung tâm (object-centric physical-native model) để liên tục cải thiện độ tin cậy và khả năng tổng quát hóa của robot.

Điểm khởi đầu của chúng tôi là AI for Science (AI phục vụ khoa học). Chúng tôi đã chọn một danh mục rộng các nhiệm vụ trong môi trường phòng thí nghiệm tổng quát làm nơi huấn luyện và kiểm chứng. Chúng tôi đã triển khai robot hợp tác với các công ty như MGI và các tổ chức nghiên cứu như Viện Hàn lâm Khoa học Trung Quốc, chứng minh rằng trong "phòng thi" khắc nghiệt nhất này, robot đã có thể thực hiện được nhiều kỹ năng có độ linh hoạt và độ chính xác cao.

Bản thân tôi phụ trách R&D và vận hành tại Yuanluo, đồng thời là giáo sư tại Trường Trí tuệ Nhân tạo, Đại học Giao thông Thượng Hải, nơi tôi hướng dẫn các sinh viên khám phá những biên giới kỹ thuật của trí tuệ hiện thân. Trước khi về nước, tôi có ba trải nghiệm làm việc: đầu tiên là tại startup AGI Vicarious ở Thung lũng Silicon, làm việc về mạng thần kinh lấy cảm hứng từ não bộ và triển khai robot trong các kịch bản logistics cho khách hàng như Bưu điện Hoa Kỳ; sau đó tại Google X tham gia vào các dự án robot giai đoạn đầu, mà sau này trở thành Intrinsic — thật thú vị là nó đã được sáp nhập trở lại Google đầu năm nay — làm việc về hệ điều hành robot, về cơ bản là Android cho robot; và năm 2023, tôi gia nhập Figure, nơi tôi xây dựng một số đường ống thu thập dữ liệu và khung học bắt chước (imitation learning) đầu tiên.

Feng Li: Có rất nhiều điều để khai thác. Hãy quay lại câu hỏi đơn giản và thực tế nhất: so sánh trên diện rộng, ấn tượng của anh về WRC năm nay là gì?

Wenzhao Lian: Khu vực triển lãm ngày càng lớn hơn, với các đơn vị tham gia khám phá các kịch bản trong mọi ngành công nghiệp: di chuyển hộp, phân loại, lắp ráp công nghiệp, nấu ăn, phục vụ trà nước. Hàng trăm công ty đang thực hiện những gì trông giống như hàng trăm thí nghiệm song song — điều này cho thấy ngành công nghiệp vẫn chưa đạt được sự đồng thuận, và các phương pháp tiếp cận vẫn rất đa dạng: một số sử dụng lập trình sẵn từ đầu đến cuối (end-to-end), một số dựa vào mô hình ngôn ngữ-hình ảnh-hành động (vision-language-action), số khác dựa vào mô hình thế giới tạo sinh... Đây là một điều tốt. Nó chứng minh trần của ngành công nghiệp này rất cao, và kỳ vọng của mọi người về tương lai của robot là rất lớn.

Nhưng làm thế nào để đáp ứng những kỳ vọng đó là điều đáng suy ngẫm — làm thế nào để đưa robot từ bản demo trở thành năng suất thực sự có thể sử dụng được. So với năm ngoái, khả năng mà các công ty khác nhau thể hiện thực tế khá giống nhau — gấp quần áo, gấp hộp, di chuyển hộp, nắm bắt vật thể — nhưng năm nay có một sự chuyển dịch rõ ràng sang "kịch bản hóa" (scenario-ization). Mọi người đều nhấn mạnh vào kịch bản, tiêu chuẩn tiếp đất, giá trị công nghiệp. Trước đây, nó mang tính "trình diễn" nhiều hơn: robot thực hiện một nhiệm vụ ngắn, thể hiện một khả năng nhỏ, và thế là hết.

Robot hai chân nhảy múa vẫn là một điểm thu hút lớn năm nay; giá trị cảm xúc cũng là giá trị thực. Nhưng tôi tập trung hơn vào lớp thao tác (manipulation layer): nó đang chuyển dịch rõ ràng từ trình diễn khả năng sang độ tin cậy như một mục tiêu của ngành.

Đây là lần thứ hai Yuanluo tham gia triển lãm. Chúng tôi vẫn neo giữ R&D của mình vào các hoạt động có trình tự dài, độ linh hoạt cao và độ chính xác cao trong lĩnh vực khoa học sự sống. Chúng tôi đã trình diễn các thí nghiệm tế bào học, bao gồm các quy trình dài như xét nghiệm độc tính tế bào — xử lý pipet, chất lỏng, ống nghiệm, máy ly tâm và nhiều thiết bị khác — đòi hỏi cả sự linh hoạt và độ chính xác, cả trí thông minh và độ tin cậy.

Feng Li: Một số báo cáo cho biết có số lượng người nước ngoài bất thường tại WRC lần này. Anh cảm nhận thế nào?

Wenzhao Lian: Quả thực, số lượng gương mặt không phải người Trung Quốc đông hơn rõ rệt: người châu Âu, Nhật Bản, Hàn Quốc, cộng thêm người từ Trung Đông và Đông Nam Á. Một số đến đây vì công việc kinh doanh, hy vọng đưa robot thông minh sản xuất tại Trung Quốc vào thị trường địa phương của họ; những người khác muốn thành lập công ty robot riêng và đến để quan sát, học hỏi. Ở nước ngoài, họ hoàn toàn công nhận năng lực R&D và sản xuất robot của Trung Quốc. Chúng ta đang trở thành trung tâm robot toàn cầu trên thực tế.

Feng Li: Trong số những khách quốc tế này, bao nhiêu người đến với nhu cầu kinh doanh cụ thể để tìm giải pháp, so với việc chỉ đi tham quan?

Wenzhao Lian: Phần lớn là nhóm trước, hoặc ít nhất là các nỗ lực hợp tác thực chất — chẳng hạn như đóng vai trò là nhà tích hợp hoặc nhà phân phối để bán tại địa phương. Mức độ sẵn sàng là khá cao.

Feng Li: Trong mẫu thử hạn chế của anh, bao nhiêu phần trăm nhu cầu này là khả thi, và bao nhiêu phần trăm vẫn nằm ngoài khả năng hiện tại của robot?

Wenzhao Lian: Từ góc độ khả năng, đại đa số có thể thực hiện được, miễn là có đủ chi phí. Những gì họ đưa ra hầu hết là các yêu cầu khá thông thường: bốc xếp máy công cụ, lắp ráp xe đạp (không hiểu sao họ muốn sản xuất xe đạp tại địa phương — họ nên mua từ Trung Quốc thì hơn), dịch vụ siêu thị, công ty dược phẩm... Mọi người đều có nhu cầu thực sự. Nếu những nhu cầu này ở Trung Quốc, chúng tôi chắc chắn có thể làm được. Nhưng ở nước ngoài thì khó hơn: số lượng kỹ sư địa phương ít hơn ở Trung Quốc, chi phí phối hợp cao hơn, và cần cân nhắc các yếu tố địa chính trị.

Feng Li: Giả sử khả năng có thể giải quyết được phần lớn, bao nhiêu trong số đó có thể bù đắp được chi phí?

Wenzhao Lian: Với số lượng ban đầu nhỏ, chắc chắn là tất cả. Để thực sự mở rộng quy mô, vấn đề quay lại việc liệu bạn có thể làm điều đó một cách đáng tin cậy hay không. Nếu bạn chỉ đẩy một cỗ máy cụ thể, giá cả có thể thương lượng. Nhưng cuối cùng bạn cần hình thành các tiêu chuẩn và sau đó mở rộng quy mô, và điều này đòi hỏi robot phải chứng minh được chúng đáng tin cậy.

Thế nào là đáng tin cậy? Nếu một con robot chạy tại một địa điểm trong một ngày, liệu khách hàng có tự nguyện bật nguồn cho nó vào ngày hôm sau không? Nếu họ sẵn sàng bật nguồn, chi phí có thể được bù đắp và mức độ sẵn sàng chi trả là rất cao. Nếu họ không bật nguồn vào ngày hôm sau — ví dụ, nói rằng "chúng tôi sẽ không bật nếu không có kỹ sư ở đó" — thì chi phí chắc chắn là cao. Vì vậy, có một quá trình sàng lọc; nó mang tính động.

Ngoài ra, sự tự tin mà ngành công nghiệp đã thể hiện trong quá khứ đã tạo ra những kỳ vọng thị trường hơi thổi phồng — mọi người thường mang đến một quy trình làm việc rất phức tạp và nói rằng, điều này chắc là dễ với các anh. Nhưng kỳ vọng cao cũng là điều tốt; bể nhu cầu lớn hơn, vì vậy bạn có thể sàng lọc.

Feng Li: Có vẻ như việc quốc tế hóa ngành robot có thể trở thành một sự bổ sung tiềm năng cho danh mục xuất khẩu mới của Trung Quốc, mặc dù khối lượng hiện tại vẫn còn nhỏ.

Feng Li: Khi chúng tôi ghi hình tập trước cách đây hơn hai năm, anh đã đưa ra một thuật ngữ mà lúc đó không nhận được nhiều sự chú ý — "vật lý trực giác". Nói một cách đơn giản, đó là khả năng của con người trong việc biết cách nắm bắt đồ vật, sử dụng tư thế và lực như thế nào khi tương tác với mọi thứ, cộng với hiểu biết vật lý thông thường. Bắt đầu từ khoảng cuối năm ngoái, hướng khởi nghiệp robot "nóng" nhất đã trở thành các mô hình thế giới, mô hình vật lý — mặc dù định nghĩa rất khác nhau, nhưng cốt lõi là cho phép robot hiểu thế giới đầy tính vật lý này và tương tác với nó. Chúng tôi đã đầu tư vào một vài công ty như vậy; định giá của họ đã tăng rất nhanh. Vì anh đã suy nghĩ về "vật lý trực giác" từ hai năm trước, anh nhìn nhận thế nào về vị thế của các mô hình thế giới hiện nay xét về giai đoạn phát triển và các giải pháp?

Wenzhao Lian: Những gì robot cần làm tóm gọn lại trong hai vấn đề: biết phải di chuyển đến đâu, và làm thế nào để đến đó một cách an toàn và đáng tin cậy. Chuyển động chia thành hai loại chính: di chuyển từ điểm A đến điểm B trong không gian tự do; và tương tác dựa trên tiếp xúc — di chuyển thứ gì đó từ A đến B, trong đó A-đến-B này không chỉ là về không gian mà còn là về sự thay đổi trạng thái. Một câu hỏi khác là: làm thế nào để xác định điểm B của tôi ở đâu, mục tiêu là gì.

Cho dù đó là các mô hình ngôn ngữ-hình ảnh-hành động (VLA) hay các mô hình thế giới mà ngành công nghiệp đã thúc đẩy, mục tiêu là hiểu được lẽ thường, và phương pháp là thu thập một lượng dữ liệu khổng lồ. VLA thu thập dữ liệu và thực hiện hồi quy: trực tiếp quyết định di chuyển đến đâu dựa trên các đại lượng quan sát được. Nó thực sự là một lối tắt bỏ qua sự hiểu biết và trực tiếp tạo ra hành động. Nhưng sau đó mọi người phát hiện ra vấn đề — nó bị quá khớp (overfit), và khả năng tổng quát hóa không tốt như tưởng tượng.

Nhân tiện, sinh viên của tôi bây giờ cũng thường nói về "tổng quát hóa" — nếu một vật vẫn có thể được nắm bắt khi dịch chuyển 0,5 cm sang trái, họ gọi đó là tổng quát hóa. Tôi chưa bao giờ nghĩ đó được tính là tổng quát hóa. Khi đổ xô vào VLA, mọi người thực sự đã hạ thấp tiêu chuẩn.

Dần dần mọi người nhận ra vấn đề này và quay lại với các mô hình thế giới: sử dụng mạng thần kinh, Transformers để trích xuất đặc trưng, đưa ra quyết định mà không loại bỏ thông tin hiểu biết về thế giới — không chỉ tạo ra hành động mà còn hiểu các mô hình phát triển của các đối tượng khách quan. Nhưng các mô hình thế giới trước đây thường vẫn là pixel-to-pixel (điểm ảnh sang điểm ảnh).

Feng Li: Từ điểm ảnh sang điểm ảnh.

Wenzhao Lian: Mọi điểm ảnh đều phải được dự đoán, tái tạo. Điều này thực sự đi ngược lại với vật lý trực giác — mô hình tiêu tốn năng lực biểu diễn khổng lồ vào việc tái tạo và phục hồi. Chúng tôi đã và đang thực hành cách tiếp cận "lấy đối tượng làm trung tâm": không mô hình hóa quá mức các chi tiết nhỏ không cần chú ý; nhưng một số chi tiết quan trọng mà các mô hình thế giới thị giác trước đây thiếu, chúng tôi cố tình tập trung vào — như lực. Lực là một phương thức (modality) khá quan trọng.

Lực như một phương thức rất thú vị: về mặt thị giác, nếu bạn thay đổi góc nhìn, thông tin bạn nhận được có thể không liên quan nhiều đến cơ thể của chính bạn; nhưng lực là thứ mà cơ thể bạn tác động lên môi trường, hoàn toàn phụ thuộc vào chính bạn. Bạn càng đẩy mạnh, phản hồi càng lớn — nó gắn kết chặt chẽ với hành động. Mô hình động lực học thế giới mà chúng tôi đang phát triển trước tiên mô hình hóa các đầu vào hình ảnh và hành động thô, sau đó đồng thời dự đoán hình ảnh và lực trong tương lai, đồng thời so sánh kết quả dự đoán với các lực được đo thực tế sau khi các hành động được áp dụng.

Feng Li: Khép kín vòng lặp, tạo ra phản hồi.

AI for ScienceRobot thí nghiệmTự động hóaCông nghệ sinh học
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.