Tin ngành
Cựu lãnh đạo AI Huawei: Chất lượng dữ liệu quan trọng hơn kiến trúc mô hình
(giờ Việt Nam)
Tóm tắt AI
Huang Qingqiu, CTO của Morphi Robot, đang áp dụng kinh nghiệm từ bộ phận xe tự lái của Huawei để nhấn mạnh tầm quan trọng của dữ liệu trong phát triển AI.
Bản dịch AI

“Dữ liệu lớn (big data) là động lực thúc đẩy học máy.” Kết luận này từ chuyên gia trí tuệ nhân tạo Li Fei-Fei đã nhận được sự đồng tình từ một số chuyên gia AI. Một trong số đó là Huang Qingqiu, cựu thành viên chương trình “Genius Youth” của Huawei và hiện là CTO của Morphi Robot.
Sau khi Morphi Robot huy động được hơn 1 tỷ RMB (148 triệu USD) vốn đầu tư thiên thần, 36Kr đã gặp Huang tại Thượng Hải. “Nếu chất lượng dữ liệu cao vô hạn, ngay cả một mô hình rất đơn giản cũng có thể được huấn luyện để tạo ra kết quả xuất sắc,” ông chia sẻ với tờ báo này.

Giữa những câu chuyện đầy tham vọng xoay quanh các startup về trí tuệ hiện thân (embodied intelligence), cách tiếp cận lấy dữ liệu làm trung tâm của Huang nghe có vẻ trực diện và thực tế một cách khác thường.
Huang từng thuộc nhóm thứ hai của chương trình “Genius Youth” tại Huawei. Ông gia nhập đơn vị kinh doanh ô tô của Huawei vào năm 2020 và trở thành người đứng đầu bộ phận AI cho xe tự lái. Trong thời gian làm việc tại Huawei, ông đã dẫn dắt các nỗ lực ứng dụng AI vào LiDAR (công nghệ phát hiện và đo khoảng cách bằng ánh sáng), nhận diện, sau đó là các hệ thống nhận diện hợp nhất cảm biến, và cuối cùng, trong kỷ nguyên ADS 4.0, là toàn bộ hệ thống hỗ trợ lái xe của Huawei.
Ông cũng dẫn dắt đội ngũ xây dựng hệ thống kỹ thuật dữ liệu xe tự lái của Huawei từ con số không. Ông cho biết, nỗ lực này bắt đầu từ kỷ nguyên ADS 2.0 và đã khá hoàn thiện vào thời điểm ADS 3.0.
Trong giai đoạn ADS 2.0, hệ thống dữ liệu do Huang dẫn dắt chỉ được sử dụng để hỗ trợ mạng lưới phát hiện vật cản chung của Huawei. Đến ADS 3.0, nó đã hỗ trợ tất cả các tác vụ nhận diện tĩnh, đèn giao thông và dự đoán. Đến ADS 4.0, hệ thống này đã có thể hỗ trợ toàn bộ ngăn xếp (stack) end-to-end.
Sự tham gia sâu sắc vào kỹ thuật dữ liệu đó đã mang lại cho Huang một phương pháp luận mà ông hiện coi là vô giá khi xây dựng công ty trong lĩnh vực trí tuệ hiện thân.
Theo 36Kr, gần như mọi doanh nhân trong lĩnh vực trí tuệ hiện thân đều đồng ý rằng đích đến cuối cùng là sự phổ cập quy mô lớn trong các hộ gia đình. Một lý do chính khiến các robot hiện thân ngày nay chưa đạt được điểm đó là do các mô hình hiện thân vẫn thiếu khả năng tổng quát hóa đầy đủ. Nói cách khác, “bộ não” của robot vẫn chưa đủ thông minh.
Để giải quyết vấn đề đó, Huang coi kỹ thuật dữ liệu là bước đột phá then chốt.
“Kiến trúc mô hình càng đơn giản càng tốt,” ông nói. “Nếu chất lượng dữ liệu cao vô hạn, ngay cả một mô hình rất đơn giản cũng có thể được huấn luyện để tạo ra kết quả xuất sắc.”
Huang giải thích với 36Kr rằng, về cốt lõi, một mô hình nén thông tin và chuyển đổi giữa các phương thức (modalities). Giới hạn năng lực của nó phụ thuộc vào số lượng tham số. Ông lập luận rằng hầu hết các cải tiến đối với kiến trúc mô hình chủ yếu là làm cho mô hình hấp thụ dữ liệu hiệu quả hơn và có tương đối ít tác động đến giới hạn năng lực tối thượng của nó.
Ông nói thêm, hiệu quả đó có thể được bù đắp bằng nhiều dữ liệu hơn và thời gian huấn luyện lâu hơn.
Đó là lý do tại sao Huang tin rằng, ở giai đoạn này, khi dữ liệu trí tuệ hiện thân chất lượng cao vẫn còn khan hiếm, kỹ thuật dữ liệu nên được ưu tiên hơn so với đổi mới trong kiến trúc mô hình.
Dựa trên quan điểm đó, Huang đã xây dựng một bánh đà dữ liệu (data flywheel) cho Morphi Robot.
Để thu thập dữ liệu, Morphi Robot đã phát triển các thiết bị đeo nhẹ của riêng mình và thuê nhân viên vệ sinh tại các khách sạn, căn hộ hỗn hợp thương mại và dân cư, cùng các môi trường thương mại khác để thu thập dữ liệu.
“Khi dữ liệu quay về, bạn cần phải đưa nó qua quá trình lọc chất lượng nghiêm ngặt,” Huang nói. “Một số dữ liệu có thể chứa các chuyển động không chính xác, thiết bị đeo không đúng cách hoặc đủ loại vấn đề khác. Bạn phải xác định được dữ liệu hợp lệ.”
“Sau đó, bạn vẫn cần phải phân loại nó. Ngay cả khi tôi có một lượng dữ liệu khổng lồ, tôi cần phải có khả năng truy xuất chính xác dữ liệu nào nên được sử dụng để huấn luyện cho từng mô hình.”
Sau khi được phân loại, dữ liệu sẽ được tự động gán nhãn với sự thật cơ bản (ground truth) cần thiết cho việc huấn luyện, sau đó đưa vào mô hình. Morphi Robot cũng đã thiết kế nhiều lớp đánh giá để kiểm tra các mô hình ở quy mô lớn.
“Sau khi đánh giá, đối với các kịch bản mà kết quả chưa đủ tốt, chúng tôi quay lại thu thập và khai thác dữ liệu một lần nữa,” Huang cho biết.
Huang thừa nhận rằng triết lý kỹ thuật dữ liệu của ông không phải là duy nhất. Ông kỳ vọng nhiều chuyên gia về trí tuệ hiện thân sẽ nhận ra rằng lĩnh vực này “cần một hệ thống dữ liệu vòng lặp kín tương tự như hệ thống được sử dụng trong xe tự lái.”
Ông cho biết, các phương pháp thu thập dữ liệu của ngành cũng đang chuyển dịch từ điều khiển từ xa (teleoperation) sang các thiết bị thu thập di động, vì điều khiển từ xa hữu ích cho việc tạo bản demo nhanh trong các kịch bản cụ thể nhưng khả năng tổng quát hóa lại hạn chế.
Điều đó không có nghĩa là mọi công ty đều có thể xây dựng một hệ thống dữ liệu vòng lặp kín tốt.
Huang nói với 36Kr rằng chất lượng của các hệ thống như vậy có thể phụ thuộc vào các chi tiết.
Làm ví dụ, ông chỉ ra khái niệm “tái định vị” (relocalization) trong lái xe thông minh.
Tái định vị đề cập đến các tình huống khi hai phương tiện đi qua cùng một vị trí. Sau khi việc gán nhãn sự thật cơ bản đã hoàn tất cho phương tiện đầu tiên, lý tưởng nhất là công ty muốn phương tiện thứ hai tái sử dụng dữ liệu đã được gán nhãn trước đó. Nhưng điều đó không phải lúc nào cũng khả thi.
“Bạn cần độ chính xác định vị của cả phương tiện thứ hai và phương tiện đầu tiên phải đủ cao để đảm bảo rằng hai bên có thể khớp chính xác với nhau,” Huang nói. Ông nói thêm rằng nhiều công ty “có thể không đạt được khả năng tái định vị ở mức centimet.”
Một hệ thống dữ liệu vòng lặp kín chứa “hàng chục nghìn chi tiết như thế này,” Huang cho biết.
“Mọi chi tiết đều phải được đẩy đến giới hạn, và mọi chi tiết đều có tiềm năng tạo ra khoảng cách giữa các công ty.”
Sự hiểu biết của Huang về kỹ thuật dữ liệu được hình thành từ kinh nghiệm của ông trong lĩnh vực xe tự lái. Trong lộ trình kỹ thuật của mình, hệ thống dữ liệu vòng lặp kín đóng vai trò là nền tảng, trong khi việc phát triển một mô hình hiện thân gốc (native embodied model) nội bộ là bước tiếp theo để tối đa hóa giá trị của dữ liệu đó.
Khi nói đến kiến trúc mô hình, Huang không muốn gắn nhãn cách tiếp cận của Morphi Robot là mô hình ngôn ngữ-thị giác-hành động (VLA) hay mô hình thế giới (world model).
Ông tin rằng hai câu hỏi quan trọng hơn: cái gì đi vào mô hình, và cái gì đi ra? Và liệu nó có tuân theo mô hình huấn luyện end-to-end hay không?
Ông lập luận rằng, miễn là những yếu tố cơ bản đó được thiết lập, các phương pháp huấn luyện có thể thay đổi bất cứ lúc nào. Cho dù đó là mô hình VLA hay mô hình thế giới, “về cơ bản chúng chỉ là công cụ và plugin cho một giai đoạn cụ thể.”
Quan điểm của Huang là cuối cùng Morphi Robot sẽ phải tự thực hiện tiền huấn luyện (pretraining) và xây dựng một mô hình hiện thân gốc.
Tuy nhiên, trước khi đạt đến giai đoạn đó, Morphi Robot đã sử dụng hậu huấn luyện (post-training) để nhanh chóng tích lũy kinh nghiệm với robot vật lý và xây dựng năng lực hệ thống.
“Giai đoạn đó đã ở lại phía sau chúng tôi rồi,” Huang nói.
Morphi Robot hiện đang thực hiện tiền huấn luyện dựa trên các mô hình mã nguồn mở. Vào khoảng cuối năm nay, sau khi tích lũy đủ dữ liệu, công ty dự định bắt đầu huấn luyện mô hình gốc của riêng mình từ con số không.
Trong lĩnh vực xe tự lái, một ngành được coi là có liên quan chặt chẽ đến trí tuệ hiện thân, các công ty hàng đầu như Momenta đã cung cấp bằng chứng cho thấy kỹ thuật dữ liệu có thể đóng vai trò là con đường dẫn đến trí tuệ cao hơn.
Để xác định liệu thiết lập tương tự có thể được sao chép trong trí tuệ hiện thân hay không, nhiều startup sẽ phải đưa nó vào thử nghiệm.
Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.