Mô hình
Lãnh đạo Xpeng: VLA thế hệ 2 tạo bước ngoặt với khả năng hiểu chiều thời gian
(giờ Việt Nam)
Tóm tắt AI
Xpeng nâng cấp mô hình VLA thế hệ 2 với kiến trúc Infini-VLA, cho phép AI hiểu không gian 4D và ghi nhớ dữ liệu 30 giây, giúp tăng tốc độ phản hồi đầu cuối lên 300%.
Bản dịch AI
Theo tin từ IT ngày 27 tháng 8, sự kiện chia sẻ về AI vật lý và trải nghiệm phiên bản hoàn toàn mới của VLA thế hệ thứ hai của XPeng đang diễn ra, với bài phát biểu của ông Lưu Tiên Minh, người đứng đầu Trung tâm Trí tuệ Tổng quát của Tập đoàn XPeng. Ông cho biết, thách thức thực sự của AI vật lý chính là việc thấu hiểu thế giới và hành động trong một thế giới thực đầy rẫy những hạn chế.

Ông Lưu Tiên Minh cho biết, nửa năm trước, XPeng đã đề xuất công thức năng lực cho AI vật lý: Năng lực = Mô hình × Sức mạnh tính toán × Dữ liệu × Thực thể (Body). Trong đó, mô hình quyết định giới hạn trên của trí tuệ, dữ liệu cung cấp kinh nghiệm về thế giới, sức mạnh tính toán hỗ trợ việc huấn luyện và vận hành, còn thực thể giúp AI thực sự hiện diện trong thế giới vật lý.

Ông Lưu Tiên Minh cho rằng, thế giới thực không phải là những bức ảnh tĩnh, mà là một quá trình liên tục thay đổi và phát triển không ngừng. Để mô hình có thể thấu hiểu thế giới như con người, trước tiên nó phải hiểu được "thời gian" là gì. Cốt lõi của việc nâng cấp VLA thế hệ thứ hai chính là giúp mô hình lần đầu tiên thiết lập được sự hiểu biết về chiều thời gian.

Theo giới thiệu, mô hình nền tảng thế giới vật lý của XPeng lần đầu tiên đưa "thời gian" vào mô hình, giúp chiều không gian mà AI thấu hiểu thế giới chuyển dịch từ "không gian 3D" sang "không gian-thời gian 4D". Thời gian càng dài, thông tin càng nhiều thì mô hình càng cần phản ứng nhanh hơn, đưa ra quyết định với tần suất cao hơn và đạt được khả năng an toàn mạnh mẽ hơn; mô hình càng lớn, khả năng khái quát hóa càng mạnh thì nhu cầu tính toán cũng càng cao.


IT lưu ý rằng, trước đây các mô hình chủ yếu nhìn thấy thông tin ở thời điểm hiện tại, còn VLA thế hệ thứ hai đã giới thiệu kiến trúc Infini-VLA với chuỗi thời gian dài, cho phép ghi nhớ thế giới trong 30 giây trước đó. Nhờ vậy, việc phán đoán khi lái xe bắt đầu có được ngữ cảnh dài hơn và nhiều thông tin hiệu quả hơn được đưa vào mô hình.

Tình trạng đường sá luôn thay đổi từng giây, vì vậy mô hình cũng cần vừa quan sát vừa suy nghĩ. Nếu tốc độ ra quyết định không theo kịp những thay đổi thực tế, thì không thể hình thành một trí tuệ thế giới vật lý thực sự đáng tin cậy. Do đó, VLA thế hệ thứ hai đã đồng thời nâng cao hiệu suất suy luận của mô hình, áp dụng phương pháp suy luận tự hồi quy dạng luồng (streaming autoregressive inference), giúp tăng tốc độ phản hồi end-to-end lên 300%, từ đó hiện thực hóa khả năng xử lý song song "vừa nhìn, vừa nghĩ, vừa hành động".
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.