IT Home
92

Mô hình

XPeng ra mắt mô hình thế giới X-Foresight: Dự đoán hành vi giao thông trước 6 giây

(giờ Việt Nam)

Tóm tắt AI

XPeng tích hợp mô hình thế giới X-Foresight và kiến trúc Infini-VLA lên xe, cho phép dự đoán hành vi giao thông trong 6 giây tới và ghi nhớ dữ liệu 30 giây trước đó, giúp tăng tốc độ phản hồi hệ thống lái tự động lên 300%.

Bản dịch AI

Theo tin từ IT ngày 27 tháng 8, tại sự kiện chia sẻ về AI vật lý và trải nghiệm phiên bản hoàn toàn mới của VLA thế hệ thứ hai của XPeng diễn ra hôm nay, năng lực mô hình VLA thế hệ thứ hai của XPeng đã được tăng cường toàn diện.

XPeng công bố mô hình thế giới dự đoán X-Foresight lần đầu tiên được trang bị trên xe, có khả năng dự đoán những gì sẽ xảy ra trong 6 giây tới, đồng thời suy luận các hành vi có thể xảy ra của những người tham gia giao thông xung quanh.

Trên đường thực tế, xe phía trước có thể phanh gấp đột ngột, người đi bộ có thể đổi hướng bất ngờ, xe bên cạnh có thể tạt đầu, XPeng đã ứng dụng Flow Matching để dự đoán nhiều tương lai hơn, từ đó đưa ra lựa chọn hành động tối ưu.

Mô hình không chỉ cần nhận diện thông tin từ hình ảnh quá khứ và hiện tại, mà còn phải thực hiện dự đoán dựa trên vị trí, tốc độ, xu hướng chuyển động của mục tiêu và môi trường đường sá. Thông qua biểu diễn lái xe theo chuỗi thời gian dài, mô hình có thể tạo ra nhiều ý định lái xe khác nhau, chuyển đổi từ tính xác định đơn lẻ sang đa giải pháp, sau đó thông qua học tăng cường (reinforcement learning) để quỹ đạo được tạo ra trở nên tự nhiên và giống con người hơn.

Ngoài ra, VLA thế hệ thứ hai còn giới thiệu kiến trúc chuỗi thời gian dài Infini-VLA, có khả năng ghi nhớ thế giới trong 30 giây trước đó, giúp việc đưa ra quyết định lái xe có ngữ cảnh dài hơn và nhiều thông tin hiệu quả hơn được đưa vào mô hình.

XPeng cho biết, các công nghệ này không hoạt động riêng lẻ: Infini chịu trách nhiệm đưa dữ liệu quá khứ vào, suy luận tự hồi quy dạng luồng (streaming autoregressive inference) xử lý hiện tại đang diễn ra liên tục, còn X-Foresight và Flow Matching đối mặt với tương lai.

Theo thông tin IT ghi nhận từ buổi họp báo, phiên bản mô hình mới đã giới thiệu kiến trúc hỗn hợp MoT, thông qua việc phân bổ năng lực mô hình linh hoạt cho các tác vụ khác nhau, giúp giảm thiểu sự can thiệp giữa các tác vụ trong các kịch bản như đường đô thị, khu công nghiệp, đỗ xe, đồng thời giao các vấn đề khác nhau cho các "chuyên gia" khác nhau, giúp mô hình chuyển đổi ổn định hơn giữa các tác vụ lái xe.

Tình hình giao thông luôn thay đổi từng khoảnh khắc, mô hình cũng cần vừa quan sát vừa suy nghĩ; nếu tốc độ ra quyết định không theo kịp những thay đổi thực tế thì không thể hình thành trí tuệ thế giới vật lý thực sự đáng tin cậy. Do đó, VLA thế hệ thứ hai đã đồng thời nâng cao hiệu suất suy luận của mô hình, áp dụng suy luận tự hồi quy dạng luồng, giúp tốc độ phản hồi đầu cuối (end-to-end) tăng 300%, hiện thực hóa quá trình xử lý song song "vừa nhìn, vừa suy nghĩ, vừa hành động".

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.