Nghiên cứu
Sau một thập kỷ, chuyên gia AI hàng đầu công bố bài nghiên cứu mới
(giờ Việt Nam)
Tóm tắt AI
Bài nghiên cứu mới từ chuyên gia AI kỳ cựu tập trung vào việc tối ưu hóa khả năng dự đoán tầm xa cho xe tự lái, giúp hệ thống 'nhìn xa trông rộng' hơn.
Chính văn · Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
24-09-2026 20:58:55 Nguồn: QbitAI
Giúp xe tự lái "đi một bước, tính mười bước"
Jessica, đưa tin từ ROBO-Nhân, QbitAI ROBO | Official Account AI4ROBO
Lĩnh vực xe tự lái vừa xuất hiện thêm một bài nghiên cứu gốc mới.
Bài báo mới nhất này giúp xe tự lái có thể "đi một bước, tính mười bước", giống với các tài xế lão luyện hơn!
Gần đây, dưới sự hướng dẫn của Nhậm Thiếu Khanh (Ren Shaoqing), bài báo "MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving" đã được công bố, đề xuất một mô hình kết hợp thế giới - hành động đa chế độ mới.
Trong hồ sơ học thuật công khai, các nghiên cứu tiêu biểu của ông chủ yếu tập trung vào giai đoạn 2014—2016, bao gồm hàng loạt công trình kinh điển về thị giác máy tính như Faster R-CNN, ResNet.

Lần này, ông quay trở lại với tư cách là tác giả liên hệ trong một bài báo về xe tự lái. Tổ chức đứng đầu bài báo là NIO, với nhiều tác giả đến từ NIO, và hướng nghiên cứu cũng chỉ thẳng vào mô hình thế giới (world model) và quy hoạch (planning).
Vấn đề cốt lõi mà bài báo này cần giải quyết rất rõ ràng: Trong cùng một kịch bản lái xe, hệ thống không chỉ cần xử lý một quỹ đạo duy nhất, cũng không chỉ là một tương lai xác định.
Tư duy của nhóm nghiên cứu là: Để mô hình tạo ra nhiều nhóm giả thuyết kịch bản - hành động cùng lúc, quỹ đạo xe và kịch bản tương lai tương ứng sẽ cùng tiến hóa, cuối cùng mới chọn ra kết quả từ đó.
Nói một cách đơn giản, xe tự lái không chỉ có thể nhìn rõ môi trường xung quanh mà còn có thể diễn tập nhiều tương lai khả thi, từ đó chọn ra lộ trình an toàn nhất để thực hiện.
Từ một quỹ đạo, mở rộng ra nhiều tương lai
Logic cơ bản của xe tự lái end-to-end là ánh xạ trực tiếp các quan sát từ cảm biến thành quỹ đạo của xe hoặc lệnh điều khiển.
World–Action Model (Mô hình Thế giới - Hành động) tiến thêm một bước bằng cách bổ sung mô hình hóa kịch bản tương lai, giúp việc quy hoạch không chỉ dựa vào môi trường hiện tại mà còn tham chiếu đến hậu quả có thể xảy ra từ các hành động.

Các World–Action Model hiện có tồn tại hai lộ trình chính:
Một là phương án phân tầng (cascade). Ví dụ, tạo ra vài quỹ đạo ứng viên trước, sau đó dự đoán kịch bản tương lai tương ứng cho từng quỹ đạo; hoặc dự đoán kịch bản tương lai trước, sau đó mới hoàn thành quy hoạch dựa trên kịch bản đó. Cách này có thể tạo ra nhiều kết quả ứng viên.
Nhưng vấn đề của phương pháp này cũng rất rõ ràng: Thông tin truyền đi theo một chiều, các biến được tạo ra sau không thể quay lại để sửa chữa các quyết định trước đó.
Giả sử mô hình đã xác định xe sẽ đi thẳng qua ngã tư, sau đó mới dự đoán được xe đối diện không giảm tốc, thì kết quả tương lai này rất khó để tham gia ngược lại vào quá trình tạo hành động trước đó.
Hai là phương án kết hợp (joint). Kịch bản và hành động được đặt trong cùng một quá trình tạo, cả hai có thể ảnh hưởng lẫn nhau.
Hành động của xe thay đổi, môi trường dự đoán sẽ điều chỉnh theo; một khi môi trường thay đổi, nó cũng sẽ tác động ngược lại quỹ đạo của xe. Các phương pháp hiện có loại này thường chỉ tạo ra một nhóm kết quả kịch bản - hành động.
Bài báo đã chỉ ra khoảng trống trong đó: Mô hình phân tầng có thể bao phủ nhiều kết quả lái xe nhưng thiếu sự tương tác hai chiều giữa kịch bản và hành động; mô hình kết hợp có khả năng tương tác hai chiều nhưng thường chỉ tạo ra một nhóm kết quả duy nhất.

Tuy nhiên, đường sá thực tế thường đòi hỏi phải xử lý đồng thời cả hai việc này.
Giải pháp mà MM-Future đưa ra là: Tạo ra nhiều nhóm giả thuyết kịch bản - hành động cùng một lúc, trong đó kịch bản và hành động bên trong mỗi nhóm tiếp tục cùng tiến hóa.
Mỗi nhóm kết quả được gọi là paired scene–action hypothesis (giả thuyết kịch bản - hành động ghép đôi).
Giả sử mô hình tạo ra hàng chục nhóm ứng viên cùng lúc, trong đó một nhóm có thể là xe tăng tốc, xe đối diện nhường đường; một nhóm khác là xe giảm tốc, xe đối diện đi trước, cùng với các mức độ phanh, cách vượt và thay đổi kịch bản khác nhau.
Những kết quả này không còn chỉ khác biệt về quỹ đạo, mà môi trường tương lai tương ứng với mỗi quỹ đạo cũng hoàn toàn khác nhau. Nhờ đó, nhiều tương lai khả thi được đưa vào quá trình quy hoạch.
Diễn tập hàng chục tương lai cùng lúc, ba ngưỡng cửa cần đối mặt
Bài báo đã chia nhỏ những khó khăn của việc mô hình hóa kết hợp đa chế độ thành ba mục:
* Sự đa dạng đến từ đâu, làm thế nào để kiểm soát chi phí tính toán cho nhiều nhóm tương lai, và làm thế nào để sàng lọc sau khi tạo ra nhiều ứng viên. Thiết kế cốt lõi của MM-Future cũng xoay quanh ba vấn đề này.
Đầu tiên là vấn đề đa dạng.
Dữ liệu lái xe thực tế có hạn chế tự nhiên, một đoạn video chỉ ghi lại một kết quả đã xảy ra. Tài xế cuối cùng đã giảm tốc, thì trong dữ liệu sẽ không đồng thời lưu lại kịch bản thực tế nếu chọn tăng tốc tại cùng thời điểm đó. Mô hình cần học ra nhiều kết quả hợp lý dưới sự giám sát của một kết quả duy nhất.
MM-Future thiết lập Gaussian Mixture Noise ở phía hành động dựa trên phân phối quỹ đạo huấn luyện, xuất phát từ các tiên nghiệm hành động khác nhau; phía kịch bản thì sử dụng nhiễu độc lập.
Trạng thái ban đầu của hành động và kịch bản được ghép đôi với nhau, tạo thành các điểm khởi đầu độc lập cho các kết quả lái xe khác nhau.
Khi huấn luyện, nhóm còn thêm vào sự giám sát Best-of-Many. Mô hình tạo ra nhiều nhóm ứng viên cùng lúc, trước tiên tìm ra nhóm gần với quỹ đạo thực tế nhất, sau đó dùng chỉ số của người chiến thắng đó để giám sát luồng hành động và luồng kịch bản.

Cách này có thể tránh việc tất cả ứng viên bị kéo về kết quả tương tự bởi cùng một quỹ đạo thực tế, đồng thời cũng giữ cho một quỹ đạo và kịch bản tương lai tương ứng của nó luôn được ghép đôi với nhau.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.