The Decoder: AI News
85

Mô hình

Alibaba ra mắt Qwen-Drive 1.0: Một mô hình AI duy nhất cho cả lái xe tự động và trợ lý thông minh

(giờ Việt Nam)

Tóm tắt AI

Dựa trên nền tảng Qwen3.5-4B, Qwen-Drive 1.0 tích hợp khả năng nhận diện môi trường 3D và lập kế hoạch lộ trình, cho phép một mô hình duy nhất vừa điều khiển xe vừa hỗ trợ người dùng trong khoang lái.

Bản dịch AI

Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver

Qwen-Drive 1.0 xử lý ba tác vụ trong cùng một mô hình AI: nhận thức không gian của môi trường, trả lời các câu hỏi về giao thông và lập kế hoạch lộ trình. Các nhà nghiên cứu khẳng định rằng một mô hình văn bản-hình ảnh không tự động hiểu được không gian ba chiều chỉ vì nó có thể mô tả các bức ảnh.

Các mô hình lái xe hiện nay thường lấy một mô hình văn bản-hình ảnh tổng quát và tinh chỉnh nó trên dữ liệu lái xe, chủ yếu là các cặp câu hỏi-đáp về tình huống giao thông. Theo bài báo, cách tiếp cận này có hai điểm yếu. Một mô hình được huấn luyện chủ yếu bằng hỏi-đáp giao thông vẫn không thể xác định khoảng cách, vị trí và không gian trống một cách đáng tin cậy. Và nếu nó trở nên quá chuyên biệt vào dữ liệu lái xe, nó sẽ mất đi kiến thức tổng quát rộng lớn từ quá trình huấn luyện ban đầu thông qua hiện tượng mà các nhà nghiên cứu gọi là "quên lãng thảm họa" (catastrophic forgetting) – chính là loại kiến thức quan trọng nhất trong các tình huống giao thông hiếm gặp và bất ngờ. Mô hình mà bộ phận nghiên cứu của Alibaba xây dựng được cho là sẽ giải quyết cả hai vấn đề này.

Một mô-đun riêng biệt kiểm tra xem mô hình có thực sự hiểu không gian hay không.

Qwen-Drive-1.0 được xây dựng dựa trên Qwen3.5-4B, ra mắt vào tháng 2, và bổ sung thêm hai thành phần phụ. Thành phần đầu tiên tạo ra bản đồ góc nhìn từ trên xuống (bird's-eye-view) của môi trường xung quanh bằng cách phát hiện các vật thể trong không gian 3D, xác định các khu vực bị chiếm dụng và vạch ra bố cục đường đi. Các nhà nghiên cứu cho biết nó cũng đóng vai trò như một công cụ đo lường tiết lộ lượng thông tin không gian mà mô hình thực sự trích xuất được từ hình ảnh.

Architecture diagram of Qwen-Drive-1.0 showing the Vision Encoder, Qwen3.5 Language Model, external BEV Perception Head for 3D detection, occupancy, and map segmentation, plus a Planning Expert for tr

Thành phần thứ hai, Planning Expert (Chuyên gia lập kế hoạch), sử dụng dữ liệu mô hình nội bộ để lập kế hoạch cho chuyển động tương lai của xe. Khi các nhà nghiên cứu chỉ huấn luyện thành phần bổ sung mà giữ nguyên mô hình ngôn ngữ-thị giác, độ chính xác về không gian vẫn ở mức thấp, xác nhận rằng một mô hình có khả năng mô tả hình ảnh chi tiết không tự động nắm bắt được không gian ba chiều. Chỉ khi nhóm nghiên cứu huấn luyện cả mô hình ngôn ngữ-thị giác trên các tác vụ không gian, hiệu suất mới cải thiện đáng kể, nghĩa là khả năng hiểu không gian trong các cảnh giao thông phải được xây dựng một cách có chủ đích.

Four scene rows with multi-view camera images, 3D object detection in bird's-eye view, semantic occupancy maps, and BEV map segmentation, each comparing the model's prediction against ground truth.

Quá trình huấn luyện bắt đầu với mô-đun nhận thức, sau đó kết hợp nhận thức và trả lời câu hỏi, tiếp theo là lập kế hoạch lộ trình. Bước cuối cùng tinh chỉnh hành vi của mô hình thông qua học tăng cường (reinforcement learning). Đối với thành phần ngôn ngữ-thị giác, nhóm đã kết hợp 24 tập dữ liệu công khai về cảnh giao thông. Các tập dữ liệu này có cấu trúc khác nhau và đôi khi chứa lỗi. Một mô hình AI đã chuẩn hóa các câu hỏi và câu trả lời, đồng thời căn chỉnh chúng với dữ liệu gốc. Nhóm cũng tự xây dựng các ví dụ giải thích lý do tại sao xe nên đưa ra một quyết định lái xe cụ thể, chẳng hạn như vật thể nào kích hoạt phanh.

Một mô hình cho cả buồng lái và hệ thống lái xe.

Trong các phương tiện hiện đại, hệ thống thông tin giải trí và hệ thống lái xe đang hội tụ về một bộ xử lý duy nhất thay vì chạy trên hai bộ điều khiển riêng biệt. Các tác giả lập luận rằng một mô hình đánh đổi khả năng tổng quát để lấy hiệu suất lái xe thuần túy sẽ không hiệu quả ở đây, vì buồng lái vẫn cần mô hình riêng và tài nguyên tính toán bổ sung cho các tác vụ như đối thoại hoặc các câu hỏi mở.

Two radar charts comparing Qwen-Drive-1.0 against models like Qwen3.5-4B, MiMo-Embodied-7B, and InternVL3.5-8B across Driving VQA, General VQA, 3D Perception, and Motion Planning benchmarks.

Theo bài báo, Qwen-Drive 1.0 đạt điểm cao hơn nhiều so với mô hình cơ sở chưa qua chỉnh sửa Qwen3.5-4B trong các câu hỏi về cảnh giao thông. Khoảng cách lớn nhất xuất hiện khi mô hình phải giải thích nguyên nhân và kết quả, chẳng hạn như tại sao xe nên phanh hoặc rẽ. Kiến thức tổng quát cũng được duy trì: Mô hình hầu như không bị giảm hiệu suất trong các bài kiểm tra ngoài lĩnh vực lái xe và thậm chí đạt điểm cao hơn một chút ở một số tác vụ không gian.

Từ mô phỏng đến thực tế đường bộ.

Đối với việc lập kế hoạch lái xe, nhóm đã thử nghiệm mô hình ở nhiều cấp độ khó khác nhau, từ các dự đoán đơn giản đến một trình mô phỏng nơi các lỗi tích tụ theo thời gian. Trong trình mô phỏng, phiên bản được huấn luyện lại với các phần thưởng đã giảm tỷ lệ xe chệch khỏi làn đường từ 24% xuống 12%. Nó cũng lái xe thận trọng hơn và tổng quãng đường di chuyển ít hơn.

Three open-loop driving scenes with overlaid reasoning text and predicted trajectories at top, and eight closed-loop time steps from two AlpaSim runs with camera images and trajectory plots below.

Tuy nhiên, các giải thích của mô hình không phải lúc nào cũng xác định chính xác nguyên nhân thực sự của một tình huống. Đèn đỏ ở xa và một đứa trẻ bước ra đường đòi hỏi thời gian phản ứng rất khác nhau, và mô hình có thể nhầm lẫn giữa hai tình huống này. Các thao tác được lập kế hoạch cũng không phải lúc nào cũng khớp với lập luận mà mô hình đưa ra trước đó. Một số kết quả dựa trên các quy trình kiểm tra do chính các tác giả thiết kế hoặc xây dựng lại, vì vậy các số liệu riêng lẻ không nói lên nhiều điều về cách hệ thống sẽ xử lý việc lái xe thực tế đầy phức tạp.

Four scene rows with camera images from unfamiliar camera configurations in WOD-E2E and PAI-AV, showing 3D detection, occupancy, and map segmentation results without ground truth comparison.

Nhóm Qwen đã tự đo lường khoảng cách này trong khả năng hiểu không gian bằng cách sử dụng tiêu chuẩn đánh giá HopChain của họ. Tại đây, các mô hình ngôn ngữ-thị giác đã phân loại sai vật thể và nhầm lẫn các mối quan hệ không gian ngay cả khi đạt điểm cao trong các bài kiểm tra văn bản-hình ảnh. Quên lãng thảm họa cũng là một vấn đề quen thuộc. Khi Google Deepmind xây dựng PaLM-E vào năm 2023, một mô hình cho ngôn ngữ, hình ảnh và điều khiển robot, các biến thể nhỏ hơn đã mất đi một phần lớn khả năng ngôn ngữ sau khi huấn luyện robot. Phiên bản lớn nhất, với 562 tỷ tham số, hầu như không mất đi khả năng nào.

Việc kết hợp một mô hình ngôn ngữ với chức năng lái xe mở ra một bề mặt tấn công mới. Các nhà nghiên cứu tại UC Santa Cruz đã đặt một biển báo có dán nhãn trong tầm nhìn của camera và đánh lừa hệ thống lái xe DriveLM khiến nó đánh lái về phía người đi bộ đang băng qua đường, mặc dù hệ thống đã phát hiện họ một cách chính xác. Trong khi đó, nghiên cứu đang chuyển hướng sang các Mô hình Hành động Thế giới (World Action Models), vốn cũng dự đoán cách môi trường thay đổi để phản ứng lại các hành động của chính tác nhân.

Nhóm Qwen đang phát hành mô hình này cho cộng đồng nghiên cứu miễn phí trên Hugging Face, ModelScope và GitHub.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.