Mô hình
XPENG ra mắt TuringViT: Bước tiến mới cho xe tự lái và robot hình người
(giờ Việt Nam)
Tóm tắt AI
XPENG vừa giới thiệu TuringViT, bộ mã hóa thị giác tối ưu cho xe tự lái và robot IRON, với hiệu suất vượt trội gấp nhiều lần so với các mô hình hiện có như Seed1.5-ViT và SigLIP2-ViT-L.
Bản dịch AI

XPENG đã công bố TuringViT, một bộ mã hóa thị giác (vision encoder) dành cho các mô hình ngôn ngữ-thị giác và hành động-ngôn ngữ-thị giác, được sử dụng trong hệ thống lái xe thông minh, hệ thống buồng lái thông minh và chương trình robot hình người IRON của hãng.
XPENG cung cấp hai phiên bản là TuringViT-18L và TuringViT-24L. Ở độ phân giải 1536×1536, công ty cho biết TuringViT-18L đạt lưu lượng xử lý gấp 3,04 lần so với Seed1.5-ViT và gấp 2,16 lần so với SigLIP2-ViT-L.
XPENG cho biết mô hình này được huấn luyện trên 850 triệu cặp hình ảnh-văn bản và đạt điểm trung bình 83,6% trên sáu tiêu chuẩn đánh giá zero-shot, vượt qua các mô hình nguồn mở cơ sở được huấn luyện trên 10 tỷ mẫu. [IT Home, tiếng Trung]





Bài viết được AI dịch và tổng hợp tự động từ TechNode. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.