Nghiên cứu
Internalized Visual Thinking: Bước tiến mới giúp AI suy luận video chủ động mà không tốn thêm tài nguyên
(giờ Việt Nam)
Tóm tắt AI
Khung huấn luyện IVT giúp mô hình đa phương thức nội hóa tư duy thị giác, cho phép suy luận video trực tiếp bằng văn bản mà không cần tạo ảnh trung gian, giúp tối ưu hóa hiệu suất đáng kể.
Bản dịch AI

Tác giả: Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt
Các mô hình ngôn ngữ lớn đa phương thức (multimodal large language models) ngày càng sử dụng chuỗi suy nghĩ trực quan (Visual CoT) để lập luận về các môi trường không gian, thời gian và hiện thân. Bằng cách tạo ra các hình ảnh suy luận trung gian, Visual CoT cung cấp một cơ chế trực quan cho khả năng dự đoán hình ảnh, nhưng lại gây ra chi phí suy luận đáng kể, điều này đặc biệt gây khó khăn cho việc lập luận video chủ động. Chúng tôi đặt câu hỏi liệu các mô hình có thể học cách tư duy trực quan trong quá trình huấn luyện trong khi vẫn lập luận trực tiếp ở giai đoạn suy luận (inference) hay không. Chúng tôi giới thiệu Internalized Visual Thinking (IVT), một khung hậu huấn luyện (post-training framework) giúp tối ưu hóa đồng thời việc dự đoán văn bản và dự đoán embedding tiếp theo trên các video không được gắn nhãn. Với một video được quan sát một phần, IVT dự đoán các biểu diễn tiềm ẩn (latent representations) của các khung hình tương lai cùng với câu trả lời văn bản mục tiêu, khuyến khích mô hình nắm bắt chuyển động, sự chuyển đổi đối tượng, tương tác và ý định tiềm ẩn. Tại giai đoạn suy luận, IVT tạo ra câu trả lời trực tiếp mà không cần tổng hợp hoặc mã hóa lại các khung hình tương lai. Chúng tôi thực hiện các nghiên cứu có kiểm soát trên các biểu diễn mục tiêu, thiết kế bộ giải mã, phạm vi dự đoán, hỗn hợp dữ liệu, chương trình huấn luyện và các mục tiêu dự đoán. IVT cải thiện hiệu suất so với phương pháp hậu huấn luyện chỉ dùng văn bản trên cả sáu thiết lập đánh giá, trong khi vẫn duy trì lộ trình suy luận hiệu quả như cũ. So với Visual CoT, IVT đạt được hiệu suất tương đương hoặc tốt hơn và giảm độ trễ từ đầu đến cuối (end-to-end latency) hơn 5 lần. Những phát hiện của chúng tôi cho thấy rằng việc tạo không gian pixel rõ ràng tại thời điểm suy luận, như được sử dụng trong Visual CoT, có thể không cần thiết cho việc lập luận video chủ động. Mô hình thế giới dự đoán (predictive world modeling) có thể được nội hóa trong quá trình huấn luyện để tạo ra các mô hình lập luận đa phương thức vừa chính xác hơn vừa hiệu quả hơn đáng kể.
Các bài đọc liên quan và cập nhật.
Chain-of-thought (CoT) prompting là một kỹ thuật tiêu chuẩn thực tế để gợi mở các phản hồi giống như lập luận từ các mô hình ngôn ngữ lớn (LLMs), cho phép chúng trình bày chi tiết từng bước trước khi đưa ra câu trả lời cuối cùng. Mặc dù sự tương đồng với tư duy con người là không thể phủ nhận, nhưng các động lực thúc đẩy sự thành công của lập luận CoT vẫn còn chưa rõ ràng. Trong công trình này, chúng tôi thực hiện phân tích chuyên sâu về các dấu vết CoT bắt nguồn từ…
Đọc thêm
Lập luận Chain-of-thought (CoT) trong các mô hình ngôn ngữ thị giác (VLMs) là yếu tố then chốt để cải thiện khả năng diễn giải và độ tin cậy. Tuy nhiên, các công thức huấn luyện hiện nay thường dựa vào các tập dữ liệu chủ yếu là các chú thích ngắn với lý lẽ tối thiểu. Trong công trình này, chúng tôi chỉ ra rằng việc huấn luyện VLM trên các câu trả lời ngắn dẫn đến khả năng tổng quát hóa kém đối với các tác vụ lập luận đòi hỏi giải thích chi tiết hơn. Để giải quyết hạn chế này, chúng tôi đề xuất một quy trình hai giai đoạn…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.