The Decoder: AI News
85

Tin ngành

Nghiên cứu mới: Các bước suy luận trong văn bản AI tương ứng với những mô hình hoạt động nội tại riêng biệt

(giờ Việt Nam)

Tóm tắt AI

Các nhà nghiên cứu từ KAIST và Naver AI Lab phát hiện rằng các bước suy luận của AI có thể được phân biệt thông qua trạng thái nội tại của mô hình. Kết quả này cho thấy AI không chỉ tạo văn bản ngẫu nhiên mà thực sự vận hành theo các quy trình tư duy logic cụ thể ở tầng trung gian.

Bản dịch AI

AI models' written reasoning steps correspond to distinct internal patterns, a new study finds

Chuyển đến nội dung chính

12 tháng 9, 2026

Nano Banana Pro được gợi ý bởi THE DECODER

Liệu các bước suy luận riêng biệt mà một mô hình ngôn ngữ thể hiện trong văn bản đầu ra có thể được tìm thấy trong các trạng thái nội tại của nó không? Một nghiên cứu mới đã đưa vấn đề này vào thử nghiệm.

Khi một mô hình suy luận giải quyết một nhiệm vụ từng bước một, nó thực hiện các công việc khác nhau trong quá trình đó: đọc dữ liệu, phân tích vấn đề, truy xuất công thức, thực hiện tính toán. Các nhà nghiên cứu tại KAIST và Naver AI Lab của Hàn Quốc muốn biết liệu những bước suy luận đó có thể được tách biệt khỏi nhau bên trong các biểu diễn số học của mô hình hay không. Câu trả lời là có, và tín hiệu này mạnh nhất ở các lớp trung gian.

Nhóm nghiên cứu đã xác định tám thao tác suy luận lặp đi lặp lại, bao gồm trích xuất, phân tách, truy xuất công thức, suy diễn và tính toán. Họ đã yêu cầu ba mô hình (Qwen2.5-7B, Qwen3-8B và Gemma4-31B) giải các bài toán, chia nhỏ các lộ trình giải quyết thành từng phân đoạn, sau đó sử dụng GPT-5 để gắn nhãn cho mỗi phân đoạn bằng một trong những thao tác đó.

Two-part graphic from the paper. Left side shows the same Qwen3-8B response three times with color-coded highlights for Extraction, Recall, and Decomposition operations. Right side shows a scatter plo

Các bước suy luận có thể tách biệt rõ ràng bên trong mô hình

Các thao tác suy luận khác nhau có thể được phân biệt một cách đáng tin cậy trong các biểu diễn nội tại của mô hình, và điều này đúng với cả ba mô hình được thử nghiệm. Sự tách biệt đạt đỉnh điểm ở các lớp trung gian.

Các nhà nghiên cứu đã kiểm tra xem liệu việc lựa chọn từ ngữ đơn thuần có thể giải thích cho hiệu ứng này hay không. Một bộ phân loại chỉ xem xét các token được sử dụng cho kết quả kém hơn so với bộ phân loại phân tích các biểu diễn nội tại. Vị trí trong lộ trình giải quyết cũng không giải thích được điều này. Điều đó có nghĩa là các trạng thái nội tại mang thông tin về loại bước suy luận vượt xa khỏi cách diễn đạt ở bề mặt.

Left side shows AUROC values for eight reasoning operations in Qwen3-8B, Qwen2.5-7B, and Gemma4-31B with confidence intervals. Right side shows the average AUROC across all operations plotted over mod

Cùng một từ ngữ, các biểu diễn khác nhau tùy thuộc vào bước suy luận

Các từ chức năng phổ biến như "a", "is" hoặc "the" xuất hiện trong các bước suy luận rất khác nhau. Ở các lớp đầu, biểu diễn của chúng vẫn bị trộn lẫn, nhưng đến các lớp trung gian và lớp sau, chúng tách biệt theo thao tác xung quanh. Cùng một từ nhận được một biểu diễn nội tại khác nhau tùy thuộc vào việc nó thuộc về bước suy luận nào.

Các nhà nghiên cứu cũng kiểm tra xem liệu một bước suy luận có hình thành một cách độc lập hay không. Khi họ chặn sự chú ý (attention) đến 30 token trước đó thông qua một biện pháp can thiệp có mục tiêu, tín hiệu cho thao tác đó đã yếu đi. Các bước suy luận không tự nhiên xuất hiện mà được xây dựng dựa trên ngữ cảnh trước đó.

Grid of 18 scatter plots for three operation pairs across the embedding layer and layers 1, 11, 21, 27, and 36 of Qwen3-8B. Each point represents one occurrence of a shared token.

Ngay cả đối với các bài toán được giải sai, loại bước mà mô hình đang thực hiện vẫn có thể xác định được, cho dù đó là tính toán, truy xuất công thức hay suy diễn. Một bước tính toán sai lầm vẫn trông giống như một bước tính toán ở bên trong, ngay cả khi kết quả cuối cùng là sai.

Khả năng tách biệt này cũng được giữ vững trong các thử nghiệm bổ sung. Nó được tái lập với Llama-3-8B, và đối với Qwen3-8B, các bộ phân loại đã huấn luyện được chuyển đổi thành công sang GPQA-Diamond và MATH-500. Tuy nhiên, các thí nghiệm này chỉ giới hạn trong các nhiệm vụ toán học và một số ít mô hình. Liệu những phát hiện này có thể được sử dụng để phát hiện lỗi hoặc điều hướng mô hình trong quá trình tạo văn bản hay không vẫn là một câu hỏi mở cho các nghiên cứu trong tương lai.

Mối quan hệ giữa văn bản đầu ra và tính toán nội tại rất quan trọng đối với sự an toàn của AI. Theo OpenAI, đọc chuỗi suy nghĩ (chain of thought) là một trong số ít các công cụ giám sát hiện có, nhưng Anthropic đã chỉ ra rằng các mô hình chỉ tiết lộ những gợi ý mà chúng đã sử dụng trong 25 đến 39 phần trăm các trường hợp. Một phương pháp chuyển đổi các vector nội tại của mô hình thành văn bản có thể đọc được đã tiết lộ rằng Claude Opus 4.6 xử lý nhiều hơn những gì hiển thị trong suy luận đầu ra của nó. Và với mô hình Astra của OpenAI, kỹ thuật Recurrent Depth chuyển một phần suy luận vào các biểu diễn số học nội tại, đây chính là không gian mà nghiên cứu của KAIST đang điều tra.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về các công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

Đăng ký The Decoder

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.