QbitAI
88

Mô hình

Huy chương Fields tham chiến AI: Sự kết hợp giữa Qwen 4B và GLM tạo đột phá tại ARC-AGI

(giờ Việt Nam)

Tóm tắt AI

Sự hợp tác giữa các chuyên gia toán học hàng đầu và mô hình ngôn ngữ lớn đang mở ra hướng đi mới, khi kết hợp Qwen 4B trên thiết bị di động với sức mạnh đám mây của GLM để chinh phục thử thách ARC-AGI.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

07/09/2026 16:36:30 Nguồn: QbitAI

“Việc tìm ra cơ sở toán học chung giữa hai mô hình thực sự rất khó khăn”

Heng Yu, đưa tin từ Aofei Temple

QbitAI | Kênh chính thức QbitAI

Nghe có vẻ vô lý?

GPT-6 Astra đạt điểm gần như tuyệt đối trong bài kiểm tra ARC-AGI 3, và một mô hình nhỏ 4B có thể chạy trên điện thoại cũng có thể đạt kết quả tương tự.

Chính xác hơn, đó là sự kết hợp giữa 4B Qwen và 753B GLM 5.2.

Trong đó, GLM-5.2 nằm trên đám mây, còn thiết bị di động chỉ cần chạy Qwen-3.5 4B. Mô hình lớn không xuất ra bất kỳ từ nào trong suốt quá trình, mô hình nhỏ chịu trách nhiệm viết ra câu trả lời cuối cùng.

Các chi tiết kỹ thuật cụ thể vẫn chưa được công bố, đội ngũ đứng sau là Mostik từ chối tiết lộ vào thời điểm này, "vì cuộc thi vẫn chưa kết thúc".

Tuy nhiên, họ đã công bố những phát hiện cốt lõi:

Các mô hình AI từ trước đến nay luôn giao tiếp với nhau theo một cách cực kỳ kém hiệu quả.

Mostik tin rằng họ đã xây dựng một cây cầu giúp hiệu suất truyền tải thông tin giữa các mô hình tăng lên vài bậc độ lớn.

Theo kết quả thực nghiệm mà nhóm công bố, giải pháp này cho phép mô hình 4B bù đắp khoảng 50% khoảng cách hiệu suất với mô hình 753B, đồng thời tăng độ chính xác của chính nó lên 25%. Đối với các tập hợp con bài toán khó nơi sự khác biệt giữa mô hình lớn và nhỏ rõ rệt hơn, mức cải thiện đạt tới 2 lần.

Trong khi đó, chi phí suy luận phía mô hình lớn đã bị giảm xuống chỉ còn khoảng 1/20 so với ban đầu.

Mostik mới thành lập được 4 tháng, đội ngũ gồm 15 người, trong đó có 12 tiến sĩ.

Trong nhóm còn có một người đoạt giải Fields – nhà toán học người Nga Stanislav Smirnov, người đã chứng minh tính bất biến bảo giác của "mô hình thấm" (percolation model) và "mô hình Ising phẳng" trong vật lý thống kê vào năm 2010.

Hai megabyte và mười bảy bit

Trong quá trình một mô hình lớn tạo ra một token, nó sẽ xây dựng hơn một trăm vector ẩn bên trong, chứa tổng cộng khoảng một triệu giá trị, tương đương khoảng hai megabyte thông tin trạng thái nội bộ.

Sau đó, nó chọn ra một token để xuất ra từ bảng từ vựng khoảng 150.000 từ.

17 bit rời khỏi mô hình, còn hai megabyte bị loại bỏ và không bao giờ được sử dụng nữa.

Hiện tại, tất cả các hệ thống cho phép nhiều mô hình cộng tác, bao gồm các tác nhân phụ (sub-agents) lập trình, hội đồng mô hình, điều phối định tuyến, đều được xây dựng dựa trên 17 bit này.

Kênh giao tiếp duy nhất giữa các mô hình là văn bản.

Vậy rốt cuộc bên trong hai megabyte bị loại bỏ đó chứa đựng những gì?

Các nghiên cứu về khả năng giải thích trong hai năm gần đây đã đưa ra câu trả lời rõ ràng: đó là nội dung cốt lõi của các tính toán chuyên sâu.

Một bài báo được công bố tại ICLR 2026 cho thấy, trước khi viết ra từ "accountant" vài token, Qwen-3 đã mang sẵn biểu diễn của từ này bên trong, chính biểu diễn này giúp mô hình chọn đúng mạo từ "an" thay vì "a" từ trước đó.

Hơn nữa, mô hình càng lớn thì khả năng lập kế hoạch trước này càng mạnh, và thông tin "chưa được nói ra" chứa trong trạng thái nội bộ càng nhiều.

Nhóm nghiên cứu khả năng giải thích của Anthropic cũng quan sát thấy hiện tượng tương tự trên Claude 3.5 Haiku: khi mô hình làm thơ, nó đã xác định được vần điệu trước khi đặt bút viết.

Họ còn phát hiện ra một cấu trúc gọi là "J-space" – tại bất kỳ thời điểm nào, mô hình cũng duy trì một nhóm các khái niệm chưa được biểu đạt, không phải là tiếng vang của đầu vào, cũng không phải là dự đoán cho token tiếp theo, mà là thông tin đang được xử lý.

Bản thân nhóm Anthropic đã tổng kết rằng, những phép đo này tiết lộ các quá trình suy luận và phản ứng nội bộ chưa từng xuất hiện trong đầu ra.

Điều này có nghĩa là, khi một mô hình viết một đoạn văn cho mô hình khác, thứ bị mất đi không phải là thông tin định dạng, mà là quá trình tính toán chuyên sâu đằng sau việc đưa ra lựa chọn.

Xây dựng cầu nối giữa mô hình lớn và mô hình nhỏ

Tóm tắt những gì Mostik đã làm trong một câu:

Cho phép một mô hình truyền trực tiếp trạng thái ẩn của nó cho một mô hình khác thông qua một cây cầu (bridge) nhỏ đã qua đào tạo, bên nhận sau khi lấy được các trạng thái nội bộ này sẽ sử dụng trực tiếp.

Toàn bộ quá trình không tạo ra bất kỳ văn bản nào, trọng số của hai mô hình hoàn toàn bị đóng băng, cây cầu là phần duy nhất trong hệ thống được huấn luyện.

Trong bản demo công khai, họ đã chọn GLM-5.2 của Zhipu (753B tham số) làm bên gửi và Qwen-3.5 của Alibaba (4B tham số, có thể chạy trên điện thoại) làm bên nhận.

Mô hình lớn không tạo ra bất kỳ văn bản nào từ đầu đến cuối, nó chỉ đọc câu hỏi, trạng thái ẩn đi qua cầu để truyền đi, sau đó dừng lại.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.