QbitAI
85

Mô hình

Zidong Taichu ra mắt phương pháp cắt tỉa GMC: Giảm 80% token nhưng vẫn giữ nguyên khả năng đa phương thức

(giờ Việt Nam)

Tóm tắt AI

Phương pháp cắt tỉa lõi GMC mới cho phép mô hình Zidong Taichu tối ưu hóa hiệu suất đáng kể mà không cần huấn luyện lại, sẵn sàng sử dụng ngay lập tức.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-08-12 18:54:29 Nguồn: QbitAI

Không cần huấn luyện, dùng được ngay!

Yun Zhong, đưa tin từ QbitAI

QbitAI | Kênh chính thức QbitAI

Khi độ phân giải và khả năng hiểu hình ảnh - văn bản của các mô hình ngôn ngữ thị giác (VLM) liên tục được nâng cấp, hình ảnh sẽ được mã hóa thành hàng trăm đến hàng chục nghìn Token thị giác.

Việc một lượng lớn Token liên tục tham gia vào quá trình tính toán giải mã và chiếm dụng KV Cache trong thời gian dài đã dẫn đến hàng loạt vấn đề như tiêu tốn bộ nhớ video (VRAM), tốc độ suy luận chậm và chi phí triển khai cao. Sự dư thừa Token thị giác đã trở thành nút thắt cốt lõi đối với việc suy luận hiệu quả và ứng dụng quy mô lớn của các mô hình đa phương thức.

Giải pháp phổ biến hiện nay trong ngành là sàng lọc Token theo phương pháp Top-K truyền thống: chấm điểm độc lập cho từng Token và chỉ giữ lại những mẫu có điểm số cao nhất.

Tuy nhiên, phương pháp này tồn tại những khiếm khuyết rõ rệt: các Token điểm cao tập trung dày đặc ở những vùng nổi bật trên khung hình, dẫn đến việc liên tục giữ lại các thông tin dư thừa đồng nhất, trong khi rất dễ bỏ sót các bằng chứng bổ trợ quan trọng nhưng phân tán như văn bản, con số, trục tọa độ, hay mối quan hệ không gian giữa các đối tượng.

Đồng thời, các Token điểm thấp bị xóa trực tiếp, khiến các thông tin chi tiết bị mất vĩnh viễn, dẫn đến suy luận sai lệch, phán đoán thực tế không chính xác và gia tăng hiện tượng ảo giác thị giác. Đây là bài toán khó phổ biến trong ngành: "Nén dữ liệu tất yếu làm giảm độ chính xác".

△ So sánh giữa phương pháp sàng lọc Top-K truyền thống và GMC

Nhằm giải quyết các điểm nghẽn trên, nhóm nghiên cứu mô hình lớn Zidong Taichu thuộc Viện Tự động hóa, Viện Hàn lâm Khoa học Trung Quốc đã đề xuất phương pháp cắt tỉa tập lõi GMC (Grounded Message Coreset Pruning), tạo ra bước đột phá về công nghệ.

GMC thoát ly hoàn toàn khỏi tư duy truyền thống là "sàng lọc Token tối ưu đơn lẻ". Dựa trên logic suy luận thực tế của mô hình, nhóm nghiên cứu cho rằng các mô hình ngôn ngữ thị giác phụ thuộc vào thông điệp tập thể được tạo thành từ toàn bộ Token, chứ không phải các mảnh hình ảnh cô lập. Do đó, việc nén không chỉ cần xác định "vị trí lưu giữ thông tin" mà còn phải giải quyết "cách thức mang thông tin của Token được giữ lại".

△ Khung tổng thể của phương pháp cắt tỉa tập lõi GMC

Đổi mới cốt lõi: Kiến trúc hai giai đoạn, giải quyết tận gốc mâu thuẫn giữa sự dư thừa Token và mất mát thông tin.

GMC được chia thành hai giai đoạn chính: sàng lọc thích ứng bằng chứng bổ trợ và truyền tải thông tin bổ trợ tập thể, giúp đạt được khả năng nén chuỗi thị giác độ trung thực cao và hiệu quả cao mà không cần huấn luyện hay phụ thuộc vào mô hình bổ trợ.

1. Sàng lọc thích ứng bằng chứng bổ trợ

GMC xây dựng bằng chứng đồng thời từ ba góc độ: ngữ nghĩa câu hỏi, ngoại hình thị giác và vị trí không gian.

Đầu tiên, tận dụng cơ chế chú ý thị giác - văn bản (vision-text attention) vốn có bên trong mô hình ngôn ngữ thị giác để xác định các vùng liên quan trực tiếp đến câu hỏi hiện tại.

Thứ hai, bảo vệ các cấu trúc ngoại hình khác nhau trong hình ảnh dựa trên sự tương đồng giữa các đặc trưng thị giác, tránh việc mô hình chỉ tập trung vào nội dung đã được kích hoạt bởi câu hỏi.

Cuối cùng, xây dựng bằng chứng không gian thông qua tọa độ hình ảnh gốc để giữ lại các thông tin về vị trí và hình học quan trọng trong các tác vụ biểu đồ, tài liệu và suy luận quan hệ.

Khi chọn các Token quan trọng, GMC thực hiện lựa chọn dựa trên đóng góp mới của chúng đối với "bằng chứng chưa được bao phủ".

Khi một vùng nào đó đã được biểu diễn đầy đủ, giá trị của các Token tương tự ở gần đó sẽ giảm xuống, hệ thống sẽ chuyển sang chọn các vùng khác có khả năng bổ sung cho văn bản, đối tượng, con số hoặc mối quan hệ không gian.

Nhờ đó, ngân sách Token hạn hẹp có thể được phân bổ cho nhiều loại thông tin bổ trợ khác nhau thay vì liên tục tập trung vào cùng một vị trí nổi bật.

2. Truyền tải thông tin bổ trợ tập thể

Việc chỉ chọn ra các vị trí đại diện không thể giải quyết hoàn toàn vấn đề mất mát thông tin, vì các Token không được chọn vẫn mang theo các chi tiết quan trọng.

Do đó, GMC đề xuất thêm cơ chế truyền tải thông tin bổ trợ tập thể (Population Transport), chuyển trạng thái ẩn của tất cả các Token cần xóa vào các Token đại diện phù hợp nhất.

Quá trình này xem xét tổng hợp sự tương đồng về đặc trưng thị giác và mối quan hệ lân cận không gian, tổng hợp một lượng lớn Token thị giác thành một số ít các biểu diễn cô đọng.

Các nội dung có sự khớp nối ngữ nghĩa rõ ràng có thể được truyền đến các đại diện tương tự, trong khi các chi tiết cục bộ dễ gây nhầm lẫn sẽ có xu hướng được giữ lại ở các vị trí lân cận.

Sau khi hoàn tất quá trình tổng hợp, các Token thị giác không được chọn sẽ bị xóa, và mô hình sau đó tiếp tục thực hiện tính toán chú ý trên chuỗi Token đã nén.

Khác với các phương pháp yêu cầu huấn luyện lại mô hình hoặc giới thiệu công cụ bên ngoài, GMC không cần nhãn tác vụ, cập nhật tham số, bộ phát hiện phụ trợ, mô hình OCR hay bất kỳ mô hình bổ sung nào, có thể áp dụng trực tiếp vào các mô hình lớn đa phương thức thị giác - ngôn ngữ hiện có.

Đồng thời, GMC thực hiện nén chuỗi thực tế chứ không chỉ đơn thuần ẩn Token thông qua mặt nạ (mask), do đó có thể giảm thiểu thực sự khối lượng tính toán của các lớp giải mã phía sau và mức độ chiếm dụng KV Cache.

Ưu điểm cốt lõi của giải pháp: Thích ứng không tốn phí với mọi loại mô hình lớn hình ảnh - văn bản.

1. Hoàn toàn không cần huấn luyện, không phụ thuộc vào yếu tố bên ngoài:

Không cần tinh chỉnh mô hình (fine-tuning), không cần nhãn tác vụ, không cần OCR/bộ phát hiện bên ngoài, không cần mô hình hỗ trợ, dùng được ngay, tương thích trực tiếp với các mô hình lớn thị giác - ngôn ngữ phổ biến như Qwen, LLaVA...

2. Nén không giảm chất lượng, tích hợp sẵn khả năng khử nhiễu:

Lọc bỏ các Token dư thừa không hiệu quả đồng thời giữ lại trọn vẹn bằng chứng thị giác cần thiết cho suy luận, hiệu suất trong nhiều bài kiểm tra chuẩn đạt mức ngang bằng hoặc thậm chí vượt trội so với mô hình gốc ban đầu.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.