Mô hình
H Company ra mắt NeoMME: Bộ mã hóa đa phương thức đơn tháp, tối ưu hóa hiệu suất không cần bộ giải mã
(giờ Việt Nam)
Tóm tắt AI
H Company giới thiệu dòng NeoMME (260M/800M) sử dụng kiến trúc Transformer đơn tháp để xử lý đồng thời văn bản và hình ảnh, loại bỏ bộ giải mã nhân quả giúp tăng hiệu quả trong các tác vụ đa phương thức.
Bản dịch AI

Hầu hết các công cụ truy xuất tài liệu trực quan đang được sử dụng hiện nay đều là những sản phẩm "thừa kế". ColPali và các mô hình kế nhiệm nó lấy một mô hình ngôn ngữ-hình ảnh tạo sinh (generative vision-language model) và tái sử dụng nó như một bộ mã hóa (encoder). Kết quả là mô hình vẫn mang theo một tháp thị giác (vision tower) được huấn luyện trước riêng biệt và một bộ giải mã nhân quả (causal decoder) không bao giờ thực sự tạo ra token. Điều này gây lãng phí tham số và tài nguyên tính toán cho một tác vụ vốn chỉ cần các biểu diễn (representations).
H Company vừa ra mắt NeoMME, một dòng bộ mã hóa hai chiều (bidirectional encoders) với quy mô 260 triệu và 800 triệu tham số, loại bỏ cả hai thành phần nêu trên. Một Transformer duy nhất xử lý các token văn bản đa ngôn ngữ và các mảng hình ảnh RGB 32×32 thô thông qua cùng các lớp, được huấn luyện từ khởi tạo ngẫu nhiên. Phiên bản tinh chỉnh cho truy xuất, NeoMME-Retriever, đạt 0.523 nDCG@10 trên ViDoRe v3 với 260 triệu tham số.
Liệu nó có khả thi để triển khai? Có. Mọi checkpoint đều được phát hành theo giấy phép Apache 2.0 với sự hỗ trợ ngay từ ngày đầu trong Hugging Face Transformers. Mô hình 260 triệu tham số lập chỉ mục 51,3 trang mỗi giây trên một card NVIDIA L40S duy nhất và mã hóa một truy vấn trong 78,3 ms trên máy chủ chỉ sử dụng CPU.
Một tháp, hai phương thức
Văn bản đi vào thông qua một embedding phân tách kiểu ALBERT: một bảng tra cứu 256 chiều được chiếu lên độ rộng của mô hình. Hình ảnh được chia thành các mảng 32×32 không chồng lấp và được chiếu bởi một MLP 2 lớp được huấn luyện từ đầu. Không có mô-đun gộp mảng (patch-merging), không có tháp SigLIP2.
Cả hai mô hình đều hỗ trợ ngữ cảnh 16.384 token, đủ cho hai hình ảnh 4K UHD 3.840×2.160 tiêu chuẩn sau khi chia mảng. Hầu hết các lớp sử dụng cơ chế chú ý cửa sổ trượt đối xứng (symmetric sliding-window attention); cứ mỗi sáu lớp và lớp cuối cùng sẽ chú ý toàn cục. Cấu trúc này sử dụng cơ chế chú ý truy vấn nhóm (grouped-query attention), chuẩn hóa truy vấn-khóa, chú ý có cổng (gated attention), nhúng vị trí xoay 2D và các MLP squared-ReLU. Số lượng tham số chính xác lần lượt là 262.937.906 và 793.715.032.
Bộ tách từ (tokenizer) là loại BPE không giới hạn khoảng trắng với từ vựng gồm 131.072 mục, được huấn luyện từ đầu. Trên 14 ngôn ngữ mục tiêu trong tập devtest của FLORES-200, nó tạo ra ít hơn 44,4% token so với ModernBERT.
Được huấn luyện như một bộ khử nhiễu khuếch tán có mặt nạ (masked diffusion denoiser)
Tiền huấn luyện là quá trình khuếch tán có mặt nạ rời rạc trên văn bản, tùy chọn điều kiện hóa trên các mảng hình ảnh hiển thị. Các phân đoạn chỉ có văn bản lấy tỷ lệ nhiễu ngẫu nhiên từ 0 đến 1. Các phân đoạn đa phương thức lấy từ 0,30 đến 1, giúp loại bỏ lối tắt chỉ dùng ngôn ngữ và buộc mô hình phải đọc nội dung trang.
Một thử nghiệm cắt bỏ (ablation probe) đa phương thức xác nhận điều này hiệu quả. Ở mức che mặt nạ 90%, các mảng trang hiển thị giúp tăng độ chính xác của token bị che lên 38,4 điểm đối với mô hình 260 triệu và 40,5 điểm đối với mô hình 800 triệu. Mỗi lượt chạy xử lý khoảng 524 tỷ token đầu vào đã đóng gói, trong đó khoảng 290 tỷ là văn bản thuần túy, trên lần lượt 16 và 32 bộ tăng tốc H100.
Kết quả truy xuất
NeoMME-Retriever bổ sung hai đầu ra (heads) được huấn luyện đồng thời trên backbone chia sẻ: một đầu ra dày (dense head) gộp trung bình với độ rộng Matryoshka, và một đầu ra tương tác muộn (late-interaction head) chiếu mọi token và mảng về 128 chiều. Một lần truyền xuôi (forward pass) trả về cả hai.
Trên ViDoRe v3, mô hình 260 triệu đạt 0.523 nDCG@10 và mô hình 800 triệu đạt 0.556. Kết quả của bản 260 triệu chỉ kém 0.002 so với ColQwen2.5-v0.2 với 3,75 tỷ tham số, và cao hơn 26,1 điểm so với mô hình dưới 300 triệu tham số tốt nhất khác. Mô hình 800 triệu đứng sau Vultron Retriever Flash cùng kích thước 0,9 điểm. Trên ViDoRe v1 và v2, các mô hình đạt lần lượt 0.860/0.522 và 0.874/0.559 nDCG@5.
Khả năng truy xuất văn bản yếu hơn. Trên BEIR-15, tương tác muộn đạt 0.4881 và 0.5126, so với 0.5722 của LateOn với 149 triệu tham số. Các tác giả cho rằng điều này một phần do quy mô giám sát: NeoMME đã thấy khoảng 430 nghìn ví dụ truy vấn văn bản, so với khoảng 660 triệu ví dụ tương phản của mLateOn.
Lưu trữ và thông lượng
Chỉ mục tương tác muộn rất tốn kém. Một trang 2048×2048 tạo ra 4.162 vector, khoảng 1,5 MB cho mỗi tài liệu ViDoRe v3 ở định dạng float32. Hai phương pháp giúp giảm con số này. Gộp token phân cấp (hierarchical token pooling) với hệ số 10 cùng truy vấn và tài liệu int8 mang lại 39,0 kB mỗi trang, giảm 39,4 lần trong khi vẫn giữ lại 99,16% nDCG@10 cơ sở. Hệ số gộp 8 với truy vấn int8 và tài liệu nhị phân mang lại 6,0 kB, giảm 255,5 lần trong khi giữ lại 95,19%.
Việc lập chỉ mục diễn ra nhanh chóng so với số lượng vector. Với đầu vào 2048×2048 tương ứng trên một card L40S, NeoMME-260M mã hóa 51,3 trang mỗi giây so với 26,0 của ColModernVBERT, chênh lệch 1,97 lần.
Giải thích tương tác
Những điểm chính
Hãy xem Bài báo, Bộ sưu tập mô hình và Bản demo. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi cũng như Đăng ký nhận Bản tin. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.