Sản phẩm
Marker 2 của Datalab: Vượt mặt MinerU và Docling về tốc độ lẫn độ chính xác
(giờ Việt Nam)
Tóm tắt AI
Marker 2 thiết lập chuẩn mực mới với 76.0 điểm trên olmOCR-bench, đạt tốc độ xử lý nhanh gấp 5 lần MinerU và vượt trội hơn Docling về hiệu suất thực tế.
Bản dịch AI

Datalab vừa phát hành Marker 2, phiên bản viết lại hoàn toàn của pipeline chuyển đổi tài liệu mã nguồn mở của họ. Marker chuyển đổi các tệp PDF, hình ảnh, PPTX, DOCX, XLSX, HTML và EPUB sang định dạng markdown, JSON, HTML hoặc các đoạn văn bản (chunks). Đội ngũ Datalab đã xây dựng lại công cụ này dựa trên ba thành phần được ra mắt trong những tháng gần đây: Surya OCR 2, một mô hình bố cục nhanh với 20 triệu tham số, và một phiên bản pdftext được xây dựng lại với tốc độ nhanh gấp 3 lần so với phiên bản trước.
Kết quả chính đến từ olmOCR-bench, một bộ benchmark của bên thứ ba từ Allen AI. Chế độ balanced (cân bằng) của Marker 2 đạt điểm tổng thể 76,0% và 83,5% đối với các tệp PDF kỹ thuật số gốc (born-digital). Công cụ này duy trì tốc độ 2,9 trang/giây trên một GPU B200 duy nhất. Con số này cao gấp hơn 5 lần thông lượng của pipeline backend từ MinerU, vốn đạt 72,7% với tốc độ 0,54 trang/giây. Docling đạt 50,3% với tốc độ 2,1 trang/giây trên cùng một bộ kiểm thử.
Marker 2 hiện đã ra mắt – nhanh hơn tới 5 lần và chính xác hơn so với mineru, docling và liteparse khi sử dụng các cấu hình tương đương.
Chuyển đổi các tệp pdf, hình ảnh, docx sang markdown. Tương thích với cả CPU và GPU, tốc độ lên tới 27 trang/giây. pic.twitter.com/75nMipDaZ7
Có gì mới trong Marker 2
Marker 2 cung cấp ba lộ trình chuyển đổi thay vì một như trước:
Chế độ hiện mặc định nhận diện thiết bị: balanced trên GPU, fast trên CPU/MPS, có thể ghi đè bằng tham số –mode. Hỗ trợ đầy đủ cho CPU là thay đổi cấu trúc thứ hai. Chế độ fast –disable_ocr không cần GPU và không cần máy chủ suy luận (inference server), và mô hình bố cục 20 triệu tham số vẫn có thể đọc các cột, bảng và tiêu đề trên CPU.
Thay đổi thứ ba thuộc về kiến trúc, và đây chính là yếu tố tạo nên các con số về thông lượng. Nhiều tiến trình worker CPU nhẹ chia sẻ chung một máy chủ suy luận Surya. Tiến trình cha (parent process) phân bổ khả năng xử lý đồng thời VLM cho các worker này, vì vậy thông lượng sẽ mở rộng theo năng lực của máy chủ thay vì phụ thuộc vào VRAM của từng tiến trình. Datalab báo cáo rằng chế độ balanced duy trì khoảng 2,9 trang/giây so với mức 0,3 trang/giây của luồng đơn trên cùng phần cứng.
Các thay đổi mang tính đột phá (breaking changes) cần được lưu ý trước khi nâng cấp. Hiện yêu cầu Python 3.10+. Việc đóng gói đã chuyển từ Poetry sang uv, với hatchling làm backend xây dựng, mặc dù lệnh pip install marker-pdf vẫn không thay đổi. Bộ chuyển đổi structured-extraction và các trình trích xuất đã bị loại bỏ; Datalab hướng người dùng sử dụng API được lưu trữ (hosted API) hoặc quy trình làm việc –use_llm thay thế.
So sánh
Bộ benchmark chấm điểm là olmOCR-bench từ Ai2: 1.403 tệp PDF với khoảng 8.400 bài kiểm tra đơn vị đạt/không đạt bao gồm kết xuất toán học, cấu trúc bảng, thứ tự đọc, tiêu đề đầu/chân trang và các bản quét cũ. Điểm tổng thể là trung bình cộng của 8 danh mục, được tính bằng trình kiểm tra chính thức của olmOCR-bench. Thông lượng là số trang/giây duy trì đồng thời trên một máy chủ B200, không phải độ trễ của luồng đơn.
Một lưu ý về nguồn gốc. olmOCR-bench là bộ benchmark của bên thứ ba từ Ai2, nhưng mọi số liệu về điểm số và thông lượng dưới đây đều đến từ các lần chạy thử nghiệm của chính Datalab. Tất cả đều có thể tái lập thông qua bộ công cụ mở trong kho lưu trữ Marker, vốn cũng cung cấp các trình chạy cạnh tranh cho MinerU, Docling và LiteParse bên cạnh trình chạy của Marker.
Những con số này cũng phản ánh tập hợp tài liệu của một bộ benchmark được đo lường trên một thiết lập phần cứng duy nhất, vì vậy kết quả trên tài liệu của bạn có thể khác biệt. Các đội ngũ đánh giá những hệ thống này nên chạy bộ công cụ trên chính kho dữ liệu của mình, đây là cách duy nhất để biết bốn hệ thống này xếp hạng thế nào trên các tài liệu mà họ thực sự xử lý.

Marker 2 so với MinerU
Pipeline backend của MinerU là hệ thống có kiến trúc tương đồng nhất. Cả hai đều đọc lớp văn bản PDF và thực hiện OCR một cách chọn lọc. Về điểm tổng thể, Marker chế độ balanced dẫn trước với 76,0 so với 72,7. Trên các tài liệu kỹ thuật số gốc, cả hai gần như ngang bằng: 83,5 so với 83,3.
Sự khác biệt nằm ở thông lượng. Marker chế độ balanced duy trì 2,9 trang/giây so với 0,54 trang/giây của MinerU, khoảng cách gấp 5,4 lần ở mức điểm cao hơn. Marker chế độ fast duy trì 7,4 trang/giây, gấp khoảng 13,7 lần tốc độ pipeline của MinerU, nhưng đạt điểm thấp hơn 6,1 điểm so với MinerU để đạt được tốc độ đó.
MinerU cũng cung cấp một VLM backend, mà Datalab cho biết có điểm số cao hơn pipeline backend của họ. Backend đó là phương pháp VLM toàn trang và không có trong bảng này. Các đội ngũ AI đánh giá MinerU nên benchmark lộ trình đó một cách riêng biệt.
Marker 2 so với Docling
Docling có khoảng cách lớn nhất trong số các pipeline GPU. Marker chế độ balanced dẫn trước 76,0 so với 50,3 về tổng thể và 83,5 so với 64,0 trên tài liệu kỹ thuật số gốc, đồng thời chạy nhanh hơn: 2,9 trang/giây so với 2,1 trang/giây. Datalab lưu ý rằng Docling được chạy trên pipeline mặc định của nó, sử dụng lớp văn bản cho các trang kỹ thuật số gốc và OCR cho các vùng hình ảnh.
Điểm mạnh của Docling là quản trị và độ rộng định dạng, không phải độ chính xác. Cơ sở mã nguồn được cấp phép MIT, có nguồn gốc từ IBM Research và được lưu trữ như một dự án trong LF AI & Data Foundation. Danh sách đầu vào của nó cũng mở rộng ra ngoài tài liệu sang các định dạng âm thanh và email.
Marker 2 so với LiteParse
LiteParse, từ đội ngũ LlamaIndex, là một trình phân tích tài liệu bằng Rust. Nó không cạnh tranh trên cùng một trục. Trên CPU, nó đạt 22,4 điểm tổng thể và 20,4 khi tắt OCR, so với 43,6 của Marker chỉ chạy trên CPU.
Tuy nhiên, LiteParse khi tắt OCR đạt 1721 trang/giây — gấp khoảng 73 lần chế độ CPU của Marker, đó là sự đánh đổi. Chế độ fast –disable_ocr của Marker chạy mô hình bố cục 20 triệu tham số trên CPU và vẫn khôi phục được cấu trúc, đó là lý do tại sao nó đạt điểm số cao gấp đôi so với việc trích xuất văn bản thuần túy. LiteParse không có mô hình bố cục và sẽ thất bại với bất kỳ nội dung nào không theo trình tự tuyến tính.
Marker 2 so với tầng VLM toàn trang
Đội ngũ Datalab nhấn mạnh rằng Marker được thiết kế như một pipeline thay vì một VLM, làm rõ rằng đây là những công cụ riêng biệt. Trong đánh giá này, Chandra 2 của họ đạt 85,8 điểm, trong khi Gemini Flash 3.5 qua API đạt 76,4 điểm. Kho lưu trữ Chandra của Datalab cũng xếp hạng olmOCR 2 của Ai2 ở mức 82,4 và dots.ocr 1.5 ở mức 83,9 trong một bảng riêng. Đối với các bản quét, các trang chứa nhiều toán học và để đạt độ chính xác cao nhất, tầng VLM vẫn vượt trội hơn tất cả các pipeline được liệt kê.
Chế độ balanced của Marker thu hẹp khoảng cách hiệu suất xuống chỉ còn 0,4 điểm so với Gemini Flash 3.5 về tổng thể, và thậm chí vượt trội hơn trên các tài liệu kỹ thuật số gốc với tỷ lệ 83,5 so với 79,1—mà không cần thực hiện lệnh gọi API cho mỗi trang.
Hành vi theo từng danh mục
Chế độ bạn chọn sẽ thay đổi hồ sơ lỗi, không chỉ là điểm số. Mỗi hàng là một danh mục của olmOCR-bench, được chấm điểm trên cả ba chế độ. Toán học là phần khó nhất: chế độ fast đọc các phương trình từ lớp văn bản PDF thay vì dùng VLM-OCR, vì vậy toán học arXiv giảm từ 83,9 xuống 23,4, và chế độ –disable_ocr đạt 0,0 điểm ở danh mục này theo thiết kế. Ngoài hai danh mục toán học, các bản quét cũ là phần yếu nhất trong mọi chế độ, cao nhất chỉ đạt 43,2.

Cấp phép
Đây là nơi bốn hệ thống khác biệt nhất đối với các đội ngũ thương mại:
So sánh trường hợp sử dụng
Điểm số không phải là yếu tố duy nhất để chọn công cụ. Loại kho dữ liệu, phần cứng, điều khoản cấp phép và định dạng đầu ra mới là yếu tố quyết định. Hãy thử công cụ chọn tương tác bên dưới để lọc mười kịch bản triển khai theo ràng buộc và theo công cụ, và xem trình phân tích nào phù hợp với trường hợp sử dụng của bạn.
Những điểm chính cần lưu ý
Công cụ giải thích động tương tác
Liên kết: Kho lưu trữ GitHub | Ghi chú phát hành | Bài đăng blog | Tweet thông báo

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người dùng.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.