MarkTechPost
85

Sản phẩm

Datalab Marker v2 ra mắt: Hiệu suất vượt trội, nhanh gấp 5 lần MinerU

(giờ Việt Nam)

Tóm tắt AI

Datalab vừa nâng cấp Marker lên phiên bản v2 với kiến trúc ba chế độ, đạt 76.0 điểm trên olmOCR-bench. Tốc độ xử lý đạt 2.9 trang/giây trên GPU B200, vượt xa MinerU và Docling về cả độ chính xác lẫn tốc độ.

Bản dịch AI

Datalab Marker v2 vs MinerU, Docling, and Liteparse: Benchmark Breakdown

Datalab vừa phát hành Marker 2, phiên bản viết lại hoàn toàn của pipeline chuyển đổi tài liệu mã nguồn mở của họ. Marker chuyển đổi các tệp PDF, hình ảnh, PPTX, DOCX, XLSX, HTML và EPUB sang định dạng markdown, JSON, HTML hoặc các đoạn văn bản (chunks). Đội ngũ Datalab đã xây dựng lại công cụ này dựa trên ba thành phần được ra mắt trong những tháng gần đây: Surya OCR 2, một mô hình bố cục nhanh với 20 triệu tham số, và một phiên bản pdftext được xây dựng lại với tốc độ nhanh gấp 3 lần so với phiên bản trước.

Kết quả chính đến từ olmOCR-bench, một bộ benchmark của bên thứ ba từ Allen AI. Chế độ cân bằng (balanced mode) của Marker 2 đạt điểm tổng thể 76,0% và 83,5% đối với các tệp PDF kỹ thuật số gốc (born-digital). Công cụ này duy trì tốc độ 2,9 trang mỗi giây trên một GPU B200 duy nhất. Con số này cao gấp hơn 5 lần thông lượng của backend pipeline MinerU, vốn đạt 72,7% với tốc độ 0,54 trang mỗi giây. Docling đạt 50,3% với tốc độ 2,1 trang mỗi giây trên cùng một bộ kiểm thử.

Có gì mới trong Marker 2

Marker 2 cung cấp ba lộ trình chuyển đổi thay vì chỉ một như trước:

Chế độ hiện mặc định nhận diện thiết bị: cân bằng trên GPU, nhanh trên CPU/MPS, và có thể ghi đè bằng lệnh –mode. Hỗ trợ CPU đầy đủ là thay đổi cấu trúc thứ hai. Chế độ fast –disable_ocr không cần GPU hay máy chủ suy luận (inference server), và mô hình bố cục 20 triệu tham số vẫn có thể đọc các cột, bảng và tiêu đề trên CPU.

Thay đổi thứ ba thuộc về kiến trúc, và đây chính là yếu tố tạo nên các con số về thông lượng. Nhiều tiến trình CPU nhẹ (thin CPU workers) chia sẻ chung một máy chủ suy luận Surya. Tiến trình cha (parent process) phân bổ khả năng xử lý đồng thời VLM cho các worker này, vì vậy thông lượng sẽ mở rộng theo năng lực máy chủ thay vì phụ thuộc vào VRAM của từng tiến trình. Datalab báo cáo rằng chế độ cân bằng duy trì khoảng 2,9 trang/giây so với mức 0,3 trang/giây của luồng đơn trên cùng phần cứng.

Các thay đổi gây xung đột (breaking changes) cần được lưu ý trước khi nâng cấp. Hiện yêu cầu Python 3.10+. Việc đóng gói đã chuyển từ Poetry sang uv, với hatchling làm backend xây dựng, mặc dù lệnh pip install marker-pdf vẫn không thay đổi. Bộ chuyển đổi và trích xuất có cấu trúc (structured-extraction) đã bị loại bỏ; Datalab hướng người dùng sử dụng API được lưu trữ (hosted API) hoặc quy trình làm việc –use_llm thay thế.

So sánh

Bộ benchmark chấm điểm là olmOCR-bench từ Ai2: 1.403 tệp PDF với khoảng 8.400 bài kiểm tra đơn vị đạt/không đạt bao gồm kết xuất toán học, cấu trúc bảng, thứ tự đọc, tiêu đề đầu/chân trang và các bản quét cũ. Điểm tổng thể là trung bình cộng của 8 danh mục, được tính bằng trình kiểm tra chính thức của olmOCR-bench. Thông lượng là số trang/giây duy trì đồng thời trên một máy chủ B200, không phải độ trễ của luồng đơn.

Lưu ý về nguồn gốc dữ liệu. olmOCR-bench là bộ benchmark của bên thứ ba từ Ai2, nhưng mọi số liệu về điểm số và thông lượng dưới đây đều đến từ các lần chạy thử nghiệm của chính Datalab. Tất cả đều có thể tái lập thông qua bộ kiểm thử mở trong kho lưu trữ Marker, vốn cung cấp sẵn các trình chạy cho đối thủ cạnh tranh như MinerU, Docling và LiteParse cùng với trình chạy của riêng Marker.

Những con số này cũng phản ánh tập hợp tài liệu của một bộ benchmark được đo trên một cấu hình phần cứng duy nhất, vì vậy kết quả trên tài liệu của bạn có thể khác biệt. Các đội ngũ đánh giá những hệ thống này nên chạy bộ kiểm thử trên chính kho tài liệu của mình, đây là cách duy nhất để biết bốn hệ thống này xếp hạng thế nào trên các tài liệu mà họ thực sự xử lý.

Marker 2 so với MinerU

Backend pipeline của MinerU là hệ thống có kiến trúc tương đồng nhất. Cả hai đều đọc lớp văn bản PDF và thực hiện OCR có chọn lọc. Về điểm tổng thể, Marker chế độ cân bằng dẫn trước với 76,0 so với 72,7. Trên các tài liệu kỹ thuật số gốc, cả hai gần như ngang bằng: 83,5 so với 83,3.

Sự khác biệt nằm ở thông lượng. Marker chế độ cân bằng duy trì 2,9 trang/giây so với 0,54 trang/giây của MinerU, một khoảng cách gấp 5,4 lần ở mức điểm cao hơn. Marker chế độ nhanh (fast) duy trì 7,4 trang/giây, nhanh gấp khoảng 13,7 lần tốc độ pipeline của MinerU, nhưng đạt điểm thấp hơn MinerU 6,1 điểm để đổi lấy tốc độ đó.

MinerU cũng cung cấp một backend VLM, mà Datalab cho biết có điểm số cao hơn backend pipeline của họ. Backend đó là phương pháp VLM toàn trang và không có trong bảng này. Các đội ngũ AI đánh giá MinerU nên benchmark lộ trình đó một cách riêng biệt.

Marker 2 so với Docling

Docling có khoảng cách lớn nhất trong số các pipeline GPU. Marker chế độ cân bằng dẫn trước 76,0 so với 50,3 về tổng thể và 83,5 so với 64,0 trên tài liệu kỹ thuật số gốc, đồng thời chạy nhanh hơn: 2,9 trang/giây so với 2,1 trang/giây. Datalab lưu ý rằng Docling được chạy trên pipeline mặc định, sử dụng lớp văn bản cho các trang kỹ thuật số gốc và OCR cho các vùng hình ảnh.

Điểm mạnh của Docling là khả năng quản trị và độ rộng của định dạng, không phải độ chính xác. Cơ sở mã nguồn được cấp phép MIT, bắt nguồn từ IBM Research và được lưu trữ như một dự án trong LF AI & Data Foundation. Danh sách đầu vào của nó cũng mở rộng ra ngoài tài liệu sang cả định dạng âm thanh và email.

Marker 2 so với LiteParse

LiteParse, từ đội ngũ LlamaIndex, là một trình phân tích tài liệu bằng Rust. Nó không cạnh tranh trên cùng một trục. Trên CPU, nó đạt 22,4 điểm tổng thể và 20,4 khi tắt OCR, so với 43,6 của Marker chỉ chạy trên CPU.

Tuy nhiên, LiteParse khi tắt OCR đạt tốc độ 1721 trang/giây — gấp khoảng 73 lần chế độ CPU của Marker, đó chính là sự đánh đổi. Chế độ fast –disable_ocr của Marker chạy mô hình bố cục 20 triệu tham số trên CPU và vẫn khôi phục được cấu trúc, đó là lý do tại sao nó đạt điểm số cao gấp đôi so với việc trích xuất văn bản thuần túy. LiteParse không có mô hình bố cục và sẽ bị lỗi trên bất kỳ nội dung nào không theo trình tự tuyến tính.

Marker 2 so với tầng VLM toàn trang

Đội ngũ Datalab nhấn mạnh rằng Marker được thiết kế như một pipeline thay vì một VLM, làm rõ rằng đây là những công cụ khác biệt. Trong đánh giá này, Chandra 2 được lưu trữ của họ đạt 85,8 điểm, trong khi Gemini Flash 3.5 qua API đạt 76,4 điểm. Kho lưu trữ Chandra của Datalab cũng xếp hạng olmOCR 2 của Ai2 ở mức 82,4 và dots.ocr 1.5 ở mức 83,9 trong một bảng riêng biệt. Đối với các bản quét, các trang chứa nhiều toán học và để đạt độ chính xác cao nhất, tầng VLM vẫn vượt trội hơn tất cả các pipeline được liệt kê.

Chế độ cân bằng của Marker thu hẹp khoảng cách hiệu suất xuống chỉ còn 0,4 điểm so với Gemini Flash 3.5 về tổng thể, và thậm chí còn vượt trội hơn trên các tài liệu kỹ thuật số gốc với tỷ lệ 83,5 so với 79,1—mà không cần yêu cầu gọi API cho mỗi trang.

Hành vi theo từng danh mục

Chế độ bạn chọn sẽ thay đổi hồ sơ lỗi, không chỉ là điểm số. Mỗi hàng là một danh mục của olmOCR-bench, được chấm điểm trên cả ba chế độ. Toán học là điểm khó nhất: chế độ nhanh đọc các phương trình từ lớp văn bản PDF thay vì dùng VLM-OCR, vì vậy toán học arXiv giảm từ 83,9 xuống 23,4, và –disable_ocr đạt 0,0 ở danh mục này theo thiết kế. Ngoài hai danh mục toán học, các bản quét cũ là phần yếu nhất trong mọi chế độ, cao nhất chỉ đạt 43,2.

Cấp phép

Đây là nơi bốn hệ thống khác biệt nhất đối với các đội ngũ thương mại:

So sánh trường hợp sử dụng

Điểm số không phải là yếu tố duy nhất để chọn công cụ. Loại kho tài liệu, phần cứng, điều khoản cấp phép và định dạng đầu ra mới là yếu tố quyết định. Hãy thử công cụ chọn tương tác bên dưới để lọc mười kịch bản triển khai theo ràng buộc và theo công cụ, và xem trình phân tích nào phù hợp với trường hợp sử dụng của bạn.

Những điểm chính cần lưu ý

Công cụ giải thích động tương tác

Liên kết: Kho lưu trữ GitHub | Ghi chú phát hành | Bài đăng trên blog | Tweet thông báo

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.

OCRDatalabMarkerXử lý tài liệuCông cụ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.