Sarvam Vision 2.1 đạt 87.3 điểm trên olmOCR-Bench, vượt qua Infinity-Parser2 Pro và Opus 5. Phiên bản này nâng cấp khả năng xử lý bảng biểu phức tạp, trích xuất dữ liệu KV và nhận diện chữ viết tay Indic với chi phí tối ưu cho doanh nghiệp.
Jina AI giới thiệu mô hình OCR 3.4B sử dụng kiến trúc MoE, cho phép chuyển đổi tài liệu phức tạp như PDF, hóa đơn sang Markdown với hiệu suất cao trên các thiết bị có cấu hình thấp.
LlamaIndex chỉ ra rằng khả năng đọc hiểu không quyết định tỷ lệ tự động hóa, mà là cơ chế phân loại (routing). Thay vì chỉ tăng độ chính xác, việc tích hợp chỉ số tin cậy (confidence score) giúp hệ thống tự động xử lý tài liệu hiệu quả hơn đáng kể.
Nghiên cứu khám phá cách tối ưu hóa dữ liệu tổng hợp để huấn luyện mô hình OCR tiếng Thái mà không cần nhãn thực tế, từ đó tạo ra Wayu-Paxa-OCR-Zero với độ chính xác tiệm cận dữ liệu thực.
LlamaIndex đề xuất quy trình OCR hai bước: dùng công cụ miễn phí để quét sơ bộ, sau đó chỉ dùng mô hình thị giác (VLM) cho các trang quan trọng nhằm tối ưu chi phí và hiệu suất.
Reducto giới thiệu r-1, mô hình xử lý tài liệu toàn trang thay thế quy trình OCR đa giai đoạn, giúp giảm 20% tỷ lệ lỗi và tối ưu chi phí xuống còn 1 cent mỗi trang.
Hệ thống mô-đun mới giúp chuyển đổi các bản quét báo cũ thành dữ liệu có cấu trúc, cho phép trích xuất văn bản, phân loại nội dung và nhận diện thực thể ngay trên phần cứng máy trạm thông thường.
Nghiên cứu này xác định bốn yếu tố then chốt để tối ưu hóa khả năng đọc và hiểu văn bản trực tiếp từ điểm ảnh, giúp khắc phục các hạn chế về độ phân giải và khả năng đa ngôn ngữ của các mô hình hiện nay.
Vì sao đáng đọc: Đây là bước đột phá về hiệu suất xử lý tài liệu, giải quyết trực tiếp nhu cầu cấp thiết của người dùng trong việc số hóa dữ liệu với tốc độ cực cao.
Cohere giới thiệu Parse 5, mô hình thị giác ngôn ngữ 2.3B tham số giúp chuyển đổi trực tiếp PDF, PPT và ảnh sang định dạng Markdown mà không cần qua bước OCR trung gian.
Tiện ích Chrome giúp chụp màn hình, OCR cục bộ và tổng hợp văn bản từ tài liệu khó sao chép như PDF hay slide, hỗ trợ đắc lực cho việc truy vấn trên ChatGPT hoặc Claude mà không cần API.
Hướng dẫn chi tiết cách thiết lập pipeline xử lý tài liệu từ A-Z bằng deepDoctection, bao gồm phân tích bố cục, OCR với DocTR, trích xuất bảng và tạo dữ liệu JSONL cho RAG.
NaviDC-OCR là khung làm việc thống nhất giúp giải quyết các lỗi biến dạng hình học và hạn chế về khả năng suy luận cấu trúc trong các mô hình ngôn ngữ thị giác (VLM) khi xử lý tài liệu.
Hướng dẫn chi tiết xây dựng pipeline OCR chuyên nghiệp bằng docTR, bao gồm phân tích bố cục, trích xuất dữ liệu (KIE) và tối ưu hóa hiệu suất cho các ứng dụng thực tế.
Mistral vừa phát hành phiên bản OCR 4.1 và cập nhật tài liệu hướng dẫn trên trang chủ. Dù các chi tiết kỹ thuật cụ thể chưa được công bố, bản cập nhật này đang thu hút sự chú ý lớn từ cộng đồng công nghệ.