QbitAI
92

Sản phẩm

Chuyển đổi PDF sang Markdown chỉ trong 20ms: Công cụ OCR mã nguồn mở nhanh gấp 300 lần

(giờ Việt Nam)

Tóm tắt AI

Công cụ OCR mã nguồn mở mới cho phép xử lý 200 tệp PDF chỉ trong 3 giây, đạt tốc độ nhanh gấp 300 lần so với các giải pháp truyền thống.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

29/08/2026 20:26:49 Nguồn: QbitAI

Xử lý 200 tệp PDF chỉ trong 3 giây

Những ngày tháng khổ sở khi phải trích xuất thủ công văn bản từ PDF, kết quả nhận về toàn ký tự lỗi, còn LLM thì không thể hiểu nổi—

Cuối cùng cũng sắp kết thúc rồi!

图片

Đội ngũ Firecrawl, một dự án ngôi sao được ươm tạo bởi Y Combinator, gần đây đã tung ra một "vũ khí hạng nặng":

Đồng sáng lập kiêm CTO Nicolas Camara tuyên bố rằng, công cụ OCR It mới nhất mà họ phát triển có thể trích xuất toàn bộ nội dung văn bản từ một tệp PDF không thể sao chép trong vòng 20ms, đồng thời chuyển đổi nó sang định dạng Markdown rõ ràng để AI có thể đọc và hiểu ngay lập tức.

图片

20ms là khái niệm gì?

Tương đương với việc bạn vừa nhấn xác nhận, chưa kịp chớp mắt thì một tệp Markdown đã được xử lý xong xuôi, gọn gàng nằm trên tay bạn.

Hơn nữa, nó không cần kết nối internet, có thể hoạt động 100% Offline via Bundled Tesseract.

Công cụ OCR vừa mã nguồn mở này ngay khi ra mắt đã nhận được sự quan tâm lớn trên GitHub.

Nicolas Camara tự hào cho biết, với chất lượng xử lý ngang ngửa Docling, tốc độ của OCR It nhanh hơn Docling gần 300 lần!

图片

Sau khi trải nghiệm, cộng đồng mạng cũng thi nhau để lại bình luận trên X:

Nhanh, thực sự là quá nhanh!

👍图片图片

Cách sử dụng OCR It

Trước hết, OCR It là một tiện ích mở rộng trình duyệt miễn phí dành cho Chrome và Firefox.

Bạn chỉ cần khoanh vùng một lần, sau đó mỗi lần nhấn phím tắt (hoặc bật chế độ tự động), nó có thể biến cả cuốn sách hoặc toàn bộ tài liệu thành văn bản thuần túy hoàn chỉnh và có thể chỉnh sửa, giúp bạn dễ dàng đưa trực tiếp vào AI để tóm tắt hoặc đặt câu hỏi.

Trong quá trình này, OCR It sẽ mặc định tự động dừng lại khi phát hiện hai trang giống nhau liên tiếp, không thể lật trang tiếp, OCR thất bại hoặc đạt giới hạn 300 trang, nhằm tránh việc lặp lại vô tận ở trang cuối.

Cụ thể, chế độ thủ công và tự động có thể thực hiện theo các bước sau: (Lưu ý: Người dùng Windows và Linux cần thay phím Option bằng Alt)

1. Chế độ thủ công:

Đầu tiên, nhấn Option+Shift+R để chọn vùng văn bản cần nhận diện, sau khi xác nhận chính xác thì nhấn Enter để lưu;

Sau khi hoàn thành bước khoanh vùng văn bản, nhấn Option+Shift+S một lần, OCR It sẽ bắt đầu nhận diện trang hiện tại và tự động lật sang trang tiếp theo sau khi hoàn tất.

Tiếp theo, bạn chỉ cần lặp lại thao tác này cho đến khi toàn bộ tài liệu được nhận diện xong.

Nếu muốn tiết kiệm thời gian hơn, bạn cũng có thể vừa lật trang vừa nhấn Option+Shift+S ở mỗi trang, hệ thống sẽ lập tức chụp ảnh màn hình và tự động xếp hàng thực hiện tác vụ nhận diện ở chế độ nền.

2. Chế độ tự động:

Với chế độ tự động thì đơn giản hơn nhiều, bạn chỉ cần nhấn Option+Shift+A hoặc nhấp vào Start auto-run, OCR It sẽ tự động lặp lại quy trình "Chụp ảnh màn hình — OCR — Lật trang" cho đến khi kết thúc tài liệu.

Nếu muốn kết thúc tác vụ giữa chừng, chỉ cần nhấn ESC, quy trình kiểm tra gần như tương tự với chế độ thủ công.

Ngoài ra, giao diện kho lưu trữ của OCR It cho thấy nó không cần API Key, không cần internet, và khi cài đặt cũng không yêu cầu bất kỳ quyền truy cập trang web nào. Nó chỉ yêu cầu quyền của trang web hiện tại khi cần chạy tự động hoặc thao tác với iframe xuyên miền.

Thêm vào đó, trình đọc PDF tích hợp sẵn của trình duyệt hiện vẫn chưa hỗ trợ tự động lật trang, vì vậy khi xử lý các loại PDF này, mọi người nên cố gắng sử dụng chế độ thủ công.

Vẫn chưa ổn định khi xử lý các tác vụ phức tạp

Tuy nhiên, dù OCR It trông có vẻ nhanh và tiện lợi, nhưng vẫn chưa đến mức "từ nay về sau cứ ném mọi tệp PDF cho nó là có thể kê cao gối ngủ ngon".

Một điểm chung mà cư dân mạng rút ra sau khi thực tế trải nghiệm là:

OCR It hiện có thể xử lý khá mượt mà các tài liệu PDF có bố cục đơn giản, văn bản rõ ràng, nhưng nó vẫn chưa xử lý tốt các trang phức tạp có sự trộn lẫn giữa tiêu đề, chú thích, bảng biểu, công thức toán học và đoạn văn bản chính, vì vậy nó vẫn còn nhiều không gian để cải thiện.

Hãy cùng chờ đợi những bản cập nhật tiếp theo từ đội ngũ phát triển!

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.