Sản phẩm
OCR It: Công cụ trích xuất văn bản từ tài liệu không thể copy cho LLM
(giờ Việt Nam)
Tóm tắt AI
Tiện ích Chrome giúp chụp màn hình, OCR cục bộ và tổng hợp văn bản từ tài liệu khó sao chép như PDF hay slide, hỗ trợ đắc lực cho việc truy vấn trên ChatGPT hoặc Claude mà không cần API.
Bản dịch AI
Ghim một vùng một lần duy nhất. Nhấn phím tắt trên mọi trang. Nhận toàn bộ cuốn sách dưới dạng văn bản.
Một tiện ích mở rộng Chrome dành cho việc đọc các tài liệu được phân trang bị "kẹt" trong trình xem — như sách quét, slide thuyết trình, PDF, hoặc trình đọc không cho phép bạn chọn văn bản.
Bạn kéo chọn vùng cần chụp một lần. Sau đó, mỗi lần nhấn phím tắt, tiện ích sẽ chụp ảnh màn hình đúng hình chữ nhật đó, thực hiện OCR và thêm văn bản vào một bản ghi đang chạy. Hoặc bạn có thể giao toàn bộ công việc cho máy: ⌥⇧A sẽ bắt đầu một quy trình tự động chụp, lật trang và lặp lại cho đến khi kết thúc tài liệu.
Sau đó, hãy dán kết quả vào bất cứ đâu bạn cần — LLM là lựa chọn hiển nhiên nhất, vì vài trăm trang mà bạn không thể chọn văn bản trước đây giờ đã trở thành một tệp văn bản mà bạn có thể đưa cho Claude hoặc ChatGPT để tóm tắt, tìm kiếm hoặc đặt câu hỏi.
OCR chạy cục bộ với bản dựng Tesseract đi kèm. Không cần API key, không cần mạng, không có hình ảnh nào rời khỏi máy của bạn — tiện ích này hoàn toàn không thực hiện bất kỳ yêu cầu gửi đi nào.
Cài đặt
Mọi thứ cần thiết đều đã được tích hợp sẵn. Không có bước build: lệnh npm install chỉ dành cho việc chạy thử nghiệm hoặc cập nhật lại Tesseract.
Sau đó, hãy kiểm tra chrome://extensions/shortcuts và xác nhận các phím tắt đã được thiết lập — Chrome sẽ để trống nếu các phím đó đã bị một ứng dụng khác chiếm dụng.
Tiện ích không yêu cầu quyền truy cập trang web khi cài đặt. Việc chụp đơn lẻ dựa trên activeTab, quyền mà Chrome cấp khi bạn nhấn phím tắt hoặc mở cửa sổ popup. Có hai trường hợp cần cấp quyền bền vững — tự động chạy sau khi tải lại trang và lật trang bên trong iframe khác nguồn — và popup sẽ hiển thị nút "Allow" cho trang web bạn đang truy cập khi cần thiết.
Cách sử dụng
1. Ghim vùng cần chụp
⌥⇧R, sau đó kéo một khung bao quanh văn bản. Trước khi lưu, bạn có thể kéo khung đi xung quanh, kéo các góc hoặc di chuyển từng pixel bằng phím mũi tên (giữ ⇧ để thay đổi kích thước). Nhấn Enter để xác nhận.
Hãy vẽ lấn vào bên trong lề văn bản một chút — mọi thứ trong hình chữ nhật sẽ được đọc, bao gồm cả số trang và tiêu đề đầu trang.
2. Chụp ảnh
Nhấn ⌥⇧S mỗi lần cho một trang. Ảnh chụp màn hình được thực hiện ngay lập tức và OCR chạy ở chế độ nền, vì vậy bạn không bao giờ phải chờ đợi giữa các trang — các lượt chụp sẽ được xếp hàng và huy hiệu sẽ đếm số trang đang được xử lý.
3. Hoặc để nó tự chạy
Thiết lập điều khiển lật trang (bên dưới) và ⌥⇧A sẽ tiếp quản hoàn toàn: chụp, lật, chụp, lật, cho đến khi kết thúc tài liệu. Nhấn Esc trên trang để dừng lại.
4. Xuất dữ liệu
Mỗi trang được liệt kê kèm theo hình thu nhỏ của vùng đã cắt, vì vậy nếu vùng chụp bị lệch, bạn có thể nhận ra ngay thay vì đợi đến tám mươi trang sau. Văn bản có thể chỉnh sửa trực tiếp; một trang đọc lỗi có thể được chạy lại riêng lẻ.
Copy all và Download.txt sẽ xuất các trang theo thứ tự với dấu phân cách --- page N ---.
Một trang được đánh dấu DUPLICATE nghĩa là văn bản giống hệt trang trước đó — hầu như luôn luôn là do tài liệu thực tế chưa lật trang.
Tự động lật trang cho bạn
Bật Turn the page automatically after capture, sau đó:
Test sẽ kích hoạt lệnh lật trang ngay lập tức mà không cần chụp, và báo cáo kết quả — nên dùng thử trước khi bắt đầu một quy trình dài.
Tại sao lại dùng một điểm thay vì bộ chọn (selector)
Một điểm được lưu trữ sẽ tồn tại qua các lần DOM re-render vốn thường làm mất hiệu lực của bộ chọn CSS, và nó tiếp cận được hai nơi mà bộ chọn không thể:
Tại thời điểm lật trang, điểm này được gửi đến mọi khung hình (frame) và khung hình nào thực sự sở hữu nó sẽ thực hiện hành động. Một khung hình xác định vị trí của nó bên trong viewport cấp cao nhất bằng cách duyệt ngược lên các tổ tiên cùng nguồn gốc; qua ranh giới nguồn gốc, khung cha sẽ truyền độ lệch xuống bằng postMessage. (window.screenX không có tác dụng — bên trong iframe nó báo cáo cửa sổ trình duyệt, không phải khung hình.) Khung sở hữu sẽ giải quyết điểm đó thông qua bất kỳ shadow root nào, đi đến điều khiển thực tế gần nhất và phát ra chuỗi pointerdown → mousedown → pointerup → mouseup → click, vì vậy các trình xem lật trang bằng pointerdown vẫn hoạt động giống như khi lắng nghe sự kiện click.
Khi nó không lật trang
Mọi nỗ lực đều ghi lại một kết quả, hiển thị trong popup và dưới dạng thông báo toast trên trang:
Vì mục tiêu là một điểm cố định trên màn hình, việc thay đổi kích thước cửa sổ hoặc thay đổi mức thu phóng giữa chừng sẽ làm hỏng quy trình, giống như cách nó làm hỏng vùng chụp.
Chạy tự động hoàn toàn
⌥⇧A — hoặc Start auto-run — sẽ tự động chụp, lật và lặp lại.
Mỗi chu kỳ sẽ đợi OCR của trang đó hoàn tất trước khi lật. Trên thực tế, việc này không tốn thời gian (OCR nhanh hơn lật trang) và mang lại điều quan trọng nhất mà một vòng lặp không giám sát cần: khả năng phát hiện kết thúc tài liệu đáng tin cậy. Một quy trình chỉ chụp ảnh dựa trên bộ đếm thời gian sẽ chạy quá trang cuối và làm đầy bản ghi bằng các bản sao của trang đó.
Dừng lại bằng phím Esc trên trang, phím tắt hoặc popup. Nó cũng tự dừng khi:
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.