MarkTechPost
85

Thủ thuật

Xây dựng quy trình xử lý tài liệu thông minh toàn diện với deepDoctection

(giờ Việt Nam)

Tóm tắt AI

Hướng dẫn chi tiết cách thiết lập pipeline xử lý tài liệu từ A-Z bằng deepDoctection, bao gồm phân tích bố cục, OCR với DocTR, trích xuất bảng và tạo dữ liệu JSONL cho RAG.

Bản dịch AI

Building an End-to-End Document Intelligence Pipeline with deepDoctection

Trong bài hướng dẫn này, chúng ta sẽ triển khai một quy trình (pipeline) xử lý tài liệu thông minh với deepDoctection 1.2.x, kết hợp các tác vụ: phát hiện bố cục (layout detection), nhận dạng cấu trúc bảng, OCR, tái tạo thứ tự đọc, liên kết chú thích và xuất dữ liệu có cấu trúc trong một quy trình làm việc duy nhất. Chúng ta sẽ cấu hình bộ phân tích (analyzer) một cách tường minh với tính năng phát hiện bố cục dựa trên DocLayNet, nhận dạng cấu trúc bằng Table Transformer và OCR bằng DocTR, sau đó kiểm tra các đối tượng Page kết quả để hiểu cách deepDoctection biểu diễn văn bản, hình ảnh, bảng biểu, các mối quan hệ, nguồn gốc và thứ tự đọc. Chúng ta cũng sẽ mở rộng framework bằng cách đăng ký các loại đối tượng tùy chỉnh và triển khai PipelineComponent của riêng mình để trích xuất các thực thể tiền tệ và ngày tháng, đồng thời phân loại tài liệu dựa trên các đặc điểm bảng biểu của chúng. Cuối cùng, chúng ta sẽ lắp ráp thủ công một pipeline tùy chỉnh với ServiceFactory, khám phá tính năng lọc và hoàn tác dịch vụ (service rollback), tuần tự hóa các trang đã xử lý và chuyển đổi các chú thích tài liệu thành các đoạn JSONL có thứ tự, phù hợp cho các hệ thống RAG và truy xuất dữ liệu ở hạ nguồn.

Nhấp để truy cập 2312.13560.pdf

Chúng ta cài đặt các phụ thuộc cần thiết cho deepDoctection, cấu hình môi trường chạy (runtime environment) và áp dụng bản vá tương thích cho Transformers và PEFT. Chúng ta tải xuống các tệp PDF và hình ảnh mẫu được sử dụng xuyên suốt bài hướng dẫn và chuẩn bị thư mục đầu ra. Chúng ta cũng định nghĩa các hàm hỗ trợ để trực quan hóa hình ảnh và phân tích nhất quán các thư mục, tệp PDF và tệp hình ảnh riêng lẻ.

Chúng ta kiểm tra kho lưu trữ mô hình (model registry) của deepDoctection để xác minh mô hình bố cục và các danh mục tài liệu được hỗ trợ. Chúng ta cấu hình tường minh bộ phân tích để kết hợp phát hiện bố cục, phân đoạn bảng, DocTR OCR, khớp từ, tái tạo thứ tự đọc và liên kết bố cục. Sau đó, chúng ta khởi tạo bộ phân tích và kiểm tra các thành phần pipeline cùng các loại chú thích mà nó tạo ra.

Chúng ta chạy bộ phân tích đã cấu hình trên tệp PDF mẫu và hiện thực hóa các trang kết quả từ luồng dữ liệu lazy. Chúng ta kiểm tra văn bản tường thuật, các đoạn thứ tự đọc, danh mục chú thích, mối quan hệ giữa hình ảnh và chú thích, nguồn gốc từ ngữ và các khung bao (bounding boxes). Chúng ta cũng truy cập các bảng đã phát hiện thông qua các biểu diễn HTML, CSV và từng ô riêng lẻ để kiểm tra đầu ra có cấu trúc của chúng.

Chúng ta đăng ký các loại đối tượng tùy chỉnh cho các đề cập về tiền tệ, ngày tháng và phân loại đặc điểm tài liệu đã trích xuất. Chúng ta triển khai một thành phần pipeline deepDoctection tùy chỉnh để phân tích văn bản trang và độ bao phủ của bảng nhằm tạo ra các bản tóm tắt ở cấp độ trang này. Sau đó, chúng ta hiển thị các trường tóm tắt tùy chỉnh dưới dạng các thuộc tính của Page để có thể truy cập trực tiếp từ các tài liệu đã xử lý.

Chúng ta lắp ráp thủ công một pipeline deepDoctection với ServiceFactory, kết hợp phân tích bố cục, xử lý bảng, OCR, sắp xếp văn bản và thành phần tùy chỉnh của chúng ta. Chúng ta thực thi pipeline tùy chỉnh này trên hình ảnh tài liệu tài chính và kiểm tra đặc điểm, giá trị tiền tệ, ngày tháng và cấu trúc bảng đã phát hiện. Chúng ta cũng áp dụng bộ lọc đầu vào và minh họa cách hoàn tác các chú thích do một dịch vụ DocTR được chọn tạo ra.

Chúng ta tuần tự hóa từng trang đã xử lý sang JSON trong khi vẫn bảo toàn các chú thích cấu trúc mà không nhúng dữ liệu hình ảnh gốc. Chúng ta tải lại một trang đã lưu và so sánh số lượng chú thích để xác minh rằng thông tin cấu trúc vẫn tồn tại sau khi tuần tự hóa. Cuối cùng, chúng ta chuyển đổi các đoạn văn tường thuật và HTML của bảng thành các bản ghi JSONL mà chúng ta có thể sử dụng trực tiếp trong RAG, truy xuất và các pipeline xử lý tài liệu ở hạ nguồn.

Tóm lại, chúng ta đã xây dựng được sự hiểu biết thực tế về cách deepDoctection điều phối nhiều mô hình phân tích tài liệu và các dịch vụ dựa trên quy tắc thành một pipeline xử lý có thể cấu hình. Chúng ta đã tiến xa hơn việc chỉ chạy một bộ phân tích được xác định trước bằng cách kiểm tra các đăng ký mô hình, kiểm soát các dịch vụ riêng lẻ, truy cập các chú thích cấp trang có cấu trúc, trích xuất bảng, tạo siêu dữ liệu tóm tắt tùy chỉnh và soạn thảo các giai đoạn pipeline của riêng mình. Chúng ta cũng đã xem xét cách lọc dịch vụ và các thao tác hoàn tác ảnh hưởng đến chú thích, giúp chúng ta kiểm soát tốt hơn các quy trình xử lý tài liệu phức tạp. Cuối cùng, chúng ta đã tuần tự hóa cấu trúc tài liệu đã xử lý. Chúng ta đã tạo ra các đoạn dữ liệu sẵn sàng cho RAG, cung cấp nền tảng có thể tái sử dụng để xây dựng các ứng dụng AI tài liệu hướng sản xuất như tìm kiếm tài liệu, trích xuất tri thức, truy xuất tăng cường thế hệ (RAG), v.v.

Xem MÃ NGUỒN ĐẦY ĐỦ tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC Trang Hugging Face HOẶC Phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Sana Hassan, một thực tập sinh tư vấn tại Marktechpost và là sinh viên bằng kép tại IIT Madras, có niềm đam mê áp dụng công nghệ và AI để giải quyết các thách thức trong thế giới thực. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ về sự giao thoa giữa AI và các giải pháp trong đời sống thực.

deepDoctectionRAGOCRXử lý tài liệuAI Pipeline
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.