Thủ thuật
Dự án FineBooks đánh giá 14 mô hình OCR: Mô hình nhỏ chiếm ưu thế, mở đường cho dữ liệu huấn luyện AI từ sách cổ
(giờ Việt Nam)
Tóm tắt AI
Dự án FineBooks từ Hugging Face và EleutherAI cho thấy các mô hình OCR nhỏ đạt độ chính xác trên 97% với chi phí cực thấp, đủ chất lượng để làm dữ liệu huấn luyện AI từ sách lịch sử.
Bản dịch AI

Dự án FineBooks từ Hugging Face và EleutherAI đã thử nghiệm 14 mô hình OCR mã nguồn mở (open-weight) trên hơn 2.000 trang sách lịch sử. Các mô hình tốt nhất hiện nay đã tạo ra văn bản đủ chất lượng để huấn luyện AI, nhưng chúng vẫn chưa sẵn sàng cho mục đích nghiên cứu học thuật.
Việc huấn luyện các mô hình ngôn ngữ AI mã nguồn mở trên các cuốn sách thuộc phạm vi công cộng đồng nghĩa với việc phải xử lý các văn bản kém chất lượng. Các thư viện đã trích xuất những văn bản đó từ các bản quét từ nhiều năm trước bằng công nghệ nhận dạng ký tự quang học (OCR), và kết quả thường chứa đầy lỗi. Dự án Talkie đã đưa ra con số cụ thể về thiệt hại tiềm tàng: một mô hình ngôn ngữ được huấn luyện trên văn bản OCR chỉ đạt hiệu suất bằng 30% so với mô hình được huấn luyện trên các bản chép tay của con người từ cùng những cuốn sách đó.
FineBooks, một sự hợp tác giữa Hugging Face và EleutherAI, đã kiểm tra xem liệu các mô hình OCR mã nguồn mở hiện nay có thể giải quyết vấn đề này hay không. Nhóm nghiên cứu đã chạy 14 mô hình mã nguồn mở trên 2.165 trang sách lịch sử và công bố kết quả dưới dạng bảng xếp hạng. Các mô hình tốt nhất đạt độ chính xác ký tự trên 97% với chi phí dưới hai đô la cho mỗi nghìn trang.

Hàng triệu trang sách thuộc phạm vi công cộng cần được nhận dạng văn bản tốt hơn
Khi EleutherAI và các đối tác phát hành Common Pile vào năm ngoái, bộ dữ liệu huấn luyện được cấp phép mở lớn nhất từ trước đến nay, nó chứa khoảng 300.000 cuốn sách thuộc phạm vi công cộng với văn bản từ các lần chạy OCR cũ. Các tác giả của FineBooks cho biết việc xử lý lại những cuốn sách đó bằng các mô hình tốt hơn là một trong những cách hiệu quả nhất để cải thiện các tập dữ liệu huấn luyện AI mở.
Dự án đã chọn Thư viện Di sản Đa dạng sinh học (BHL) làm mục tiêu đầu tiên, nơi lưu trữ hơn 300.000 tài liệu lịch sử tự nhiên đã được số hóa với tổng cộng hơn 64 triệu trang. BHL cung cấp bộ sưu tập của mình dưới dạng tải xuống hàng loạt thông qua AWS.
Việc đo lường chất lượng OCR đòi hỏi các trang phải có bản chép tay chính xác đã biết. Nhóm nghiên cứu đã sử dụng công trình từ dự án IMPACT và BHL-Europe: từ năm 2011 đến 2012, các chuyên gia đã chép tay sáu tập tài liệu BHL bằng tiếng Anh, Pháp, Đức và Latin với tỷ lệ lỗi khoảng một ký tự trên 2.000. Dữ liệu đó được cung cấp theo giấy phép CC-BY trong một kho lưu trữ GitHub và tạo thành cơ sở cho tập dữ liệu đối chứng (ground-truth) mới.
Các mô hình nhỏ đánh bại các đối thủ lớn hơn
Tất cả 14 mô hình đều được cung cấp miễn phí và chạy trên phần cứng cục bộ mà không cần khóa API. Chỉ số đo lường là Tỷ lệ lỗi ký tự (CER), tức tỷ lệ các ký tự được nhận dạng không chính xác. Bảng xếp hạng chia kết quả thành hai biến thể: biến thể "ngoại giao" (diplomatic) tính việc hiện đại hóa các ký tự cổ như chữ s dài (ſ) là một lỗi, và biến thể "đọc" (reading) chấp nhận những thay đổi như vậy.
Mô hình dots.mocr dẫn đầu chỉ sử dụng 3 tỷ tham số, trong khi Qwen3.5-9B đạt điểm thấp hơn mặc dù có kích thước lớn gần gấp ba lần. OvisOCR2 đứng thứ hai với chỉ 0,9 tỷ tham số ở mức giá 46 xu cho mỗi nghìn trang. Kích thước mô hình và chất lượng OCR không tương quan với nhau đối với các tài liệu lịch sử.
Đánh giá chỉ bao gồm các phông chữ Antiqua bằng bốn ngôn ngữ. Nó không tính đến Fraktur, các hệ thống chữ viết không phải Latin hoặc chữ viết tay, và FineBooks bị giới hạn ở các trang sách một cột. Nhóm nghiên cứu có kế hoạch xử lý lại khoảng 200.000 tài liệu BHL thuộc phạm vi công cộng bằng một trong những mô hình hàng đầu và phát hành văn bản dưới dạng tập dữ liệu mở. Các mô hình mới được thêm vào bảng xếp hạng trên cơ sở luân phiên và khung đánh giá được công khai rộng rãi.
Đủ tốt cho huấn luyện AI, quá thiếu chính xác cho học thuật
Các tác giả của FineBooks đánh giá kết quả dựa trên mục đích sử dụng. Họ viết rằng đối với việc huấn luyện các mô hình ngôn ngữ, các mô hình hàng đầu hoạt động đủ tốt. Các mô hình này tạo ra ít lỗi hơn nhiều so với các quy trình cũ, và việc xử lý lại một bộ sưu tập có quy mô như BHL là khả thi với chi phí đã đo lường.
Nhóm nghiên cứu lưu ý rằng các thư viện phải đối mặt với một vấn đề khác. Hệ thống của họ dựa vào ALTO XML, một định dạng có tọa độ cấp từ. Các mô hình mới xuất ra Markdown hoặc văn bản thuần túy không có vị trí từ, vì vậy chúng không thể tích hợp vào cơ sở hạ tầng thư viện hiện có.
Đối với các bản chép tay học thuật, độ chính xác vẫn chưa đạt yêu cầu, nhưng không phải vì các mô hình đọc sai ký tự. Chúng tự động hiện đại hóa các ký tự đó, thay thế chữ "s" dài hoặc các chữ ghép bằng các ký tự hiện đại tương đương. Nhóm nghiên cứu cho biết việc tinh chỉnh có mục tiêu có thể khắc phục điều này.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.