Mô hình
Alibaba ra mắt OvisOCR2: Mô hình AI 0.8B đầu tiên vượt mặt phương pháp truyền thống trong phân tích tài liệu
(giờ Việt Nam)
Tóm tắt AI
Alibaba vừa công bố OvisOCR2, mô hình AI end-to-end đầu tiên đạt đỉnh bảng xếp hạng OmniDocBench v1.6, thay thế quy trình phân tích tài liệu phức tạp bằng khả năng xử lý trực tiếp từ hình ảnh sang Markdown.
Bản dịch AI
Theo tin từ IT ngày 24 tháng 7, hôm nay, Alibaba Cloud đã chính thức mã nguồn mở mô hình phân tích tài liệu OvisOCR2. Với điểm số tổng hợp 96,58, mô hình này đã thiết lập kỷ lục mới trên bảng xếp hạng OmniDocBench v1.6, trở thành mô hình end-to-end (đầu cuối) đầu tiên vượt qua các phương pháp dạng pipeline (đường ống) để dẫn đầu bảng xếp hạng này. Phía Alibaba Cloud cho biết: "Đây là bước đột phá quan trọng về lộ trình kỹ thuật trong lĩnh vực phân tích tài liệu".
Mô hình end-to-end lần đầu tiên vượt qua phương pháp pipeline
Theo thông báo chính thức mà IT ghi nhận, phân tích tài liệu là cơ sở hạ tầng then chốt cho việc ứng dụng các mô hình ngôn ngữ lớn (LLM). Các kịch bản như cơ sở tri thức doanh nghiệp, truy xuất RAG, hỏi đáp thông minh đều cần chuyển đổi các tài liệu phi cấu trúc như PDF, bản quét thành văn bản có cấu trúc.
Trước đây, lĩnh vực này bị thống trị bởi "phương pháp pipeline", thường bao gồm hai phần: mô hình phân tích bố cục và mô hình nhận diện nội dung. Phần đầu chịu trách nhiệm nhận diện bố cục tài liệu, phần sau chịu trách nhiệm nhận diện văn bản, công thức, bảng biểu, v.v., sau đó ghép nối kết quả đầu ra. Mặc dù phương pháp này đã hoàn thiện, nhưng nó tồn tại những hạn chế cố hữu như chi phí bảo trì cao, tích lũy sai số và triển khai phức tạp.
OvisOCR2 áp dụng lộ trình kỹ thuật end-to-end: đầu vào là một hình ảnh tài liệu, mô hình sẽ xuất ra định dạng Markdown tuân theo trình tự đọc tự nhiên trong một lần tạo duy nhất, bao gồm văn bản, công thức, bảng biểu và các vùng hình ảnh. Công việc vốn trước đây cần nhiều mô hình phối hợp thực hiện, nay được hoàn thành chỉ trong một bước bởi một mô hình duy nhất.
Với 96,58 điểm trên OmniDocBench v1.6, OvisOCR2 đã dẫn đầu bảng xếp hạng, lần đầu tiên chứng minh rằng mô hình end-to-end có thể vượt qua phương pháp pipeline.
Tham số nhỏ, năng lực lớn, đạt SOTA với 0.8B
OvisOCR2 được huấn luyện hậu kỳ từ Qwen3.5-0.8B. Nhóm phát triển đã xây dựng một hệ thống công cụ dữ liệu bổ trợ giữa tài liệu thực tế và tài liệu tổng hợp, trong đó tài liệu tổng hợp được thiết kế đặc biệt để bổ sung cho các kịch bản phức tạp như bảng biểu đan xen công thức, bố cục nhiều cột và đầu ra dài. Phương án huấn luyện kết hợp quy trình bốn giai đoạn gồm: tinh chỉnh có giám sát (SFT), học tăng cường (RL), chưng cất chính sách trực tuyến (OPD) và hợp nhất mô hình, tạo thành một quy trình huấn luyện tiến triển đa giai đoạn, giúp khai thác tối đa tiềm năng của mô hình nhỏ gọn.

Dự án đã được mã nguồn mở, tích hợp liền mạch vào hệ sinh thái Qwen
OvisOCR2 được mã nguồn mở theo giấy phép Apache 2.0, tương thích với các khung suy luận phổ biến như vLLM và kết nối với hệ sinh thái suy luận Qwen3.5, giúp các nhà phát triển tích hợp mà không cần thêm các bước điều chỉnh bổ sung.
Cách thức truy cập mô hình
Hugging Face
ModelScope (Maodao)
Báo cáo kỹ thuật
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.