Mô hình
Cohere ra mắt Parse 5: Mô hình thị giác 2.3B tham số chuyển đổi tài liệu doanh nghiệp sang Markdown
(giờ Việt Nam)
Tóm tắt AI
Cohere giới thiệu Parse 5, mô hình thị giác ngôn ngữ 2.3B tham số giúp chuyển đổi trực tiếp PDF, PPT và ảnh sang định dạng Markdown mà không cần qua bước OCR trung gian.
Bản dịch AI

Cohere vừa ra mắt Parse (parse-v5.0), một mô hình phân tích tài liệu hướng tới nhu cầu xử lý khối lượng lớn của doanh nghiệp. Đây là mô hình ngôn ngữ thị giác (vision language model) với 2,3 tỷ tham số, cửa sổ ngữ cảnh 8.192 token và dung lượng khoảng 4,6GB, được xây dựng trên kiến trúc North-Micro-Vision-Instruct của Cohere Labs. Parse nhận đầu vào là các trang PDF, PPT hoặc JPEG dưới dạng URI dữ liệu mã hóa base64 và trả về định dạng Markdown bao gồm văn bản theo thứ tự đọc, bảng biểu được hiển thị dưới dạng HTML, danh sách, cặp khóa-giá trị của biểu mẫu, mô tả hình ảnh và tọa độ khung bao. Mô hình này không cần giai đoạn OCR riêng biệt phía trước. Cohere định giá Parse API ở mức 1,50 USD cho mỗi 1.000 trang và định vị mô hình dựa trên hiệu năng/giá thành thay vì độ chính xác tuyệt đối — một tuyên bố được công ty củng cố bằng điểm số ParseBench tự công bố là 79,2, mà như chúng tôi trình bày chi tiết bên dưới, chỉ đo lường ba trong số năm khía cạnh của tiêu chuẩn đánh giá đó.
Liệu mô hình này có thể triển khai được không?
Có, trong môi trường thực tế (production). Parse hiện đã khả dụng thông qua Cohere Parse API, Microsoft Foundry, AWS SageMaker và Model Vault dành cho khách hàng đơn lẻ (single-tenant). Không có danh sách chờ và không yêu cầu giấy phép nghiên cứu.
Parse là gì?
Parse là một mô hình ngôn ngữ thị giác với 2,3 tỷ tham số được xây dựng trên kiến trúc North-Micro-Vision-Instruct của Cohere Labs, với cửa sổ ngữ cảnh 8.192 token và dung lượng khoảng 4,6GB. Mô hình chấp nhận các trang PDF, PPT và JPEG dưới dạng URI dữ liệu mã hóa base64 và trả về Markdown chứa văn bản tài liệu, danh sách, bảng biểu dưới dạng HTML, tọa độ khung bao và mô tả hình ảnh.
Không có giai đoạn OCR riêng biệt nào phía trước mô hình. Mô hình khôi phục văn bản và thứ tự đọc, bảng biểu, danh sách, biểu mẫu và các cặp khóa-giá trị, hình ảnh và chú thích, cũng như vị trí của các đường biên trang và các yếu tố hình ảnh chỉ trong một lần xử lý. Chín ngôn ngữ được liệt kê là ổn định gồm: tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha và tiếng Tây Ban Nha — cùng với hỗ trợ zero-shot cho các ngôn ngữ khác với độ chính xác thấp hơn.
Hai chế độ đầu ra rất quan trọng trong thực tế. Chế độ mặc định trả về một chuỗi Markdown cho mỗi trang. Việc thiết lập output_format="blocks" sẽ trả về các khối được phân loại, trong đó một khối bảng sẽ chứa mã HTML, tọa độ khung bao và mô tả của nó. Chế độ thứ hai này chính là yếu tố giúp khả năng truy xuất nguồn gốc ở cấp độ trích dẫn trở nên khả thi.
Tiêu chuẩn đánh giá (Benchmark)
Cohere báo cáo điểm số ParseBench của Parse là 79,2, tính trung bình trên các tiêu chí bảng biểu, độ trung thực của nội dung và định dạng ngữ nghĩa, vượt qua Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) và Databricks AI Parse (72,4).
ParseBench là một bộ tiêu chuẩn đánh giá của LlamaIndex gồm khoảng 2.078 trang tài liệu doanh nghiệp đã được con người xác thực, được chấm điểm trên năm khía cạnh: bảng biểu, biểu đồ, độ trung thực của nội dung, định dạng ngữ nghĩa và khả năng nhận diện hình ảnh (visual grounding). Con số của Cohere là mức trung bình của ba trong số các khía cạnh đó và đã loại bỏ biểu đồ cùng khả năng nhận diện hình ảnh — hai khía cạnh mà hầu hết các bộ phân tích đều thất bại.
So với bảng xếp hạng công khai, các nhà cung cấp tương tự đạt điểm thấp hơn nhiều khi xét trên cả năm khía cạnh: Mistral OCR 4 đạt 60,68, Databricks AI Parse đạt 60,68, Azure Document Intelligence (Layout) đạt 59,64. Mức trung bình ba khía cạnh của Azure là 74,3, khớp chính xác với con số của Cohere và xác nhận phương pháp luận này. Cohere Parse hiện chưa được liệt kê trên bảng xếp hạng đó, nơi LlamaParse Agentic đang dẫn đầu với 84,88 điểm.
Vì vậy, 79,2 là điểm số cho một tập hợp con do nhà cung cấp tự báo cáo, không phải vị trí trên bảng xếp hạng. Đây là một tuyên bố hợp lý để bạn tự kiểm chứng trên tài liệu của chính mình.
Chi phí
Cohere định giá Parse API ở mức 1,50 USD cho mỗi 1.000 trang. Trên Model Vault, Parse 5 có giá 4,00 USD/giờ hoặc 2.500 USD/tháng cho phiên bản Medium, và 7,00 USD/giờ hoặc 4.300 USD/tháng cho phiên bản XL.
Điểm hòa vốn mà không ai công bố: với mức 0,0015 USD mỗi trang, một phiên bản Medium đơn lẻ sẽ hòa vốn ở mức khoảng 1,67 triệu trang mỗi tháng, và phiên bản XL ở mức khoảng 2,87 triệu trang. Dưới mức đó, các cuộc gọi API theo lưu lượng sẽ rẻ hơn. Trên mức đó, năng lực chuyên dụng (dedicated capacity) sẽ thắng về giá — chưa kể đến các lập luận về lưu trữ dữ liệu (data residency), vốn thường là lý do thực sự khiến các doanh nghiệp chuyển sang dùng Vault.
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây và dùng thử trên HF. Ngoài ra, hãy theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới, hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, đảm bảo cả tính kỹ thuật lẫn sự dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.