Sarvam AI (Web)
Điểm AI 47/100

Mô hình

Sarvam Vision 2.1 ra mắt: Thiết lập chuẩn mực mới cho trí tuệ tài liệu

(giờ Việt Nam)

Tóm tắt AI

Sarvam Vision 2.1 đạt 87.3 điểm trên olmOCR-Bench, vượt qua Infinity-Parser2 Pro và Opus 5. Phiên bản này nâng cấp khả năng xử lý bảng biểu phức tạp, trích xuất dữ liệu KV và nhận diện chữ viết tay Indic với chi phí tối ưu cho doanh nghiệp.

Chính văn · Bản dịch AI

Sarvam Vision 2.1
  1. Trang chủ
  2. /
  3. Blog

Sarvam Vision 2.1: Đẩy mạnh biên giới Pareto của trí tuệ tài liệu

Đạt hiệu suất tiên tiến nhất trên các tiêu chuẩn toàn cầu và Indic với các khả năng mới về trích xuất có cấu trúc và nhận dạng chữ viết tay Indic

Nghiên cứu

24 tháng 9, 2026 · 7 phút đọc

Giới thiệu

Sarvam Vision, được ra mắt như một phần trong dòng mô hình chủ quyền của chúng tôi vào tháng 2 năm 2026, đã mang lại hiệu suất tiên phong về trí tuệ tài liệu. Mặc dù là một mô hình ngôn ngữ thị giác (VLM) tổng quát, mô hình này tập trung vào các khả năng nhận dạng ký tự quang học (OCR) cho tiếng Indic, phân tích bảng, suy luận thị giác đa ngôn ngữ và đầu ra có cấu trúc từ dữ liệu thị giác. Kể từ khi ra mắt, việc áp dụng mô hình đã phát triển rộng rãi và chúng tôi đã nhận được những phản hồi quan trọng về các lĩnh vực cần cải thiện. Những tín hiệu này chủ yếu nằm trên hai trục: (a) các khả năng nhất định (hoặc sự thiếu hụt các khả năng đó) và (b) các mối quan tâm thực tế về khả năng sử dụng.

Đối với các mối quan tâm về khả năng sử dụng, chúng tôi tập trung vào việc tối ưu hóa ngăn xếp suy luận (inference stack). Điều này cho phép phục vụ mô hình ở mức giá rẻ hơn so với mức chúng tôi đã công bố khi ra mắt. Hơn nữa, API của mô hình hiện đã được tối ưu hóa cho các khối lượng công việc sản xuất. Trên trục khả năng, một số quy trình làm việc trong trí tuệ tài liệu đòi hỏi hiệu suất mạnh mẽ trong việc phân tích bảng phức tạp (ví dụ: trích xuất có cấu trúc từ các bảng nhiều trang); trích xuất khóa-giá trị (KV) từ các biểu mẫu; nhận dạng chữ viết tay Indic để giải quyết trí tuệ chặng cuối. Bên cạnh những khả năng mới này, một số điểm yếu của mô hình - chủ yếu liên quan đến ảo giác và sự không nhất quán - đã được giải quyết.

Sarvam Vision 2.1 là một bước tiến thay đổi về các khả năng mới và cải tiến: nó đạt được hiệu suất tiên phong trên các tiêu chuẩn và được xây dựng cho các quy trình làm việc sản xuất.

Dữ liệu và Kiến trúc mô hình

Tương tự như phiên bản trước, kiến trúc của chúng tôi tuân theo mô hình harness-with-VLM. Trình phân tích bố cục ngữ nghĩa và mạng lưới thứ tự đọc con trỏ tạo nên các harness chính. Mặc dù VLM của chúng tôi có khả năng làm việc trực tiếp ở cấp độ trang hoặc tài liệu, sự đánh đổi về độ chính xác đòi hỏi phải sử dụng harness cho mô hình để có kết quả vượt trội.

Về khía cạnh quản lý dữ liệu, chúng tôi đã cẩn thận tạo ra các tập dữ liệu chất lượng cao và quy mô lớn cho việc trích xuất KV và chữ viết tay Indic. Các tập dữ liệu này bao gồm cả hai loại - tổng hợp và thực tế. Ví dụ, chúng tôi đã xây dựng các biểu mẫu tổng hợp viết tay và in ấn với số lượng lớn bằng nhiều ngôn ngữ khác nhau. Để cân bằng giữa dữ liệu tổng hợp và phân phối thực tế, chúng tôi đã lấy thêm các biểu mẫu từ web và điền vào chúng một cách tổng hợp để đạt được độ biến thiên cao. Tương tự, đối với chữ viết tay Indic, chúng tôi đã tận dụng video và các nguồn khác chứa nhiều nội dung viết tay phong phú. Những nguồn dữ liệu mới này, cùng với việc tinh chỉnh kho dữ liệu huấn luyện hiện có, đã cho phép huấn luyện các khả năng mới và khắc phục những điểm yếu.

Tận dụng các cải tiến về dữ liệu, chúng tôi đã thực hiện hậu huấn luyện quy mô lớn: tinh chỉnh có giám sát (SFT) theo sau là RLVR.

Các tiêu chuẩn toàn cầu

Trong phiên bản trước của Sarvam Vision, chúng tôi đã báo cáo về hai tiêu chuẩn chính: olmOCR-Bench và OmniDocBench. Các đánh giá này cung cấp thước đo chung để đo lường hiệu suất mô hình trên nhiều loại tài liệu và vấn đề gặp phải trong các quy trình làm việc trí tuệ tài liệu. Chúng tôi tiếp tục báo cáo về các tiêu chuẩn này, mặc dù có thể nói rằng chúng đã bão hòa. Lý do chính để tận dụng các tiêu chuẩn này là để báo hiệu khả năng của mô hình được đo lường bởi một tiêu chuẩn chấp nhận được do cộng đồng thiết lập. Tất nhiên, có một câu hỏi về tính tổng quát của các đánh giá như vậy: mối tương quan giữa kết quả mạnh mẽ trên một tiêu chuẩn so với tính hữu dụng trong thế giới thực. Mô hình đã trải qua quá trình kiểm tra nghiêm ngặt nội bộ trên nhiều loại quy trình làm việc thực tế để được coi là hữu ích nói chung.

olmOCR-Bench

Tiêu chuẩn này kiểm tra hiệu suất ở cấp độ tài liệu bằng cách sử dụng các kiểm tra đạt-không đạt. Các kiểm tra này bao gồm nhiều biến thể tài liệu đa dạng: toán học arXiv, toán học quét cũ, bảng biểu, bản quét cũ bị suy giảm, trang nhiều cột và các đoạn văn bản nhỏ dài. Thay vì tìm kiếm những sai lệch tinh vi, tiêu chuẩn này kiểm tra sự hiện diện và vắng mặt của các sự kiện.

(Lưu ý: Tiêu chuẩn này chính thức chỉ dành cho tiếng Anh. Tuy nhiên, nó chứa một số mẫu nhiễm bẩn bằng tiếng Trung và các ngôn ngữ khác. Vì mô hình 1.0 của chúng tôi được huấn luyện trên ngôn ngữ Indic và tiếng Anh, chúng tôi đã báo cáo trước đó trên một tập dữ liệu chỉ tiếng Anh đã lọc; phiên bản này báo cáo trên tập dữ liệu chính thức để tương đương với các mô hình đối thủ.)

Mô hìnhToán họcCơ sởĐầu trang/Chân trangVăn bản nhỏNhiều cộtBản quét cũToán học cũBảngTổng thể
Sarvam Vision 2.190.599.896.392.582.155.389.791.987.3
Infinity-Parser2 Pro87.4100.095.192.583.358.083.688.986.1
Opus 590.0100.083.993.585.854.084.389.585.1
Chandra-OCR286.599.991.593.482.449.285.887.584.5
Mistral OCR483.799.791.691.685.748.975.188.683.1
Gemini 3.6 Flash86.599.987.592.578.648.179.985.982.4
GPT 6 Astra82.699.995.774.977.847.085.890.981.8
PaddleOCR-VL 1.686.998.995.892.882.737.570.583.781.1
Gemma 484.199.676.285.179.247.383.891.880.9
GLM-OCR84.099.096.190.378.540.368.174.878.9
Bodhan Indic-OCR82.099.181.182.874.545.875.589.178.8
DeepSeek-OCR281.699.995.989.182.034.270.576.578.7
Google Cloud Vision0.098.419.689.679.929.00.00.339.6
AWS Textract0.0100.024.440.012.326.70.00.225.5
Azure Vision 4.00.098.420.139.613.324.70.00.224.5

Cuộn

Cuộn

olmOCR-Bench (So sánh hiệu suất theo danh mục)

OmniDocBench v1.6

Tiêu chuẩn này là thước đo tổng hợp của ba thước đo tương đồng liên tục - khoảng cách chỉnh sửa văn bản, cấu trúc bảng sử dụng TEDS và nhận dạng công thức sử dụng CDM. Các mẫu đánh giá bao gồm báo chí, sách giáo khoa, tạp chí, báo cáo tài chính và các tài liệu tương tự. Trọng tâm của tiêu chuẩn này là đo lường độ trung thực về cấu trúc.

Mô hìnhKhoảng cách chỉnh sửa văn bản ↓Công thức CDM ↑Bảng TEDS ↑Cấu trúc bảng TEDS ↑Thứ tự đọc ↓Tổng thể
PaddleOCR-VL 1.60.03560.9850.9310.9610.10096.01
Sarvam Vision 2.10.02890.9880.8900.9350.09994.97
GLM-OCR0.03740.9840.8950.9330.09994.71
GPT 6 Astra0.04600.9670.8910.9420.09893.74
Gemini 3.6 Flash0.03710.9760.8690.9250.13693.58
Infinity-Parser2 Pro0.03250.9630.8650.9110.09293.18
Opus 50.04710.9670.8560.9050.11392.51
Bodhan Indic-OCR0.04710.9730.8390.8910.11992.17
Chandra-OCR20.04030.9630.8420.9090.10192.14
Mistral OCR40.04140.9670.8260.8740.10191.72
Gemma 40.06440.9580.8340.8830.17990.94
DeepSeek-OCR20.04450.9270.7550.8170.11487.91
Azure Vision 4.00.04990.3980.0000.0000.18144.95
Google Cloud Vision0.08760.3510.0000.0000.24442.10
AWS Textract0.38630.2090.0000.0000.43627.42

Scroll

Scroll

OmniDocBench v1.6 (So sánh hiệu năng chi tiết)

Sarvam Indic OCR Bench

Các bộ tiêu chuẩn đánh giá toàn cầu, tập trung vào tiếng Anh đã đánh giá khá tốt các khía cạnh kỹ thuật và cấu trúc của quá trình xử lý tài liệu - như độ trung thực của bố cục, bảng biểu, toán học, chất lượng bản quét, v.v. Khoảng trống còn lại là một bộ tiêu chuẩn chất lượng cao giúp đánh giá nghiêm ngặt độ chính xác của mô hình trên 22 ngôn ngữ chính thức của Ấn Độ. Hôm nay, chúng tôi ra mắt Indic OCR bench để cộng đồng có thể thực hiện việc đánh giá. Bộ dữ liệu này bao gồm 6.909 mẫu (6.609 mẫu trải dài trên 22 ngôn ngữ Ấn Độ; 300 mẫu bằng tiếng Anh). Trọng tâm duy nhất của nó là độ chính xác ngôn ngữ: mỗi mẫu được tuyển chọn để đo lường chính xác độ chính xác của ký tự và từ ngữ một cách mạnh mẽ.

Hầu hết các ngôn ngữ Ấn Độ đã trải qua sự biến đổi to lớn về ngôn ngữ và chữ viết. Để đo lường độ chính xác OCR tốt nhất, các mẫu được lấy từ nhiều nguồn khác nhau (báo chí, tờ rơi, sách giáo khoa, văn bản lịch sử, v.v.) và được tuyển chọn từ nhiều giai đoạn lịch sử khác nhau, từ năm 1800 đến nay.

Bộ tiêu chuẩn đánh giá được lưu trữ trên huggingface của chúng tôi: https://huggingface.co/datasets/sarvamai/indic-ocr-bench

Ngôn ngữSarvam Vision 2.1Bodhan Indic-OCRGemini 3.6 FlashGoogle Cloud VisionSurya OCR 2Mistral OCR4Opus 5Gemma 4Chandra-OCR2
Độ chính xác tổng thể ↑87.3984.9479.3571.7669.9669.1668.8165.5364.56
Tiếng Bengal93.4790.8790.3685.2481.7985.0688.7581.4580.64
Tiếng Gujarati88.8783.2683.6864.4065.8068.1970.9270.6859.14
Tiếng Hindi93.5290.9992.1184.2986.1285.8789.3885.0383.18
Tiếng Kannada90.5486.5182.7075.4079.6077.8478.8759.3671.93
Tiếng Malayalam90.2486.3884.4176.0676.6171.5082.4463.5769.36
Tiếng Marathi95.0690.7693.1486.5086.5884.1786.5582.9183.66
Tiếng Odia80.0175.4581.0168.3269.3457.0465.9943.3768.09
Tiếng Punjabi89.1686.5187.0681.6583.0681.6584.2272.5380.17
Tiếng Tamil87.7084.2184.5878.1479.0779.7380.4674.2076.35
Tiếng Telugu91.5586.9285.2275.7172.5578.0677.5471.0870.88
Tiếng Urdu91.2190.6289.5284.7786.0178.1188.2279.3182.62
Tiếng Sindhi91.4488.8985.7884.7683.0281.6581.6679.3275.23
Tiếng Santhali53.9168.3051.8432.1021.5329.9526.2620.6810.16
Tiếng Phạn84.0578.1181.0771.3560.2571.3546.3062.8660.23
Tiếng Nepal97.0094.7095.0394.8889.5491.5388.9291.5784.02
Tiếng Manipuri85.1282.850.550.000.000.000.000.000.00
Tiếng Maithili96.7093.6493.7184.4878.0078.0157.2985.0175.86
Tiếng Konkani97.4195.9993.9393.7290.8187.3584.5580.9583.76
Tiếng Kashmiri54.8248.0436.0424.2226.2722.6332.2023.0224.33
Tiếng Dogri89.4685.5180.0369.2365.8755.9153.8266.6552.34
Tiếng Bodo90.4890.6986.3776.8869.9670.0362.7870.2652.48
Tiếng Assam90.8889.4187.5586.5887.2585.9786.6277.8575.79

Scroll

Scroll

Sarvam Indic OCR Bench (Độ chính xác theo ngôn ngữ)

Đường biên Pareto của trí tuệ tài liệu

Trí tuệ tài liệu là một bài toán đa mục tiêu. Một hệ thống mạnh mẽ được đánh giá trên nhiều trục, mà nhiều trong số đó không nhất thiết phải tương quan với nhau: chuyển đổi bản quét từ những năm 1950 mà không gây ra hiện tượng ảo giác (fscan); tái tạo chính xác cấu trúc của bảng biểu (ftable); hoặc chuyển đổi chính xác tiếng Tamil (ftamil). Do đó, điều quan trọng trong bối cảnh này không phải là điểm số cao nhất trên bất kỳ trục đơn lẻ nào, mà là liệu có tồn tại một hệ thống khác tốt hơn trên mọi trục cùng một lúc hay không. Đặc tính này của mô hình Sarvam Vision 2.1 có thể được nghiên cứu thông qua phân tích Pareto.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Sarvam Vision 2.1OCRTrí tuệ tài liệuAI doanh nghiệpBenchmark

Bài viết được AI dịch và tổng hợp tự động từ Sarvam AI (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Sarvam Vision 2.1 ra mắt: Thiết lập chuẩn mực mới cho trí tuệ tài liệu | AIHOT.vn