Sản phẩm
Databricks ra mắt OfficeQA Pro V2: Chuẩn đo lường mới cho khả năng suy luận của AI trong doanh nghiệp
(giờ Việt Nam)
Tóm tắt AI
Databricks giới thiệu OfficeQA Pro V2, bộ tiêu chuẩn đánh giá khả năng suy luận chính xác của AI dựa trên tài liệu thực tế tại văn phòng, giúp doanh nghiệp lựa chọn mô hình phù hợp.
Bản dịch AI

Hôm nay, chúng tôi ra mắt OfficeQA Pro V2, một bộ tiêu chuẩn (benchmark) mới được thiết kế để đánh giá khả năng khái quát hóa của các tác nhân AI (AI agents) đối với các tác vụ suy luận dựa trên dữ liệu thực tế (grounded-reasoning) mang tính chất doanh nghiệp mà chúng chưa từng gặp trước đây.
Bảy tháng trước, chúng tôi đã giới thiệu bộ tiêu chuẩn OfficeQA để đo lường mức độ hiệu quả của các hệ thống AI trong việc trả lời các câu hỏi phân tích dựa trên bằng chứng từ các tập hợp tài liệu lớn – một tác vụ doanh nghiệp cực kỳ phổ biến và quan trọng mà chúng tôi nhận thấy các tác nhân AI thường gặp khó khăn. Kể từ khi ra mắt, OfficeQA và tập hợp con chuyên sâu của nó là OfficeQA Pro đã trở thành thước đo quan trọng cho năng lực của các mô hình và tác nhân tiên tiến, thúc đẩy sự tiến bộ trong việc truy xuất, phân tích cú pháp và suy luận phân tích tài liệu. Tuy nhiên, sự tiến bộ này đặt ra một câu hỏi cơ bản: liệu những cải tiến này phản ánh những bước tiến rộng hơn trong suy luận dựa trên dữ liệu thực tế, hay chỉ là sự tiến bộ cụ thể đối với một tập dữ liệu (corpus) và phân phối tác vụ nhất định? Sự khác biệt này rất quan trọng trong môi trường doanh nghiệp, nơi các tác nhân hiếm khi chỉ hoạt động trên một tập hợp tài liệu duy nhất và ổn định.
Bộ tiêu chuẩn mới của chúng tôi, OfficeQA Pro V2, được thiết kế để kiểm tra trực tiếp khả năng khái quát hóa đó. Ban đầu, chúng tôi phát triển OfficeQA Pro V2 làm bộ tiêu chuẩn cho cuộc thi Databricks Grounded Reasoning Cup lần đầu tiên, một cuộc thi trực tiếp nơi 11 đội thi từ các trường đại học, với sự hỗ trợ của OpenAI, Anthropic và Google DeepMind, đã xây dựng các tác nhân được đánh giá trên một tập dữ liệu và bộ tác vụ suy luận dựa trên dữ liệu thực tế hoàn toàn mới. Bộ tiêu chuẩn này chứa 90 câu hỏi dựa trên khoảng 120.000 trang tài liệu từ "Accounts of Receipts and Expenditures" (Báo cáo Thu chi) của Bộ Tài chính Hoa Kỳ, vốn được Bộ Tài chính Hoa Kỳ phát hành dưới dạng một tập dữ liệu thống nhất lần đầu tiên nhân dịp kỷ niệm 250 năm thành lập Hoa Kỳ. Giờ đây, chúng tôi rất vui mừng được phát hành bộ tiêu chuẩn này rộng rãi hơn cho các chuyên gia AI để họ sử dụng cho quá trình phát triển của riêng mình.

OfficeQA Pro V2 vẫn là một thách thức đối với các hệ thống AI hiện nay. Các tác nhân tiên tiến "nguyên bản" (out-of-the-box) sử dụng Claude Code với Claude Opus 4.8 và Claude Fable 5, hoặc Codex với GPT-5.5 và GPT-5.6 Sol, đạt độ chính xác trung bình là 37,5%. Các tác nhân được phát triển đặc biệt cho cuộc thi Grounded Reasoning Cup có hiệu suất tốt hơn, trung bình đạt 41,1%, với đội chiến thắng đạt 63,3%. Chúng tôi cũng đã đánh giá Databricks Genie – tác nhân AI của Databricks được thiết kế để trả lời các câu hỏi phức tạp trên dữ liệu doanh nghiệp – bằng cách sử dụng các mô hình nền tảng tương tự. Genie, vốn cũng sử dụng công cụ ai_parse của Databricks để phân tích trước tập tài liệu, đã cải thiện độ chính xác trung bình thêm 24,0 điểm phần trăm so với các bộ khung mặc định, với cấu hình mạnh nhất đạt 60%. Tổng hợp lại, những kết quả này cho thấy suy luận dựa trên dữ liệu thực tế vẫn còn lâu mới được giải quyết triệt để, nhưng việc sử dụng bộ khung tác nhân (agent harness) phù hợp có thể mang lại những bước tiến đáng kể từ các mô hình tiên tiến hiện có.
Dưới đây, chúng tôi mô tả chi tiết hơn về cách các tác nhân thực hiện trên OfficeQA Pro V2, cách nó được xây dựng và sự khác biệt so với bộ tiêu chuẩn OfficeQA ban đầu.
Hiệu suất của Tác nhân trên OfficeQA Pro V2

Trước tiên, chúng tôi đánh giá các mô hình tiên tiến bằng cách sử dụng bộ khung đi kèm của từng nhà cung cấp mô hình, với Codex cho các mô hình GPT và Claude Code cho các mô hình Claude, sử dụng cùng một thước đo khớp chính xác (exact-match) với dung sai 0,0% như đã dùng cho OfficeQA. Trên cả năm mô hình được đánh giá theo cả hai bộ khung, các cấu hình cơ sở này đạt độ chính xác trung bình 26,0%. Hiệu suất thay đổi đáng kể tùy theo mô hình và chi phí cao hơn không đồng nghĩa với độ chính xác cao hơn. Ví dụ, Sonnet 5 trên Claude Code đạt 15,6% với chi phí 5,01 USD mỗi lần chạy, trong khi GPT-5.6 Sol trên Codex đạt 33,3% với chi phí tương đương là 4,70 USD.
Việc sử dụng các mô hình này trong Genie mang lại những cải thiện đáng kể. Qua các so sánh mô hình tương đương, Genie đã cải thiện độ chính xác trung bình thêm 24,0 điểm phần trăm (mức cải thiện tương đối 92%). Các cấu hình Genie sử dụng GPT-5.6 Luna, GPT-5.6 Terra và Claude Fable 5 cũng chiếm ưu thế trên đường biên Pareto về chi phí-chất lượng, chứng minh rằng những cải tiến này không đòi hỏi phải đánh đổi hiệu suất lấy độ chính xác. Trong trường hợp của Claude Fable 5, việc chuyển sang sử dụng Genie giúp cải thiện hiệu suất thêm 14,4 điểm phần trăm (+32% tương đối) trong khi giảm chi phí khoảng 9 lần. Từ việc kiểm tra các dấu vết (traces), chúng tôi nhận thấy Fable 5 có xu hướng lặp lại các nỗ lực phân tích nhiều tài liệu, dẫn đến các lần chạy kéo dài với chi phí trung bình là 37,36 USD. Genie phân tích tài liệu bằng cách sử dụng ai_parse, cho phép mô hình xác định thông tin chính xác từ mỗi trang một cách hiệu quả, từ đó tiết kiệm chi phí và cải thiện hiệu suất.
Mặc dù những cải tiến về bộ khung này mang lại những bước tiến đáng kể, OfficeQA Pro V2 vẫn còn nhiều dư địa để phát triển. Các hệ thống vẫn tiếp tục bộc lộ những lỗi tương tự như chúng tôi đã quan sát thấy trong OfficeQA ban đầu – độ trung thực khi phân tích cú pháp, sự hòa giải thời gian không chính xác khi các quy ước kế toán thay đổi theo thời gian, và hiểu sai phạm vi thực thể hoặc độ chi tiết của danh mục.
Xây dựng một Bộ tiêu chuẩn Suy luận dựa trên dữ liệu thực tế mới
Để thực sự kiểm tra khả năng khái quát hóa, chúng tôi cần một tập dữ liệu mới phản ánh được các kỹ năng liên quan đến doanh nghiệp mà OfficeQA được thiết kế để đo lường: phân tích các tài liệu phức tạp, truy xuất bằng chứng phù hợp và thực hiện suy luận phân tích dựa trên thông tin đó.
Chúng tôi đã hợp tác với Bộ Tài chính Hoa Kỳ để xây dựng bộ tiêu chuẩn dựa trên một tập dữ liệu mới: "U.S. Federal Accounts of Receipts and Expenditures", tập dữ liệu mà Bộ Tài chính chuẩn bị phát hành dưới dạng một tập dữ liệu thống nhất lần đầu tiên nhân dịp kỷ niệm 250 năm thành lập Hoa Kỳ. Tập dữ liệu này bao gồm khoảng 1.400 tệp PDF và 120.000 trang chứa các hồ sơ kế toán chi tiết của Hoa Kỳ, trải dài từ năm 1793 đến năm 2024.
Giống như các bản tin của Bộ Tài chính Hoa Kỳ (U.S. Treasury Bulletins) được sử dụng trong bộ tiêu chuẩn OfficeQA ban đầu, tập dữ liệu mới này phản ánh nhiều thách thức phổ biến trong các bộ sưu tập tài liệu doanh nghiệp: các bảng và biểu đồ dày đặc, các giá trị được sửa đổi theo thời gian, các quy ước báo cáo thay đổi và kiến thức chuyên môn sâu sắc về thể chế. Những phức tạp này cũng dẫn đến một bài kiểm tra đánh giá đầy thách thức: tương tự như bộ tiêu chuẩn OfficeQA ban đầu, chúng tôi nhận thấy các tác nhân tiên tiến cơ sở gặp khó khăn trong việc đạt được độ chính xác cao ổn định trên OfficeQA Pro V2.
Mở rộng OfficeQA Pro V2 với Dữ liệu Tổng hợp (Synthetic Data)

Khi chúng tôi tạo ra bộ tiêu chuẩn OfficeQA ban đầu vào cuối năm 2025, quy trình này chủ yếu là thủ công. Các chuyên gia chú giải con người đã xây dựng câu hỏi và câu trả lời bằng tay trong khi rà soát tập dữ liệu gồm 89.000 trang bản tin của Bộ Tài chính Hoa Kỳ, thường đòi hỏi nhiều vòng đánh giá của con người để đảm bảo chất lượng câu hỏi. Mặc dù phương pháp này cuối cùng đã tạo ra một bộ tiêu chuẩn chất lượng cao, nhưng nó rất tốn thời gian, tốn kém và khó mở rộng. Kể từ đó, chúng tôi đã phát triển các kỹ thuật để tự động hóa việc tạo ra các bộ tiêu chuẩn nghiêm ngặt một cách hiệu quả và đáng tin cậy hơn nhiều.
Để xây dựng OfficeQA Pro V2, chúng tôi đã tận dụng asynth, thư viện nội bộ của chúng tôi để xây dựng các quy trình tạo dữ liệu tổng hợp. Điều này cho phép chúng tôi tạo ra một bộ tiêu chuẩn đa dạng, có thể kiểm chứng một cách nhanh chóng và có khả năng mở rộng, phản ánh chính xác những thách thức của suy luận dựa trên dữ liệu thực tế bằng cách sử dụng một quy trình hệ thống để tạo và kiểm duyệt câu hỏi:
Các câu hỏi thu được đòi hỏi những năng lực suy luận dựa trên dữ liệu thực tế cốt lõi tương tự như bộ tiêu chuẩn OfficeQA ban đầu: truy xuất trên nhiều tài liệu nguồn, suy luận phân tích và các năng lực chuyên biệt như tìm kiếm web bổ sung và diễn giải đa phương thức các hình ảnh. Các câu hỏi ví dụ từ bộ tiêu chuẩn, cũng như chi tiết về thành phần của nó, có thể được xem bên dưới.
Các câu hỏi ví dụ
1. Độ khó thấp: Tính thu nhập của Chánh án: “Tổng giá trị danh nghĩa bằng đô la cho thu nhập của John Jay với tư cách là Chánh án Tòa án Tối cao, theo Báo cáo Thu chi của Hoa Kỳ trong nửa cuối năm dương lịch 1793 là bao nhiêu, và những số hiệu lệnh chi (warrant numbers) nào tương ứng với các khoản thanh toán đó? Hãy trả về câu trả lời của bạn dưới dạng các giá trị phân tách bằng dấu phẩy trong ngoặc vuông theo thứ tự giá trị thu nhập của ông ấy và các số hiệu lệnh chi theo thứ tự năm dương lịch.”

Câu hỏi này đòi hỏi việc xác định vị trí một trang Báo cáo Thu chi năm 1793 và đọc bốn khoản thanh toán lệnh chi được ghi cho Chánh án John Jay (được tô đỏ), đồng thời diễn giải chính xác rằng "do." là viết tắt của "ditto" (như trên), chỉ cùng một danh mục dữ liệu với hàng trước đó. Câu hỏi sau đó đòi hỏi phải hiểu rằng "nửa cuối năm dương lịch 1793" giới hạn câu trả lời chỉ trong các khoản thanh toán tháng 7 và tháng 11. Cuối cùng, cần truy xuất các số hiệu lệnh chi tương ứng và thực hiện một phép tính tổng đơn giản để có câu trả lời cuối cùng.
2. Độ khó trung bình: Dự báo mức tăng chi tiêu Medicare: “Từ năm tài chính 1990 đến năm tài chính 1994 (bao gồm cả hai năm), chi tiêu cho Medicare đã tăng nhanh chóng khi chương trình mở rộng. Bằng cách khớp hồi quy tuyến tính OLS với các số liệu chi tiêu Medicare hàng năm được báo cáo cho các năm tài chính đó, mức tăng đô la trung bình hàng năm ước tính trong chi tiêu Medicare được báo cáo là bao nhiêu triệu đô la, làm tròn đến hai chữ số thập phân?”

Câu hỏi này đòi hỏi việc truy xuất số liệu chi tiêu Medicare từ bảng "Chi tiêu theo Chức năng" trong năm Báo cáo Tổng hợp hàng năm riêng biệt (năm tài chính 1990–1994, được tô đỏ). Quan trọng là, tác nhân phải đọc giá trị của mỗi năm từ cột năm trước đã sửa đổi mới nhất, thay vì số liệu được báo cáo lần đầu. Cuối cùng, tác nhân phải khớp chuỗi dữ liệu với một mô hình hồi quy tuyến tính để ước tính mức tăng trung bình hàng năm.
3. Độ khó cao: Dự báo mức tăng chi tiêu giữa các cơ quan: “Đối với tổng chi tiêu ròng của các Bộ Thương mại, Nội vụ và Ngoại giao, Cơ quan Bảo vệ Môi trường và Cơ quan Hàng không và Vũ trụ Quốc gia được tổng hợp từ các gia đình Mã Tài khoản Kho bạc (TAS) cấu thành của chúng như được báo cáo bởi Bộ Tài chính Hoa Kỳ, hãy khớp phương pháp Theta phi mùa vụ tiêu chuẩn trên các khoản chi tiêu được báo cáo: ước tính thành phần θ=0 dưới dạng xu hướng tuyến tính OLS, xây dựng chuỗi biến đổi θ=2, dự báo thành phần đó bằng phương pháp làm mịn hàm mũ đơn giản được khởi tạo tại giá trị đầu tiên của nó, và chọn α trên [0, 1], cho phép α = 1.0. Sử dụng dự báo này và tính trung bình các dự báo một bước trước của θ=0 và θ=2, dự báo năm tài chính 1989 tính bằng triệu đô la làm tròn đến hàng trăm gần nhất là bao nhiêu?”
Câu hỏi này đòi hỏi việc tập hợp một chuỗi tám năm (năm tài chính 1981–1988) về chi tiêu ròng cho năm cơ quan khác nhau (Thương mại, Nội vụ, Ngoại giao, EPA và NASA) từ tám Báo cáo Tổng hợp riêng biệt. Một lần nữa, tác nhân phải chỉ sử dụng các số liệu được báo cáo mới nhất cho mỗi năm. Chuỗi kết quả sau đó phải được sử dụng để dự báo chi tiêu ròng cho năm tài chính 1989, sử dụng một phương pháp dự báo cụ thể.
Chi tiết về Bộ tiêu chuẩn
OfficeQA Pro V2 bao gồm 90 câu hỏi, tất cả đều đòi hỏi bằng chứng từ tập dữ liệu của bộ tiêu chuẩn. Là một phần của quy trình xác minh dữ liệu tổng hợp, chúng tôi đã lọc bỏ các câu hỏi có thể trả lời được bằng kiến thức tham số hoặc chỉ bằng tìm kiếm web.
Mặc dù được xây dựng trên một tập dữ liệu mới, OfficeQA Pro V2 vẫn bảo tồn các năng lực suy luận dựa trên dữ liệu thực tế cốt lõi của doanh nghiệp được đo lường bởi bộ tiêu chuẩn OfficeQA ban đầu, cả trên toàn bộ tập câu hỏi (OfficeQA Full) và trong tập con có độ khó tiên tiến (OfficeQA Pro). 7% câu hỏi đòi hỏi khả năng hiểu trực quan về biểu đồ, đồ thị hoặc hình ảnh, so với khoảng 3% trong OfficeQA Pro. 10% khác đòi hỏi thông tin bổ sung thu được thông qua tìm kiếm web (như chỉ số lạm phát, chuỗi GDP hoặc số liệu dân số), so với 21,8% trong OfficeQA Pro và 15,9% trong OfficeQA Full. Tổng cộng, khoảng một trong sáu câu hỏi của OfficeQA Pro V2 đòi hỏi ít nhất một trong những năng lực chuyên biệt này ngoài việc truy xuất và phân tích văn bản.
So với OfficeQA Pro, OfficeQA Pro V2 đòi hỏi bằng chứng từ nhiều tài liệu nguồn hơn đáng kể cho mỗi câu hỏi. Các câu hỏi của OfficeQA Pro dựa trên trung bình khoảng 2 tài liệu Bản tin Kho bạc, trong khi các câu hỏi của OfficeQA Pro V2 đòi hỏi bằng chứng từ trung bình 6,7 tài liệu nguồn, với trung vị là 5,5 và tối đa là 24. Tổng cộng, 74,4% câu hỏi của OfficeQA Pro V2 đòi hỏi bốn nguồn trở lên, so với 62,4% trong OfficeQA Pro và 56,1% trong OfficeQA Full.
Tổng hợp lại, những đặc điểm này làm cho OfficeQA Pro V2 trở thành một bài kiểm tra khắt khe hơn về suy luận dựa trên dữ liệu thực tế từ đầu đến cuối so với bộ tiêu chuẩn ban đầu, đồng thời vẫn giữ nguyên sự kết hợp thực tế giữa các yêu cầu về phân tích, đa phương thức và kiến thức bên ngoài thường thấy trong các quy trình công việc doanh nghiệp. Để hiểu tại sao bộ tiêu chuẩn này vẫn là một thách thức, việc xem xét cách các tài liệu cơ bản và quy ước báo cáo đã thay đổi đáng kể theo thời gian là rất hữu ích.
Một tập dữ liệu trải dài hơn hai thế kỷ
Trải dài 232 năm báo cáo tài chính liên bang của Hoa Kỳ, tập dữ liệu này cũng ghi lại sự phát triển của cấu trúc tài liệu, quy ước kế toán, thuật ngữ và các thể chế trong hơn hai thế kỷ. Ví dụ, các hồ sơ vào cuối những năm 1700 và đầu những năm 1800 thường ghi lại các khoản thanh toán cho cá nhân. Những tài liệu này thường bao gồm các trang gấp khổ ngang rộng, kiểu chữ cổ xưa như việc sử dụng chữ s dài trong các từ như “Treaſury” hoặc “Preſident”, và các quy ước viết lịch sử như ghi “do./ditto”, đặt ra những thách thức mới cho các giải pháp phân tích cú pháp hiện đại.
Đến giữa thế kỷ XIX, dữ liệu được trình bày ở định dạng tài khoản chữ T hai trang và các bảng kẻ ô dày đặc, trong khi kỳ báo cáo thay đổi từ năm dương lịch sang năm tài chính. Đầu những năm 1900 sau đó đã giới thiệu các thuật ngữ tài chính mới như số dư đầu kỳ và cuối kỳ, phân bổ nhiều năm, và các quy ước về thặng dư và thâm hụt.
Đến những năm 1980, Báo cáo Tổng hợp đã phát triển thành một báo cáo hàng năm với phụ lục chi tiết. Các báo cáo trở thành kỹ thuật số nguyên bản vào đầu những năm 2000 và bắt đầu kết hợp các biểu đồ trực quan cùng với mục lục chuẩn hóa.
OfficeQA Pro V2 được xây dựng dựa trên những phức tạp của Báo cáo Thu chi, tạo ra một bài kiểm tra áp lực đặc biệt khắt khe cho suy luận dựa trên dữ liệu thực tế. Trên toàn bộ tập dữ liệu, cùng một khái niệm tài chính có thể thay đổi về tên gọi, vị trí, lược đồ bảng, đơn vị, cơ sở thời gian và mức độ tổng hợp. Ngoài việc phân tích tài liệu và truy xuất giá trị, điều này có nghĩa là các tác nhân phải hòa giải thông tin giữa các quy ước báo cáo đang thay đổi – một sự phức tạp điển hình trong môi trường doanh nghiệp.
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.