Tin ngành
Databricks tổ chức cuộc thi Grounded Reasoning Cup: Đánh giá trực tiếp năng lực suy luận của AI Agent
(giờ Việt Nam)
Tóm tắt AI
Databricks vừa khởi động cuộc thi Grounded Reasoning Cup, tập trung đánh giá khả năng suy luận thực tế của các AI Agent trong môi trường trực tiếp thay vì các bài kiểm tra lý thuyết tĩnh.
Bản dịch AI

Năm nay, Databricks đã tổ chức Grounded Reasoning Cup lần đầu tiên, một cuộc thi AI trực tiếp có tính chất tiên phong nhằm đánh giá khả năng suy luận của các AI agent trên các tập hợp tài liệu phức tạp theo phong cách doanh nghiệp. Bằng cách kiểm tra các agent trên một bộ dữ liệu mới được công bố trong điều kiện thi đấu trực tiếp, Grounded Reasoning Cup được thiết kế để giúp trả lời một trong những câu hỏi khó nhất trong việc đánh giá AI: liệu những cải thiện về hiệu suất trên một bộ benchmark có thể khái quát hóa tốt đến mức nào đối với các tác vụ thực tế tương tự?
Cuộc thi đã quy tụ 11 đội học thuật hàng đầu từ khắp Hoa Kỳ và Canada, được kết nối với các nguồn lực và sự cố vấn từ các phòng thí nghiệm tiên phong bao gồm OpenAI, Anthropic và Google DeepMind. Trong suốt hai tháng, các đội đã phát triển và tối ưu hóa agent của họ trên OfficeQA, bộ benchmark suy luận có căn cứ (grounded-reasoning) hàng đầu của chúng tôi, được thiết kế để phản ánh các quy trình làm việc có giá trị kinh tế trong doanh nghiệp. Vào ngày thi đấu, họ được thử thách áp dụng các hệ thống đó trong thời gian thực vào một bộ benchmark suy luận có căn cứ mới được công bố là OfficeQA Pro V2, được thiết kế để kiểm tra xem những cải tiến của họ có khả năng khái quát hóa hay không.
Stanford đã giành chiến thắng với một hệ thống đạt độ chính xác 63,3%, vượt qua điểm trung bình của các đội khoảng +22 điểm và vượt qua mức cơ sở (baseline) ngoại tuyến của các agent tiên phong trung bình khoảng +35 điểm. Các đội hàng đầu đã chứng minh những bước tiến đáng kể thông qua việc tiền xử lý tài liệu, truy xuất có mục tiêu, sử dụng các agent song song, sử dụng công cụ có cấu trúc và xác minh. Đồng thời, 18,8% số câu hỏi không được đội nào giải quyết, nhấn mạnh rằng vẫn còn rất nhiều dư địa để phát triển trong lĩnh vực suy luận có căn cứ cho doanh nghiệp.

Trong bài viết này, chúng tôi tóm tắt lại cuộc thi và thảo luận về các chiến lược tối ưu hóa agent cũng như những hiểu biết sâu sắc từ các đội chiến thắng của Grounded Reasoning Cup: Stanford, Đại học Massachusetts Amherst và Yale.
Nhìn chung, chúng tôi nhận thấy những điều sau:
Thiết lập cuộc thi
Mục tiêu của Grounded Reasoning Cup là tập hợp các đội học thuật hàng đầu để phát triển các phương pháp có khả năng khái quát hóa cho suy luận có căn cứ – một tác vụ phổ biến trong môi trường doanh nghiệp, đòi hỏi việc trả lời các câu hỏi phức tạp bằng cách sử dụng bằng chứng từ các bộ sưu tập tài liệu lớn, thường là tài liệu độc quyền.
Các đội gồm 2-4 người đại diện cho tổ chức học thuật của họ được ghép cặp với một đối tác trong ngành từ OpenAI, Anthropic hoặc Google DeepMind, những người cung cấp quyền truy cập vào các mô hình và sự cố vấn trong suốt giai đoạn phát triển. Các đội có khoảng hai tháng để xây dựng một agent bằng bất kỳ phương pháp nào họ thấy phù hợp, với một ràng buộc duy nhất là họ phải sử dụng độc quyền dòng mô hình của phòng thí nghiệm đối tác để vận hành agent của mình. Trong giai đoạn này, họ đã sử dụng bộ benchmark OfficeQA để đánh giá các kỹ thuật mới mà họ tin rằng sẽ khái quát hóa được cho các tác vụ suy luận có căn cứ tương tự.
Vào ngày thi đấu, các đội được giao nhiệm vụ áp dụng các agent của mình trong thời gian thực trên một bộ benchmark mới vừa được công bố. Cuộc thi được điều hành bởi các quy tắc sau:
Hiệu suất và bài học của các đội
Cuộc thi đã làm rõ một điều: khả năng suy luận có căn cứ trên các kho tài liệu kiểu doanh nghiệp đã được cải thiện kể từ khi chúng tôi phát hành bộ benchmark OfficeQA cách đây 7 tháng, nhưng vẫn còn lâu mới đạt đến mức hoàn thiện. Điểm trung bình của các đội là ~41%, trong khi ba đội dẫn đầu đạt độ chính xác trên 50%, với đội Stanford giành chiến thắng với độ chính xác 63,3%. Những kết quả này cho thấy công việc ấn tượng từ các đội hàng đầu, cũng như rất nhiều dư địa còn lại để khám phá.
Chiến lược của các đội chiến thắng
Mặc dù mỗi đội có một cách tiếp cận độc đáo, một số mô hình đã xuất hiện trên các agent được xây dựng bởi ba đội hàng đầu. Các hệ thống mạnh thường kết hợp việc tiền xử lý tài liệu cẩn thận, truy xuất có mục tiêu, sử dụng công cụ có cấu trúc và các bước xác minh câu trả lời. Trong nhiều trường hợp, hiệu suất phụ thuộc ít hơn vào một lệnh gọi mô hình đơn lẻ mà phụ thuộc nhiều hơn vào hệ thống xung quanh: cách tài liệu được phân tích cú pháp, cách bằng chứng được truy xuất, cách các phép tính trung gian được thực hiện và cách câu trả lời được xác minh trước khi gửi. Mặc dù đây là những phẩm chất mà các hệ thống hiệu suất cao nhất thường có điểm chung, mỗi đội cũng áp dụng các chiến lược riêng biệt và sáng tạo, như được mô tả dưới đây.

Hạng 1: Đại học Stanford

Cách tiếp cận chiến thắng của đội Stanford đến từ việc biến các lỗi suy luận có căn cứ phổ biến thành các quy trình vận hành có thể tái sử dụng để agent Claude Code (sử dụng Claude Opus 4.8) của họ học hỏi và áp dụng vào các câu hỏi trong cuộc thi. Trong quá trình phát triển trên bộ benchmark OfficeQA công khai, bao gồm các thử nghiệm cắt bỏ (ablation) với Opus 4.8 và thậm chí cả Fable 5 (khi có sẵn), đội đã liên tục truy vết các câu trả lời sai về đúng bước sai lầm của agent, sau đó biến các mô hình đó thành các kỹ năng định vị bảng biểu, định dạng câu trả lời, làm rõ các thuật ngữ tài chính phổ biến, v.v. Đội cũng tích hợp các kỹ năng quyết định khi nào nên tìm kiếm trên văn bản đã phân tích cú pháp và các biểu diễn tài liệu kiểu markdown, và khi nào nên quay lại các tệp PDF gốc nếu văn bản đã phân tích thiếu ngữ cảnh đầy đủ. Đến ngày thi đấu, Stanford đã trang bị cho agent của họ một bộ cẩm nang gồm hơn 100 kỹ năng. Họ dẫn đầu tất cả các đội về độ chính xác với 57 câu trả lời đúng trên 88 câu họ thực hiện.
Mặc dù có sự chuẩn bị kỹ lưỡng này, Stanford vẫn phải điều chỉnh chiến lược của mình trong cuộc thi. Trong ba vòng đầu tiên, đội đã sử dụng một agent Claude Code khác làm bộ xác minh để trích xuất lại các giá trị trung gian, kiểm tra các lỗi phổ biến như truy vết các giá trị đã sửa đổi thông qua dòng dữ liệu và xử lý việc thay đổi đơn vị, đồng thời vá các phép tính khi phát hiện sai lệch. Nhưng sau khi chỉ giành được hai phần thưởng tốc độ trong các vòng đó, Stanford đã loại bỏ bước xác minh bổ sung cho ba vòng cuối. Thay đổi này đã giảm đáng kể độ trễ, giúp đội giành được phần thưởng tốc độ trên 14 câu hỏi và thúc đẩy sự trở lại của họ. Tuy nhiên, bộ xác minh đã chứng tỏ tính quyết định trong vòng cuối cùng, khi Stanford bật lại nó để sửa một câu trả lời thông qua lần gửi lại cuối cùng, cuối cùng đảm bảo chiến thắng của họ.
Hạng 2: UMass Amherst

Đội UMass đã đặt cược vào tốc độ. Họ sử dụng Claude Opus 4.8 Fast làm mô hình chính và tiền xử lý kho tài liệu để tạo ra một danh mục siêu dữ liệu cho phép tìm kiếm và lọc nhanh chóng trên các tài liệu đã phân tích. Để cải thiện chất lượng câu trả lời trong khi vẫn duy trì độ trễ thấp, họ đã chạy ba agent song song trên mỗi câu hỏi, theo sau là một lệnh gọi xác minh Opus cuối cùng để chọn câu trả lời tốt nhất.
Chiến lược này đã mang lại cho UMass thời gian gửi câu trả lời đúng trung bình nhanh nhất: bốn phút, chưa bằng một nửa mức trung bình của các đội là tám phút 30 giây. Kết quả là, họ đã giành được 36 phần thưởng tốc độ, mỗi phần thưởng trị giá 0,25 điểm, vì là đội đầu tiên trả lời đúng, gấp đôi tổng số 16 điểm của đội đứng thứ hai là Stanford. Những phần thưởng này đã giúp họ tạo ra cách biệt 10,25 điểm so với Stanford vào giữa trận và duy trì lợi thế 3,75 điểm khi bước vào vòng cuối cùng. UMass giữ vững lợi thế đó cho đến 56 giây cuối cùng của cuộc thi, khi agent chậm hơn nhưng chính xác hơn của Stanford đã chứng tỏ tính quyết định ở những câu hỏi khó nhất và vươn lên giành chiến thắng với cách biệt 1,75 điểm.
Cách tiếp cận của UMass chứng minh cách các mô hình nhanh hơn, tiền xử lý tài liệu và mở rộng quy mô trong thời gian kiểm tra (test-time scaling) có thể phối hợp với nhau để đạt được độ trễ rất thấp mà không phải hy sinh quá nhiều độ chính xác.
Hạng 3: Đại học Yale

Đội Yale đã xây dựng một bộ khung xác minh đa nhánh được thiết kế để duy trì sự mạnh mẽ khi bất kỳ agent riêng lẻ nào thất bại. Hệ thống chạy bốn nhánh độc lập song song, bao gồm hai chiến lược agent. Hai nhánh sử dụng các agent ReAct tự chủ: một nhánh được vận hành bởi Gemini 3.1 Pro và nhánh kia bởi Gemini 3.5 Flash. Các nhánh còn lại sử dụng quy trình lập kế hoạch-xác minh có cấu trúc hơn, với Gemini 3.1 Pro vận hành tất cả các lệnh gọi LLM. Trong quy trình này, bộ lập kế hoạch kiểm tra và đặt các tài liệu nguồn vào ngữ cảnh, tập hợp một bản nháp chứa bằng chứng cần thiết để trả lời câu hỏi. Sau đó, bộ xác minh kiểm tra các nguồn được trích dẫn và thực hiện các phép tính cuối cùng.
Một bộ siêu xác minh (meta-verifier) Gemini 3.1 Pro đã xem xét các câu trả lời và lập luận do cả bốn nhánh tạo ra và chọn phản hồi cuối cùng. Để giảm rủi ro đưa ra một câu trả lời mới không được hỗ trợ, bộ siêu xác minh chỉ có thể chọn một câu trả lời do một trong các nhánh hiện có đề xuất. Khi không thể làm như vậy, hệ thống sẽ quay lại bỏ phiếu theo đa số. Bằng cách kết hợp các kiến trúc agent riêng biệt với các chế độ lỗi độc lập, một phần không tương quan, Yale đã nhấn mạnh vào việc xác minh có căn cứ và nhất quán. Cách tiếp cận này đã mang lại cho đội vị trí thứ ba, với 49 trên 90 câu hỏi được trả lời đúng và xếp hạng độ chính xác trong top ba ở bốn trong sáu vòng của cuộc thi.
Tóm tắt chiến lược của các đội chiến thắng
Một trong những bài học cốt lõi từ các cách tiếp cận chiến thắng này là việc áp dụng thành công một agent vào các tác vụ suy luận có căn cứ từ đầu đến cuối đòi hỏi tư duy hệ thống tổng thể, thay vì chỉ chọn mô hình. Trong các cách tiếp cận chiến thắng, một vài đòn bẩy thiết kế chính nổi bật là đặc biệt quan trọng:
Những yếu tố này quyết định liệu mô hình có thể tìm thấy bằng chứng phù hợp, thực hiện phép tính đúng và gửi câu trả lời chính xác dưới áp lực thời hạn hay không.
Tác động và các bước tiếp theo
Tóm lại, kết quả của Grounded Reasoning Cup chứng minh một số bài học rộng lớn hơn:
Chúng tôi biết ơn tất cả các đội và các nhà tài trợ trong ngành, bao gồm OpenAI, Google DeepMind và Anthropic, những đơn vị đã tham gia Grounded Reasoning Cup lần đầu tiên của Databricks và giúp thúc đẩy lĩnh vực này tiến lên phía trước. Chúng tôi cũng cảm ơn USAFacts vì sự hợp tác liên tục của họ, từ việc giúp chúng tôi xác định một kho dữ liệu mới và tạo các câu hỏi liên quan cho OfficeQA Pro V2, đến việc hợp tác với chúng tôi trong chính cuộc thi. Cuối cùng, chúng tôi cảm ơn Bộ Tài chính Hoa Kỳ đã giúp xác định "U.S. Accounts of Receipts and Expenditures" làm nền tảng cho bộ benchmark của cuộc thi, và vì đã phát hành tập dữ liệu này dưới dạng một bộ sưu tập thống nhất lần đầu tiên.
Tác giả: Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Brooke Wenig, Denny Lee, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.