Databricks: Blog
85

Thủ thuật

Databricks tối ưu hóa truy xuất dữ liệu cho AI Agent thông qua trích xuất biểu đồ cấu trúc

(giờ Việt Nam)

Tóm tắt AI

Databricks giới thiệu phương pháp chuyển đổi biểu đồ trong tài liệu doanh nghiệp thành định dạng cấu trúc, giúp AI Agent truy xuất và phân tích dữ liệu chính xác hơn trong các tác vụ phức tạp.

Bản dịch AI

Enhancing Agent Retrieval with Structured Chart Extraction

Động lực

Ngày càng có nhiều doanh nghiệp yêu cầu các tác nhân (agents) làm việc với các tài liệu độc quyền của họ và trả lời các câu hỏi về nội dung bên trong đó. Tuy nhiên, phần lớn thông tin quan trọng lại nằm trong các hình ảnh và biểu đồ. Nhiều khách hàng nhận thấy rằng các tác nhân gặp khó khăn khi trả lời những câu hỏi đòi hỏi phải đọc và đếm các giá trị trong biểu đồ. Để các tác nhân hoạt động đáng tin cậy trong môi trường doanh nghiệp đa dạng, chúng ta cần làm cho các biểu đồ trở nên dễ diễn giải hơn.

Làm thế nào để giúp biểu đồ trở nên dễ hiểu hơn đối với các tác nhân? Chúng tôi đã thực hiện một thử nghiệm nhanh và đơn giản: chúng tôi hỏi các tác nhân khác nhau rằng: “Có bao nhiêu cực đại địa phương trên biểu đồ này?”

Dưới đây là sự so sánh giữa một tác nhân tiên tiến (frontier agent) và Databricks Genie khi trả lời câu hỏi này. Tác nhân tiên tiến chỉ được cung cấp hình ảnh, đã dành 50 giây để suy luận nhưng vẫn đưa ra câu trả lời sai là 17. Trong khi đó, Databricks Genie đã sử dụng phương pháp trích xuất có cấu trúc của biểu đồ thông qua ai_parse_document và đưa ra câu trả lời đúng là 18.

image12.png

Chúng tôi nhận thấy những thiếu sót này trong bộ tiêu chuẩn đánh giá OfficeQA Pro của mình, nơi các mô hình hoạt động kém hiệu quả hơn đối với các câu hỏi dựa trên biểu đồ và đa phương thức so với các câu hỏi không yêu cầu khả năng hiểu biểu đồ. Chúng tôi cũng thấy những khoảng trống tương tự trong các hệ thống truy xuất thông tin của khách hàng, đặc biệt là trong lĩnh vực dịch vụ tài chính. Một hệ thống truy xuất dựa trên văn bản chỉ có thể tìm kiếm trong không gian văn bản. Một giải pháp phổ biến là tạo chú thích để mô tả nội dung biểu đồ; tuy nhiên, cách này có thể bỏ lỡ dữ liệu cần thiết cho các câu hỏi chi tiết về những con số bên trong biểu đồ. Kết quả là hệ thống có thể truy xuất sai trang, hoặc truy xuất đúng trang nhưng không có đủ thông tin để trả lời câu hỏi.

Trong bài viết này, chúng tôi chứng minh rằng việc trích xuất có cấu trúc từ các biểu đồ giúp cải thiện cả chất lượng truy xuất lẫn chất lượng câu trả lời cho các câu hỏi dựa trên biểu đồ. Chúng tôi đánh giá phương pháp của mình trên hai tập dữ liệu: một tập con chứa nhiều biểu đồ của ViDoRe V3 – bộ tiêu chuẩn đánh giá cho việc truy xuất và trả lời câu hỏi trên các tài liệu giàu hình ảnh, và một tập dữ liệu tổng hợp tập trung vào biểu đồ mà chúng tôi gọi là Chart-RAG. Phương pháp của chúng tôi đạt hiệu suất cạnh tranh so với các mô hình nhúng đa phương thức (multimodal embedding models) đơn vector và đa vector quy mô lớn.

image9.png

Chúng tôi xây dựng một quy trình truy xuất nhận diện biểu đồ (chart-aware retrieval pipeline) từ đầu đến cuối bằng các hàm AI của Databricks, một tập hợp các hàm có thể kết hợp được tối ưu hóa bằng các kỹ thuật nghiên cứu tiên tiến nhất (xem Hình 2). Chúng tôi đã sử dụng ai_parse_document để trích xuất nội dung tài liệu, bao gồm các biểu đồ được biểu diễn dưới dạng JSON có cấu trúc, và ai_prep_search để chuyển đổi nội dung thành các đoạn (chunks) sẵn sàng cho việc truy xuất, được lập chỉ mục bằng một mô hình nhúng văn bản nhẹ với 300 triệu tham số. Chúng tôi đã tạo một chỉ mục từ các đoạn này bằng ai_search và kết nối chỉ mục đó với Genie để thực hiện truy xuất và trả lời.

image5.png

Phương pháp đánh giá

Chúng tôi đã so sánh hai chỉ mục, được tạo bằng mô hình nhúng văn bản BGE 300 triệu tham số, xây dựng từ cùng một nguồn PDF, chỉ khác nhau ở cách biểu diễn hình ảnh biểu đồ:

Một ví dụ về trích xuất biểu đồ:

image3.png

Chúng tôi đã đánh giá 310 câu hỏi tập trung vào biểu đồ và đồ họa thông tin từ bộ tiêu chuẩn ViDoRe V3. Bộ tiêu chuẩn này đánh giá khả năng truy xuất và trả lời trên bảy lĩnh vực: việc làm, năng lượng, dược phẩm, vật lý, tài chính, khoa học máy tính và tài liệu công nghiệp. Đối với mỗi thử nghiệm, chúng tôi đã phân tích và chia nhỏ toàn bộ kho dữ liệu tiếng Anh gồm 16.000 trang và tạo câu trả lời cho mọi truy vấn, thực hiện tìm kiếm trên toàn bộ chỉ mục.

Mặc dù các câu hỏi tập trung vào biểu đồ đã được chọn lọc, nhiều câu hỏi vẫn có thể được trả lời bằng cách sử dụng văn bản xung quanh. Để cô lập tác động của nội dung biểu đồ, chúng tôi đã tạo một bộ tiêu chuẩn thứ hai chỉ tập trung vào các câu hỏi dựa trên biểu đồ được lấy từ ba báo cáo phức tạp, chứa nhiều biểu đồ (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Chúng tôi đã soạn 114 câu hỏi dựa trên hình ảnh từ 3 tài liệu này với tổng cộng 378 trang để xây dựng tập dữ liệu tổng hợp Chart-RAG.

Chấm điểm: Chúng tôi chấm điểm mỗi câu trả lời là Đúng / Đúng một phần / Sai bằng cách sử dụng một LLM giám khảo (gemini-3-flash) đối chiếu với câu trả lời chuẩn (gold answer).

Truy xuất: Chúng tôi báo cáo chỉ số Hit Rate@10 và nDCG@10. Hit Rate@10 kiểm tra xem liệu có ít nhất một trang chuẩn (gold page) xuất hiện trong top 10 kết quả truy xuất hay không. Các câu hỏi từ bộ tiêu chuẩn ViDoRe có thể có nhiều trang chuẩn, mỗi trang có điểm mức độ liên quan là 1 hoặc 2. Đối với Hit Rate@10, chúng tôi chuyển đổi mức độ liên quan đã chấm điểm thành mức độ liên quan nhị phân bằng cách cho phép các trang có một trong hai điểm số được tính là một lượt truy xuất thành công (hit). Đối với nDCG@10, chúng tôi giữ nguyên mức độ liên quan đã chấm điểm. Trong tập dữ liệu Chart-RAG, mỗi truy vấn có một trang chuẩn.

Để đạt được phép đo ổn định, chúng tôi đã chạy mỗi cấu hình ba lần và báo cáo kết quả kèm theo khoảng tin cậy.

Dữ liệu biểu đồ có cấu trúc giúp cải thiện khả năng truy xuất và trả lời

image6.png

JSON biểu đồ có cấu trúc giúp cải thiện cả chất lượng câu trả lời và khả năng truy xuất trên cả hai tập dữ liệu. Phân tích ở cấp độ câu hỏi dưới đây cho thấy thời điểm các câu trả lời được sửa đổi trùng khớp với khả năng truy xuất tốt hơn.

Ví dụ sau từ tập dữ liệu Chart-RAG minh họa cách các biểu diễn JSON cải thiện khả năng truy xuất và chất lượng câu trả lời:

Mức đỉnh (điểm %) mà Oil VIX đạt được vào khoảng quý 1 năm 2026 là bao nhiêu?

Tham chiếu đến biểu đồ sau:

Lợi ích truy xuất này có thể không chỉ giới hạn ở các câu hỏi về biểu đồ. Các giá trị và nhãn biểu đồ được trích xuất có thể giúp bản thân trang tài liệu dễ truy xuất hơn, ngay cả khi câu trả lời không xuất hiện trực tiếp trên biểu đồ.

Hình ảnh giúp cải thiện hơn nữa chất lượng câu trả lời

Một số câu hỏi phụ thuộc vào hình dáng của biểu đồ thay vì chỉ các giá trị của nó. Để đo lường lợi ích của việc khôi phục ngữ cảnh hình ảnh, chúng tôi đã cung cấp cho tác nhân các hình ảnh tương ứng với ba đoạn văn bản truy xuất được hàng đầu cùng với JSON tại thời điểm trả lời.

Ở đây, khả năng truy xuất không thay đổi. Hình ảnh giúp tăng 4 điểm phần trăm trên tập dữ liệu Chart-RAG và 2,6 điểm phần trăm trên tập con ViDoRe V3.

Các biểu diễn JSON có tính cạnh tranh với các mô hình nhúng đa phương thức

Một câu hỏi đặt ra là phương pháp của chúng tôi, vốn sử dụng mô hình nhúng văn bản nhẹ 300 triệu tham số, so sánh như thế nào với các mô hình nhúng đa phương thức. Chúng tôi đã đánh giá so sánh với bốn lựa chọn thay thế: ColQwen2.5-3B, một mô hình nhúng đa phương thức đa vector quy mô lớn sử dụng tính điểm tương tác trễ (late-interaction scoring); Qwen3-VL-Embedding-2B, một mô hình nhúng đa phương thức đơn vector quy mô lớn; và các mô hình đơn vector nhẹ hơn là Jina CLIP v2 (0,9 tỷ tham số) và CLIP ViT-L/14 (428 triệu tham số). Mỗi mô hình đa phương thức đã nhúng mọi trang. Tại thời điểm truy vấn, chúng tôi xếp hạng các trang bằng cách sử dụng MaxSim cho ColQwen2.5-3B và độ tương đồng cosine cho các mô hình đơn vector, tìm kiếm trên toàn bộ kho dữ liệu và chuyển năm trang có điểm số cao nhất cho VLM trả lời. Chúng tôi báo cáo độ chính xác của câu trả lời bằng cách sử dụng năm trang được truy xuất vì hai lý do. Thứ nhất, nó cung cấp một điểm trung bình cân bằng giữa các độ sâu hiệu suất tốt nhất cho tập con ViDoRe và tập dữ liệu Chart-RAG. Thứ hai, năm trang xấp xỉ với ngữ cảnh đầu vào trung bình được sử dụng trong phương pháp của chúng tôi, cho phép so sánh công bằng. Chúng tôi vẫn báo cáo nDCG@10 như là chỉ số truy xuất tiêu chuẩn.

ViDoRe V3:

Chart-RAG:

Đối với các mô hình mạnh nhất, khả năng truy xuất trên tập dữ liệu Chart-RAG gần như bão hòa do quy mô kho dữ liệu nhỏ chỉ với 378 trang. Do đó, sự so sánh thú vị hơn ở đây chính là chất lượng câu trả lời.

Trên ViDoRe V3, JSON biểu đồ với ba hình ảnh hàng đầu đạt độ chính xác 75,9%. Trên Chart-RAG, cấu hình tương tự đạt 75,1%. Cả hai trường hợp đều vượt qua bốn mô hình nhúng đa phương thức cơ sở trong khi chỉ chuyển ba hình ảnh cho mô hình. Hiệu suất này đến từ một giải pháp thay thế nhỏ hơn khoảng 10 lần và đơn giản hơn so với kiến trúc đa vector, tương tác trễ của ColQwen2.5-3B. Do đó, việc tiền xử lý biểu đồ có cấu trúc có thể mang lại chất lượng câu trả lời cạnh tranh với ngân sách hình ảnh nhỏ hơn và chi phí lập chỉ mục cũng như truy xuất thấp hơn.

Kết luận

Biểu đồ là một dạng thông tin chiếm ưu thế trong các tài liệu doanh nghiệp. Việc làm cho thông tin biểu đồ dễ tìm kiếm và diễn giải rõ ràng là rất quan trọng đối với độ chính xác của các tác nhân truy xuất. JSON biểu đồ có cấu trúc giúp thu hẹp khoảng cách trong hệ thống RAG cổ điển bằng cách thêm các giá trị chính xác vào chỉ mục truy xuất để các tác nhân suy luận. Chúng tôi chứng minh rằng JSON biểu đồ có cấu trúc giúp cải thiện cả chất lượng truy xuất và độ chính xác câu trả lời của tác nhân. Các nghiên cứu trong tương lai có thể khám phá thêm cách các định dạng biểu diễn trích xuất có cấu trúc khác nhau ảnh hưởng đến độ chính xác của việc truy xuất và trả lời.

Tính năng làm giàu JSON biểu đồ cho ai_parse_document sẽ sớm ra mắt, vì vậy bất kỳ tài liệu nào được phân tích sẽ tự động bao gồm các giá trị biểu đồ của nó dưới dạng văn bản có cấu trúc mà không cần thay đổi giao diện của hàm. Đối với việc truy xuất, chúng tôi khuyến nghị kết hợp nó với ai_prep_search. Khả năng này cũng sẽ hỗ trợ Genie One cải thiện câu trả lời cho các câu hỏi liên quan đến biểu đồ trên tệp PDF cho khách hàng của Databricks.

Tác giả: Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

DatabricksAI AgentRAGXử lý dữ liệuKỹ thuật AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.