Databricks: Blog
85

Tin ngành

Adaptive Instructed-Retriever: Đột phá tốc độ tìm kiếm gấp 2 lần cho doanh nghiệp

(giờ Việt Nam)

Tóm tắt AI

Databricks ra mắt Adaptive Instructed-Retriever, giải pháp tối ưu hóa tìm kiếm cho AI doanh nghiệp giúp giảm độ trễ gấp 2 lần mà vẫn duy trì độ chính xác vượt trội.

Bản dịch AI

Adaptive Instructed-Retriever: Frontier-Quality Search at 2x Lower Latency

Các tác nhân dữ liệu doanh nghiệp hiệu quả đòi hỏi khả năng tìm kiếm vừa chính xác vừa nhanh chóng. Đầu năm nay, chúng tôi đã phát hành Instructed-Retriever-1, một mô hình truy xuất có thể kết hợp các lược đồ dữ liệu doanh nghiệp và các chỉ dẫn tùy chỉnh, đồng thời sử dụng khả năng mở rộng song song trong thời gian kiểm thử (test-time scaling) để cải thiện độ chính xác truy xuất với độ trễ thấp. Phương pháp tìm kiếm một bước này hoạt động hiệu quả với phần lớn các yêu cầu từ người dùng. Tuy nhiên, các câu hỏi phức tạp hơn, đòi hỏi nhiều bước (multi-hop), vẫn có thể hưởng lợi từ tìm kiếm tuần tự, nơi mô hình thu thập bằng chứng và tinh chỉnh các truy vấn của nó qua nhiều bước – đổi lại là độ trễ tăng thêm.

Đó là lý do tại sao chúng tôi giới thiệu Adaptive Instructed-Retriever, kết hợp tốc độ của truy xuất song song với hiệu suất của tìm kiếm tuần tự, trong khi vẫn duy trì các cam kết nghiêm ngặt về chi phí và độ trễ. Mục tiêu rất đơn giản: chỉ dành thêm các bước tìm kiếm khi chúng thực sự hữu ích. Đây cũng chính là bài toán hiệu quả truy xuất mà Genie Code, tác nhân dữ liệu của Databricks, phải đối mặt: nó cần tìm đúng các bảng, sổ tay (notebooks), bảng điều khiển (dashboards) và tài liệu trong một không gian làm việc lớn và luôn thay đổi mà không lãng phí lượt truy vấn vào việc khám phá kiểu "vét cạn" (brute-force). Adaptive Instructed-Retriever được thiết kế cho lớp truy xuất này, phản hồi nhanh chóng khi bằng chứng đã rõ ràng và chỉ sử dụng tìm kiếm tuần tự khi một yêu cầu khó hơn đòi hỏi điều đó. Như chúng tôi trình bày trong bài viết này, mô hình đã qua huấn luyện đạt chất lượng tương đương với các mô hình bên thứ ba hàng đầu với độ trễ thấp hơn gấp 2 lần và cải thiện đáng kể so với tìm kiếm một bước trên các tiêu chuẩn đánh giá truy xuất của chúng tôi.

score and end-to-end latency measured on retrieval benchmark suite

Để xây dựng Adaptive Instructed-Retriever, chúng tôi áp đặt một giới hạn trên cố định cho số bước tuần tự và huấn luyện tác nhân để tự thích ứng quyết định xem mỗi yêu cầu của người dùng cần bao nhiêu tính toán. Khi đã tìm thấy đủ bằng chứng, tác nhân sẽ dừng sớm và trả về bằng chứng liên quan; khi việc tìm kiếm thêm có khả năng cải thiện chất lượng truy xuất, nó có thể tiếp tục tìm kiếm cho đến giới hạn bước đã đặt.

Figure 1. Architecture of the Adaptive Instructed-Retriever which enables multistep agentic search with bounded latency.

Huấn luyện Adaptive Instructed-Retriever

Để đạt được sự cân bằng tốt hơn giữa chất lượng truy xuất và chi phí độ trễ của việc mở rộng tuần tự, chúng tôi đã huấn luyện Adaptive Instructed-Retriever – một mô hình tùy chỉnh nhỏ hỗ trợ cả truy xuất song song một bước và tìm kiếm tuần tự, trong khi vận hành với độ trễ thấp hơn đáng kể so với các mô hình bên thứ ba hàng đầu. Chúng tôi đánh giá mô hình trên sự kết hợp giữa các tiêu chuẩn truy xuất doanh nghiệp độc quyền và công khai, bao gồm cả các tác vụ hưởng lợi từ suy luận nhiều bước. Trên các tiêu chuẩn này, Adaptive Instructed-Retriever đạt hiệu suất tương đương với các mô hình bên thứ ba và mã nguồn mở hàng đầu, đồng thời mang lại độ trễ thấp hơn gấp 2 lần.

Để chuẩn bị dữ liệu huấn luyện, chúng tôi dựa vào các môi trường truy xuất doanh nghiệp tổng hợp và quy trình tổng hợp dữ liệu tác nhân tương tự như Instructed-Retriever-1 và đã được công bố trong báo cáo KARL. Chúng tôi tái sử dụng dữ liệu huấn luyện hiện có cho Instructed-Retriever-1 để bảo toàn khả năng thực hiện tìm kiếm song song một bước nhanh chóng của mô hình, đồng thời bổ sung các câu hỏi tổng hợp nhiều bước vốn hưởng lợi nhiều hơn từ các bước tìm kiếm tác nhân.

Bắt đầu từ mô hình cơ sở, chúng tôi sử dụng học tăng cường trực tuyến (ORL) để dạy mô hình chỉ thực hiện thêm các bước tìm kiếm khi chúng có khả năng cải thiện hiệu suất cuối cùng. Cụ thể, chúng tôi tối ưu hóa mô hình theo phương thức end-to-end bằng cách sử dụng CISPO (Clipped Importance Sampling Policy Optimization), với thiết kế phần thưởng cân bằng giữa chất lượng quỹ đạo và chi phí tìm kiếm: mô hình được thưởng cho các quỹ đạo hiệu suất cao trong khi bị phạt vì các bước tìm kiếm bổ sung không mang lại sự cải thiện hiệu suất tương ứng.

Chúng tôi huấn luyện mô hình bằng AI Runtime (AIR). AIR cũng khả dụng cho khách hàng của Databricks, giúp phương pháp này trở nên thực tiễn cho việc phát triển các mô hình chuyên biệt cho lĩnh vực và khối lượng công việc của riêng họ. Công thức huấn luyện được cố tình làm cho nhẹ nhàng: chúng tôi bắt đầu từ một mô hình cơ sở đã được huấn luyện trước và sử dụng một lượng dữ liệu tổng hợp vừa phải để chuyên biệt hóa hành vi tìm kiếm của nó. Như Hình 2 minh họa, phương pháp nhẹ nhàng của chúng tôi khái quát hóa tốt cho các tác vụ và lĩnh vực tìm kiếm mới.

Figure 2. Adaptive Instructed-Retriever achieves comparable performance to Claude Sonnet 5 and GPT-5.6 Luna with significantly lower latency. The results are reported on a mixture of seven held-out in

Hình 2 so sánh Adaptive Instructed-Retriever với hai mô hình bên thứ ba hàng đầu (Claude Sonnet 5 và GPT-5.6 Luna) và một mô hình mã nguồn mở (DeepSeek-V4-Flash). Chúng tôi vẽ biểu đồ chất lượng truy xuất so với độ trễ end-to-end trung bình cho mỗi mô hình. Thanh màu sáng hiển thị điểm truy xuất từ một bước tìm kiếm đơn lẻ, trong khi thanh màu tối hiển thị kết quả từ tìm kiếm nhiều bước, được đo theo trục bên trái (càng cao càng tốt); thanh có gạch chéo hiển thị độ trễ end-to-end theo trục bên phải (càng thấp càng tốt). Adaptive Instructed-Retriever đạt hiệu suất tương đương với các mô hình bên thứ ba và mã nguồn mở hàng đầu trong khi phản hồi chỉ trong 5,8 giây, nhanh hơn gấp 2 lần so với Claude Sonnet 5, DeepSeek-V4-Flash hoặc GPT-5.6 Luna.

Học tăng cường trực tuyến cho các đánh đổi Chất lượng-Độ trễ tùy chỉnh

Việc huấn luyện Adaptive Instructed-Retriever cho phép chúng tôi chọn sự đánh đổi giữa chất lượng và độ trễ bằng cách điều chỉnh mức độ phạt bước được sử dụng trong quá trình ORL. Do đó, chúng tôi có thể huấn luyện một loạt các điểm kiểm tra (checkpoints) cung cấp năng lượng cho Adaptive Instructed-Retriever và chọn bất kỳ điểm nào phù hợp với khối lượng công việc thực tế.

Figure 3. By tuning the step-penalty weight during ORL training, we can choose any operating point along a Pareto frontier that dominates DeepSeek-V4-Flash, Claude Sonnet 5, and GPT-5.6 Luna across th

Hình 3 cho thấy cách chúng tôi thu được một loạt các điểm kiểm tra bằng cách quét mức độ phạt trong quá trình huấn luyện ORL, mỗi điểm nằm ở một vị trí khác nhau trên mặt phẳng chất lượng-độ trễ — điểm số trên trục y (càng cao càng tốt) so với độ trễ end-to-end trên trục x (được vẽ sao cho nhanh hơn nằm về phía bên phải). Đường cong màu đỏ kết nối các điểm vận hành này thành một biên giới: mức phạt bước nhẹ hơn cho phép mô hình thực hiện nhiều bước hơn và đạt điểm số cao hơn, trong khi mức phạt nặng hơn làm giảm độ trễ của nó.

Toàn bộ biên giới của các mô hình Adaptive Instructed-Retriever đã huấn luyện vượt trội hơn các phương án thay thế. So với mô hình cơ sở Instructed-Retriever chưa huấn luyện, mỗi điểm kiểm tra đều mang lại chất lượng cao hơn ở độ trễ tương đương hoặc thấp hơn, cho thấy rằng những cải thiện đến từ việc học cách khi nào nên tìm kiếm — và khi nào không. Ở đỉnh của biên giới, mô hình của chúng tôi đạt điểm số tương đương với các mô hình hàng đầu khác trong khi nhanh hơn gấp 2 lần. Vì biên giới đã huấn luyện bao gồm các điểm kiểm tra với các đánh đổi khác nhau, chúng tôi có thể chọn điểm phù hợp nhất với từng khối lượng công việc và ngân sách – ưu tiên tốc độ cho việc sử dụng tương tác hoặc chất lượng cho việc truy xuất ngoại tuyến khó hơn.

Adaptive Instructed-Retriever xây dựng quy trình tìm kiếm hiệu quả và có mục tiêu hơn

Chúng tôi trình bày một số ví dụ so sánh các chính sách tìm kiếm của các phương án thay thế với mô hình Adaptive Instructed-Retriever đã huấn luyện của chúng tôi. Các ví dụ này minh họa cách Adaptive Instructed-Retriever tìm kiếm hiệu quả trên các câu hỏi đơn giản và, đối với các câu hỏi khó hơn, có thể sử dụng ngân sách tìm kiếm còn lại của nó hiệu quả hơn.

Xác minh câu trả lời phủ định mà không cần tìm kiếm toàn diện

Adaptive Instructed-Retriever đạt được phần thưởng tương tự sớm hơn một bước so với Sonnet và sớm hơn hai bước so với Luna.

Câu hỏi: Công ty X có báo cáo rõ ràng chi phí tái cơ cấu như một mục trong báo cáo thu nhập năm tài chính 2022 không?

Sử dụng vòng tiếp theo để thay đổi chiến lược

Adaptive Instructed-Retriever học cách điều chỉnh chiến lược tìm kiếm để cải thiện khả năng thu hồi: nó chuyển từ khám phá rộng sang tìm kiếm tài khoản có mục tiêu. Nó đạt được phần thưởng cao nhất trong khi ngang bằng với Sonnet về số bước ít nhất.

Câu hỏi: Những khách hàng nào đang sử dụng hoặc đã cân nhắc sử dụng LiteLLM Proxy?

Kết luận

Adaptive Instructed-Retriever mở rộng Instructed-Retriever-1 đã công bố trước đó từ truy xuất song song một bước sang tìm kiếm thích ứng nhiều bước, cho phép mô hình dành thêm các bước tìm kiếm cho các truy vấn phức tạp, nơi suy luận lặp đi lặp lại và thu thập bằng chứng có thể cải thiện đáng kể chất lượng truy xuất, đồng thời phản hồi sớm đối với các truy vấn đơn giản hơn để giảm thiểu độ trễ. Phương pháp thích ứng này mang lại hiệu suất truy xuất mạnh mẽ hơn đáng kể so với tìm kiếm một bước, đồng thời đạt hiệu suất tương đương với các mô hình bên thứ ba hàng đầu với độ trễ thấp hơn gấp 2 lần. Bằng cách thay đổi mức phạt bước trong quá trình Học tăng cường trực tuyến, chúng tôi có thể tối ưu hóa rõ ràng sự đánh đổi giữa chất lượng truy xuất và chi phí suy luận, tạo ra các điểm kiểm tra tại các vị trí khác nhau dọc theo biên giới chất lượng-độ trễ và chọn điểm vận hành phù hợp nhất với khối lượng công việc thực tế.

Đóng góp của chúng tôi cung cấp một khối xây dựng truy xuất thực tiễn cho các tác nhân dữ liệu tại Databricks hoạt động trên các không gian làm việc lớn, luôn thay đổi. Các trải nghiệm như Genie Code, Genie One và Genie Agents phải tìm đúng các bảng, sổ tay, bảng điều khiển và tài liệu mà không tốn quá nhiều thời gian và công sức cho việc khám phá sâu. Adaptive Instructed-Retriever cung cấp một chính sách có giới hạn cho bối cảnh này: nó nhanh chóng trong các tra cứu thông thường, đồng thời kỹ lưỡng trong các tác vụ khám phá khó và có thể kiểm soát được trong ngân sách độ trễ của sản phẩm. Rộng hơn, những kết quả này minh họa tính cạnh tranh của các mô hình chuyên biệt nhỏ ngay cả đối với các tác vụ đòi hỏi suy luận nhiều bước. Databricks AIR cho phép khách hàng của chúng tôi tùy chỉnh các mô hình chuyên biệt cho lĩnh vực và yêu cầu hiệu suất của riêng họ.

DatabricksRAGTìm kiếm AITối ưu hóaDoanh nghiệp
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.