The Decoder: AI News
85

Nghiên cứu

Search Index: Bộ tiêu chuẩn mới đánh giá chất lượng, chi phí và tốc độ của API tìm kiếm cho AI Agent

(giờ Việt Nam)

Tóm tắt AI

Artificial Analysis ra mắt Search Index, sử dụng mô hình GPT-5.6 Luna để đánh giá hiệu năng của 7 nhà cung cấp API tìm kiếm hàng đầu như Parallel, Exa và Firecrawl trong môi trường AI Agent.

Bản dịch AI

New benchmark ranks search APIs for AI agents on quality, cost, and speed

Artificial Analysis vừa ra mắt "Search Index", một bộ tiêu chuẩn đánh giá hiệu quả hoạt động của các nhà cung cấp API tìm kiếm dành cho các AI agent dựa trên ba tiêu chí: chất lượng, chi phí và tốc độ.

Danh sách ban đầu bao gồm Parallel, Exa, Firecrawl, You.com, Tavily, Keenable và Brave. Mỗi đơn vị được kiểm thử với cùng một mô hình (GPT-5.6 Luna) trong một thiết lập agent tiêu chuẩn, chỉ thay đổi nhà cung cấp dịch vụ tìm kiếm. Agent này chạy trên Stirrup, một framework mã nguồn mở từ Artificial Analysis, và thực hiện 25 lượt chạy cho mỗi tác vụ để tìm kiếm và trích xuất nội dung từ các trang web.

Chỉ số này kết hợp ba bộ tiêu chuẩn đánh giá với trọng số ngang nhau. DeepSearchQA bao gồm 900 câu hỏi nghiên cứu, mỗi câu hỏi đòi hỏi nhiều truy vấn tìm kiếm. Một tập hợp con BrowseComp kiểm tra 200 dữ kiện khó tìm đòi hỏi quá trình duyệt web qua nhiều bước. AA-Omniscience bao gồm 600 câu hỏi thuộc sáu lĩnh vực kiến thức. Một cơ sở so sánh không dùng công cụ (tool-free baseline), nơi mô hình tự trả lời, được dùng làm điểm đối chiếu.

Chất lượng tìm kiếm tốt hơn cũng giúp giảm tổng chi phí. Mô hình sử dụng ít token hơn khi nhận được kết quả tốt ngay từ đầu. Với Parallel Search (bản nâng cao), lượng token tiêu thụ giảm hơn 40% so với phiên bản Basic. Mặc dù chi phí tìm kiếm cho mỗi tác vụ tăng lên, nhưng tổng chi phí lại thấp hơn ($0,084 so với $0,11).

Tốc độ thô trên mỗi truy vấn không phải lúc nào cũng đồng nghĩa với kết quả nhanh hơn về tổng thể. Parallel Search (bản turbo) đạt thời gian phản hồi ngắn nhất trên mỗi truy vấn (0,51 giây so với 1,03 giây của bản Basic), nhưng chất lượng thấp hơn (67 so với 73) buộc agent phải thực hiện nhiều lượt chạy hơn. Tổng thời gian cho mỗi tác vụ cuối cùng vẫn tương đương nhau.

Artificial Analysis cho biết Parallel, Firecrawl và Parallel (bản turbo) đạt được sự kết hợp tốt nhất giữa chi phí và hiệu suất. Các nhà cung cấp khác có thể đăng ký tham gia bộ tiêu chuẩn này. Phương pháp luận đầy đủ đã được công khai.

Tin tức AI không thổi phồng – Được biên soạn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận.

Đăng ký ngay.

AI AgentAPI tìm kiếmĐánh giá công nghệArtificial AnalysisCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.