Sản phẩm
Keenable AI ra mắt NEEDLE: Bộ tiêu chuẩn đánh giá tìm kiếm thời gian thực tự làm mới mỗi giờ
(giờ Việt Nam)
Tóm tắt AI
Keenable AI vừa mã nguồn mở NEEDLE, bộ benchmark tự động cập nhật dữ liệu từ các nguồn tin tức, tài chính và pháp lý theo giờ để ngăn chặn tình trạng mô hình AI học thuộc lòng đáp án.
Bản dịch AI

Làm thế nào để đánh giá (benchmark) một API tìm kiếm web khi đối tượng được kiểm thử có thể đọc được đáp án? Một tác nhân tìm kiếm (search agent) có công cụ tìm nạp dữ liệu. Nếu các nhãn vàng (gold labels) nằm trong một tập dữ liệu công khai, tác nhân có thể tải chúng xuống ngay trong quá trình đánh giá và bỏ qua hoàn toàn bước truy xuất. Một vấn đề tương tự nảy sinh khi các câu trả lời đã được mã hóa trong bộ nhớ tham số của mô hình: một phản hồi đúng không còn chứng minh được rằng tìm kiếm web đã hoạt động hiệu quả. Câu trả lời của Keenable là NEEDLE, một bộ benchmark mã nguồn mở trực tiếp, tự xây dựng lại tập truy vấn từ các nguồn công khai mới thay vì cố định một tập dữ liệu. Các truy vấn tin tức được tạo mới hàng giờ từ RSS feeds và Google Trends; các truy vấn về tài chính, học thuật, pháp lý và thực thể hiếm được tạo mới hàng ngày từ SEC XBRL, arXiv, Europe PMC, CourtListener và nhật ký tác nhân công khai. Mười lăm API tìm kiếm được chạy với cùng một văn bản truy vấn theo một giao thức thống nhất, và mọi điểm số đều được đối chiếu với ultimate, một công cụ oracle tổng hợp giúp đánh dấu những gì toàn bộ lĩnh vực đã tìm thấy.
Nó có khả năng tái lập không?
Có, vì đây là một bộ công cụ đánh giá mã nguồn mở thay vì là một sản phẩm thương mại. needle là một Python CLI được cài đặt bằng uv sync và vận hành bởi hai lệnh phụ cho mỗi benchmark là generate và run. Nó cần một khóa OpenRouter để đánh giá và một khóa API cho mỗi công cụ được kiểm thử, đồng thời có thể chạy trên máy tính xách tay hoặc trong môi trường CI. Nó cho phép tái tạo tất cả các luồng truy vấn đang được sử dụng bên cạnh các đánh giá về chất lượng xếp hạng.
Những gì NEEDLE đo lường
NEEDLE là viết tắt của News (Tin tức), Everyday (Hàng ngày), Expert (Chuyên gia), Deep-tail (Đuôi dài/Chuyên sâu) và Legal Evaluation (Đánh giá pháp lý). Mỗi phân khúc mô hình hóa một ý định tác nhân khác nhau. News đưa các mục mới nhất từ khoảng 124 RSS feeds được chọn lọc và Google Trends vào một truy vấn từ khóa. Finance yêu cầu các dữ kiện đăng ký từ Wikidata và GLEIF cộng với các số liệu 10-Q hàng quý từ SEC XBRL. Scholar biến một bài báo thành bốn kiểu truy vấn: tiêu đề bị suy giảm, chi tiết chỉ có trong toàn văn, manh mối ngôn ngữ tự nhiên và mô tả gợi ý mơ hồ. Deep-tail lấy mẫu các truy vấn từ hiếm từ các bản ghi quỹ đạo tác nhân công khai bao gồm DeepResearchGym, OpenResearcher và LRAT. Legal trích xuất các ý kiến gần đây từ CourtListener trên 14 tòa án liên bang và các phần của eCFR.
Việc chấm điểm được phân chia theo cùng tiêu chí. News và deep-tail không có kết quả đúng duy nhất, vì vậy một LLM đóng vai trò giám khảo sẽ đánh giá mỗi kết quả từ 0 đến 4 và bộ công cụ sẽ báo cáo chỉ số nDCG@5 với hình phạt cho các URL trùng lặp. Finance báo cáo chỉ số answer-recall@5: liệu dữ kiện có đến được với tác nhân trong top 5 đoạn trích hay không. Scholar và legal là các tác vụ tìm kiếm mục tiêu xác định (known-item tasks), được chấm điểm dựa trên sự khớp của định danh.
Phần thú vị nằm ở mức trần (ceiling)
Mọi công cụ đều nhận được cùng một văn bản truy vấn. Bộ chạy (runner) thực hiện từng lệnh gọi một, vì vậy các phân vị độ trễ có thể so sánh được và không có công cụ nào phải chịu tải đồng thời. Việc đánh giá diễn ra dựa trên thứ hạng, tiêu đề và đoạn trích của chính công cụ đó. Các trang không bao giờ được tìm nạp và kết quả không bao giờ được xếp hạng lại. Bằng chứng được cắt ngắn còn 2.000 ký tự cho tất cả mọi người, và giám khảo không nhìn thấy tên của công cụ.
Con số thú vị hơn là mức trần ultimate. Đối với mỗi truy vấn, NEEDLE tổng hợp các kết quả trả về bởi mọi công cụ vào một công cụ oracle tổng hợp, sau đó sắp xếp tập hợp kết hợp đó theo mức độ liên quan. Điều đó tạo ra một mức trần thực nghiệm dựa trên những gì toàn bộ lĩnh vực có thể truy xuất được.
Do đó, khoảng cách đến mức ultimate chính là giới hạn trên về chất lượng tìm kiếm của tác nhân ở thời điểm hiện tại. Khoảng cách lớn nghĩa là đã có những kết quả tốt hơn tồn tại nhưng mọi công cụ đều không thể hiển thị hoặc xếp hạng chúng tốt. Điểm số ultimate thấp nghĩa là một điều khác: ngay cả sau khi tổng hợp mọi nhà cung cấp, benchmark vẫn tìm thấy rất ít bằng chứng mạnh mẽ. Nói cách khác, NEEDLE có thể phân biệt được vấn đề xếp hạng với vấn đề truy xuất vốn là điểm yếu chung của toàn thị trường.
Vị thế thực sự của lĩnh vực này
Các con số dưới đây là giá trị trung bình 7 ngày được công bố cho giai đoạn kết thúc vào ngày 28/08/2026.
Finance gần như đã được giải quyết: Exa 0.910, Keenable 0.872, Perplexity 0.871, Google 0.847, so với mức ultimate là 0.965. Scholar có sự phân hóa, Keenable đạt 0.774 so với Tavily 0.310 trên mức trần 0.869, bởi vì các truy vấn tiêu đề có thể trả lời được từ siêu dữ liệu còn truy vấn nội dung thì không. Deep-tail là khó nhất và gần với lưu lượng truy cập tác nhân thực tế nhất: Exa dẫn đầu ở mức 0.557 so với ultimate, Keenable theo sau ở mức 0.470, Bing đứng ở mức 0.199. Khoảng cách giữa chất lượng thực tế và chất lượng có thể đạt được ngày càng nới rộng khi các truy vấn tiến gần đến cách thức các tác nhân thực sự tìm kiếm.
Độ trễ là một chỉ số quan trọng khác ở đây, vì các tác nhân gọi tìm kiếm hàng chục lần cho mỗi tác vụ. Trong cùng giai đoạn: Keenable-realtime 193 ms p50 / 284 ms p95, Exa 1.876 / 2.955, Bing 2.767 / 9.381.
Những điểm chính cần lưu ý
Hãy xem bảng điều khiển trực tiếp, kho lưu trữ GitHub, bài viết kỹ thuật và các tài liệu lưu trữ. Mọi công lao đều thuộc về các nhà nghiên cứu của dự án này.
Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub HOẶC Trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.