Baseten Blog (Web)
82

Sản phẩm

Baseten ra mắt Hosted Tools: Tích hợp tìm kiếm web cho các mô hình AI nguồn mở

(giờ Việt Nam)

Tóm tắt AI

Baseten giới thiệu bộ công cụ Hosted Tools, cho phép các mô hình AI nguồn mở trên nền tảng này truy cập dữ liệu thời gian thực thông qua 4 nhà cung cấp dịch vụ tìm kiếm như Exa và You.com.

Bản dịch AI

Introducing Baseten Hosted Tools

Cho đến nay, các nhà phát triển xây dựng ứng dụng và tác nhân (agent) bằng các mô hình mã nguồn mở thường phải lắp ghép từng công cụ một. Mặc dù MCP cung cấp sự thống nhất ở một mức độ nhất định, các nhà phát triển vẫn phải xử lý vòng lặp ReAct, điều phối tác vụ, điều hướng mô hình, và việc thực thi lệnh ngay lập tức hoặc đồng thời - tất cả đều làm tăng độ phức tạp khi triển khai. Khi một ứng dụng có thêm nhiều khả năng, công việc tích hợp này nhanh chóng trở thành một phần quan trọng trong lộ trình phát triển sản phẩm.

Baseten Hosted Tools giúp lớp công việc đó trở nên đơn giản chỉ với một thay đổi trong cấu hình, đảm bảo tính mạnh mẽ và độ trễ thấp.

Baseten Grounded Inference

Công cụ Baseten Hosted Tool đầu tiên của chúng tôi là tìm kiếm web: Baseten Grounded Inference.

Baseten Grounded Inference cung cấp cho các mô hình được lưu trữ trên Baseten quyền truy cập vào thông tin cập nhật theo thời gian thực, có tính cụ thể và không có sẵn trong dữ liệu huấn luyện của chúng. Nó mở ra những trải nghiệm sản phẩm khó có thể xây dựng nếu chỉ dùng mô hình đơn thuần: nghiên cứu về một công ty trước cuộc gọi bán hàng, so sánh các sản phẩm và giá cả hiện tại, điều tra một sự kiện đang diễn ra, tìm kiếm tài liệu kỹ thuật mới nhất - nói chung là củng cố câu trả lời dựa trên toàn bộ cơ sở tri thức của web.

Tìm kiếm web chạy bên trong Baseten Inference Stack và có thể được kích hoạt bằng cách thêm tên các công cụ tìm kiếm được lưu trữ của chúng tôi vào cấu hình trong yêu cầu Messages, Chat Completions hoặc Responses tiêu chuẩn.

Mô hình sẽ quyết định xem một prompt có cần tìm kiếm web hay không dựa trên khả năng sử dụng công cụ gốc của nó và có thể thực hiện nhiều lần lặp cho đến khi đạt được độ tin cậy. Thông qua system prompt và ngân sách có thể cấu hình cho các lần lặp, hành vi này có thể được tùy chỉnh theo điểm thiết lập mong muốn: từ one-shot (một lần duy nhất) đến tác nhân nghiên cứu chuyên sâu.

Baseten đan xen việc suy luận mô hình và các yêu cầu tìm kiếm trong một vòng lặp phía máy chủ (server-side), đồng thời truyền phát (stream) các khối sử dụng công cụ và kết quả công cụ dưới dạng tiến trình trực tiếp đến client của bạn, giúp bạn có thể sử dụng để hiển thị tiến trình. Cuối cùng, mô hình sẽ tạo ra một phản hồi có căn cứ (grounded response).

Một ví dụ đơn giản về yêu cầu suy luận có căn cứ (grounded inference) trông như sau:

Việc lựa chọn công cụ và tiêu đề là bắt buộc.

`baseten.tool_settings` là tùy chọn.

Hoạt động với `ChatCompletions`, `Messages` và `Responses` ở cả chế độ streaming và buffered.

<INSERT_PROVIDER> phải được thay thế trước khi tập lệnh có thể chạy.

Ra mắt cùng với Exa, Keenable, Parallel và You.com

Các công cụ tuyệt vời đòi hỏi sự chuyên môn hóa sâu sắc. Đó là lý do tại sao chúng tôi xây dựng Baseten Hosted Tools như một hệ sinh thái, bắt đầu với các đối tác đã đầu tư mạnh mẽ vào việc làm cho web trở nên hữu ích đối với các ứng dụng AI.

Khi ra mắt, chúng tôi cung cấp quyền truy cập vào 4 nhà cung cấp tìm kiếm web hàng đầu, được liệt kê dưới đây theo thứ tự bảng chữ cái bằng chính lời của họ:

Exa cung cấp cho tác nhân AI của bạn quyền truy cập vào hơn 100 tỷ trang web, tài liệu, bài báo, con người, công ty, tin tức và nhiều hơn thế nữa. Từ đó, tác nhân của bạn có thể tìm kiếm web theo thời gian thực, đọc các trang liên quan và trả lời bằng các nguồn thông tin cập nhật. Đây là cách tìm kiếm web hiệu quả về token. Được hơn 500 nghìn nhà phát triển và công ty yêu thích. Exa cung cấp sức mạnh tìm kiếm cho Cursor, Vercel, Lovable, HubSpot, Clay, CodeRabbit và nhiều đơn vị khác.

Keenable cung cấp cơ sở hạ tầng tìm kiếm web độc lập cho các phòng thí nghiệm AI và các tác nhân, được vận hành bởi chỉ mục riêng gồm hơn 100 tỷ tài liệu web, được cập nhật theo thời gian thực để hiển thị nội dung mới nhất. Nó mang lại chất lượng hàng đầu trên các tiêu chuẩn đánh giá tác nhân (agentic benchmarks). Độ trễ dưới 250 ms p95 tại khu vực US East, với mức giá 4 USD cho mỗi 1.000 yêu cầu. Được thiết kế cho suy luận khối lượng lớn với độ trễ thấp, các tác vụ tác nhân hoặc học tăng cường và tạo dữ liệu ở quy mô lớn.

Parallel Web Systems cung cấp cơ sở hạ tầng web cho các tác nhân AI, vận hành việc nghiên cứu web tác nhân tại các công ty như Notion, Harvey, Granola, Hex và Dropbox. Các API Tìm kiếm và Trích xuất của họ được thiết kế để phù hợp với trí thông minh và chi phí của các mô hình mã nguồn mở, truy xuất thông tin web liên quan và cung cấp thông tin đó ở định dạng mà các mô hình có thể sử dụng trực tiếp, giúp các tác nhân tiêu tốn ít token hơn cho việc khám phá, cào dữ liệu và xử lý các trang.

You.com cung cấp các API tìm kiếm web cấp doanh nghiệp được xây dựng cho các tác nhân AI. Chạy trên một chỉ mục được thu thập dữ liệu độc lập, họ phục vụ hơn 1 tỷ truy vấn mỗi tháng cho các doanh nghiệp toàn cầu, các phòng thí nghiệm tiên phong và các công ty AI-native trên diện rộng. Các API tìm kiếm của họ được xây dựng cho cả độ chính xác và tốc độ. Highlights, chế độ trích xuất của họ, cung cấp ngữ cảnh có thể trích dẫn và hiệu quả về token cho các LLM hạ nguồn, giữ chi phí cho mỗi tác vụ ở mức thấp, đặc biệt là khi kết hợp với các mô hình open-weight của Baseten. Cùng một API đó có thể mở rộng từ bản mẫu (prototype) sang sản xuất (production) tuân thủ ZDR, với QPS cao mà không cần tái cấu trúc stack của bạn.

Mỗi đối tác mang đến một cách tiếp cận khác nhau, và việc cung cấp chúng thông qua Baseten cho phép các nhà phát triển chọn trải nghiệm tìm kiếm phù hợp nhất với ứng dụng của họ mà không cần phải xây dựng lại phần tích hợp xung quanh.

Baseten Hosted Tools

Baseten Hosted Tools cung cấp cho các nhà phát triển quyền truy cập vào các khả năng sẵn sàng cho sản xuất từ Baseten và hệ sinh thái đối tác của chúng tôi. Những lợi ích bao gồm:

Giữ cho các tác nhân hoạt động nhanh chóng: Với Baseten Hosted Tools, các lệnh gọi công cụ nằm trực tiếp trong vòng lặp của tác nhân. Nó được xây dựng cho độ trễ thấp, chạy ngay lập tức và đồng thời, đồng thời mang lại thông lượng ở quy mô sản xuất.

Ra mắt sản phẩm nhanh hơn: Thêm các khả năng mà không cần phải tích hợp và điều phối từng dịch vụ một cách độc lập.

Chọn công cụ tốt nhất cho công việc: Truy cập các nhà cung cấp chuyên biệt thông qua trải nghiệm nhà phát triển nhất quán.

Vận hành mọi thứ cùng nhau: Chạy các mô hình và các công cụ mà chúng gọi trên cùng một nền tảng sản xuất.

Tích hợp thanh toán và báo cáo sử dụng: Giống như việc sử dụng token API mô hình, các lệnh gọi công cụ là các mục riêng biệt, được phân loại theo mô hình, nhà cung cấp và loại công cụ.

Điều này có nghĩa là các nhóm có thể dành nhiều thời gian hơn để cải thiện chức năng ứng dụng và ít thời gian hơn để bảo trì hệ thống hạ tầng bên dưới.

Thực thi công cụ phía máy chủ = ít lượt truy vấn (round trips) hơn và tác nhân nhanh hơn

Trong các bài kiểm tra của chúng tôi, các tác nhân chạy với Hosted Tools đã giảm 15% độ trễ tổng thể so với các công cụ phía client.

Một vòng lặp tìm kiếm phía client phải chịu "thuế truyền tải" trên mỗi lần lặp. Ứng dụng của bạn gọi mô hình, mô hình yêu cầu tìm kiếm, phản hồi truyền ngược lại ứng dụng của bạn, ứng dụng của bạn gọi nhà cung cấp tìm kiếm ở bất kỳ khu vực nào họ chạy, và kết quả truyền ngược lại. Và bạn phải gửi lại toàn bộ ngữ cảnh đang ngày càng lớn dần cho mô hình. Điều này làm tăng thêm nhiều bước nhảy mạng và yêu cầu phân tích cú pháp lại mỗi yêu cầu.

Khi bạn chạy công cụ trong client của mình, mỗi lượt là một yêu cầu mới mang theo toàn bộ cuộc hội thoại. Khi bạn chạy công cụ trong đường dẫn phục vụ (serving path), client của bạn chỉ thấy một yêu cầu duy nhất.

Baseten Hosted Tools loại bỏ công việc dư thừa:

Runtime là thực thi đồng vị trí (co-located execution).

Ngữ cảnh được giữ ở phía máy chủ, giảm thiểu các lượt truy vấn phân tích cú pháp.

Thực thi công cụ ngay lập tức và đồng thời trong khi mô hình đang truyền phát.

Xử lý lỗi linh hoạt.

SSE trực tiếp của từng bước chi tiết và siêu dữ liệu bổ sung để quan sát hệ thống.

BasetenAI nguồn mởTìm kiếm webCông cụ AILLM
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Baseten Blog (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.