LangChain: Blog
92

Thủ thuật

LangSmith ra mắt LLM Gateway: Kiểm soát runtime tối ưu cho các tác nhân AI trong môi trường thực tế

(giờ Việt Nam)

Tóm tắt AI

LangSmith giới thiệu tính năng LLM Gateway mới, cung cấp các công cụ kiểm soát runtime mạnh mẽ giúp doanh nghiệp quản lý, bảo mật và tối ưu hóa hiệu suất cho các tác nhân AI khi triển khai thực tế.

Bản dịch AI

LangSmith LLM Gateway: runtime controls for production agents

LangSmith LLM Gateway hiện đã có bản public beta.

Các agent trong môi trường production cần có cơ chế kiểm soát thời gian thực đối với các lệnh gọi mô hình để tránh những kết quả không mong muốn như vượt quá ngân sách và gián đoạn dịch vụ. Các giới hạn chi tiêu (spend caps), giới hạn tốc độ (rate limits), cơ chế dự phòng mô hình (model fallbacks) và bảo vệ dữ liệu nhạy cảm đều là những biện pháp kiểm soát quan trọng, nhưng nếu không có công cụ phù hợp, các kỹ sư phải tự viết các biện pháp này theo cách thủ công cho từng agent đối với mỗi nhà cung cấp mô hình.

Đó là lý do chúng tôi xây dựng LangSmith LLM Gateway. Đây là lớp quản trị tập trung nằm giữa các agent và các mô hình mà chúng gọi, được thiết kế đặc biệt cho các biện pháp kiểm soát mà các đội ngũ kỹ thuật agent cần trong môi trường production. LLM Gateway cung cấp cho các đội ngũ một nơi duy nhất để thực thi các biện pháp kiểm soát thời gian thực trên các agent, mô hình và nhà cung cấp, giúp họ quản lý việc sử dụng mô hình một cách nhất quán đồng thời tránh tình trạng bị phụ thuộc vào một nhà cung cấp (vendor lock-in).

Hãy dùng thử bản public beta ngay hôm nay.

Tại sao các agent cần một lớp quản trị tập trung?

Trong môi trường production, lớp mô hình có thể nhanh chóng trở thành nguồn gốc của những sai lầm tốn kém và các sự cố ảnh hưởng đến khách hàng. Thực tế diễn ra như sau: nhà cung cấp mô hình của bạn gặp sự cố, và giờ đây agent chăm sóc khách hàng của bạn trả về lỗi, dẫn đến sự thất vọng của khách hàng và mất doanh thu. Hoặc agent lập trình của bạn bị kẹt trong vòng lặp thử lại suốt đêm, và đến sáng hôm sau, nó đã thực hiện 10.000 lệnh gọi LLM, khiến bạn nhận về một hóa đơn lên tới hàng nghìn đô la.

Trong những trường hợp này, việc hiểu chuyện gì đã xảy ra sau khi sự việc kết thúc là chưa đủ. Bạn cần thực thi các chính sách trước khi các vi phạm xảy ra. Nhưng nếu các biện pháp kiểm soát được nhúng vào mã nguồn của từng agent, thì mỗi agent và nhà cung cấp mô hình mới sẽ tạo thêm một quy trình triển khai cần phải bảo trì. Một model gateway cho phép các đội ngũ xác định chính sách một lần, sau đó thực thi chúng một cách nhất quán trên các mô hình và agent.

Các biện pháp kiểm soát của LLM Gateway

LLM Gateway cung cấp các biện pháp kiểm soát mà các đội ngũ cần ưu tiên khi đưa agent vào môi trường production: kiểm soát chi phí, giới hạn tốc độ, dự phòng mô hình và xử lý dữ liệu nhạy cảm.

Tránh vượt quá ngân sách: LLM Gateway cho phép bạn giám sát và kiểm soát chi tiêu LLM cho người dùng nội bộ và bên ngoài trước khi nó trở thành vấn đề. Bạn có thể đặt các giới hạn theo thời gian và theo dõi chi tiêu ở bốn cấp độ:

Khi đạt đến giới hạn, agent sẽ nhận được phản hồi 402 kèm theo thông báo lỗi rõ ràng.

Giới hạn lưu lượng truy cập quá mức: Áp dụng giới hạn tốc độ ở cấp độ tổ chức, không gian làm việc (workspace), người dùng và API key để ngăn chặn việc lạm dụng vô ý hoặc các đợt tăng lưu lượng đột biến làm vượt quá giới hạn của nhà cung cấp và gây ảnh hưởng đến độ tin cậy đối với các agent hoặc đội ngũ khác.

Chính sách theo từng khách hàng cho chi tiêu và giới hạn tốc độ: Đối với các môi trường đa khách hàng (multi-tenant) và đại lý bán lại, LLM Gateway cung cấp cho bạn quyền kiểm soát ở cấp độ khách hàng mà không cần API key riêng cho từng khách hàng. Sử dụng tiêu đề yêu cầu (request header) tùy chỉnh để xác định từng khách hàng cuối hoặc đội ngũ, sau đó thực thi các giới hạn chi tiêu và giới hạn tốc độ riêng biệt trong khi vẫn định tuyến tất cả các lệnh gọi LLM thông qua một API key duy nhất. Bạn có thể cập nhật giới hạn và kiểm tra chi tiêu của khách hàng từ một nơi duy nhất, thay vì phải tự xây dựng và duy trì logic đó.

Cải thiện độ tin cậy của agent: Xác định các quy tắc dự phòng trên các mô hình và máy chủ, sau đó thực thi chúng cho tất cả các ứng dụng. Khi một nhà cung cấp bị gián đoạn, bị giới hạn tốc độ hoặc không khả dụng, các agent có thể chuyển hướng sang một mô hình khác mà không cần logic dự phòng tùy chỉnh trong từng ứng dụng.

Giảm thiểu việc lộ dữ liệu nhạy cảm: Phát hiện, che giấu (redact) và thay thế PII (thông tin nhận dạng cá nhân) và các thông tin bảo mật trong các yêu cầu trước khi chúng đến được nhà cung cấp mô hình. LLM Gateway cũng che giấu dữ liệu nhạy cảm khỏi các dấu vết (traces) mà nó ghi lại trong LangSmith. Hiện tại, tính năng này chỉ khả dụng cho người dùng gói Enterprise.

Theo dõi các sự kiện LLM Gateway trong LangSmith: Các sự kiện Gateway được ghi lại dưới dạng siêu dữ liệu (metadata) trong các dấu vết LangSmith, vì vậy bạn có thể giám sát cách các biện pháp kiểm soát hoạt động với lưu lượng truy cập thực tế. Khi một yêu cầu bị chặn bởi giới hạn chi tiêu, giới hạn tốc độ hoặc biện pháp kiểm soát khác, bạn có thể mở dấu vết để kiểm tra những gì đã xảy ra trong ngữ cảnh đó và quyết định xem có cần thay đổi điều gì không.

Duy trì quyền lựa chọn mô hình

LLM Gateway cung cấp một giao diện duy nhất để định tuyến các lệnh gọi giữa agent của bạn và các nhà cung cấp mô hình. Nó hỗ trợ các nhà cung cấp phổ biến như OpenAI, Anthropic, Fireworks và các mô hình tùy chỉnh với các endpoint tương thích với OpenAI hoặc Anthropic.

LangSmith Gateway ưu tiên mô hình BYOK (Bring Your Own Key - Tự mang theo key của bạn). Bạn có thể sử dụng key của nhà cung cấp riêng và dùng LLM Gateway để định tuyến, quản trị và kiểm soát chính sách mà không cần thêm công cụ đo lường phức tạp vào mỗi lệnh gọi LLM. Đối với các đội ngũ muốn quy trình mua sắm đơn giản hơn hoặc cách nhanh hơn để bắt đầu xây dựng agent, Gateway cũng hỗ trợ suy luận (inference) được lưu trữ cho các mô hình mở do Fireworks cung cấp, có sẵn trực tiếp thông qua LangSmith bằng cách sử dụng Gateway Credits. Fireworks cung cấp khả năng suy luận nhanh, hiệu quả cho các mô hình mở, giúp các đội ngũ đưa chúng vào môi trường production thông qua LangSmith LLM Gateway.

Chúng tôi tin rằng các mô hình trọng số mở (open weight models) rất quan trọng vì chúng mang lại cho các đội ngũ quyền kiểm soát lớn hơn đối với các hệ thống AI. Chúng mang lại sự linh hoạt để tối ưu hóa về chi phí, chất lượng, độ trễ, quyền riêng tư và nhu cầu triển khai, cũng như tinh chỉnh các mô hình theo đặc thù kinh doanh của họ. Gateway là một trong những cách chúng tôi giúp các mô hình mở trở nên dễ dàng áp dụng hơn trong môi trường production.

Lin Qiao, CEO, Fireworks

Cách các đội ngũ đang sử dụng LLM Gateway trong môi trường production

Các đội ngũ đang sử dụng LLM Gateway để đặt ra các giới hạn cứng và các biện pháp kiểm soát chung cho các agent trong môi trường production. Một số mô hình phổ biến bao gồm các agent hướng tới người dùng công khai cần giới hạn chi tiêu, và các agent phục vụ nhiều khách hàng cần thanh toán tập trung, theo dõi sử dụng và giới hạn theo từng khách hàng.

Bắt đầu với LLM Gateway

Bạn có thể gọi LLM Gateway trực tiếp qua API hoặc sử dụng nó với các bộ công cụ lập trình như Claude Code, Codex và Deep Agents Code (dcode).

Để bắt đầu, hãy trỏ các agent của bạn đến endpoint của LangSmith Gateway, xác thực bằng API key LangSmith của bạn và thêm API key của nhà cung cấp vào phần bảo mật của không gian làm việc (workspace secrets). Sau đó, cấu hình các biện pháp kiểm soát cho dự phòng, giới hạn tốc độ, giới hạn chi tiêu và xử lý dữ liệu nhạy cảm. Cập nhật base_url của bạn và giữ nguyên phần mã còn lại.

Định hướng tương lai của LLM Gateway

Chúng tôi bắt đầu LLM Gateway với những biện pháp kiểm soát mà chúng tôi thấy các đội ngũ cần nhất. Tiếp theo, chúng tôi sẽ mở rộng nền tảng đó với nhiều cách hơn để quản trị các lệnh gọi mô hình trong môi trường production.

Hãy dùng thử ngay hôm nay

LLM Gateway hiện đã có bản public beta cho các gói Plus và Enterprise.

Bắt đầu bằng cách đăng nhập vào LangSmith hoặc đăng ký, sau đó chọn “LLM Gateway” trong thanh bên. Bạn có thể tìm thấy chi tiết thiết lập trong tài liệu của chúng tôi.

Người dùng gói Enterprise có thể yêu cầu quyền truy cập vào các biện pháp kiểm soát Bảo vệ Dữ liệu tại đây.

LangChainLangSmithLLM GatewayAI AgentsMôi trường sản xuất
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.