Tin ngành
Xây dựng bộ khung kiểm thử với Jev: Giải pháp tối ưu từ LangChain
(giờ Việt Nam)
Tóm tắt AI
LangChain giới thiệu Jev, một công cụ hỗ trợ xây dựng bộ khung (harness) giúp đơn giản hóa quy trình kiểm thử và đánh giá hiệu năng cho các ứng dụng AI phức tạp.
Bản dịch AI

Các Agent vận hành theo một vòng lặp: một LLM quyết định việc cần làm, một công cụ (tool) thực thi, một mô hình đánh giá kết quả, và sau đó tiếp tục vòng lặp đó cho đến khi tác vụ hoàn tất.
Ban đầu, việc tích hợp các Agent và LLM vào các ứng dụng phần mềm vốn phụ thuộc vào dữ liệu có cấu trúc và giao diện dự đoán được là rất khó khăn. Hai nguyên mẫu (primitives) đã xuất hiện giúp việc này trở nên dễ dàng hơn nhiều:
Tuy nhiên, ngay cả khi đã có những nguyên mẫu đó, vòng lặp của Agent vẫn chậm và tốn kém: mỗi quyết định đều đòi hỏi một lần gọi mô hình khác.
Xin giới thiệu Jev. Jev là một mô hình mới được TypeSafe AI phát hành. Công ty báo cáo rằng mô hình này có tốc độ suy luận nhanh hơn tới 200 lần và chi phí thấp hơn 400 lần so với các LLM tương đương trong các tác vụ phân loại.
Bài viết này đề cập đến cách thức hoạt động của Jev, vị trí của nó trong vòng lặp Agent và cách sử dụng nó với LangChain.
Tất tần tật về Jev
Jev thực chất không phải là một LLM truyền thống, nó không tạo ra văn bản. Nó là thứ mà đội ngũ TypeSafe AI gọi là mô hình System One:
Nó được huấn luyện bằng phương pháp học tăng cường cho các quyết định đã được hiệu chuẩn (RLCD). Mã nguồn của bạn sử dụng các kết quả đó để hướng dẫn bước tiếp theo của Agent mà không cần phải gọi một chat LLM đầy đủ cho mỗi quyết định.
Để gọi một mô hình Jev, bạn gửi cho nó một trạng thái (ngữ cảnh) và các câu hỏi về trạng thái đó. Dưới đây là phiên bản một câu hỏi của ví dụ về phiếu hỗ trợ (support-ticket) trong tài liệu của họ:
Ví dụ trong tài liệu đưa ra câu trả lời về mức độ khẩn cấp này, được hiển thị ở đây mà không bao gồm phần còn lại của phản hồi:
Đó là xác suất 99,9% rằng tin nhắn này là khẩn cấp, thông tin mà ứng dụng của bạn có thể sử dụng để ưu tiên phiếu hỗ trợ đó.
Có ba loại câu hỏi được hỗ trợ:

Một tính năng chính ở đây là bạn có thể hỏi nhiều câu hỏi về cùng một trạng thái trong một yêu cầu duy nhất.
Để xem ví dụ về việc hỏi nhiều câu hỏi về một phiếu hỗ trợ, hãy xem phần Quickstart của TypeSafe.
Tóm lại, không giống như các LLM truyền thống, Jev không bị giới hạn bởi việc tạo văn bản hay ra quyết định tuần tự!
Cách sử dụng Jev với LangChain
Mô hình bất khả tri về nhà cung cấp (provider agnostic) của LangChain rất phù hợp để hỗ trợ Jev cùng với hàng ngàn tích hợp và nhà cung cấp mô hình khác.
Tích hợp LangChain hiển thị Jev thông qua TypeSafeClassifier. Bạn truyền trạng thái và các câu hỏi của mình vào.invoke và nhận được kết quả phân loại thay vì một phản hồi trò chuyện.
Cài đặt langchain-typesafe và thiết lập TYPESAFE_API_KEY của bạn, sau đó thực hiện lệnh gọi:
Trạng thái có thể là văn bản, dữ liệu có cấu trúc hoặc các tin nhắn LangChain. Điều đó giúp việc gọi Jev từ một node hoặc middleware hook trở nên đơn giản bằng cách sử dụng ngữ cảnh mà Agent của bạn đã có.
Bạn có thể xây dựng tính năng này vào các middleware hoặc công cụ tùy chỉnh!
Các trường hợp sử dụng
Jev không phải là sự thay thế hoàn toàn cho LLM. Nó không tạo ra văn bản, nhưng nó có thể xử lý các tác vụ phân loại mà chúng ta thường dùng LLM hiện nay, mà không gặp phải độ trễ và chi phí tương tự. Điều đó làm cho nó trở thành một sự bổ sung đầy hứa hẹn cho mô hình điều khiển Agent của bạn: sử dụng LLM cho việc suy luận và tạo nội dung mở, còn Jev cho các quyết định nhanh chóng, có cấu trúc trong suốt quá trình thực hiện.
Định tuyến mô hình (Model routing)
Một tra cứu đơn giản không cần dùng đến cùng một mô hình như một tác vụ gỡ lỗi khó. Middleware định tuyến mô hình cho phép Jev đánh giá yêu cầu và chọn một mô hình dựa trên các tiêu chí bạn xác định, nhờ đó các tác vụ đơn giản sẽ nhanh và rẻ, còn các tác vụ phức tạp sẽ có mô hình mạnh hơn xử lý.
Bộ định tuyến chọn một mô hình từ tin nhắn người dùng mới nhất và sử dụng nó trong suốt quá trình chạy. Các xác suất và độ tin cậy cũng vẫn khả dụng trong trạng thái của Agent.
Chế độ tự động (Auto Mode)
Các Agent về bản chất vẫn chưa đáng tin cậy. Một Agent có thể nhận được các hướng dẫn tồi (dù là tự nhiên hay từ một kẻ tấn công có động cơ) khiến nó thực hiện các hành động mà chúng ta không mong muốn.
Các công cụ hỗ trợ lập trình như claude, codex, cursor đã triển khai một số cách để phân loại các hành động nguy hiểm trước khi chúng được thực hiện, điều này đã dần giúp xây dựng niềm tin vào các Agent. Cho đến nay, bước phân loại này vẫn bị khóa trong các phần mã nguồn đóng của các công cụ đó.
Giờ đây, khi đã có một mô hình phân loại rẻ và hiệu năng cao, chúng ta có thể áp dụng cùng mô hình đó cho tất cả các Agent!
AutoModeMiddleware sử dụng Jev để kiểm tra các lệnh gọi công cụ (tool calls) cho những quyết định rủi ro mà nó có thể thực hiện, và chặn các lệnh gọi đó trước khi công cụ được thực thi.
Bắt đầu thôi!
Chúng tôi rất hào hứng về Jev và những khả năng mà nó mang lại. Một vài dự án thú vị mà chúng tôi đã thấy: Kyle Jeong từ Browserbase đang vận hành các Agent sử dụng trình duyệt với chi phí chỉ bằng một phần nhỏ của một xu, Jarrod Watts đã xây dựng một Agent giao dịch trực tiếp, và Ryan Vogel đang thực hiện phân loại email ở quy mô lớn.
Các mô hình mới ra mắt hàng tuần vào thời điểm này, nhưng mô hình này đã nhận được phản hồi rất lớn. Chúng tôi rất mong chờ xem bạn sẽ xây dựng những gì với LangChain và Jev.
Hãy cho chúng tôi biết suy nghĩ của bạn trên diễn đàn, gắn thẻ chúng tôi trên X và chia sẻ những gì bạn đang xây dựng, hoặc tham gia vào các vấn đề (issues) của LangChain!
Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.