MarkTechPost
Điểm AI 85/100

Sản phẩm

20 ứng dụng thực tế của Jev từ TypeSafe AI trong phát triển AI Agent

(giờ Việt Nam)

Tóm tắt AI

Jev của TypeSafe AI tối ưu hóa chi phí bằng cách bỏ qua tạo văn bản, thay vào đó trả về các quyết định có định dạng kiểu dữ liệu và xác suất chuẩn xác. Bài viết phân tích 20 trường hợp sử dụng thực tế như điều hướng mô hình, kiểm soát gọi công cụ và lọc dữ liệu đầu vào.

Chính văn · Bản dịch AI

20 Agentic Use Cases of TypeSafe AI’s Jev

Tuần trước, TypeSafe AI đã ra mắt Jev, mô hình System One đầu tiên của họ. Người sáng lập Diogo Almeida trước đây từng làm việc tại OpenAI trong nhóm nghiên cứu về khả năng tuân thủ chỉ dẫn (instruction-following) đứng sau ChatGPT.

Jev không trò chuyện, viết mã hay tóm tắt văn bản. Nó tiếp nhận trạng thái phi cấu trúc và trả về các quyết định có kiểu dữ liệu cụ thể cùng xác suất đã được hiệu chuẩn. Điều này khiến nó trở nên phù hợp một cách tự nhiên cho hàng ngàn phán đoán nhỏ trong vòng lặp của một tác nhân (agent loop): nên gọi mô hình nào, một lệnh có an toàn hay không, đoạn văn nào là phù hợp, liệu tác nhân đã thực sự hoàn thành công việc hay chưa.

Cách thức hoạt động của Jev

Mỗi yêu cầu gửi đi một trạng thái (văn bản hoặc JSON) kèm theo một từ điển các câu hỏi có kiểu dữ liệu xác định. Tài liệu của TypeSafe định nghĩa 3 nguyên hàm:

  • Choice: Chọn một tùy chọn từ danh sách và trả về xác suất cho mỗi tùy chọn kèm theo độ tin cậy.
  • Score: Đánh giá trạng thái dựa trên các cấp độ tiêu chuẩn có thứ tự và trả về xác suất kèm theo độ tin cậy.
  • Noul: Trả về xác suất (từ 0 đến 1) cho thấy một tuyên bố là đúng.

Tất cả các câu hỏi được đánh giá song song dựa trên cùng một trạng thái trong một yêu cầu duy nhất. TypeSafe huấn luyện Jev bằng phương pháp Học tăng cường cho các quyết định đã hiệu chuẩn (RLCD), vì vậy độ tin cậy cao hơn sẽ tương ứng với độ chính xác cao hơn. Choice hỗ trợ tối đa 255 tùy chọn.

Các tuyên bố chính, nhanh hơn 193,6 lần và rẻ hơn 444,6 lần, đến từ các đánh giá quy trình làm việc của chính TypeSafe. Bài viết ra mắt cho biết các con số này nằm ở mức cao của những cải thiện trong thực tế và sử dụng GPT-6 Astra cùng Fable 5.1 làm câu trả lời tham chiếu.

Công cụ giải thích tương tác

Đua tốc độ giữa một LLM từng token với một lần truyền duy nhất của Jev, thay đổi ngưỡng tin cậy để xem mã kiểm soát từng quyết định như thế nào, ước tính chi phí hàng tháng và duyệt qua tất cả 20 trường hợp sử dụng.

Định tuyến và điều phối

  1. Định tuyến mô hình: Đánh giá độ khó của yêu cầu, sau đó gửi đến một mô hình nhanh hoặc mạnh. LangChain cung cấp tính năng này dưới dạng ModelRouterMiddleware; jev-router thực hiện việc này theo từng lượt cho Claude Code và Codex.
  2. Lựa chọn kỹ năng: Sách hướng dẫn gợi ý kỹ năng của TypeSafe chọn tối đa một kỹ năng từ 182 kỹ năng trong danh mục Hermes của Nous Research bằng cách sử dụng 2 yêu cầu.
  3. Gọi hàm có kiểu dữ liệu: Sách hướng dẫn gọi hàm ánh xạ các yêu cầu giao dịch bằng ngôn ngữ tự nhiên sang tên hàm và các đối số trong tập hợp đóng, được kiểm soát bởi độ tin cậy.
  4. Phân loại yêu cầu hỗ trợ và định tuyến ý định: Một lệnh gọi trả về bộ phận, mức độ thất vọng và tính khẩn cấp. Mô hình định tuyến ý định gửi từng yêu cầu đến logic xác định, một LLM chuyên biệt hoặc con người.

An toàn và rào cản bảo vệ

  1. Kiểm soát rủi ro khi gọi công cụ: pi-warden đặt câu hỏi liệu một lệnh bash, lệnh ghi hoặc chỉnh sửa đang chờ xử lý có phải là không thể đảo ngược hoặc nằm ngoài nhiệm vụ hay không. Nó phân biệt lệnh db:reset sau khi yêu cầu “reset the database” với db:reset sau khi yêu cầu “add a column”. AutoModeMiddleware của LangChain trả về lỗi cho các lệnh gọi rủi ro.
  2. Tự động phê duyệt chỉ đọc: jev-auto-approve là một hook của Claude Code chỉ tự động phê duyệt ở mức p ≥ 0.95 và đã phê duyệt 0 trên 8 lệnh thay đổi trạng thái trong quá trình hiệu chuẩn được công bố.
  3. Bảo vệ rò rỉ bí mật: jev-secret-guard gửi các chuỗi đã được che giấu đến Jev và đã chặn 6 trên 6 bí mật, đồng thời không chặn 6 chuỗi an toàn nào trong quá trình hiệu chuẩn.
  4. Sàng lọc tiêm nhiễm câu lệnh (prompt-injection): Trong sách hướng dẫn về đoạn văn RAG của TypeSafe, độ tương đồng cosine xếp hạng một đoạn tiêm nhiễm được cài cắm ở vị trí đầu tiên với 0,584. Jev chấm điểm nó 0,99 và loại bỏ nó.
  5. Rào cản bảo vệ đầu vào và đầu ra của LLM: Sách hướng dẫn về rào cản bảo vệ đặt ngưỡng xác suất nguy hiểm để thông qua, xem xét, chặn hoặc định tuyến mọi tin nhắn.

Truy xuất và kiểm chứng (grounding)

  1. Xếp hạng lại (Reranking): Trên 40 truy vấn pháp lý CLERC, sách hướng dẫn xếp hạng lại đã nâng độ chính xác top-1 từ 5% lên 18% và top-10 từ 38% lên 62%.
  2. Xác minh trích dẫn: Sách hướng dẫn kiểm tra trích dẫn sử dụng một Choice để quyết định xem một phần nguồn có hỗ trợ, mâu thuẫn hay không đề cập gì đến một tuyên bố hay không.

Điều khiển máy tính, trình duyệt và thời gian thực

  1. Tác nhân trình duyệt: Jev Ultrafast của Browser Use chọn một thao tác và phần tử DOM trong một yêu cầu và hoàn thành tìm kiếm Google Flights trong khoảng 7,1 giây.
  2. Sử dụng máy tính để bàn: typesafe-computer-use thực hiện OCR màn hình macOS và để Jev phân loại hành động tiếp theo với chi phí khoảng $0,0002 mỗi bước.
  3. Tác nhân di động: Mobile Jev quyết định từng thao tác chạm trên Android, đạt đến màn hình thanh toán Uber trong khoảng 21 giây và 9 hành động.
  4. Tác nhân trò chơi thời gian thực: Bản demo Doom của TypeSafe chạy khoảng 10 truy vấn mỗi giây, với chi phí khoảng $7 mỗi giờ, trên trạng thái trò chơi có cấu trúc.

Chất lượng tác nhân và bộ nhớ

  1. Phát hiện đình trệ vòng lặp: ProgressGate đánh giá quỹ đạo, và mã trả về CONTINUE, WARN, REPLAN hoặc HALT.
  2. Xác minh tuyên bố “đã hoàn thành”: jev-belay kiểm tra bản ghi để tìm bằng chứng trước khi tin tưởng vào tuyên bố “đã hoàn thành” của tác nhân Claude Code.
  3. Nén ngữ cảnh: fast-jev-compaction chấm điểm các lệnh gọi công cụ và loại bỏ những lệnh cũ thay vì tóm tắt ngữ cảnh.
  4. Khai thác dấu vết cho bộ nhớ: Beacon by Asymptote Labs sử dụng Jev để tìm xem các lần chạy nào trên Claude Code, Codex, Cursor và OpenCode đáng để chuyển đổi thành các kỹ năng có thể tái sử dụng.
  5. Kiểm tra ngữ nghĩa (Semantic linting): jev-lint gắn cờ các vi phạm quy tắc nhóm tại thời điểm chỉnh sửa cho Claude Code và Codex.

Jev so với các đối thủ cạnh tranh gần nhất

Tính năngJev 1.13 (TypeSafe)Laya (mở)kev (mở)Claude Opus 5 (LLM)
Loại mô hìnhMô hình quyết định System OneMô hình quyết định Encoder (ModernBERT-large)LoRA + đầu đọc trên Qwen2.5-0.5BLLM tạo sinh
Trọng số / giấy phépĐóng, API được lưu trữApache 2.0, 421M và 322M tham sốApache-2.0 (cơ sở sử dụng giấy phép Qwen)Đóng, API được lưu trữ
Choice / Score / NoulCóCóCóThông qua nhắc lệnh có cấu trúc
Tương thích /v1/systemoneNguyên bảnCóCóKhông
Đảm bảo đầu raRàng buộc theo lược đồ (schema), không lỗi kiểu dữ liệuCâu trả lời có kiểu dữ liệu dựa trên các tùy chọn đã khai báoCâu trả lời có kiểu dữ liệu dựa trên các tùy chọn đã khai báo0 trên 3.080 không hợp lệ trong bài kiểm tra OpenRouter
Hiệu chuẩn (Calibration)Độ tin cậy được huấn luyện bằng RLCDĐộ tin cậy được trả vềECE tập dữ liệu kiểm chứng (held-out) 0,065Ước tính qua prompt, không đảm bảo đã hiệu chuẩn
Tùy chọn lựa chọn tối đa255Suy giảm sau 50255n/a
Độ trễ70 đến 500 ms (nhà cung cấp); 175 ms trung vị (OpenRouter)32,8 ms một câu hỏi, cục bộ (tự báo cáo)~160 ms, 6 câu hỏi, cục bộ (tự báo cáo)2.266 ms trung vị (OpenRouter)
Độ chính xác Banking7781,0% (OpenRouter)Không thể so sánh (0,425 ở mặc định, bộ công cụ riêng)0,860 trên 77 lựa chọn (tập dữ liệu kiểm chứng riêng)84,4% (OpenRouter)
Giá$0,042/triệu token đầu vào, đầu ra miễn phíMiễn phí, tự lưu trữMiễn phí, tự lưu trữ$2,42 mỗi 1.000 yêu cầu so với $0,11 cho Jev (OpenRouter)
Triển khaiTypeSafe, Vercel AI Gateway, OpenRouterpip, CPU hoặc GPU cục bộMáy chủ cục bộAPI

Các số liệu của mô hình mở được tự báo cáo bởi từng dự án trên bộ công cụ riêng của họ, vì vậy hãy coi chúng là thông tin tham khảo. Bài kiểm tra Banking77 của OpenRouter là phép so sánh trực tiếp rõ ràng nhất: Jev có độ chính xác thấp hơn 3,3 điểm so với Claude Opus 5, nhanh hơn 13 lần ở mức trung vị và chi phí chỉ bằng khoảng 1/22.

Điểm chính cần lưu ý

  • Jev trả về các câu trả lời dạng Choice, Score và Noul có kiểu dữ liệu kèm xác suất, không bao giờ trả về văn bản tự do.
  • TypeSafe niêm yết giá $0,042 mỗi triệu token đầu vào, đầu ra miễn phí và độ trễ từ 70 đến 500 ms.
  • Phù hợp nhất cho tác nhân AI: định tuyến, kiểm soát gọi công cụ, xếp hạng lại, kiểm tra trích dẫn và sàng lọc nội dung chèn.
  • Trên Banking77, Jev đạt 81,0% so với 84,4% của Claude Opus 5, với độ trễ trung vị thấp hơn 13 lần.
  • An toàn về lược đồ (schema-safe) không có nghĩa là chính xác: hãy hiệu chuẩn ngưỡng trên lưu lượng truy cập của riêng bạn trước.

Câu hỏi thường gặp (FAQ)

  • Jev là gì? Jev là mô hình System One đầu tiên của TypeSafe AI. Nó trả về các câu trả lời dạng Choice, Score và Noul có kiểu dữ liệu kèm xác suất thay vì văn bản được tạo ra.
  • Jev có phải là sự thay thế cho LLM không? Không. Nó hoạt động song song với LLM. LLM lập kế hoạch và viết; Jev xử lý các quyết định có giới hạn như định tuyến, kiểm soát và xác minh.
  • Jev có giá bao nhiêu? TypeSafe niêm yết giá $0,042 mỗi triệu token đầu vào, với token đầu ra miễn phí.
  • Tôi có thể chạy Jev cục bộ không? Không phải mô hình của TypeSafe. Các dự án mở như Laya và kev triển khai cùng giao diện /v1/systemone trên phần cứng của riêng bạn.

Asif Razzaq

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với người xem.

AI AgentJevTối ưu chi phíTypeSafe AIQuy trình AI

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

20 ứng dụng thực tế của Jev từ TypeSafe AI trong phát triển AI Agent | AIHOT.vn