Hướng dẫn
OpenRouter thử nghiệm Jev: Khi nào nên dùng mô hình ra quyết định thay vì LLM tạo văn bản?
(giờ Việt Nam)
Tóm tắt AI
OpenRouter so sánh mô hình Jev 1.13 với GPT và Claude trong việc phân loại yêu cầu. Kết quả cho thấy Jev tối ưu hơn hẳn về chi phí và tốc độ, đạt độ chính xác tương đương LLM trong các tác vụ logic cụ thể.
Chính văn · Bản dịch AI

Giả sử bạn có một sản phẩm nhận được 40.000 phiếu hỗ trợ (support ticket) mỗi tháng và mỗi phiếu đều cần được phân loại để xác định ba yếu tố: nội dung là gì, có cần chuyển cấp hay không, và câu trả lời là gì.
Một mô hình LLM tiên tiến (frontier LLM) với JSON schema có thể thực hiện công việc này. Kết quả chạy thử nghiệm của chúng tôi cho thấy chi phí là 2,88 USD cho mỗi 1.000 phiếu với thời gian phản hồi trung bình là hai giây, tương đương khoảng 115 USD mỗi tháng. Một mô hình LLM nhỏ hơn đã thực hiện việc này với chi phí 0,09 USD cho mỗi 1.000 phiếu trong khoảng một giây.
Một cách suy nghĩ khác là xem xét những gì một mô hình ra quyết định (decision model) có thể làm. Jev là một mô hình từ TypeSafe và trong cùng một lần chạy, nó đã thực hiện phân loại với chi phí 2,5 cent cho mỗi 1.000 phiếu với thời gian trung bình là 194 mili giây, tương đương khoảng một đô la mỗi tháng. Thêm vào đó, nó trả về các xác suất, vì vậy không cần phải phân tích cú pháp (parse) gì cả.
Tuy nhiên, nó không thể viết câu trả lời. Để làm điều đó, bạn vẫn cần một LLM. Vì vậy, chúng tôi đã thử nghiệm Jev, GPT Luna và Claude Opus trên 100 trường hợp hỗ trợ thông qua OpenRouter và xây dựng hai mô hình (pattern) tận dụng cả hai.
Jev là gì và mỗi mô hình thực sự trả về những gì
Khi yêu cầu một mô hình ngôn ngữ đưa ra quyết định dựa trên mã nguồn, nó sẽ trả về văn bản. Bạn có thể yêu cầu định dạng JSON, nhưng mô hình được xây dựng để viết văn. Mã của bạn phải phân tích cú pháp đầu ra và đảm bảo rằng mô hình đã trả lời thay vì giải thích.
Thay vào đó, Jev trả về một câu trả lời có kiểu dữ liệu (typed answer). Bạn gửi cho nó trạng thái và các câu hỏi được xây dựng từ ba nguyên hàm (primitive): choice chọn một tùy chọn từ tập hợp bạn định nghĩa, noul trả về xác suất "có", và score đặt nội dung vào các mức độ bạn mô tả. Các câu trả lời của choice và score có thể bao gồm xác suất trên các khóa (key) của riêng bạn, và noul là một con số duy nhất. Dưới đây là phản hồi cho hai câu hỏi về một phiếu thanh toán.
Ý định (intent) là một trong các khóa của bạn và việc chuyển cấp (escalation) là một con số mà bạn so sánh với ngưỡng do bạn quyết định.
TypeSafe gọi Jev là mô hình Hệ thống Một (System One model). Điều đó có nghĩa là nó đưa ra các phán đoán nhanh, trực quan thay vì phân tích chậm chạp, có cân nhắc. Nó chỉ nhận văn bản, vì vậy không thể xử lý hình ảnh, âm thanh hoặc PDF làm đầu vào. Nó đọc các tiêu chí theo nghĩa đen. Hơn nữa, nó có xu hướng giảm độ chính xác khi trạng thái mà nó kiểm tra chứa các chi tiết không liên quan, và nó không đáng tin cậy trong các phép tính số học, đếm và so sánh ngày tháng.
So sánh Jev và một LLM tạo sinh (generative LLM) cạnh nhau
Giá cả được lấy từ siêu dữ liệu mô hình của OpenRouter vào ngày chạy thử nghiệm. Hãy kiểm tra trang mô hình trước khi lập ngân sách.
Những gì chúng tôi đã đo lường
Các mô hình được sử dụng là Jev 1.13, GPT Luna (được phân giải thành GPT 5.6 Luna) và Claude Opus (được phân giải thành Claude Opus 5). Các LLM nhận được cùng các định nghĩa và quy tắc chuyển cấp như Jev trong một system prompt, với temperature bằng 0 và yêu cầu trả về một đối tượng JSON thuần túy. Mỗi ví dụ là một yêu cầu. Đây là các tập dữ liệu nhỏ, gồm 60 và 40 ví dụ trong một ngày, với một bộ prompt duy nhất. Đây là hình thái của sự đánh đổi, thay vì một bảng xếp hạng.
Nhiệm vụ A: phân loại 60 phiếu hỗ trợ thành năm ý định cộng với một cờ chuyển cấp
Sáu mươi phiếu hỗ trợ thuộc năm ý định: trạng thái đơn hàng, trả hàng hoặc hoàn tiền, tranh chấp thanh toán, câu hỏi về sản phẩm, truy cập tài khoản, mỗi ý định có một định nghĩa dài một câu. Việc chuyển cấp bao gồm các đe dọa pháp lý, yêu cầu bồi hoàn (chargeback), nghi ngờ gian lận, nguy cơ an toàn và đe dọa công khai thông tin.
Độ chính xác là ngang nhau. Jev gửi nhiều token đầu vào hơn vì mỗi yêu cầu đều mang theo đầy đủ các tiêu chí, nhưng chi phí vẫn chỉ bằng khoảng một phần tư so với GPT Luna và dưới một phần trăm so với Claude Opus. Chỉ có một ý định bị nhầm, đó là câu hỏi về việc chia nhỏ khoản hoàn tiền cho một mặt hàng đã trả lại. Jev đã xếp nó vào mục "trả hàng hoặc hoàn tiền" với độ tin cậy là 0,56. Đây là phiếu duy nhất có độ tin cậy dưới 0,8, vì vậy với ngưỡng 0,8, nó vẫn sẽ được chuyển cho con người xử lý.
Nhiệm vụ B: sàng lọc 40 tin nhắn để phát hiện tấn công chèn prompt (prompt injection)
Hai mươi hai tin nhắn hỗ trợ thông thường và mười tám nỗ lực tấn công chèn (bỏ qua hướng dẫn, đánh dấu quản trị viên giả, đóng vai, hướng dẫn trong dấu ngoặc kép). Chúng tôi đã đưa cho Jev một câu hỏi có/không: "đây có phải là nỗ lực thay đổi hành vi của trợ lý không", và các LLM nhận được cùng định nghĩa đó và trả về một giá trị boolean.
Jev đã phân tách các nhóm một cách rõ ràng. Các tin nhắn tấn công chèn đạt điểm từ 0,86 đến 0,99 và các tin nhắn thông thường từ 0,01 đến 0,20. Lỗi duy nhất của Luna là một trường hợp đóng vai.
Sử dụng Jev khi câu trả lời là một trong N lựa chọn
Bất cứ thứ gì kết thúc bằng một câu lệnh switch đều là một câu hỏi dành cho Jev. Ý định, mức độ ưu tiên, ngôn ngữ, cảm xúc, hàng đợi nào, điều này có vi phạm chính sách không, yêu cầu này có được hỗ trợ không. Trong mỗi trường hợp, câu trả lời đều đã biết trước. Bạn chỉ muốn có một xác suất cho mỗi câu trả lời khả thi. Dưới đây là lệnh gọi phân loại của bài kiểm tra sử dụng TypeScript SDK của OpenRouter.
Ba điều cần lưu ý trong mã phân loại đó:
Đưa ra một phán đoán nhỏ cho mỗi câu hỏi và kết hợp các câu trả lời trong mã. Ở đây, ý định và việc chuyển cấp là các câu hỏi riêng biệt trong cùng một yêu cầu.
Viết các tiêu chí như một bản đặc tả (spec). Vì Jev đọc theo nghĩa đen, khi một trường hợp rơi vào sai nhóm, hãy sửa văn bản tiêu chí trước.
Chỉ gửi trạng thái mà mỗi câu hỏi cần. Chi tiết không liên quan sẽ làm giảm độ chính xác của câu trả lời.
Sử dụng LLM khi câu trả lời là văn xuôi
Bây giờ, khi chúng ta thực sự cần tạo một câu trả lời, chúng ta sử dụng LLM.
Chọn mô hình dựa trên tác vụ viết. Khi bạn cần một câu trả lời ngắn, nhanh và rẻ, GPT Luna là lựa chọn phù hợp, với chi phí khoảng 0,0001 USD mỗi câu trả lời trong lần chạy này. Hãy nâng cấp lên mô hình tiên tiến khi việc viết đòi hỏi khả năng suy luận thực sự, ngữ cảnh dài hoặc mã nguồn. LLM cũng là câu trả lời bất cứ khi nào bạn gặp phải một số hạn chế của Jev, chẳng hạn như đầu vào có hình ảnh, âm thanh hoặc PDF, hoặc đầu ra là một tài liệu, bản diff hoặc kế hoạch.
Định tuyến bằng Jev, tính toán bằng mã, viết bằng LLM
Nhìn tổng thể, mô hình đầu tiên rất đơn giản. Jev thực hiện phân loại. Mã kiểm tra mức độ chắc chắn của nó. Chỉ khi kết quả cần là văn xuôi, mã mới gọi LLM.
Trình xử lý sẽ gửi bất kỳ phiếu nào có mức độ chuyển cấp từ 0,5 trở lên cho con người. Nó cũng gửi bất kỳ phiếu nào có độ tin cậy về ý định dưới 0,8. Nếu không, nó sẽ trả lời trạng thái đơn hàng từ hệ thống đơn hàng mà không cần mô hình, và chỉ yêu cầu LLM soạn thảo cho các ý định cần văn xuôi.
Một đoạn mã chạy ngắn sẽ in các tín hiệu của Jev bên cạnh mỗi kết quả.
Dưới đây là đầu ra cho bốn phiếu mẫu.
Một trong bốn phiếu đã sử dụng LLM. Việc tra cứu trạng thái đơn hàng là chính xác và miễn phí. Báo cáo gian lận không bao giờ chạm tới mô hình nào có thể hứa hẹn bất cứ điều gì. Vì độ tin cậy cho phiếu chia nhỏ hoàn tiền - phiếu mà Jev phân loại sai trong Nhiệm vụ A - nằm dưới 0,8, nên nó đã được chuyển cho con người. Cuối cùng, câu trả lời về chiếc áo khoác vẫn là một bản nháp chưa được kiểm tra ở đây. Việc kiểm tra nó là mô hình thứ hai.
Xác minh đầu ra của LLM bằng Jev trước khi gửi đi
Mô hình thứ hai chạy theo hướng ngược lại. LLM soạn thảo, sau đó Jev kiểm tra bản nháp dựa trên chính sách trước khi nó được gửi đi. Điều này giúp ngăn chặn việc AI trả lời một cách thân thiện nhưng lại hứa hẹn những điều trái với chính sách.
Jev nhận chính sách, câu hỏi của khách hàng và bản nháp, sau đó nó trả lời một câu hỏi lựa chọn về việc liệu bản nháp đó được hỗ trợ, không được hỗ trợ hay bị từ chối. Chúng tôi đã chạy bốn bản nháp qua nó. Bản đầu tiên là từ GPT Luna, và ba bản còn lại được viết tay, mỗi bản được viết để nhắm vào một nhánh cụ thể.
Dòng thời gian bịa đặt được trả về là "không được hỗ trợ" với xác suất 1,00, và nếu câu trả lời đó được gửi đi, khách hàng sẽ viết thư lại vào ngày thứ tám để hỏi về khoản hoàn tiền.
Bản nháp của Luna mới là điều thú vị, vì nó nêu mọi sự thật đúng với chính sách. Nhưng nó vừa từ chối một nửa, vừa trả lời câu hỏi, và thêm vào một chi tiết không ai yêu cầu. Jev chia xác suất thành ba hướng, và ngưỡng 0,8 gửi nó đến nhân viên để kiểm tra nhanh.
Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.