OpenRouter: Announcements
85

Thủ thuật

So sánh Jev 1.13 và Claude Opus 5: Hiệu năng phân loại dữ liệu ngân hàng trên OpenRouter

(giờ Việt Nam)

Tóm tắt AI

Thử nghiệm trên 3.080 mẫu hội thoại ngân hàng cho thấy Jev 1.13 có độ chính xác 81%, thấp hơn Claude Opus 5 (84,4%) nhưng tốc độ phản hồi nhanh gấp 13 lần và chi phí rẻ hơn đáng kể.

Bản dịch AI

Is Jev as Accurate as Frontier Models at Classification?

Jev là mô hình quyết định System One của TypeSafe. Chỉ cần cung cấp cho nó một đối tượng trạng thái ứng dụng và một câu hỏi có định dạng kiểu dữ liệu (typed question), nó sẽ trả về câu trả lời có định dạng tương ứng, điểm tin cậy và xác suất cho từng tùy chọn khả thi (đây là kiểu phản hồi của Decisions API, không phải các endpoint chat). Theo giới thiệu của TypeSafe, bạn có thể thay thế một mô hình chat tiên tiến (frontier model) bằng một mô hình đánh giá nhỏ gọn như Jev để cắt giảm đáng kể cả chi phí lẫn độ trễ trong các tác vụ phân loại như thế này. Vậy bạn phải đánh đổi bao nhiêu độ chính xác?

Chúng tôi đã chạy 3.080 câu lệnh hỗ trợ khách hàng từ tập dữ liệu Banking77 thông qua cả Jev 1.13 và Claude Opus 5 – mô hình mà người dùng OpenRouter chi tiêu nhiều nhất cho tác vụ phân loại trong phần "Task spend" trên trang xếp hạng tính đến ngày 22 tháng 9 năm 2026. Mỗi câu lệnh được phân loại vào một trong 77 ý định (intent) ngân hàng, và cả hai mô hình đều nhận được cùng một mô tả một dòng cho mỗi ý định.

Biểu đồ dưới đây đặt Jev và Opus cạnh nhau, cho thấy sự so sánh giữa chúng về độ chính xác, độ trễ trung vị và chi phí trên mỗi nghìn yêu cầu.

Jev kém Opus 3,3 điểm về độ chính xác, nhưng nhanh hơn 13 lần ở mức trung vị và chi phí chỉ bằng 1/22 so với Opus.

Jev so với Claude Opus 5 trong nháy mắt

Dưới đây là cái nhìn chi tiết hơn về kết quả. Macro-F1 gán trọng số bằng nhau cho mọi ý định.

Các con số trong ngoặc đơn là khoảng tin cậy bootstrap 95%, được chúng tôi tính toán dựa trên 3.080 ví dụ. Không mô hình nào trả về phản hồi sai định dạng. Mọi lỗi đều là gắn nhãn sai, không phải lỗi phân tích cú pháp.

Cách chúng tôi thực hiện

Banking77 là tập dữ liệu ý định hỗ trợ khách hàng ở cấp độ câu lệnh từ PolyAI với giấy phép CC BY 4.0. Các câu lệnh này rất ngắn, trung vị là chín từ, và mỗi câu được gắn nhãn với một trong 77 ý định. Khi chạy Jev và Opus trên Banking77, chúng tôi sử dụng toàn bộ tập kiểm tra (test split), bao gồm 3.080 ví dụ, mỗi ý định có 40 ví dụ. Một số ý định khá gần nhau khiến các mô hình không thể chỉ dựa vào một vài từ khóa rồi dừng đọc. Hãy nghĩ đến card_arrival so với card_delivery_estimate.

Chúng tôi đã viết tiêu chí một dòng cho mỗi ý định chỉ dựa trên tên nhãn mà không hề xem qua dữ liệu kiểm tra, và chúng tôi cung cấp danh sách tiêu chí chính xác như nhau cho cả Jev và Opus. Để chấm điểm Jev, chúng tôi gửi mỗi câu lệnh dưới dạng câu hỏi Choice của Decisions API với 77 tiêu chí làm tùy chọn. Đối với Opus, chúng tôi xây dựng một prompt trong đó nó thấy một thông báo hệ thống liệt kê tất cả các tiêu chí, sau đó là thông báo người dùng chỉ chứa câu lệnh. Chúng tôi chạy Opus ở nhiệt độ (temperature) bằng 0, tắt tính năng suy luận (reasoning), và sử dụng định dạng phản hồi JSON schema nghiêm ngặt với một enum gồm 77 nhãn. Chúng tôi đã bật tính năng prompt caching cho thông báo hệ thống vì nó giống hệt nhau trong mọi yêu cầu. Cả hai mô hình đều chạy từ cùng một máy, chúng tôi gửi 8 yêu cầu đồng thời mỗi lần và đo độ trễ dưới dạng thời gian khứ hồi (round-trip) mà client quan sát được thông qua OpenRouter.

Jev chính xác đến mức nào?

Hãy nói về các con số. Trên Banking77, Jev đạt 81,0%, Opus đạt 84,4%. Phép tính bootstrap ghép cặp cho ra khoảng tin cậy 95% từ 2,3 đến 4,4 điểm, vì vậy việc Opus dẫn trước khoảng ba điểm khó có khả năng là do nhiễu.

Về mặt tích cực, hai mô hình này có sự đồng thuận rất cao. Chúng đồng ý với nhau trên 89,3% các câu lệnh. Ở những nơi chúng khác biệt, Opus tự mình trả lời đúng 175 câu, còn Jev là 72 câu.

Về mặt hạn chế, cả hai vẫn nằm dưới mức 90% thấp mà các bộ mã hóa (encoder) được tinh chỉnh (fine-tuned) trên toàn bộ 10.003 ví dụ huấn luyện của Banking77 báo cáo. Đó là cái giá phải trả khi dựa vào các tiêu chí một dòng thay vì thực hiện tinh chỉnh toàn diện.

Theo từng lớp (class), Opus dẫn trước Jev ở 35 trên 77 ý định, Jev dẫn trước ở 15, và hòa ở 27. Opus dẫn trước nhiều nhất ở ý định receiving_money, nơi nó đạt 80,0% so với 52,5% của Jev. Trong khi đó, Jev tỏa sáng ở ý định compromised_card với 95,0% trong khi Opus chỉ đạt 70,0%. Opus có xu hướng nhầm lẫn chi tiết thẻ bị đánh cắp với một khoản thanh toán không xác định.

Jev nhanh và rẻ đến mức nào?

Rất nhanh, thời gian khứ hồi trung vị của Jev là 175 ms và p95 là 270 ms. Ngược lại, Opus khi không ở chế độ suy luận có thời gian khứ hồi trung vị là 2.266 ms và p95 là 3.004 ms. Điều đó có nghĩa là cuộc gọi Jev chậm nhất (~1,6s) vẫn nhanh hơn cuộc gọi Opus nhanh nhất (~1,9s).

Tổng chi phí cho Jev là 0,34 USD, tương đương 0,11 USD cho mỗi nghìn yêu cầu. Opus tốn 7,44 USD, tương đương 2,42 USD cho mỗi nghìn yêu cầu. Con số của Opus đã bao gồm việc cache prompt hệ thống 3.700 token, vì vậy tất cả các yêu cầu đều ở mức giá đọc cache thay vì giá niêm yết. Nếu không có cache, giá niêm yết cho Opus sẽ vào khoảng 19 USD mỗi nghìn yêu cầu. Vì vậy, nếu bạn đang sử dụng phân loại nhãn với một mô hình tiên tiến, hãy cache prompt hệ thống đó.

Định tuyến dựa trên điểm tin cậy của Jev

Jev cung cấp cho bạn điểm tin cậy, nhưng đó không phải là xác suất đã hiệu chuẩn. Ở đây, nó đã đánh giá quá cao độ chính xác của chính mình ở mức trung bình. Tuy nhiên, nó vẫn xếp hạng tốt. Với 58% các câu lệnh có độ tin cậy ≥0,99, độ chính xác là 96,3%. Với 3,5% các câu lệnh có độ tin cậy dưới 0,5, độ chính xác là 29,6%.

Thứ tự đó là tất cả những gì bạn cần để thực hiện phân tầng (cascade). Chấp nhận kết quả của Jev nếu vượt ngưỡng nhất định, gửi phần còn lại cho Opus. Dưới đây là độ chính xác và chi phí mỗi nghìn yêu cầu tại mỗi ngưỡng, từ chỉ dùng Jev đến chỉ dùng Opus.

Tại ngưỡng 0,90, 76% lưu lượng truy cập bỏ qua Opus. Đổi lại, độ chính xác của bạn giảm tối đa 0,4 điểm so với chỉ dùng Opus, và chi phí giảm 3,5 lần. Opus trả lời đúng 175 câu lệnh mà Jev bỏ lỡ. Độ tin cậy trung vị của các trường hợp đó là 0,67, và 85% dưới 0,90. Vì vậy, Jev thường biết khi nào nó chỉ đang đoán.

Các lưu ý

Hãy nói một cách hẹp về thử nghiệm thực tế mà chúng tôi đã thực hiện: một tập dữ liệu, một lĩnh vực, một thiết kế prompt và một khoảng thời gian mười lăm phút vào một buổi chiều.

Nếu có lợi thế về khả năng ghi nhớ của Opus ở đây, điểm số của nó có thể hơi được tâng bốc, vì Banking77 được công bố vào năm 2020. Nhưng bạn không thể khẳng định điều đó chỉ từ lần chạy này.

Một điểm khác là cả hai mô hình đều vấp ngã ở một lớp, vì các tiêu chí được viết chỉ từ tên nhãn mà không xem các tin nhắn ví dụ. Trong trường hợp này, một trong các nhãn là get_physical_card, bao gồm các truy vấn về việc liệu mã PIN có được gửi riêng hay không. Gần như không thể đoán được điều đó từ cái tên. Mỗi mô hình đạt 0 trên 40 điểm ở lớp đó, định tuyến hầu hết các tin nhắn sang change_pin. Nếu loại trừ lớp đó, Jev đạt 82,1% và Opus 85,5%. Nhưng một đội ngũ vận chuyển sẽ lặp lại các tiêu chí bằng cách sử dụng dữ liệu huấn luyện giữ lại (held-out), không phải tập kiểm tra, và cả hai mô hình sẽ trở nên tốt hơn.

Bảng phân tầng mà chúng tôi hiển thị sử dụng chính xác 3.080 ví dụ được dùng để đo độ chính xác, vì vậy đây là giới hạn trên. Hãy chọn ngưỡng của bạn dựa trên lưu lượng truy cập của riêng bạn.

Cuối cùng, các thử nghiệm này được chạy với Opus ở chế độ "reasoning off" và bật đầu ra có cấu trúc. Opus không được thử nghiệm ở chế độ "reasoning on", hoặc với các schema khác hay ví dụ few-shot.

Điều này có ý nghĩa gì

Nếu ba điểm độ chính xác quan trọng hơn 2,42 USD mỗi nghìn yêu cầu, hãy chọn Opus. Nếu bạn đang xử lý khối lượng lớn, cần độ trễ thấp hoặc cần một vị trí dự phòng, Jev đơn thuần đã đạt được kết quả trong phạm vi 3,3 điểm so với Opus. Tốt hơn nữa, việc chạy phân tầng dựa trên điểm tin cậy của Jev đã đưa chúng tôi đến gần trong phạm vi 0,4 điểm so với Opus, với chi phí dưới 30%.

Tài liệu tham khảo Decisions API hướng dẫn qua cấu trúc yêu cầu cơ bản. Sách hướng dẫn (cookbook) của Jev hướng dẫn bạn thực hiện một câu hỏi Choice hoạt động trong TypeScript. Sách hướng dẫn về phân tầng đã xác minh của Jev có mô hình leo thang trong mã, với một mô hình rẻ tiền soạn thảo, Jev kiểm tra bản thảo và mô hình tiên tiến chỉ xử lý những gì không vượt qua được kiểm tra. Tập kiểm tra Banking77 là một tệp CSV 3.080 dòng trong kho lưu trữ của PolyAI.

Các câu hỏi thường gặp

Jev chính xác như thế nào so với Claude Opus 5 về phân loại ý định?

Trên tập kiểm tra Banking77 bao gồm 3.080 câu lệnh qua 77 ý định được chạy vào ngày 22 tháng 9 năm 2026, Claude Opus 5 đạt độ chính xác 84,4% và macro-F1 83,6%, trong khi Jev 1.13 đạt độ chính xác 81,0% và macro-F1 80,5%. Khoảng cách ghép cặp là 3,3 điểm phần trăm về độ chính xác với khoảng bootstrap 95% từ 2,3 đến 4,4 điểm phần trăm. Các mô hình đồng ý với nhau trên 89,3% các câu lệnh.

Jev nhanh hơn bao nhiêu so với một mô hình tiên tiến trong việc phân loại?

Về độ trễ khứ hồi trung vị và p95 mà client quan sát được, Jev đạt trung vị 175 ms và p95 270 ms, trong khi Claude Opus 5 khi tắt suy luận đạt trung vị 2.266 ms và p95 3.004 ms, cao hơn khoảng 13 lần ở mức trung vị. Những con số này được đo từ cùng một client dưới 8 yêu cầu đồng thời. Chúng bao gồm thời gian mạng và bất kỳ hàng đợi nào trong hệ thống của nhà cung cấp trước khi thực hiện suy luận thực tế.

Chi phí để phân loại văn bản với Jev trên OpenRouter là bao nhiêu?

Tất cả 3.080 yêu cầu Banking77 được tính phí tổng cộng 0,34 USD trên typesafe/jev-1.13, tức là 0,11 USD mỗi nghìn yêu cầu hoặc khoảng 0,0001 USD mỗi yêu cầu. Sử dụng tính năng prompt caching trên prompt hệ thống 77 nhãn, các yêu cầu tương tự được tính phí tổng cộng 7,44 USD trên anthropic/claude-opus-5, hoặc 2,42 USD mỗi nghìn yêu cầu. Nếu không có caching, Opus sẽ tính phí khoảng 19 USD mỗi nghìn yêu cầu theo giá niêm yết.

Tôi có thể sử dụng điểm tin cậy của Jev để quyết định khi nào cần chuyển sang mô hình lớn hơn không?

AIOpenRouterClaudeTối ưu chi phíPhân loại dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.