Thủ thuật
Simon Willison đánh giá Jev: Mô hình ra quyết định thế hệ mới từ TypeSafe AI
(giờ Việt Nam)
Tóm tắt AI
TypeSafe AI vừa ra mắt Jev, một mô hình 'System One' chuyên biệt trả về điểm số tin cậy thay vì văn bản. Với chi phí cực rẻ chỉ 0,042 USD/triệu token, đây là giải pháp tối ưu cho các tác vụ ra quyết định tự động.
Bản dịch AI
21 tháng 9 năm 2026
Tuần trước, TypeSafe AI đã công bố Jev, ví dụ đầu tiên của họ về một danh mục mô hình mới mà họ gọi là “System One models” (Tôi đồng tình với Maggie Appleton, tôi nghĩ “decision models” là cái tên phù hợp hơn cho các mô hình này). Jev là một biến thể thú vị so với định dạng LLM thông thường: nó vẫn chấp nhận đầu vào là văn bản, nhưng thay vì đầu ra là văn bản, nó trả về các số dấu phẩy động tương ứng với các danh mục, câu hỏi có/không, xếp hạng và điểm số tin cậy liên quan.
TypeSafe mô tả Jev như sau:
Hãy coi Jev như một hàm gọi trí tuệ tiên phong (frontier-intelligence function call): đầu vào là trạng thái phi cấu trúc, đầu ra là các quyết định xác suất có định dạng.
Nó cũng rất nhanh và thực sự rẻ. Các LLM thông thường được định giá dựa trên token đầu vào và đầu ra, trong đó đầu ra thường bị tính phí với mức cao hơn đáng kể. Jev chỉ tính phí cho đầu vào—đầu ra là miễn phí—và giá đầu vào cho mô hình đầu tiên của họ là 0,042 đô la cho mỗi triệu token—thậm chí còn rẻ hơn cả GPT-5 Nano của OpenAI (0,05 đô la/triệu token).
Jev cho phép bạn đặt câu hỏi về văn bản hoặc dữ liệu bán cấu trúc. Bạn soạn một đối tượng “trạng thái” (state) chứa một chuỗi, mảng các chuỗi hoặc tập hợp các cặp tên-giá trị—điều này có thể mô tả một bài báo, một khách hàng hoặc bất kỳ loại bản ghi nào khác. Sau đó, bạn gửi đối tượng đó đến API của họ cùng với một hoặc nhiều câu hỏi và nhận lại câu trả lời cho từng câu hỏi.
Bạn có thể đặt ba loại câu hỏi:
API của Jev có thể chấp nhận một tài liệu đơn lẻ (“trạng thái”) và nhiều câu hỏi tùy thích miễn là nằm trong cửa sổ ngữ cảnh. Các câu hỏi được đánh giá song song, vì vậy việc gửi nhiều câu hỏi sẽ mất thời gian tương đương với việc chỉ gửi một câu hỏi.
Tôi nghĩ cách tiếp cận “mô hình quyết định” (decision model) rất hữu ích để hiểu nơi nào nên sử dụng Jev. Nó rất tuyệt vời cho bất kỳ tác vụ nào có thể biểu diễn dưới dạng phân loại—ví dụ như phát hiện thư rác, gợi ý nhãn, ưu tiên và xếp hạng.
Tôi cũng đã thử nghiệm nó cho việc xếp hạng lại kết quả tìm kiếm (search reranking), nơi bạn lấy 100 kết quả phù hợp tiềm năng bằng một thuật toán rẻ tiền như BM25, sau đó để Jev chấm điểm 100 ứng viên đó về mức độ liên quan so với truy vấn gốc.
Hộp đen đang trở lại thời thượng
Một điều tôi cảm thấy hơi không thoải mái về Jev là cách nó thể hiện sự thoái lui sâu hơn nữa về phía các hệ thống học máy hộp đen (black box).
Các LLM vốn đã là hộp đen—bạn có thể yêu cầu chúng giải trình các quyết định của mình, nhưng bạn không thể đảm bảo rằng những gì chúng nói là hữu ích hoặc chính xác.
Jev thậm chí còn không cung cấp cho bạn điều đó: bạn nhập bao nhiêu văn bản tùy thích, thứ duy nhất bạn nhận lại chỉ là một con số dấu phẩy động. Nếu Jev đánh dấu thứ gì đó là thư rác, thì tín hiệu nội dung nào đã khiến nó làm vậy?
Điều này cũng có nghĩa là những lo ngại về định kiến cần phải được đặt lên hàng đầu. Tôi thực sự hy vọng không ai sử dụng Jev để xếp hạng ứng viên xin việc—con số dấu phẩy động đó có thể che giấu đủ loại định kiến vô hình được cài cắm trong các mô hình, và việc phân tách các định kiến đó thông qua thực nghiệm sẽ là một công việc đầy thách thức.
(Tôi đã thử một thí nghiệm trong đó tôi yêu cầu Jev chấm điểm mọi thành phố ở Vùng Vịnh San Francisco bằng câu trả lời có/không cho câu hỏi liệu đó có phải là một “Thành phố tốt?” hay không—nó xếp Cupertino ở vị trí cao nhất và East Palo Alto ở vị trí thấp nhất. Hừm.)
Trên thực tế, tất cả những điều này có nghĩa là các đánh giá (evals) và thử nghiệm có cấu trúc thậm chí còn quan trọng hơn so với các dự án LLM thông thường. Rất may, Jev rẻ đến mức việc chạy hàng trăm hay thậm chí hàng nghìn câu lệnh thử nghiệm qua nó chỉ tốn vài xu.
Những cách sử dụng phi truyền thống cho Jev
Thật thú vị khi theo dõi cộng đồng rộng lớn đưa ra các trường hợp sử dụng tiềm năng cho Jev trong vài ngày qua. Dưới đây là một số ý tưởng sáng tạo đã thu hút sự chú ý của tôi:
Tái tạo mô hình trọng số mở
Cũng đã có một loạt các dự án cố gắng tạo ra một mô hình giống như Jev dựa trên các mô hình trọng số mở. Kev là một ví dụ thú vị, sử dụng Qwen 3.5 để tạo ra các mô hình 0.8B, 4B và 9B. Đây là chủ đề Hacker News đi kèm, nơi ai đó đã liên kết đến một điểm chuẩn JevBench đã xuất hiện để so sánh các “mô hình quyết định lớp Jev”.
Với việc Jev mới chỉ được phát hành chưa đầy một tuần, mức độ hoạt động xung quanh nó thực sự rất ấn tượng.
Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.