Mô hình
Contrastive-LM ra mắt CLM-8B: Mô hình System One đánh giá hành động Agent nhanh gấp 9 lần Jev
(giờ Việt Nam)
Tóm tắt AI
Contrastive-LM giới thiệu CLM-8B, mô hình ngôn ngữ đối chiếu đầu tiên tập trung vào việc chấm điểm và xếp hạng các hành động của Agent thay vì tạo văn bản, mang lại hiệu suất vượt trội so với Jev của TypeSafe AI.
Chính văn · Bản dịch AI

Contrastive-LM vừa phát hành CLM-8B, mô hình mở đầu tiên thuộc một lớp mới gọi là Contrastive Language Models (CLMs). CLM không tạo văn bản. Nó chấm điểm một tập hợp các hành động ứng viên dựa trên trạng thái hiện tại và trả về xác suất. Baseline chính của họ là Jev, mô hình System One độc quyền từ TypeSafe AI.
Có thể triển khai được không? Có. Phần head Apache-2.0 nặng 75 MB. Nó chạy trên 1 GPU NVIDIA dưới hệ điều hành Linux, với vLLM phục vụ bộ mã hóa Qwen3-8B.
Mô hình System One làm được gì
Jev bắt đầu truy cập sớm giới hạn vào ngày 15 tháng 9 năm 2026. Nó trả về các giá trị có kiểu dữ liệu kèm xác suất thay vì văn bản. CLM nhắm đến cùng một giao diện đó. Kho lưu trữ GitHub của CLM cung cấp CLM-8B thông qua API tương thích với TypeSafe. Nó hỗ trợ 3 loại câu hỏi:
- Noul: trả về xác suất một khẳng định là đúng.
- Choice: chọn một tùy chọn từ một tập hợp đã khai báo, kèm theo xác suất.
- Score: trả về mức độ kỳ vọng trên một thang đo có thứ tự.
Một yêu cầu được viết cho API của TypeSafe có thể được chạy lại thông qua client Python của CLM.
Cách CLM hoạt động
CLM huấn luyện một bộ mã hóa trạng thái và một bộ mã hóa hành động với hàm mất mát InfoNCE hai chiều. Mỗi bộ mã hóa là một backbone Qwen3-8B đã đóng băng cộng với một head dự báo có thể huấn luyện với 20 triệu tham số. Quá trình huấn luyện kéo trạng thái về phía hành động thực tế đã thực hiện và đẩy nó ra xa các hành động khác.
Khi suy luận, CLM chấm điểm từng ứng viên bằng tích vô hướng của các embedding trạng thái và hành động. Một hàm softmax trên các điểm số đó trở thành phân phối câu trả lời. Nguyên lý tương tự được dùng để xếp hạng các giải pháp best-of-N, điều hướng công cụ và trả lời các quyết định có kiểu dữ liệu.
Thiết kế này tách biệt trạng thái và hành động. Trong một vòng lặp tác tử (agent loop), trạng thái thay đổi sau mỗi bước trong khi tập hợp hành động hầu như cố định. clm-serve dành riêng một phần bộ nhớ GPU, tương tự như KV cache của vLLM, và tái sử dụng các vector đã lưu trong cache. Trên 1 card RTX 4090 với 3 hành động, thời gian xử lý các trạng thái cũ giảm từ 1,7 ms xuống 0,6 ms. Báo cáo mô hình cho biết CLM chạy nhanh hơn 13 lần so với Jev với khoảng 1.000 ứng viên.
Công thức huấn luyện 3 giai đoạn
- Tiền huấn luyện trên ~60 triệu cặp câu hỏi-trả lời Nemotron DQA.
- Huấn luyện giữa trên ~30 triệu mẫu phủ định khó (hard negatives) tổng hợp được tạo bởi Gemini 2.5 Flash-Lite.
- Hậu huấn luyện trên ~1 triệu quỹ đạo tác tử từ Agent Data Protocol, Endless-Terminals và LiteCoder-Terminal-SFT.
Trên ~100 nghìn câu hỏi kiểm chứng, chỉ riêng tiền huấn luyện đạt độ chính xác top-1 là 52,1%. Huấn luyện giữa nâng con số này lên 69,2%. Huấn luyện trên các mẫu phủ định khó ngay từ đầu đạt đỉnh ở mức 62,4%, sau đó bị quá khớp (overfit).
Kết quả Zero-Shot so với Jev
| Tác vụ | Độ trễ CLM-8B | Độ trễ Jev | Thành công CLM-8B | Thành công Jev |
|---|---|---|---|---|
| Trò chơi T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Gọi công cụ (BFCL v4) | 76,8 ms | 125,5 ms | 95.2% | 99.2% |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Con số 9 lần đến từ trò chơi T-Rex, nơi các hành động lặp lại giữa các trạng thái. CLM ngang bằng với Jev trên T-Rex và Super Mario. Nó chậm hơn ở tác vụ gọi công cụ và WikiRacing trong khi vẫn chạy nhanh hơn ở mọi tác vụ.
CLM đóng vai trò là bộ kiểm chứng cho các tác tử lập trình
Ở đây, một trình tạo lấy mẫu một vài giải pháp ứng viên và bộ kiểm chứng sẽ chọn một giải pháp. Opus 5 tạo ra các ứng viên DeepSWE (best-of-4). Fable 5 tạo ra các ứng viên Terminal-Bench 2.1 (best-of-5). Nhóm nghiên cứu đã đánh giá 38 tác vụ DeepSWE và 30 tác vụ Terminal-Bench 2.1 được giữ lại. Độ trễ được đo trên H100.
| Benchmark | Pass@1 | CLM (đã tinh chỉnh) | Jev | Độ trễ CLM | Độ trễ Jev |
|---|---|---|---|---|---|
| DeepSWE | 73.7% | 81.6% | 71.1% | 79 ms | 449 ms |
| Terminal-Bench 2.1 | 84.0% | 87.6% | 83.1% | 32 ms | 131 ms |
Nhóm nghiên cứu báo cáo đây là những kết quả SOTA mới cho bộ kiểm chứng. Jev đạt điểm dưới pass@1 trên cả hai benchmark, vì vậy việc chọn bằng Jev còn tệ hơn so với việc lấy 1 mẫu. CLM chạy nhanh hơn từ 4,1 đến 5,7 lần. Những con số này sử dụng các head đã tinh chỉnh nhẹ, không phải checkpoint zero-shot. Đây là kết quả trên tập con kiểm chứng, không phải kết quả đầy đủ trên bảng xếp hạng.
Các điểm chính
- CLM-8B chấm điểm các hành động ứng viên thay vì tạo văn bản.
- Độ trễ thấp hơn tới 9 lần so với Jev trong các bài kiểm tra zero-shot.
- Các head đã tinh chỉnh đạt 81,6% trên DeepSWE và 87,6% trên các tập con Terminal-Bench 2.1.
- Các vector trạng thái và hành động được lưu cache giúp giảm độ trễ vòng lặp tác tử.
- Head Apache-2.0, tự lưu trữ trên 1 GPU NVIDIA.
Xem Blog, Mã nguồn và Dữ liệu & Mô hình. Mọi công lao thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Kết nối với chúng tôi

Michal Sutter
Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy (machine learning) và kỹ thuật dữ liệu (data engineering), Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.