MarkTechPost
88

Mô hình

Pokee AI ra mắt Pokee-Isaac 28B: Mô hình AI 28 tỷ tham số với cửa sổ ngữ cảnh 10 triệu token

(giờ Việt Nam)

Tóm tắt AI

Pokee-Isaac 28B là mô hình AI chuyên dụng cho các ngành bảo mật cao, cho phép xử lý 10 triệu token ngay tại hạ tầng nội bộ của khách hàng mà chỉ cần một GPU B200.

Bản dịch AI

Pokee AI Releases Pokee-Isaac 28B: A 10M-Token Context Agentic Model Built to Run Inside the Customer Boundary

Các tác nhân (agent) có tầm nhìn dài hạn tích lũy ngữ cảnh nhanh hơn tốc độ giải quyết tác vụ. Mọi đầu ra của công cụ, quan sát và các bước suy luận trung gian đều nằm lại trong cửa sổ ngữ cảnh, và hai khả năng quan trọng nhất — duy trì ngữ cảnh đó và giữ tính nhất quán xuyên suốt — cho đến nay gần như chỉ có sẵn trên các điểm cuối đám mây (cloud endpoints). Điều này loại trừ các ngành công nghiệp được quản lý chặt chẽ, các tổ chức khu vực công và các ứng dụng chạy trên thiết bị (on-device), nơi dữ liệu không được phép rời khỏi phạm vi kiểm soát. Pokee AI vừa ra mắt Pokee-Isaac 28B, một mô hình nền tảng chỉ xử lý văn bản với 28 tỷ tham số và cửa sổ ngữ cảnh 10 triệu token, được thiết kế để chạy bên trong phạm vi đó. Nhóm nghiên cứu Pokee tuyên bố đạt 93,3% trên RULER ở mức 10 triệu token, ngang bằng với các mô hình đám mây tối ưu chi phí mạnh nhất trên các tiêu chuẩn đánh giá tác nhân (agentic benchmarks), và có cấu hình phục vụ (serving profile) phù hợp với một GPU duy nhất.

Có thể triển khai được không?

Có — nhưng là phiên bản cấp phép, không phải mã nguồn mở (open-weight). Pokee AI cung cấp Isaac thông qua API dành cho nhà phát triển tương thích với OpenAI, đồng thời cấp phép để triển khai bên trong VPC, tại chỗ (on-premises) hoặc trên thiết bị. Thông báo ra mắt cho biết hỗ trợ ngay từ ngày đầu (Day-0) cho vLLM và SGLang, cùng khả năng phục vụ trên một GPU duy nhất bắt đầu từ RTX 4090 hoặc tương đương. Nhóm nghiên cứu chỉ công bố các phép đo từ một GPU dòng B200, vì vậy hãy coi tuyên bố về GPU tiêu dùng là hướng dẫn từ nhà cung cấp thay vì kết quả đã được kiểm chứng.

Kết quả về ngữ cảnh dài

Trên RULER, Isaac duy trì mức trên 93,3% ở mọi độ dài được kiểm tra, kết thúc ở mức 93,3% tại 10 triệu token. GPT-5.6 Luna và Gemini 3.5 Flash Lite theo sát đến mức 512K, sau đó gặp lỗi tràn ngữ cảnh (context-overflow) ở mức 1 triệu token.

Trên MRCR v2 với 8 "kim" (needles), Isaac đạt điểm 0,607, 0,743 và 0,500 lần lượt tại 256K, 512K và 1 triệu token. Khoảng cách của nó so với Gemini nới rộng từ 0,133 lên 0,295 trong suốt quá trình thử nghiệm này.

Kết quả về tác nhân và bảo mật

Isaac dẫn đầu BFCL v4 với 70,94 điểm so với 70,61 của Luna. Báo cáo gọi đây là sự ngang bằng thay vì dẫn trước, đó là cách đọc đúng. Trên τ³-bench, nó đạt trung bình 0,662 qua bốn lĩnh vực, vượt qua 0,631 của Gemini, với lĩnh vực ngân hàng đạt 0,186 — mức độ khó cho tất cả mọi người. Trên MCP-Atlas, nó đứng thứ ba với độ bao phủ 74,59%, nhưng chỉ sử dụng 9,10 lượt (turns) mỗi tác vụ so với 14,99 của Gemini. Trên Terminal-Bench 2.1, nó giải quyết được 56 trong số 86 tác vụ tương thích văn bản (65,1%), đứng sau 60 tác vụ của Luna. Đó là tiêu chuẩn đánh giá duy nhất mà một mô hình đám mây giành chiến thắng, và báo cáo đã nêu rõ điều đó.

Về kiểm thử xâm nhập (red-teaming) DTAP, Isaac ghi nhận tỷ lệ tấn công thành công thấp nhất ở cả ba hạng mục: trực tiếp (36,0), gián tiếp (35,2) và kết hợp (35,6), với tỷ lệ thành công lành tính là 82,5. Có một điều kiện khác biệt: các mô hình cơ sở chạy trên trình chạy mặc định (stock runner), còn Isaac chạy trên bộ công cụ (harness) của Pokee.

Hiệu suất, giá cả và tính di động

Với khối lượng công việc RULER trên một GPU dòng B200, TTFT (thời gian cho token đầu tiên) là 23,6 giây ở mức 1 triệu token và 72,9 giây ở mức 10 triệu token. Thông lượng tiền xử lý (prefill throughput) tăng theo ngữ cảnh, từ 42.400 lên 137.200 token/giây, vì vậy một câu lệnh dài gấp mười lần chỉ tốn khoảng ba lần TTFT. Giá niêm yết là 0,15 USD/1,00 USD cho mỗi triệu token đầu vào/đầu ra, được đánh dấu là tạm tính. Isaac cũng chạy hoàn toàn trên thiết bị với Intel Arc Pro B70 và Core Ultra Series 3 (Panther Lake), cũng như trên Qualcomm Snapdragon X2 Elite.

Những điểm chính cần lưu ý

Hãy xem Blog và Bài báo. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.

Pokee AIMô hình ngôn ngữAI bảo mậtContext windowCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.