Mô hình
Needle 2: Mô hình gọi công cụ siêu nhẹ 45M tham số, chỉ tốn 28MB RAM
(giờ Việt Nam)
Tóm tắt AI
Cactus Compute ra mắt Needle 2, mô hình AI chuyên về gọi công cụ với dung lượng chỉ 14MB, cho phép chạy mượt mà trên các thiết bị hạn chế tài nguyên với mức tiêu thụ RAM cực thấp.
Bản dịch AI

Cactus Compute vừa ra mắt Needle 2, một mô hình mã nguồn mở với 45 triệu tham số được thiết kế cho việc gọi công cụ (tool calling), sử dụng thiết bị và trích xuất dữ liệu có cấu trúc. Toàn bộ mô hình được đóng gói thành một tệp nhị phân duy nhất dung lượng 14MB, chạy một phiên làm việc đầy đủ với khoảng 28MB RAM. Các trọng số được huấn luyện và triển khai ở định dạng CQ2-bit sử dụng Cactus Quants, và mô hình được niêm phong bên trong công cụ C++ của chính công ty, vì vậy không cần cài đặt runtime hay tải xuống thêm khi thực hiện suy luận (inference). Tốc độ giải mã được báo cáo là 500 token/giây trên Raspberry Pi 5, 400–1.500 token/giây trên Meta Quest 3S và Apple Vision Pro, và 300–700 token/giây trên các điện thoại có giá dưới 200 USD. Tiền đề thiết kế của mô hình khá hẹp và được đội ngũ nêu rõ: việc ánh xạ một câu lệnh lộn xộn sang một chữ ký hàm (function signature) có kiểu dữ liệu xác định không cần kiến thức thế giới hay văn xuôi mở. Chính khung tư duy đó là lý do tại sao 45 triệu tham số là đủ cho tác vụ này, và tại sao mô hình nhắm đến các phần cứng không có GPU và NPU.
Nó có thể triển khai được không?
Có, Needle 2 được cung cấp dưới dạng các tệp nhị phân dựng sẵn và thư viện tĩnh cho macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS và WebAssembly. Cactus cho biết Pebble đã chạy Needle cục bộ trong ứng dụng Index 01 cho các tác vụ giọng nói ngoại tuyến.
Kiến trúc: Simple Attention Network
Needle 2 sử dụng cái mà đội ngũ Cactus gọi là Simple Attention Network (Mạng chú ý đơn giản). Công thức này thay thế FFN bằng một Hadamard MLP, giữ lại cơ chế chú ý GQA, thêm bộ nhớ khóa-giá trị engram từ các bảng n-gram băm, và sử dụng các kết nối siêu cấp đa làn (multi-lane hyper-connections). Mạng này có 27 lớp và độ rộng 512. Nghiên cứu cơ bản về nó hiện có trên arXiv với tiêu đề "A Controlled Study of Attention-Only Transformers".
Quá trình tiền huấn luyện sử dụng một tập dữ liệu độc quyền gồm 115 tỷ token, với 38 tỷ token cho giai đoạn hậu huấn luyện. Đội ngũ nghiên cứu lưu ý rằng LFM2.5-230M đã được tiền huấn luyện trên 19 nghìn tỷ token.
Needle 2 tiêu tốn 70 MFLOP mỗi token, với 35 triệu trong tổng số 45 triệu tham số hoạt động ở chế độ matmul. LFM2.5 230M tiêu tốn 460, FunctionGemma 270M tiêu tốn 540, và Apple FM nằm ở mức gần 6.000.
Công cụ, ngữ pháp, truy xuất và độ tin cậy
Các trọng số không bao giờ giải nén vào RAM. Các mã 2-bit mở rộng bên trong các thanh ghi vector và hợp nhất thành các phép nhân chấm số nguyên (integer dot products), vì vậy đường dẫn tính toán vẫn giữ ở mức int8. Một tệp nhị phân sẽ thăm dò CPU khi khởi động và chọn tầng nhân (kernel tier) phù hợp: SDOT, NEON, AVX2, RISC-V vectors, wasm SIMD, hoặc scalar.
Một ngữ pháp cấp byte được biên dịch từ các lược đồ JSON của bạn sẽ giới hạn mọi token được phát ra. Vì bộ khớp (matcher) biết những token nào là hợp lệ trước khi các logit tồn tại, công cụ này bỏ qua tới 98% quá trình dự đoán từ vựng trên các token cấu trúc.
Cơ chế chú ý sử dụng cửa sổ trượt 256 token, và các lượt hội thoại cộng với khai báo công cụ được ghim làm các KV sink. Bộ nhớ duy trì ở mức gần 28MB bất kể độ dài hội thoại.
Khai báo năm công cụ trở xuống và chúng sẽ hiển thị trực tiếp. Trên năm công cụ, một đầu truy xuất tương phản (contrastive retrieval head) sẽ nhúng mỗi lược đồ một lần, chấm điểm truy vấn theo từng lượt và chỉ chấp nhận năm kết quả hàng đầu. Các công cụ không được chọn sẽ không thể truy cập được, chứ không chỉ đơn thuần là ít khả năng xảy ra.
Mỗi phản hồi đều mang một giá trị độ tin cậy, là giá trị tối thiểu của một đầu phân loại hậu kiểm (calibrated post-hoc head) và xác suất giải mã của các token lệnh gọi. Các yêu cầu lạc đề sẽ trả về lệnh gọi trống []. Hợp đồng ở đây là một ngưỡng: thực hiện nếu trên ngưỡng, hỏi lại hoặc leo thang nếu dưới ngưỡng.
Đánh giá
Đội ngũ Cactus đánh giá trên năm tiêu chuẩn gọi hàm công khai bằng cách sử dụng khớp chính xác nghiêm ngặt có thứ tự (ordered strict exact match), trong đó tên, thứ tự gọi và mọi đối số phải khớp hoàn toàn. Needle 2 chạy end-to-end thông qua công cụ được cung cấp ở định dạng CQ2-bit với tính năng truy xuất được bật; các mô hình cơ sở (baselines) chạy ở định dạng f16 dưới vLLM.
Needle 2 dẫn đầu cả hai phân đoạn Seal-Tools và đạt độ chính xác 98,3% về tên hàm trên Mobile Actions. Nó xếp sau trên BFCL v4, điều mà Cactus cho là do sự khác biệt về phân phối: tập dữ liệu của nó là các hành động trên thiết bị người dùng cuối, không phải các API doanh nghiệp hay tổng quát. Tỷ lệ đầu ra đúng định dạng trên 3.641 hàng của BFCL là 93,4. Đội ngũ này nêu rõ hai sự bất đối xứng ngay từ đầu: các mô hình cơ sở f16 có lợi thế về định dạng, và sự chuyên biệt hóa tác vụ mang lại lợi thế cho Needle.
Những điểm chính cần lưu ý
Hãy xem qua GitHub Repo, Hugging Face Model Card, trang Cactus Needle và Bài báo nghiên cứu. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi và đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Sản phẩm mới hoặc Hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.