Mô hình
PrismML ra mắt Bonsai 2 27B: Mô hình lượng tử hóa 3 giá trị, tiết kiệm 9 lần bộ nhớ mà vẫn giữ 98,2% hiệu năng
(giờ Việt Nam)
Tóm tắt AI
PrismML vừa giới thiệu Bonsai 2 27B dựa trên Qwen3.8, sử dụng kỹ thuật lượng tử hóa 3 giá trị giúp giảm dung lượng bộ nhớ xuống dưới 1/9 nhưng vẫn duy trì 98,2% hiệu suất so với bản gốc.
Bản dịch AI
Theo tin từ IT ngày 18/9, phòng thí nghiệm trí tuệ nhân tạo PrismML đã ra mắt mô hình tinh chỉnh Bonsai 27B vào đầu năm nay, đạt được 95% hiệu suất của mô hình nền tảng Qwen2.5 27B với mức tiêu thụ bộ nhớ thấp hơn đáng kể.
Vào ngày 27 theo giờ địa phương, PrismML thông báo ra mắt phiên bản lượng tử hóa tam phân (ternary quantization) của Bonsai 2 27B. Mô hình này nâng cấp nền tảng lên Qwen2.5 27B, với sự cải thiện toàn diện về khả năng suy luận, lập trình, thị giác và tác nhân thông minh dài hạn (long-range agent). Với mức tiêu thụ bộ nhớ chưa đến 1/9, mô hình đạt 98,2% điểm số của mô hình nền tảng trong các bài kiểm tra chuẩn tổng hợp, thậm chí hiệu suất tổng thể còn tốt hơn cả Qwen2.5 27B.

PrismML cho biết, Bonsai 2 27B đủ khả năng đảm nhận các "công việc tri thức thực thụ" ngay tại máy cục bộ như vòng lặp tác nhân lập trình, quy trình làm việc trên máy tính, phân tích tài liệu riêng tư, gỡ lỗi đa phương thức, điều phối hỗn hợp, và chỉ gọi API đám mây khi thực sự cần thiết.

Bonsai 2 27B lượng tử hóa tam phân sử dụng kỹ thuật chia nhóm tỷ lệ FP16, với số bit hiệu dụng cho mỗi trọng số là 1,76, tổng kích thước mô hình là 5,9GB và hỗ trợ cửa sổ ngữ cảnh 262K.
Mô hình đạt tốc độ xử lý 143 TPS (token mỗi giây) trên NVIDIA GeForce RTX 5090 và lên tới 46,8 TPS trên Apple Silicon M5 Max. Hiệu suất năng lượng của mô hình này trên GeForce RTX 4090 là 0,714 mWh/Token, thấp hơn 40% so với mô hình 8B ở độ chính xác đầy đủ (full precision).
Bonsai 2 27B có thể chạy trên GPU NVIDIA thông qua CUDA hoặc trên các thiết bị Apple thông qua MLX; mô hình được mở trọng số theo giấy phép Apache 2.0.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.