DịchĐội ngũ Tencent Hunyuan đã nén mô hình Hy4 preview từ 1,5TB xuống còn 214 GiB mà vẫn giữ nguyên 770 tỷ tham số nhờ thuật toán Sherry và định dạng STQ1_0, đạt mức trung bình 2,38 bit mỗi trọng số.
Dự án K2-Horizon-7B đang triển khai tối ưu hóa bộ nhớ với định dạng 8-bit và 4-bit, đồng thời cộng đồng đang kỳ vọng nhóm phát triển sớm tích hợp cơ chế Hybrid Attention để nâng cao hiệu năng.
Bài viết thử nghiệm hiệu năng của các phiên bản nén GGUF (Unsloth) trên mô hình Qwen3.8 27B qua các bộ benchmark GPQA Diamond, IFBench và Terminal-Bench 2.1.
Phương pháp mới giúp tối ưu hóa mô hình AI bằng cách nén xuống 4-bit mà vẫn giữ nguyên hoặc cải thiện hiệu suất so với mô hình gốc, giải quyết bài toán đánh đổi giữa tốc độ và độ chính xác.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong tối ưu hóa mô hình, giúp giảm tài nguyên tính toán đáng kể mà không làm mất đi chất lượng, rất hữu ích cho cộng đồng phát triển AI.
23/08
Chủ Nhật · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Người dùng thường đánh giá thấp khả năng của LLM do sử dụng các phiên bản đã được nén (quantized) làm giảm độ chính xác. Hiệu suất kém thực chất nằm ở cách triển khai thay vì lỗi của chính mô hình.
Bài đánh giá chuyên sâu sắp tới sẽ so sánh hiệu năng của các mô hình Qwen và Gemma ở nhiều mức độ nén (3-8 bit) và khả năng suy luận, giúp người dùng tối ưu hóa việc triển khai AI trên phần cứng cá nhân.