Mô hình
Tencent ra mắt mã nguồn mở Hunyuan Hy4 Preview: Nén mô hình từ 1.5TB xuống 214GB
(giờ Việt Nam)
Tóm tắt AI
Đội ngũ Tencent Hunyuan vừa phát hành phiên bản rút gọn Hy4 Preview dưới dạng mã nguồn mở, cho phép tối ưu hóa dung lượng từ 1.5TB xuống còn 214GB và hỗ trợ suy luận trên các thiết bị không đồng nhất.
Bản dịch AI
Theo tin từ IT ngày 1 tháng 9, đội ngũ Tencent Hunyuan hôm nay đã công bố ra mắt phiên bản rút gọn Hy4 preview, nén trọng số mô hình của Hy4 preview từ gần 1.5TB xuống còn khoảng 214GB.
Lưu ý của IT: Hy4 preview là thế hệ mô hình ngôn ngữ lớn MoE (Mixture of Experts) mới được Tencent phát hành và mã nguồn mở vào ngày 28 tháng 8, với tổng số tham số là 770B (770 tỷ), tham số kích hoạt là 49B và độ dài ngữ cảnh lên tới 1 triệu Token.
Việc nén mô hình lần này dựa trên hai công nghệ cốt lõi: thứ nhất là thuật toán lượng tử hóa tam phân thưa Sherry, giúp nén trọng số lớp chuyên gia định tuyến xuống trung bình 1.25 bit; thứ hai là chiến lược độ chính xác hỗn hợp MIX-STQ1_0, quyết định độ rộng bit lượng tử hóa cho từng lớp dựa trên dữ liệu hiệu chuẩn, trong đó các lớp nhạy cảm được giữ ở độ chính xác cao hơn (2.06 bit IQ2_XXS), còn các lớp không nhạy cảm sử dụng STQ1_0 (1.31 bit) mạnh mẽ hơn.

Sự kết hợp của hai công nghệ này giúp mô hình duy trì hiệu suất ổn định trên các tác vụ chính — khả năng hiểu văn bản dài gần như tương đương với mô hình BF16 gốc, khả năng truy xuất ngữ cảnh dài đa vòng đạt mức tương đương, và khả năng toán học chỉ giảm nhẹ. Điểm số MCP Atlas giảm nhẹ từ 83.7 xuống 83.2, và SWE-Bench multi giảm từ 82.9 xuống 81.3.

BF16 tức định dạng dấu phẩy động bfloat16, là định dạng số độ chính xác thấp thường được dùng trong huấn luyện AI; bpw (bits per weight) chỉ số bit trung bình chiếm dụng cho mỗi tham số trọng số, giá trị càng thấp thì tỷ lệ nén càng cao.

Về khả năng suy luận kết hợp trên thiết bị không đồng nhất, Tencent Hunyuan đã hợp tác với prima.cpp để kiểm chứng một giải pháp mới: trên một máy tính xách tay trang bị một card 4090 và một máy chủ bốn card A4000 (tổng cộng 80GB VRAM, 64GB RAM, thuộc hai mạng LAN khác nhau), thông qua việc lập lịch không đồng nhất của prima.cpp để phân tách và phân bổ các lớp MoE, phiên bản rút gọn 214GB của mô hình đã đạt tốc độ suy luận 1.02 token/s, nhanh hơn khoảng 6 lần so với việc offload trên một máy tính xách tay đơn lẻ.

Phiên bản rút gọn của mô hình đã có mặt trên các nền tảng Hugging Face và GitHub, hỗ trợ các framework suy luận phổ biến như llama.cpp, vLLM, SGLang.
Tài liệu tham khảo:
Lượng tử hóa GGUF: huggingface.co/ AngelSlim / Hy4-preview-GGUF
Mô hình gốc: huggingface.co/ tencent / Hy4-preview
Kho lưu trữ mã nguồn: github.com/ Tencent / AngelSlim
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.