24/09

Thứ Năm · 3 tin
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 46/100

FIT-GGUF: Giải pháp lượng tử hóa hỗn hợp tùy chỉnh dung lượng cho MiniCPM5-2B

🚀 FIT-GGUF brings controllable-size mixed-precision quantization to MiniCPM5-2B Developer @Scorp1o_…

DịchCông cụ FIT-GGUF cho phép người dùng MiniCPM5-2B tùy chỉnh dung lượng file hoặc độ chính xác mong muốn. Hệ thống sẽ tự động phân bổ độ phân giải cho từng tensor, đồng thời dự đoán và xác thực file GGUF đầu ra.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 48/100

Nghiên cứu mới từ Google: Tải mô hình là 'nút thắt' chính gây độ trễ khi khởi động LLM lượng tử hóa

New Google paper shows for small quantized LLMs on serverless CPUs, 55-70% of cold-start latency is …

DịchNghiên cứu của Google chỉ ra rằng 55-70% độ trễ khởi động của các LLM lượng tử hóa trên CPU serverless đến từ việc tải trọng số mô hình. Việc tăng dung lượng RAM cấp phát có thể giúp tối ưu hóa đáng kể tốc độ suy luận.

22/09

Thứ Ba · 2 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 48/100

Chạy mô hình AI tiên tiến trên phần cứng cá nhân: Tuần lễ mã nguồn mở từ một phòng thí nghiệm học thuật

Một phòng thí nghiệm học thuật khởi xướng 'Tuần lễ mã nguồn mở', chứng minh khả năng chạy mô hình Qwen 3.6 35B-A3B trên Mac với tốc độ ấn tượng 450 tokens/giây nhờ kỹ thuật lượng tử hóa 1.5-bit.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tối ưu hóa Cellpose-SAM cho kính hiển vi tế bào gốc thông qua kỹ thuật lượng tử hóa hậu huấn luyện

Nghiên cứu giới thiệu phương pháp nén mô hình Cellpose-SAM giúp giảm dung lượng lưu trữ tới 6,76 lần mà vẫn duy trì độ chính xác cao khi phân tích hình ảnh tế bào gốc trên các thiết bị phần cứng hạn chế.

19/09

Thứ Bảy · 2 tin

18/09

Thứ Sáu · 1 tin
IT Home
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnPrismML ra mắt Bonsai 2 27B: Mô hình lượng tử hóa 3 giá trị, tiết kiệm 9 lần bộ nhớ mà vẫn giữ 98,2% hiệu năng

PrismML vừa giới thiệu Bonsai 2 27B dựa trên Qwen3.8, sử dụng kỹ thuật lượng tử hóa 3 giá trị giúp giảm dung lượng bộ nhớ xuống dưới 1/9 nhưng vẫn duy trì 98,2% hiệu suất so với bản gốc.

Cùng sự kiện, bài đại diện «PrismML ra mắt Ternary Bonsai 2 27B: Nén mô hình gấp 9 lần nhưng vẫn giữ 98,2% hiệu năng»

17/09

Thứ Năm · 1 tin
karminski@karminski3
Quan điểmĐiểm AI 19/100

Giả thuyết: Mô hình AI có thể thông minh và chính xác hơn khi xử lý đơn lẻ?

Một giả thuyết mới cho rằng khi chạy ở chế độ đơn luồng (concurrency=1), việc sử dụng GEMV thay vì GEMM trong quá trình lượng tử hóa cực hạn có thể giúp giảm thiểu sai số và cải thiện hiệu suất mô hình. Đây hiện chỉ là suy đoán cá nhân và chưa có dữ liệu thực nghiệm kiểm chứng.

14/09

Thứ Hai · 1 tin

13/09

Chủ Nhật · 1 tin
Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
NgànhĐiểm AI 31/100

Đồng sáng lập Hugging Face hé lộ hệ thống AI Agent chạy trực tiếp trên thiết bị

Interesting new on-device local AI agentic system - seems to be running an open-weights 4B model qua…

DịchThomas Wolf chia sẻ về một hệ thống AI Agent chạy cục bộ đầy hứa hẹn, dường như đang vận hành mô hình mã nguồn mở 4B đã được lượng tử hóa 4-bit thông qua framework MLX.

11/09

Thứ Sáu · 2 tin
Ant Ling@AntLingAGI
NgànhĐiểm AI 42/100

Ling-3.0-flash-VL cập nhật: Hỗ trợ OpenRouter và mở mã nguồn phiên bản lượng tử hóa

Two updates for Ling-3.0-flash-VL: - Now available on OpenRouter with two weeks of free access - FP4…

DịchMô hình Ling-3.0-flash-VL vừa ra mắt trên OpenRouter với ưu đãi dùng thử miễn phí 2 tuần, đồng thời công bố mã nguồn các phiên bản lượng tử hóa FP4 và INT4.

09/09

Thứ Tư · 2 tin
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 23/100

inclusionAI ra mắt mô hình thị giác ngôn ngữ Ling-3.0-flash-VL-int4

inclusionAI vừa phát hành phiên bản lượng tử hóa int4 của mô hình thị giác ngôn ngữ Ling-3.0-flash-VL trên HuggingFace. Người dùng cần đăng nhập và xác thực tài khoản để truy cập thông tin chi tiết do các hạn chế truy cập hiện tại.

08/09

Thứ Ba · 1 tin
ModelBest OpenBMB@OpenBMB
NgànhĐiểm AI 34/100

Mặt Bích AI chia sẻ tầm nhìn về mô hình 2B chạy cục bộ

Thanks for testing it out and sharing these numbers! 🙌 "Run a swarm of these locally" - that's exa…

DịchMặt Bích AI khẳng định tầm nhìn về việc chạy các mô hình 2B tối ưu trên thiết bị cá nhân. Với kích thước chỉ 1.56GB sau khi lượng tử hóa, mô hình đạt tốc độ hơn 200 token/giây trên RTX 4090 mà vẫn giữ được hiệu năng tương đương các mô hình 4B.

07/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Khi lượng tử hóa làm hỏng bộ nhớ: Vấn đề ghi đè trạng thái hồi quy trong suy luận độ chính xác thấp

Nghiên cứu chỉ ra rằng việc lượng tử hóa trạng thái trong mạng hồi quy (RNN) có thể gây sai số nghiêm trọng khi dự đoán các thông số sinh học. Việc lưu trữ trạng thái 4-bit làm tăng sai số dự báo lên gấp hàng trăm lần so với mô hình gốc.

04/09

Thứ Sáu · 1 tin

29/08

Thứ Bảy · 1 tin
Tencent Hunyuan@TencentHunyuan
Mô hìnhĐiểm AI 62/100

Tencent Hunyuan nén mô hình 770B xuống còn 200GB mà gần như không giảm độ chính xác

We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well! Meet MIX-STQ1_0.The…

DịchTencent đã tối ưu hóa mô hình Hunyuan Hy4-preview từ 1.5TB xuống còn 200GB định dạng GGUF bằng kỹ thuật lượng tử hóa hỗn hợp MIX-STQ1_0, giúp mô hình khổng lồ chạy mượt mà hơn trên phần cứng hạn chế.

28/08

Thứ Sáu · 2 tin
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 49/100

MiniCPM-o 4.5 đã hỗ trợ chạy mượt mà trên chip Apple Silicon nhờ TyloQuant MFQ

MiniCPM-o 4.5 now runs efficiently on Apple Silicon with TyloQuant MFQ! 🥰 The team at @Tylogi_ai h…

DịchMô hình MiniCPM-o 4.5 hiện đã có thể chạy cục bộ trên chip Apple Silicon thông qua kỹ thuật lượng tử hóa TyloQuant MFQ, giúp tối ưu bộ nhớ mà vẫn giữ nguyên khả năng xử lý đa phương thức và tương tác thời gian thực.

27/08

Thứ Năm · 1 tin
Simon Willison Blog
Mô hìnhĐiểm AI 65/100

Cùng sự kiệnRa mắt Qwen3.8-Flash-Next: Mô hình MoE đa phương thức mã nguồn mở, hé lộ kiến trúc Qwen4

Qwen giới thiệu mô hình MoE đa phương thức Qwen3.8-Flash-Next với 125B tham số (kích hoạt 6B), mang lại hiệu suất vượt trội và là bước đệm cho kiến trúc Qwen4. Người dùng đã có thể trải nghiệm các phiên bản lượng tử hóa tối ưu trên nền tảng Unsloth.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»

25/08

Thứ Ba · 1 tin

20/08

Thứ Năm · 1 tin
Qwen@Alibaba_Qwen
Sản phẩmĐiểm AI 35/100

Qwen2.5-27B ra mắt phiên bản lượng tử hóa siêu nhẹ từ Unsloth

Huge thanks to Unsloth for the great work. This is wonderful news for the community! 🥳Qwen3.8-27B, …

DịchĐội ngũ Qwen hợp tác cùng Unsloth phát hành phiên bản lượng tử hóa GGUF cho Qwen2.5-27B, cho phép chạy mượt mà trên thiết bị có 8GB RAM với độ chính xác ấn tượng nhờ công nghệ Dynamic V3.

19/08

Thứ Tư · 1 tin
Hugging Face: Blog
Mô hìnhĐiểm AI 64/100

Tinh chọnLiquid AI ra mắt dòng LFM 2.5 với kỹ thuật QAD: Khôi phục 97% độ chính xác sau khi lượng tử hóa

Liquid AI giới thiệu các checkpoint Q4_0 cho dòng mô hình LFM 2.5, sử dụng kỹ thuật chưng cất nhận thức lượng tử (QAD) để duy trì tốc độ cao trong khi khôi phục tới 97% độ chính xác so với chuẩn BF16.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tối ưu hóa mô hình nhỏ (SLM) cho thiết bị biên, rất hữu ích cho cộng đồng phát triển AI tại Việt Nam.

14/08

Thứ Sáu · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ReRound: Phương pháp lượng tử hóa LLM không cần hiệu chỉnh bằng cách giải quyết sai số làm tròn

ReRound sử dụng mô hình khuếch tán để tái tạo trọng số, giúp xác định chính xác hướng làm tròn cho các giá trị nằm gần điểm giữa của khoảng lượng tử hóa, từ đó tối ưu hóa hiệu suất LLM ở mức bit thấp.

Tổng 27 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (38 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Lượng tử hóa” | AIHOT.vn