24/09

Thứ Năm · 2 tin

22/09

Thứ Ba · 1 tin

21/09

Thứ Hai · 2 tin
Hugging Face: Blog
Nghiên cứuĐiểm AI 47/100

Multiverse: Ứng dụng vật lý lượng tử để tối ưu hóa việc cắt tỉa mô hình LLM

Multiverse giới thiệu phương pháp cắt tỉa khối LLM bằng cách chuyển đổi thành bài toán tối ưu hóa Ising, giúp chọn cấu hình nén tối ưu mà không cần chạy benchmark. Kết quả trên Llama-3.3-70B cho thấy hiệu suất vượt trội, tăng 23% điểm MMLU so với các phương pháp truyền thống.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tối ưu hóa Cellpose-SAM cho kính hiển vi tế bào gốc thông qua kỹ thuật lượng tử hóa hậu huấn luyện

Nghiên cứu giới thiệu phương pháp nén mô hình Cellpose-SAM giúp giảm dung lượng lưu trữ tới 6,76 lần mà vẫn duy trì độ chính xác cao khi phân tích hình ảnh tế bào gốc trên các thiết bị phần cứng hạn chế.

19/09

Thứ Bảy · 1 tin

18/09

Thứ Sáu · 2 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 69/100

PrismML ra mắt Ternary Bonsai 2 27B: Nén mô hình gấp 9 lần nhưng vẫn giữ 98,2% hiệu năng

Dựa trên Qwen 27B, Ternary Bonsai 2 sử dụng kỹ thuật trọng số tam phân để giảm dung lượng xuống chỉ còn 5,9GB, giúp tối ưu hóa đáng kể khả năng chạy mô hình lớn trên phần cứng hạn chế.

Thêm 2 nguồn khác đưa tinIT HomeMarkTechPost
Emad Mostaque@EMostaque
Mô hìnhĐiểm AI 64/100

Cùng sự kiệnPrismML ra mắt Ternary Bonsai 2 27B: Mô hình nén 9 lần từ Qwen, chạy mượt trên thiết bị 8GB RAM

This is basically an Opus 4.5/4.6 level model that will work on anything with 8 Gb RAM

DịchDựa trên Qwen 27B, Ternary Bonsai 2 đạt hiệu suất 98,2% so với bản gốc nhưng chỉ nặng 5,9 GB, cho phép chạy trên các thiết bị có bộ nhớ hạn chế.

Cùng sự kiện, bài đại diện «PrismML ra mắt Bonsai 2 27B: Nén mô hình Qwen 27B xuống còn 5.9GB, chạy mượt trên PC»

17/09

Thứ Năm · 1 tin

14/09

Thứ Hai · 1 tin

11/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 39/100

X-AuT: Tối ưu hóa bộ mã hóa âm thanh cho mô hình ngôn ngữ lớn thông qua nén và chưng cất

X-AuT sử dụng kỹ thuật cắt tỉa dần dần và chưng cất đa quy mô để nén bộ mã hóa âm thanh của LLM, giúp giảm số lớp Transformer mà vẫn cải thiện độ chính xác trên các bài kiểm tra tiếng Anh và tiếng Trung.

09/09

Thứ Tư · 1 tin

04/09

Thứ Sáu · 1 tin

03/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

Debias-SparseGPT: Phương pháp cắt tỉa mô hình ngôn ngữ lớn giúp giảm thiểu định kiến

Debias-SparseGPT là kỹ thuật cắt tỉa hậu huấn luyện giúp giảm định kiến xã hội trong các mô hình ngôn ngữ lớn mà vẫn duy trì độ chính xác và hiệu suất, ngay cả ở cấu trúc nén 2:4 khắt khe.

01/09

Thứ Ba · 2 tin

30/08

Chủ Nhật · 1 tin
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 53/100

Mô hình Hy4 Preview cập bến WorkBuddy: Hỗ trợ chạy cục bộ với hiệu suất ấn tượng

Hy4 preview is now available on WorkBuddy, where users can switch between Work and Coding tasks. Th…

DịchTencent Hy4 Preview đã có mặt trên WorkBuddy, cho phép xử lý đa nhiệm từ viết code đến làm việc. Nhờ công nghệ nén MIX-STQ1_0, mô hình chỉ còn 200GiB GGUF, giúp chạy cục bộ mà vẫn giữ được độ chính xác gần như tương đương bản gốc BF16.

29/08

Thứ Bảy · 1 tin
Tencent Hunyuan@TencentHunyuan
Mô hìnhĐiểm AI 62/100

Tencent Hunyuan nén mô hình 770B xuống còn 200GB mà gần như không giảm độ chính xác

We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well! Meet MIX-STQ1_0.The…

DịchTencent đã tối ưu hóa mô hình Hunyuan Hy4-preview từ 1.5TB xuống còn 200GB định dạng GGUF bằng kỹ thuật lượng tử hóa hỗn hợp MIX-STQ1_0, giúp mô hình khổng lồ chạy mượt mà hơn trên phần cứng hạn chế.

25/08

Thứ Ba · 2 tin
Hugging Face Blog
Nghiên cứuĐiểm AI 92/100

Tinh chọnQuantization-Aware Healing: Kỹ thuật nén mô hình 4-bit vượt trội hơn cả bản gốc full-precision

Phương pháp mới giúp tối ưu hóa mô hình AI bằng cách nén xuống 4-bit mà vẫn giữ nguyên hoặc cải thiện hiệu suất so với mô hình gốc, giải quyết bài toán đánh đổi giữa tốc độ và độ chính xác.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong tối ưu hóa mô hình, giúp giảm tài nguyên tính toán đáng kể mà không làm mất đi chất lượng, rất hữu ích cho cộng đồng phát triển AI.

24/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnLlama-Mobile: Đột phá nén mô hình thị giác ngôn ngữ xuống 2.7-bit cho thiết bị di động

Llama-Mobile giới thiệu phương pháp nén mô hình VLMs xuống định dạng 2.7-bit, cho phép chạy mượt mà trên chip Arm mà vẫn giữ vững hiệu suất, giúp đưa các mô hình lớn như Llama 3.2 11B lên smartphone.


Vì sao đáng đọc: Đây là bước tiến quan trọng cho ứng dụng AI trên thiết bị (on-device AI), giải quyết bài toán tài nguyên phần cứng vốn là rào cản lớn nhất hiện nay.

15/08

Thứ Bảy · 1 tin
Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 37/100

Atomic ra mắt phiên bản Qwen3.8 27B nén GGUF siêu nhẹ

Atomic has released Dynamic Quants for Qwen3.8-27B-GGUF, a quantized version of Qwen3.8 27B, compres…

DịchAtomic vừa phát hành phiên bản Qwen3.8-27B với công nghệ nén GGUF động, giảm dung lượng từ 28.9GB xuống chỉ còn 8.5GB. Đáng chú ý, phiên bản AD-IQ3_S có thể chạy mượt trên MacBook Air 16GB mà vẫn giữ được 92.4% độ chính xác so với bản gốc BF16.

12/08

Thứ Tư · 1 tin
Tổng 23 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (44 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Nén mô hình” | AIHOT.vn