Lấy cảm hứng từ lý thuyết nén là dự đoán, tác giả đã tạo ra gzipt - một công cụ sử dụng cửa sổ trượt DEFLATE của gzip để dự đoán văn bản mà không cần huấn luyện hay mạng thần kinh.
Nghiên cứu đề xuất khung mã hóa thưa tích chập (CSC) có khả năng tự học hệ số thưa thông qua thuật toán FISTA, giúp cân bằng hiệu quả giữa việc nén dữ liệu và bảo toàn thông tin quan trọng cho các tác vụ thị giác máy tính.
DeepSeek-V4.1-Flash là mô hình MoE Encoder-Decoder 552 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 1 triệu token cùng công nghệ nén KV cực mạnh, hiện đã có mặt trên API dưới tên deepseek-flash.
Vì sao đáng đọc: Đây là bước tiến lớn về kỹ thuật tối ưu hóa bộ nhớ và ngữ cảnh cho các mô hình ngôn ngữ quy mô lớn, thu hút sự quan tâm cao từ cộng đồng AI.
17/09
Thứ Năm · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Bài viết phân tích kỹ thuật chuyên sâu về DeepSeek-V4.1-Flash, làm rõ cách thức CED và CSA2 tối ưu hóa bộ nhớ KV Cache, đồng thời đánh giá đây là bước nhảy vọt về kiến trúc tương đương thế hệ V5.
Đội ngũ kỹ thuật của Taotian vừa xuất sắc giành 6 giải quán quân tại cuộc thi mã hóa video uy tín MSU 2025, khẳng định vị thế dẫn đầu trong công nghệ tối ưu hóa trải nghiệm hình ảnh.
GLIE giải quyết bài toán lưu trữ lớn trong truy xuất tài liệu bằng cách sử dụng k vector tâm chuẩn hóa để lập chỉ mục, sau đó dùng bộ giải mã để tái tạo và tái xếp hạng chính xác, giúp tối ưu hóa hiệu suất mà vẫn đảm bảo độ chính xác.
Cadence kết hợp mô hình TimesFM-3 với bộ mã hóa số học thích ứng để nén chuỗi thời gian, đảm bảo sai số nằm trong ngưỡng cho phép. Phương pháp này vượt trội hơn các thuật toán truyền thống như xz hay zstd nhờ khả năng tận dụng dự báo chính xác để tối ưu hóa dung lượng lưu trữ.
BeaconKV giải quyết nút thắt bộ nhớ khi suy luận dài bằng cách xác định các 'Thought Revisiting Tokens' quan trọng, giúp nén KV cache hiệu quả mà không làm giảm khả năng truy xuất ngữ cảnh xa.
Vì sao đáng đọc: Giải pháp kỹ thuật thực tế, giải quyết vấn đề cấp bách về bộ nhớ GPU cho các mô hình suy luận dài (LRMs), có tính ứng dụng cao trong triển khai thực tế.
LatentPress giới thiệu phương pháp nén tài liệu và lịch sử hội thoại thành các token bộ nhớ liên tục, cho phép mô hình AI đọc trực tiếp mà không cần giải mã văn bản, giúp tăng hiệu suất xử lý dữ liệu dài gấp 4-16 lần.
Vì sao đáng đọc: Đây là nghiên cứu quan trọng về tối ưu hóa bộ nhớ cho LLM, giải quyết bài toán nén ngữ cảnh hiệu quả hơn hẳn các phương pháp truyền thống như tóm tắt văn bản hay OCR.
ZipTok3D là phương pháp tokenizer 3D mới giúp tái tạo hình học chất lượng cao từ các chuỗi token cực ngắn bằng cách sử dụng tiền tố thông tin phân cấp và cơ chế giải mã lặp lại.
A scary finding from new Pennsylvania Uni paper. AI agents can go off-script in a simple way: they …
DịchNghiên cứu mới chỉ ra rằng các mô hình AI thường quên đi các quy tắc thiết lập khi nén hội thoại dài, dù vẫn nhớ nhiệm vụ chính. Giải pháp đơn giản là sử dụng bộ trích xuất 9B để khôi phục quy tắc, giúp tỷ lệ lưu giữ tăng từ 17% lên hơn 90%.
Một nhà sáng tạo đã sử dụng bộ giải mã âm thanh EnCodec của Meta để nén bài hát xuống chỉ còn 21KB, sau đó chia nhỏ thành 8 mã QR để lưu trữ vật lý trên giấy.
SkillZip là khung trừu tượng hóa thủ tục giúp nén các thư viện kỹ năng của AI dưới dạng đồ thị, cho phép tái sử dụng hiệu quả các đoạn mã mà vẫn đảm bảo tính thực thi và khả năng mở rộng trong bối cảnh hạn chế của LLM.
Bài viết làm rõ bản chất của nén dữ liệu và LLM đều là bài toán dự đoán phần tử tiếp theo, từ đó giải thích vì sao khả năng dự đoán tốt hơn lại dẫn đến tỷ lệ nén cao hơn.