MarkTechPost
95

Mô hình

DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh

(giờ Việt Nam)

Tóm tắt AI

DeepSeek-V4.1-Flash là mô hình MoE đa phương thức mới với 748B tham số, nổi bật nhờ khả năng xử lý 1 triệu token và giảm dung lượng KV Cache xuống chỉ còn 890 byte mỗi token, tối ưu hiệu suất vượt trội so với các thế hệ trước.

Bản dịch AI

DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse

Các tác nhân (agent) có độ dài ngữ cảnh lớn (long-horizon) đã biến việc phục vụ LLM thành một khối lượng công việc nặng về đầu vào. Việc lặp lại quá trình prefill và ngữ cảnh lên tới hàng triệu token tạo ra các bộ nhớ đệm KV (KV caches) gây áp lực lên HBM, dung lượng SSD và băng thông. DeepSeek AI đã xây dựng phiên bản mới nhất của mình xoay quanh chính nút thắt đó. DeepSeek-V4.1-Flash là một mô hình Mixture-of-Experts đa phương thức với 552B tham số nền, 196B tham số Engram bổ sung và cửa sổ ngữ cảnh 1M-token. Nó kích hoạt 8B tham số mỗi token trong quá trình prefill và 16B trong quá trình decode. Con số quan trọng nhất là dung lượng bộ nhớ đệm KV toàn cục chỉ 890 byte mỗi token, bằng khoảng 1/4 so với DeepSeek-V4-Flash và nhỏ hơn khoảng 437 lần so với DeepSeek-V1.

Mô hình này có thể triển khai được không? Có. Các trọng số mở được phát hành theo giấy phép MIT với các đường dẫn vLLM, SGLang và Transformers trên Hugging Face, và nhóm nghiên cứu cũng mô tả một API công khai với các cấp độ suy luận thấp, cao và tối đa.

Causal Encoder-Decoder: Giảm một nửa quá trình Prefill

Cấu trúc nền 40 lớp được chia thành 20 lớp causal encoder và 20 lớp decoder. Lấy cảm hứng từ YOCO, decoder không tự tính toán KV toàn cục của riêng nó. Thay vào đó, các trọng số chiếu theo từng lớp sẽ suy ra nó từ trạng thái ẩn (hidden state) cuối cùng của encoder. Do đó, các token gợi ý (prompt tokens) dừng lại ở encoder, giúp giảm gần một nửa khối lượng tính toán prefill. Sliding-window attention (SWA) với cửa sổ 128-token vẫn chạy ở mọi lớp, vì vậy các trạng thái SWA của decoder được xây dựng lại bằng cách phát lại chỉ 128 token gợi ý cuối cùng. Nhóm nghiên cứu gọi đây là Decoder SWA Bounded Replay.

Compressed Sparse Attention 2 (CSA2)

DeepSeek-V4 đã kết hợp CSA với Heavily Compressed Attention. V4.1-Flash sử dụng CSA2 thuần túy và tấn công vào kích thước bộ nhớ đệm dọc theo trục lớp. Mỗi lớp CSA2 được gán tĩnh một trong 3 chế độ:

Mỗi lớp giữ lại Q và SWA KV chính của riêng nó. 18 lớp encoder CSA2 sử dụng tỷ lệ nén là 2 trong 3 nhóm gồm 6 lớp (1 Full, 5 Reuse). 20 lớp decoder sử dụng tỷ lệ 1 trong 5 nhóm gồm 4 lớp: lớp đầu tiên là Full cộng với 3 Reuse, các lớp còn lại là Reindex cộng với 3 Reuse. Một bộ lập chỉ mục thưa thớt phân cấp (Hierarchical Sparse Indexer) trong decoder cho phép lớp Full xây dựng một nhóm ứng viên lên tới 16.384 vị trí (2.048 khối, mỗi khối 8 vị trí), nhờ đó các lớp Reindex sau đó chỉ cần chấm điểm một tập hợp giới hạn thay vì toàn bộ ngữ cảnh.

FP4 KV, Bounded Replay và các mở rộng khác

Bộ nhớ đệm KV chính được lượng tử hóa sang E2M1 với một tỷ lệ E4M3 cho mỗi 16 kênh, tuân theo NVFP4 nhưng không có tỷ lệ toàn cục. Điều này được giới thiệu thông qua quá trình huấn luyện nhận biết lượng tử hóa (quantization-aware training) trong giai đoạn hậu huấn luyện và giảm gần một nửa dung lượng lưu trữ so với bộ nhớ đệm FP8 của V4.

Ở cấp độ triển khai, SWA KV không còn được lưu trữ trên SSD. Nó nằm trong một nhóm phân tán được trích xuất từ 10% DRAM của máy chủ với TTL (thời gian tồn tại) tính bằng phút, trong khi KV toàn cục giữ thời gian tồn tại đảm bảo là 72 giờ. Khi xảy ra lỗi (miss), Encoder SWA Bounded Replay chỉ tính toán lại 128 token thay vì tính theo số lớp nhân với cửa sổ.

Các thay đổi khác bao gồm Single-Pass mHC, giúp dịch chuyển các hệ số trộn đầu vào đi một khối để nhân (kernel) Mega-mHC hợp nhất có thể giảm một nửa lưu lượng bộ nhớ kích hoạt, mô-đun bộ nhớ có điều kiện Engram tại các lớp 1 và 14, giải mã suy đoán DSpark được huấn luyện sau giai đoạn tiền huấn luyện với phần nền (backbone) bị đóng băng, và Muon theo từng đầu (head-wise). FLOPs cho giải mã đơn token chỉ tăng 1/4 khi ngữ cảnh tăng từ 4K lên 1M.

Huấn luyện và Kết quả

Quá trình tiền huấn luyện bao gồm 45T token đa phương thức với tỷ lệ văn bản trên đa phương thức là 7:1. Sparse attention được huấn luyện từ đầu với độ dài chuỗi 64K mà không cần khởi động dày (dense warmup), và ngữ cảnh được mở rộng lên 1M tại mốc 34T token. Mô hình cơ sở đạt kết quả tương đương DeepSeek-V4-Pro-Base về kiến thức thế giới và lập trình trong khi chỉ sử dụng 1/3 tổng số tham số và 1/4 số tham số được kích hoạt.

Giai đoạn hậu huấn luyện không giới thiệu thuật toán mới nào. Các cải tiến đến từ việc tổng hợp quy mô lớn các tác vụ tác nhân có thể kiểm chứng, RL trên các khung công tác không đồng nhất (Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness) và chưng cất on-policy từ hơn 40 giáo viên. Các kết quả nỗ lực tối đa được chọn lọc:

Giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem mô hình trên Hugging Face và Báo cáo kỹ thuật. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.