Mô hình
DeepSeek ra mắt V4.1-Flash: Kiến trúc CED tối ưu chi phí xử lý cho AI lập trình
(giờ Việt Nam)
Tóm tắt AI
DeepSeek vừa phát hành mã nguồn mở V4.1-Flash với kiến trúc CED giúp giảm đáng kể chi phí prefill. Mô hình 552B tham số này hỗ trợ cửa sổ ngữ cảnh 1 triệu token và khả năng xử lý đa phương thức văn bản - hình ảnh.
Bản dịch AI

Tuần này, DeepSeek đã phát hành open weights cho DeepSeek-V4.1-Flash trên HuggingFace, và mô hình này hiện đã có sẵn trên Baseten Model APIs (hỗ trợ Loops sẽ sớm ra mắt). Các thông số kỹ thuật chính bao gồm:
Tổng cộng 552B tham số
8B tham số hoạt động cho giai đoạn prefill, 16B cho giai đoạn decode
Cửa sổ ngữ cảnh 1M token
Đầu vào đa phương thức (văn bản + hình ảnh), đầu ra văn bản
Vốn được phổ biến bởi dòng Gemini của Google, thuật ngữ "flash" mô tả các mô hình nhẹ hơn, chi phí thấp hơn được thiết kế để hoạt động tương đương với các mô hình lớn hơn. V4.1-Flash đánh dấu bản phát hành open-weight flash thứ ba của DeepSeek trong năm nay, gia nhập cùng các sản phẩm gần đây từ Z.ai và Alibaba khi các phòng thí nghiệm mô hình cung cấp trí tuệ cao hơn với mức giá thấp hơn cho các khối lượng công việc của coding agent.
So sánh các mô hình DeepSeek: cũ và mới
DeepSeek V4.1-Flash cho thấy những cải tiến so với các mô hình V4-Flash và V4-Pro ở cả khả năng xử lý văn bản và đa phương thức.
Trên các tiêu chuẩn đánh giá về lập trình và tác vụ agent, V4.1-Flash vượt qua V4-Pro với khoảng một phần ba tổng số tham số. Những bước nhảy vọt lớn nhất nằm ở các tác vụ agent dài hạn (long-horizon), với mức cải thiện đạt hai con số, trong khi các tác vụ dòng lệnh đơn lẻ (single-shot) cải thiện khiêm tốn hơn. Những cải tiến này là thực tế, nhưng điểm số 54.8 trên Automation-Bench đồng nghĩa với việc nó vẫn thất bại ở khoảng một nửa các quy trình công việc phức tạp. Hãy giữ con người trong vòng lặp (human in the loop) đối với các đường ống agent.
Trích từ thẻ mô hình HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash*Điểm số cao nhất là 100 cho tất cả các tiêu chuẩn đánh giá được ghi chú.
V4.1-Flash là mô hình phi thực nghiệm đầu tiên của DeepSeek có đầu vào hình ảnh gốc, vốn trước đây chỉ giới hạn ở V4-Flash-Vision-Exp. Khả năng suy luận hình ảnh cũng được cải thiện trong thế hệ này, đặc biệt là về giải thích biểu đồ và suy luận logic trên hình ảnh, rất hữu ích nếu bạn cung cấp cho nó ảnh chụp màn hình, bảng điều khiển hoặc bản thiết kế giao diện (UI mockups). Tuy nhiên, điểm số ZeroBench vẫn chưa đạt mức 50, và ở mức đó, bạn vẫn sẽ muốn có sự kiểm duyệt của con người đối với các suy luận dựa trên hình ảnh cho bất kỳ tác vụ quan trọng nào.
Trích từ thẻ mô hình HuggingFace DeepSeek-ai/DeepSeek-V4-Flash-Vision-Exp*Điểm số cao nhất là 100 cho tất cả các tiêu chuẩn đánh giá được ghi chú.
DeepSeek đã ngừng cung cấp các mô hình V4-Flash trên nền tảng của mình và hiện chuyển hướng lưu lượng truy cập sang V4.1-Flash. Lưu lượng truy cập V4-Pro cũng sẽ được chuyển hướng bắt đầu từ ngày 14 tháng 9. Nếu bạn đang chạy bất kỳ mô hình DeepSeek V4 nào, hãy nâng cấp lên V4.1-Flash. Đây cũng là một lựa chọn đáng cân nhắc nếu bạn đang sử dụng một mô hình đa năng lớn từ một phòng thí nghiệm khác và muốn có hiệu suất lập trình và tác vụ agent mạnh mẽ, hiệu quả hơn.
Tham số kích hoạt bất đối xứng giúp sử dụng tài nguyên tính toán hiệu quả hơn
DeepSeek-V4.1-Flash là mô hình duy nhất ở quy mô này sử dụng kiến trúc Causal Encoder-Decoder (CED).
Hai bước chính trong quá trình tính toán của mô hình là:
Prefill: Đọc đầu vào
Decode: Tạo đầu ra
Các mô hình MoE khác kích hoạt cùng một số lượng tham số cho cả bước prefill và decode. CED chia 40 lớp của V4.1-Flash thành một bộ mã hóa nhân quả (causal encoder) 20 lớp và một bộ giải mã (decoder) 20 lớp, và bộ nhớ đệm KV của bộ giải mã được chiếu trực tiếp từ đầu ra của bộ mã hóa. Điều đó có nghĩa là prefill chỉ cần chạy bộ mã hóa, kích hoạt 8B tham số cho mỗi token, trong khi decode chạy toàn bộ mô hình ở mức 16B.
Ý tưởng ở đây là việc tạo đầu ra khó hơn việc đọc đầu vào, vì vậy tài nguyên tính toán được ưu tiên cho decode hơn là prefill. Để so sánh, V4-Flash kích hoạt 13B cho cả prefill và decode, vì vậy V4.1-Flash đánh đổi việc decode nặng hơn (16B) để lấy một quá trình prefill nhẹ hơn nhiều (8B).
CED giảm bớt tính toán prefill bằng cách dừng lại ở bộ mã hóa và tái sử dụng bộ nhớ đệm KV đã được chiếu trong quá trình giải mã.
Thiết lập này giúp tăng hiệu quả chi phí cho các coding agent, nơi các vòng lặp agent tạo ra nhiều token prefill hơn đáng kể so với token decode. Ngoài ra, vì các trạng thái key-value của bộ giải mã được chiếu từ đầu ra của bộ mã hóa thay vì được tính toán độc lập trong mỗi lớp, CED góp phần tạo ra bộ nhớ đệm KV nhỏ hơn nhiều, giúp cắt giảm chi phí lưu trữ bộ nhớ đệm.
Tiết kiệm hơn nữa thông qua các cải tiến bộ nhớ đệm KV
Theo DeepSeek, bộ nhớ đệm KV toàn cục của V4.1-Flash chỉ yêu cầu một phần tư bộ nhớ so với V4-Flash. Kiến trúc CED đóng góp bằng cách chiếu bộ nhớ đệm KV của bộ giải mã từ đầu ra của bộ mã hóa thay vì tính toán độc lập. Nó cũng hoạt động với hai kỹ thuật khác để giảm thiểu bộ nhớ đệm KV hơn nữa.
Compressed Sparse Attention 2: Chia sẻ các mục key-value giữa các lớp chú ý (attention layers)
FP4 KV caching: Lưu trữ các mục key-value ở độ chính xác thấp hơn.
Bộ nhớ đệm KV toàn cục của DeepSeek-V4.1-Flash yêu cầu ít bộ nhớ hơn cho mỗi token.
Trích từ Giới thiệu DeepSeek-V4.1-Flash: thông minh hơn, nhanh hơn, hiệu quả hơn.
Ít bộ nhớ hơn cho mỗi token đồng nghĩa với việc nhiều ngữ cảnh hơn có thể nằm vừa trong bộ nhớ đệm, làm tăng tỷ lệ hit rate. Khi tiền tố (prefix) của một prompt đã được lưu trong bộ nhớ đệm, mô hình sẽ bỏ qua việc tính toán lại attention trên các token đó, giúp giảm thời gian tạo token đầu tiên (time-to-first-token) và tăng thông lượng trên mỗi GPU. Các coding agent được hưởng lợi nhiều nhất, vì các vòng lặp agent gửi lại phần lớn cùng một ngữ cảnh trong mỗi bước. Việc nắm bắt khả năng tái sử dụng đó trong môi trường sản xuất phụ thuộc vào cách các yêu cầu được định tuyến qua các GPU, đó là lúc ngăn xếp phục vụ (serving stack) phát huy tác dụng.
Suy luận sản xuất cho DeepSeek-V4.1-Flash
Baseten Inference Stack xử lý việc định tuyến đó với NVIDIA Dynamo và định tuyến nhận biết bộ nhớ đệm KV (KV cache-aware routing), giúp điều hướng từng yêu cầu đến bản sao (replica) đã chứa sẵn tiền tố của nó thay vì bất kỳ bản sao nào đang rảnh rỗi.
“Định tuyến nhận biết KV gửi các yêu cầu đến các bản sao đã lưu trữ sẵn ngữ cảnh liên quan, giúp tiết kiệm thời gian bằng cách tránh tính toán prefill dư thừa.”
Trích từ Suy luận nhanh hơn gấp 2 lần với định tuyến nhận biết bộ nhớ đệm KV
Tất cả những điều này chạy phía sau Baseten Model APIs, nơi DeepSeek-V4.1-Flash hiện đã có sẵn. Hãy dùng thử trong Thư viện Mô hình (Model Library) của chúng tôi hoặc liên hệ với chúng tôi về việc triển khai chuyên dụng nếu nhóm của bạn cần dung lượng dự phòng.
Bài viết được AI dịch và tổng hợp tự động từ Baseten Blog (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.