Mô hình
DeepSeek v4.1-Flash: Kiến trúc Encoder-Decoder đột phá đánh dấu sự trở lại đầy ấn tượng
(giờ Việt Nam)
Tóm tắt AI
DeepSeek ra mắt kiến trúc 763B tham số mới tích hợp thị giác máy tính, một bước tiến mạnh mẽ khiến giới chuyên gia cho rằng đây xứng đáng là phiên bản v5.
Bản dịch AI
![[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale](https://substackcdn.com/image/fetch/$s_!dYdZ!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F149285a5-df59-4df7-8ba9-4653b68c5f0b_2316x1122.png)
Chúng tôi có hơi chậm trễ trong việc này nhưng muộn còn hơn không. Chúng tôi đã rất bận rộn hoàn thiện sự kiện AIE NYC lần thứ hai, sẽ diễn ra trong một tháng nữa. Hãy mua vé trước khi giá tăng - tuần tới chúng tôi sẽ công bố các diễn giả từ Bridgewater, Ramp, Coatue, Mastercard, Vanguard, Coinbase, Blackrock, Fidelity, Point72, Capital One, JPMC, Wells Fargo, Bloomberg, A24 (vâng, chính là studio phim đó) Labs, Two Sigma, Apollo Global và nhiều đơn vị khác!
Cách DeepSeek theo đuổi chương trình nghiên cứu của họ thực sự vô cùng thú vị. Giữa các phiên bản DeepSeek lớn, từ v2 đến v3 rồi v4, họ đã phát hành các bài báo trung gian với những cải tiến kiến trúc cực kỳ tập trung và đạt tỷ lệ thành công gần như 100%, từ Math (đặc biệt là GRPO), Coder, và R1, chưa kể đến các công trình gần đây hơn về Manifold Constrained Hyperconnections và Compressed Sparse Attention. Sau sự chú ý khổng lồ trong nửa đầu năm 2025 từ bài báo R1, DeepSeek bắt đầu giữ kín tiếng, và trong khoảng một năm qua, họ hài lòng để các đối thủ như GLM và Kimi dẫn đầu về Open Models.

Mọi thứ có vẻ hơi bấp bênh trong một thời gian ngắn, nhưng những "whalebros" (nhà đầu tư lớn) chân chính chưa bao giờ nao núng, và giờ đây DeepSeek đang gửi đi một thông điệp khá khó hiểu khi thực hiện một kiến trúc hoàn toàn mới, cho "nghỉ hưu" V4 Pro và dồn toàn lực vào mô hình mới này, nhưng lại chỉ đặt tên là v4.1 Flash. Có vẻ đây là một bài kiểm tra xem liệu bạn có biết cách đọc xuyên qua các tiêu đề cơ bản để hiểu được những tiến bộ thực sự hay không.
Đúng là v4.1 Flash về mặt kỹ thuật vẫn đứng sau các mô hình mở khác trong một số bài kiểm tra (benchmark). Nhưng đó là vì chúng ta chưa có các bài kiểm tra nắm bắt một cách súc tích những gì v4.1, và chương trình nghiên cứu rộng hơn của DeepSeek, đang hướng tới - đó là cách sử dụng ngữ cảnh sáng tạo và hiệu quả nhất mà chúng ta từng thấy được công khai giải thích.

DeepSeek@deepseek_ai
🚀 Giới thiệu DeepSeek-V4.1-Flash: thông minh hơn, nhanh hơn, hiệu quả hơn. 🔹 Giới thiệu mô hình nhỏ nhất trong dòng kiến trúc mới của chúng tôi, với khả năng hiểu hình ảnh gốc. 🔹 Được thiết kế để có năng lực lớn hơn, suy luận nhanh hơn, thông lượng cao hơn và khả năng mở rộng lên các mô hình lớn hơn. 1/6

6:10 sáng · 10 tháng 9, 2026 · 6,04 triệu lượt xem
933 lượt trả lời · 3,02 nghìn lượt đăng lại · 27,7 nghìn lượt thích
Nếu bạn thuộc kiểu người chỉ đọc các phiên bản mô hình và tiêu đề bài kiểm tra, bạn chính xác là kiểu người hời hợt mà DeepSeek đang muốn đánh lừa. Cách tốt nhất để hiểu được bước tiến khổng lồ của DeepSeek ở đây là nhìn vào meme của Sebastian:

Sebastian Raschka@rasbt
Tôi biết, xin lỗi nhé, nhưng thật khó để cưỡng lại

3:21 sáng · 11 tháng 9, 2026 · 6,72 nghìn lượt xem
8 lượt trả lời · 3 lượt đăng lại · 120 lượt thích
Cùng tên mô hình, nhưng theo tiêu chuẩn của bất kỳ ai thì đây khó có thể gọi là bản cập nhật 0.1, và họ thậm chí còn thêm khả năng xử lý hình ảnh mà không bắt bạn phải chờ đợi một mô hình riêng biệt. Để có cái nhìn trực quan hơn, bạn có thể xem tất cả các cải tiến mô hình được tích lũy theo thời gian từ kiến trúc encoder-decoder nguyên bản trong "Attention is All You Need":
Peter Gostev@petergostev
Tôi đã yêu cầu Astra đọc bài báo về DeepSeek v4.1 Flash và so sánh nó với kiến trúc Transformer gốc ở dạng 3D - bạn có thể phóng to và kiểm tra từng thành phần cạnh nhau. Mọi thứ đã thay đổi khá nhiều. Hãy tự mình thử xem: …architecture.petergostev.chatgpt.site
8:43 tối · 10 tháng 9, 2026 · 218 nghìn lượt xem
54 lượt trả lời · 334 lượt đăng lại · 2,76 nghìn lượt thích
Nếu bạn đã đọc bài viết về V4 Pro và Engram của chúng tôi, bạn sẽ nắm bắt được kiến thức cơ bản về kiến trúc của DeepSeek tính đến tháng 4 năm 2026, nhưng điều chúng tôi cực kỳ ấn tượng là sự tách biệt prefill/decode được giới thiệu ở đây: 8B cho prefill (input tokens), 16B cho decode (output tokens), tạo nên một mớ hỗn độn thuật ngữ “DeepSeek v4.1-Flash: 763B-P8B-D16B” nếu bạn mở rộng ký hiệu đã thiết lập cho các MoE. Đó là độ thưa (sparsity) 1-2%, và nếu bạn đọc báo cáo kỹ thuật của DeepSeek v4.1 Flash, kết hợp với các tinh chỉnh mới như Sliding-Window Attention Bounded Replay, sẽ tạo ra dấu chân KV cache chỉ bằng 1/8 so với V4 Flash… điều này làm cho nó tốt hơn/nhanh hơn/rẻ hơn nhiều cho các tác nhân (agents) chạy dài hạn:
Chúng tôi rất vui khi DeepSeek quay trở lại công bố các nghiên cứu SOTA (tiên tiến nhất). Điểm nhấn cuối cùng của chúng tôi là bình luận của họ về hậu đào tạo (post-training), nơi họ dường như phần lớn đồng ý với Giáo sư Jie Tang:
Jasper Lu@lu__jasper
Điều này đáng chú ý. DeepSeek, một phòng thí nghiệm thường đi đầu trong việc tiên phong các thuật toán và kiến trúc mới, đang nói rằng tại thời điểm này, ROI (tỷ suất hoàn vốn) của việc cải thiện chất lượng dữ liệu vượt xa việc nghiên cứu các thuật toán hậu đào tạo mới. Tôi nghĩ điều này đã đúng từ lâu đối với…
DeepSeek @deepseek_ai
🚀 Giới thiệu DeepSeek-V4.1-Flash: thông minh hơn, nhanh hơn, hiệu quả hơn. 🔹 Giới thiệu mô hình nhỏ nhất trong dòng kiến trúc mới của chúng tôi, với khả năng hiểu hình ảnh gốc. 🔹 Được thiết kế để có năng lực lớn hơn, suy luận nhanh hơn, thông lượng cao hơn và khả năng mở rộng lên các mô hình lớn hơn. 1/6
4:08 chiều · 10 tháng 9, 2026 · 176 nghìn lượt xem
56 lượt trả lời · 143 lượt đăng lại · 1,67 nghìn lượt thích
Tin tức AI từ 9/9/2026-10/9/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào đáng chú ý. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/hủy nhận email theo tần suất!
DeepSeek đã ra mắt V4.1-Flash như một flagship trọng lượng mở mới tập trung vào hiệu quả suy luận cực cao và chi phí thấp.
Tài khoản kiểm chuẩn độc lập Artificial Analysis báo cáo rằng DeepSeek V4.1 Flash vượt qua DeepSeek V4 Pro 0813 mặc dù rẻ hơn nhiều, đạt 40 điểm trên Chỉ số Trí tuệ của Artificial Analysis, ngay dưới GLM-5.3-Flash và trên V4 Pro mới nhất, với mức giá $0.30 / 1 triệu input tokens và $1.20 / 1 triệu output tokens, với input được lưu trữ (cached) ở mức $0.006 / 1 triệu và giảm giá thêm 50% ngoài giờ cao điểm; họ cũng mô tả đây là mô hình có tổng 763 tỷ tham số với 8 tỷ tham số hoạt động cho input và 16 tỷ tham số hoạt động cho output, ngữ cảnh 1 triệu token, hỗ trợ văn bản+hình ảnh, giấy phép MIT, và khả dụng tại Mỹ/API thông qua chính DeepSeek @ArtificialAnlys, @ArtificialAnlys, @ArtificialAnlys
Vals gọi đây là mô hình trọng lượng mở số 1 mới trên Chỉ số Vals, vượt qua Kimi K3, với chi phí chỉ $0.30 mỗi bài kiểm tra, là mô hình rẻ nhất trong top 10 trọng lượng mở; họ cũng lưu ý rằng quá trình đánh giá chạy với ngữ cảnh 1 triệu token, tối đa 384 output tokens, nhiệt độ (temperature) 1, mặc định top-p/top-k, và nỗ lực suy luận cao @ValsAI, @ValsAI, @ValsAI
Baseten đã hỗ trợ ngay từ ngày đầu và tóm tắt định vị sản phẩm là thông minh hơn, nhanh hơn và hiệu quả hơn so với DeepSeek v4 Pro 0813, với văn bản và hình ảnh, chỉ dành cho Mỹ, ZDR, và ngữ cảnh 1 triệu token @baseten
Ollama bắt đầu triển khai nó cho các tài khoản Max và Team, sau đó mở rộng cho những người đăng ký gói Pro @ollama, @ollama, @ollama
Điểm mới lạ về kỹ thuật được thảo luận nhiều nhất là thiết kế causal encoder-decoder nhằm giảm chi phí tính toán hoạt động và KV/cache.
Artificial Analysis cho biết mô hình sử dụng kiến trúc Encoder–Decoder nhân quả (causal) mới, với 8 tỷ tham số hoạt động cho input/prefill và 16 tỷ tham số hoạt động cho output/decode @ArtificialAnlys
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.