MarkTechPost
92

Mô hình

DeepSeek ra mắt DeepSeek-V4-Flash-0731: Nâng cấp vượt trội về khả năng lập trình và AI Agent

(giờ Việt Nam)

Tóm tắt AI

DeepSeek vừa phát hành phiên bản V4-Flash-0731 với kiến trúc 284B MoE, tối ưu hóa mạnh mẽ khả năng xử lý tác vụ thông minh và lập trình, đồng thời mở cổng API công khai với mức giá cạnh tranh.

Bản dịch AI

DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains

DeepSeek đã phát hành DeepSeek-V4-Flash-0731 trên Hugging Face và đưa API chính thức của V4-Flash vào giai đoạn thử nghiệm công khai (public beta) vào ngày 31 tháng 7 năm 2026. Thẻ mô hình (model card) nêu rõ đây là bản phát hành chính thức thay thế cho bản xem trước, đồng thời kiến trúc và kích thước của mô hình vẫn không thay đổi. Những cải tiến đạt được là nhờ quá trình tái huấn luyện (re-post-training), không phải do thiết kế mới.

Checkpoint này đi kèm với mô-đun giải mã suy đoán (speculative decoding) DSpark, khớp với cấu trúc của DeepSeek-V4-Flash-DSpark. Hugging Face báo cáo mô hình có 304 tỷ tham số, bao gồm cả mô-đun dự thảo (draft module) bổ sung trên nền tảng cơ sở 284 tỷ tham số.

Về phía API, deepseek-v4-flash hiện hỗ trợ định dạng Responses API một cách tự nhiên và đã được điều chỉnh cho Codex. Các API V4-Pro cùng các mô hình trên ứng dụng và web không được cập nhật trong đợt này.

Mô hình này có thể triển khai được không?

Có, theo hai cách rất khác nhau.

Thông qua API, gần như bất kỳ ai cũng có thể triển khai: Trang định giá của DeepSeek niêm yết deepseek-v4-flash ở mức 0,14 USD cho mỗi 1 triệu token đầu vào khi cache miss, 0,0028 USD khi cache hit và 0,28 USD cho mỗi 1 triệu token đầu ra, với giới hạn đồng thời là 2.500. Mức giá này chỉ bằng khoảng một phần ba giá đầu ra của deepseek-v4-pro (0,87 USD). Các startup giai đoạn hạt giống, nhà phát triển độc lập và các đội ngũ nền tảng nội bộ có thể chạy các vòng lặp tác nhân (agent loops) với mức giá này mà không cần ngân sách cho GPU.

Thông qua tự lưu trữ (self-hosting), rào cản cao hơn nhiều: Các trọng số được cấp phép theo MIT và không bị hạn chế, nhưng mọi chuyên gia (expert) đều phải nằm trong bộ nhớ ngay cả khi chỉ có 13 tỷ tham số được kích hoạt trên mỗi token. Ví dụ vLLM của DeepSeek phục vụ mô hình này trên một node 4×GB300 duy nhất. Các GGUF động của Unsloth đưa bản dựng 8-bit không mất dữ liệu lên 162 GB và bản 3-bit lên 103 GB, cần tổng cộng khoảng 110 GB RAM cộng với VRAM. Tự lưu trữ phù hợp với các doanh nghiệp vừa và lớn có cụm máy chủ, hoặc một máy trạm cấu hình mạnh với kỹ thuật lượng tử hóa (quantization) cao.

Kiến trúc

Theo báo cáo kỹ thuật của DeepSeek-V4, V4-Flash là mô hình MoE 284 tỷ tham số với 13 tỷ tham số được kích hoạt trên mỗi token và cửa sổ ngữ cảnh 1 triệu token. Mỗi lớp MoE chứa 1 chuyên gia dùng chung và 256 chuyên gia được định tuyến với chiều trung gian là 2048, trong đó 6 chuyên gia được định tuyến sẽ hoạt động trên mỗi token. Ba lớp MoE đầu tiên sử dụng định tuyến băm (hash routing). Độ sâu dự đoán đa token (multi-token prediction) là 1.

Cơ chế chú ý (Attention) là dạng lai, kết hợp giữa Compressed Sparse Attention (CSA) và Heavily Compressed Attention (HCA). Manifold-Constrained Hyper-Connections (mHC) thay thế các kết nối dư (residual connections) truyền thống, với hệ số mở rộng là 4 và 20 vòng lặp Sinkhorn-Knopp. Quá trình tiền huấn luyện sử dụng hơn 32 nghìn tỷ token và trình tối ưu hóa Muon. Chỉ số hiệu quả tiêu biểu trong bài báo — 27% FLOPs suy luận đơn token và 10% KV cache so với DeepSeek-V3.2 ở ngữ cảnh 1 triệu token — được áp dụng cho V4-Pro, không phải Flash.

<!– EMBED HERE: dán wordpress-embed.html vào khối Custom HTML –>

Điểm chuẩn (Benchmarks)

Tất cả các số liệu dưới đây đều do DeepSeek báo cáo, lấy từ thẻ mô hình 0731.

Hai điều quan trọng cần lưu ý:

Phục vụ mô hình (Serving)

DSpark được kích hoạt bằng một flag vLLM: --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'. Bài báo về DSpark báo cáo tốc độ tạo văn bản cho mỗi người dùng trên V4-Flash nhanh hơn 60–85% so với baseline MTP-1 ở cùng mức thông lượng tổng hợp.

Không có Jinja chat template. Thay vào đó, DeepSeek cung cấp thư mục encoding/ với các hàm encode_messages và parse_message_from_completion_text. Tham số reasoning_effort nhận các giá trị low, high hoặc max. DeepSeek khuyến nghị temperature = 1.0, top_p = 0.95 cho việc sử dụng tác nhân (agentic) và 1.0 cho các trường hợp khác, với tối đa 384 nghìn token đầu ra ở chế độ high và max.

Những điểm chính cần nhớ

Hãy xem Cập nhật Mô hình trên HF. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? giờ đây bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành Sản phẩm hoặc Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

DeepSeekMô hình AILập trìnhAI AgentCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.