DeepSeek mã nguồn mở V4.1-Flash: Kiến trúc CED giúp giảm chi phí prefill cho các Agent lập trình
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
DeepSeek đã ra mắt mô hình V4.1 Flash vào ngày 10 tháng 9. Đây là mô hình MoE với 552 tỷ tham số, sở hữu khả năng hiểu thị giác đa phương thức nguyên bản. Công ty tuyên bố mô hình này vượt qua các phiên bản flagship trước đó, bao gồm cả V4 Pro, về hiệu năng, chi phí và tốc độ. V4.1 Flash sử dụng cấu trúc Causal Encoder Decoder với đầu vào và đầu ra không đối xứng; quy mô kích hoạt ở phía đầu vào là 8 tỷ tham số và phía đầu ra là 16 tỷ tham số. Bằng cách cắt giảm KV Cache, mô hình đã giảm đáng kể chi phí suy luận: theo thông báo, nhu cầu HBM giảm xuống còn 1/4 và nhu cầu SSD giảm xuống còn 1/8.
DeepSeek ban đầu dự kiến ngừng dịch vụ V4 Pro vào trưa ngày 14 tháng 9 (giờ Bắc Kinh) và tạm thời chuyển hướng các yêu cầu API của V4 Pro sang V4.1 Flash, áp dụng mức phí của mô hình mới. Tuy nhiên, để đáp ứng nhu cầu từ người dùng, công ty sau đó đã thông báo sẽ tiếp tục cung cấp dịch vụ gọi API V4 Pro sau ngày 14 tháng 9 với phương thức tính phí không đổi. Đồng thời, DeepSeek đã ngừng hoạt động mô hình V4-Flash trên nền tảng của mình và chuyển hướng lưu lượng truy cập sang V4.1-Flash.
Về hỗ trợ hệ sinh thái, DeepSeek đã mở mã nguồn các kho lưu trữ mới nhằm đơn giản hóa việc triển khai V4.1 Flash cũng như các mô hình mã nguồn mở trong tương lai. Các nền tảng bên thứ ba như SiliconFlow và Baseten đã nhanh chóng tích hợp V4.1 Flash ngay sau khi mô hình được công bố. SiliconFlow cũng thông báo tiếp tục hỗ trợ các phiên bản cũ như V4 Pro 0813, V4 Pro (0424) và V4 Flash 0731; người dùng có thể sử dụng phương thức BYOK với API key hiện có để duy trì các luồng công việc cũ.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới CN · 13/09 · 06:17.
Diễn biến mới nhất
Blog kỹ thuật của Baseten xác nhận DeepSeek đã chuyển hướng lưu lượng truy cập của V4-Pro sang V4.1-Flash kể từ ngày 14 tháng 9.
Chính chủ · 3 bài
Nghe trực tiếp từ bên liên quan
- Baseten kỹ thuật Blog (Web)DeepSeek mã nguồn mở V4.1-Flash: Kiến trúc CED giúp giảm chi phí prefill cho các Agent lập trình
- X: SiliconFlow (@SiliconFlowAI)SiliconFlow tiếp tục hỗ trợ DeepSeek V4 Flash và V4 Pro
Dòng thời gian đưa tin
Đang hiện 8 bài · tất cả · mới trước
T7 · 12/09
DeepSeek mã nguồn mở V4.1-Flash: Kiến trúc CED giúp giảm chi phí prefill cho các Agent lập trình
Baseten kỹ thuật Blog (Web)Chính chủTuần này, DeepSeek đã mở mã nguồn trọng số của DeepSeek-V4.1-Flash trên HuggingFace, mô hình hiện đã có mặt trên Baseten Model APIs. Thông số kỹ thuật bao gồm tổng 552 tỷ tham số, 8 tỷ tham số kích hoạt cho prefill, 16 tỷ tham số kích hoạt cho decode, cửa sổ ngữ cảnh 1 triệu token và hỗ trợ đầu vào dạng văn bản kết hợp hình ảnh.
T6 · 11/09
SiliconFlow tiếp tục hỗ trợ DeepSeek V4 Flash và V4 Pro
X: SiliconFlow (@SiliconFlowAI)Chính chủSiliconFlow thông báo tiếp tục cung cấp các mô hình DeepSeek V4 nguyên bản. Mặc dù V4 Flash đã ngừng hoạt động và V4 Pro dự kiến ngừng hoạt động vào ngày 14 tháng 9, nhưng các phiên bản V4 Pro 0813, V4 Pro (0424) và V4 Flash 0731 vẫn có thể được gọi trên nền tảng này. Người dùng có thể duy trì quy trình làm việc hiện tại bằng cách sử dụng phương thức BYOK với khóa API của SiliconFlow để chọn các phiên bản V4 Flash/V4 Pro nguyên bản.
DeepSeek thông báo tiếp tục cung cấp API V4 Pro, hủy bỏ kế hoạch ngừng dịch vụ vào ngày 14/9
IT HomeDeepSeek thông báo sẽ tiếp tục cung cấp dịch vụ gọi API cho DeepSeek V4 Pro sau ngày 14/9/2026 với phương thức tính phí không đổi. Trước đó, DeepSeek từng có kế hoạch chuyển toàn bộ yêu cầu V4 Pro sang V4.1 Flash và tính phí theo đơn giá của mô hình mới, sau đó thông báo hoãn thời điểm ngừng dịch vụ đến 12:00 ngày 14/9. Giá cho mỗi triệu token đầu ra của V4 Pro vào giờ cao điểm là 27,0 nhân dân tệ.
Ra mắt DeepSeek V4.1 Flash: KV Cache thu nhỏ 437 lần
X: Hongming (@hongming731)DeepSeek ra mắt mô hình MoE 552B tham số V4.1 Flash, sử dụng cấu trúc Causal Encoder Decoder với đầu vào và đầu ra bất đối xứng, kích hoạt 8B tham số đầu vào và 16B tham số đầu ra, hỗ trợ nguyên bản khả năng hiểu thị giác đa phương thức.
T5 · 10/09
DeepSeek-V4.1-Flash đã có mặt trên SiliconFlow, mô hình MoE 552B hỗ trợ cửa sổ ngữ cảnh 1 triệu token
X: SiliconFlow (@SiliconFlowAI)Chính chủSiliconFlow thông báo DeepSeek-V4.1-Flash đã được tích hợp lên nền tảng của họ ngay trong ngày ra mắt (Day 0). Đây là mô hình MoE 552B với khoảng 8 tỷ tham số kích hoạt cho quá trình prefill và khoảng 16 tỷ tham số kích hoạt cho quá trình decode. Mô hình hỗ trợ thị giác máy tính nguyên bản, cửa sổ ngữ cảnh 1 triệu token, mức tiêu thụ bộ nhớ đệm KV chỉ bằng 1/4 so với bản V4 Flash và được phát hành theo giấy phép MIT.
DeepSeek ra mắt kho lưu trữ mã nguồn mở mới hỗ trợ triển khai V4.1 Flash
X: Tianyi Cui (@tianyi)DeepSeek vừa công bố một số kho lưu trữ mã nguồn mở mới, giúp việc triển khai V4.1 Flash cũng như các mô hình mã nguồn mở trong tương lai trở nên dễ dàng hơn: https://github.com/deepseek-ai/deepseek-recipe https://github.com/deepseek-ai/DeepSelect https://github.com/deepseek-ai/DeepJIT
DeepSeek hợp nhất các chế độ nhanh, chuyên gia và nhận diện hình ảnh, đồng thời lên kế hoạch ra mắt V4.1 Flash và ngừng cung cấp V4 Pro
X: X.PIN (@thexpin)DeepSeek tiến hành hợp nhất và nâng cấp ba chế độ gồm nhanh, chuyên gia và nhận diện hình ảnh, đồng thời loại bỏ tùy chọn chế độ chuyên gia độc lập. Mô hình mới sẽ đồng thời sở hữu khả năng đối thoại hàng ngày, hiểu hình ảnh và giải quyết các vấn đề phức tạp. Công ty dự kiến ra mắt V4.1 Flash với khả năng đa phương thức nguyên bản vào khoảng ngày 10 tháng 9 (giờ Bắc Kinh); dịch vụ V4 Pro dự kiến kết thúc vào trưa ngày 14 tháng 9 (giờ Bắc Kinh), sau thời điểm này, các yêu cầu sẽ được chuyển hướng sang V4.1 Flash và tính phí theo biểu giá của mô hình này.
DeepSeek ra mắt V4.1-Flash: Kiến trúc Causal Encoder–Decoder mới với khả năng hiểu thị giác nguyên bản
X: Kim (@kimmonismus)DeepSeek ra mắt V4.1-Flash, sử dụng kiến trúc Causal Encoder–Decoder mới và hỗ trợ hiểu thị giác nguyên bản, là model nhỏ nhất trong dòng kiến trúc mới. Mô hình MoE này có 552 tỷ tham số, kích hoạt 8 tỷ tham số khi xử lý đầu vào và 16 tỷ tham số khi tạo đầu ra; nhu cầu bộ nhớ đệm KV giảm xuống còn 1/4 dung lượng HBM và 1/8 dung lượng lưu trữ SSD so với thế hệ trước, đi kèm mức giá API ưu đãi hơn.