← Về bảng nóng
SỰ KIỆNĐã lắng xuống

DeepSeek V4.1 Flash hiện đã có mặt trên Hugging Face, là mô hình MoE với 552 tỷ tham số, sử dụng cấu trúc encoder-decoder mới cùng khả năng hiểu thị giác nguyên bản

Tổng quan sự kiện

Tóm tắt sự kiện · Tổng hợp tự động

DeepSeek ra mắt DeepSeek-V4.1-Flash và đưa lên Hugging Face. Đây là mô hình MoE 552 tỷ tham số, sử dụng cấu trúc Encoder-Decoder mới, phương pháp tiền huấn luyện mới và quy trình hậu huấn luyện bằng học tăng cường quy mô lớn hơn.

Dựng tự động từ bài đưa tin sớm nhất (X: Testing Catalog (@testingcatalog)); xem dòng thời gian bên dưới để nắm diễn biến.

Diễn biến mới nhất

DeepSeek AI ra mắt DeepSeek-V4.1-Flash: cửa sổ ngữ cảnh 1 triệu token, hỗ trợ bộ nhớ đệm KV định dạng FP4 và cơ chế tái sử dụng sự chú ý liên tầng (cross-layer attention reuse).

Chính chủ · 1 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 3 bài · tất cả · mới trước

T5 · 10/09

  1. DeepSeek AI ra mắt DeepSeek-V4.1-Flash: cửa sổ ngữ cảnh 1 triệu token, hỗ trợ bộ nhớ đệm KV định dạng FP4 và cơ chế tái sử dụng sự chú ý liên tầng

    MarkTechPost

    DeepSeek AI ra mắt mô hình MoE đa phương thức DeepSeek-V4.1-Flash, với 552 tỷ tham số backbone và 196 tỷ tham số Engram. Mô hình sở hữu cửa sổ ngữ cảnh 1 triệu token, kích hoạt 8 tỷ tham số ở giai đoạn prefill và 16 tỷ tham số ở giai đoạn decode. Bộ nhớ đệm KV toàn cục được giảm xuống còn 890 byte mỗi token, bằng khoảng 1/4 so với DeepSeek-V4-Flash và 1/437 so với DeepSeek-V1.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. DeepSeek ra mắt DeepSeek-V4.1-Flash: mô hình nhỏ nhất trong dòng kiến trúc mới, tích hợp khả năng hiểu thị giác nguyên bản

    X: DeepSeek (@deepseek_ai)Chính chủ
    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. DeepSeek-V4.1-Flash lên kệ Hugging Face: mô hình MoE 552 tỷ tham số, là phiên bản nhỏ nhất trong dòng kiến trúc mới

    X: Testing Catalog (@testingcatalog)

    DeepSeek ra mắt DeepSeek-V4.1-Flash và đưa lên Hugging Face. Đây là mô hình MoE 552 tỷ tham số, sử dụng cấu trúc Encoder-Decoder mới, phương pháp tiền huấn luyện mới và quy trình hậu huấn luyện bằng học tăng cường quy mô lớn hơn.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

DeepSeek V4.1 Flash hiện đã có mặt trên Hugging Face, là mô hình MoE với 552 tỷ tham số, sử dụng cấu trúc encoder-decoder mới cùng khả năng hiểu thị giác nguyên bản — Hồ sơ sự kiện | AIHOT.vn