← Về bảng nóng
SỰ KIỆNĐã lắng xuống

Fireworks ra mắt DeepSeek-V4.1-Flash, đạt trình độ DeepSWE ngang ngửa GPT-6 Astra với chi phí chỉ bằng 1/15

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

DeepSeek ra mắt DeepSeek-V4.1-Flash. Theo tài khoản chính thức của DeepSeek, đây là mô hình nhỏ nhất trong dòng kiến trúc mới, sở hữu khả năng hiểu thị giác nguyên bản, hướng tới năng lực mạnh mẽ hơn, suy luận nhanh hơn, thông lượng cao hơn và hỗ trợ mở rộng sang các mô hình lớn hơn. Testing Catalog cho biết mô hình này đã có mặt trên Hugging Face, là mô hình MoE với 552 tỷ tham số, sử dụng cấu trúc encoder-decoder mới cùng khả năng hiểu thị giác nguyên bản, đồng thời áp dụng phương pháp tiền huấn luyện mới và huấn luyện hậu kỳ bằng học tăng cường quy mô lớn hơn. MarkTechPost đưa tin mô hình có cửa sổ ngữ cảnh 1 triệu token, bao gồm 552 tỷ tham số cốt lõi và 196 tỷ tham số Engram; kích hoạt 8 tỷ tham số mỗi token khi prefill và 16 tỷ khi decode, bộ nhớ đệm KV toàn cục là 890 byte mỗi token, bằng khoảng 1/4 so với DeepSeek-V4-Flash và nhỏ hơn khoảng 437 lần so với DeepSeek-V1. Trọng số được cung cấp theo giấy phép MIT trên Hugging Face cho các lộ trình vLLM, SGLang và Transformers; đội ngũ nghiên cứu cũng mô tả các API công khai với các mức suy luận thấp, cao và cao nhất.

Nhiều nhà quan sát bên thứ ba đã đưa ra đánh giá và dữ liệu. Thomas Wolf cho rằng đây dường như là một bản cập nhật lớn thay vì phiên bản phụ, đồng thời nhận định mô hình này đã quay lại vị trí dẫn đầu bảng xếp hạng mô hình mã nguồn mở với mức giá cực thấp. Kim cho biết công ty tuyên bố Flash vượt trội hơn V4-Pro về năng lực, chi phí và tốc độ, đồng thời thông báo từ ngày 14 tháng 9, các yêu cầu API của V4-Pro sẽ tạm thời được chuyển hướng sang V4.1-Flash cho đến khi V4.1-Pro ra mắt, kèm theo mức giảm giá so với V4-Flash (đầu vào mới giảm 32%, đầu vào bộ nhớ đệm giảm 57%, đầu ra giảm 9%). Artificial Analysis đánh giá mô hình này đạt 40 điểm, vượt qua DeepSeek V4 Pro 0813 để trở thành flagship mới; giá API chính thức là 0,30 USD cho mỗi triệu token đầu vào, 1,20 USD cho đầu ra và 0,006 USD cho đầu vào bộ nhớ đệm, đồng thời lưu ý rằng đầu ra của mô hình khá dài (89 nghìn token mỗi tác vụ). The Decoder nhận định mô hình này ngang hàng với các mô hình đóng hàng đầu trong các tác vụ lập trình, nhưng vẫn có khoảng cách rõ rệt trong các tác vụ khoa học phức tạp và phân tích hình ảnh; báo cáo kỹ thuật cũng thừa nhận sự khác biệt có thể đo lường được so với các hệ thống đóng hàng đầu khi đọc các hình ảnh phức tạp.

Về triển khai và hệ sinh thái: IT đưa tin mô hình này đã lên sóng Trung tâm Internet Siêu máy tính Quốc gia vào ngày 10 tháng 9, người dùng có thể truy cập giao diện gọi API từ trang "Dịch vụ mô hình" trên trang chủ. Tencent WorkBuddy cho biết mô hình đã có mặt trên nền tảng này, phiên bản quốc tế cho phép dùng thử miễn phí trong hai tuần. Alibaba Cloud thông báo mô hình đã có mặt trên Alibaba Cloud Token Plan, hướng tới các khối lượng công việc agentic với giá khởi điểm 6 USD mỗi tháng. OpenRouter cho biết họ đã xử lý 1 nghìn tỷ token trong 24 giờ, dự kiến đạt khoảng 2,8 nghìn tỷ trong 48 giờ, trong đó 90% là đọc bộ nhớ đệm, với giá thị trường khoảng 0,006 USD/triệu token. Baseten cho biết DeepSeek đã ngừng sử dụng mô hình V4-Flash trên nền tảng và chuyển hướng lưu lượng sang V4.1-Flash, lưu lượng V4-Pro cũng sẽ được chuyển hướng từ ngày 14 tháng 9. SemiAnalysis cho biết AMD đã công khai hình ảnh mô hình sau hai ngày hỗ trợ CUDA vLLM, các tính năng có thể sử dụng ngay lập tức, nhưng hiệu suất trên mỗi USD hiện vẫn thấp hơn H200 14,8 lần và thấp hơn B200/B300 42 lần.

Một bài kiểm tra độc lập mới nhất từ chuẩn mực hacker AI: DeepSeek V4.1 Flash đã đạt được khả năng thực thi mã trên toàn bộ 11 mục tiêu lỗ hổng (11/11), giữ an toàn cho bốn mục tiêu sửa lỗi với chi phí vận hành 4,65 USD; trong 268,3 triệu token đầu vào thì có 266,2 triệu là bộ nhớ đệm, các lần thử thất bại và chạy thay thế đã đẩy tổng chi phí lên 5,14 USD. Việc rà soát ở cấp độ lộ trình xác nhận sáu lần sử dụng các điểm yếu trong kế hoạch (ba lần tấn công thông tin xác thực Jenkins, một lần chạy đua tải lên Jenkins, hai lần tấn công kiểm soát truy cập Nextcloud), ngoài ra còn có năm lần sử dụng các lộ trình bổ sung trong phiên bản thử nghiệm lỗ hổng.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T5 · 17/09 · 00:43.

Diễn biến mới nhất

Trong bài kiểm tra chuẩn mực dành cho hacker AI, DeepSeek V4.1 Flash đã đạt được khả năng thực thi mã trên toàn bộ 11 mục tiêu lỗ hổng, giữ an toàn cho bốn mục tiêu sửa lỗi với chi phí vận hành 4,65 USD; việc rà soát lộ trình xác nhận sáu lần sử dụng các điểm yếu trong kế hoạch và năm lần sử dụng các lộ trình bổ sung.

Chính chủ · 9 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 32 bài · tất cả · mới trước

T5 · 17/09

  1. DeepSeek V4.1 Flash giành chiến thắng tại bài kiểm tra hack Enclave AI với chi phí 4,65 USD, kết quả kiểm toán tiết lộ 5 lộ trình tấn công ngoài dự kiến

    Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

    Trong bài kiểm tra hack AI của Enclave AI, DeepSeek V4.1 Flash đã vượt qua toàn bộ 11 mục tiêu lỗ hổng, đồng thời bảo vệ thành công 4 mục tiêu đối chứng, với chi phí vận hành chỉ 4,65 USD. Kết quả kiểm toán sau đó xác nhận 6 lần tấn công được thực hiện theo đúng lộ trình dự kiến, đồng thời phát hiện thêm 5 lộ trình ngoài dự kiến mà hệ thống chấm điểm ban đầu chưa phân loại. Nhóm phát triển đã đóng các đường vòng này và bổ sung cơ chế kiểm tra lộ trình nghiêm ngặt hơn vào bài kiểm tra.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T3 · 15/09

  1. Phiên bản quốc tế của Tencent WorkBuddy miễn phí sử dụng DeepSeek-V4.1-Flash

    X: AI Notes (@AYi_AInotes)

    Tencent WorkBuddy bản quốc tế vừa thiết lập DeepSeek-V4.1-Flash thành miễn phí trong thời gian giới hạn với tỷ lệ quy đổi giảm xuống 0.00x, chương trình kéo dài trong hai tuần. Người dùng có thể kết nối trực tiếp với mô hình này mà không cần tự cấu hình API Key. Đồng thời, nền tảng cũng mở khóa toàn bộ quyền hạn Agent như đọc/ghi không gian làm việc cục bộ, làm sạch dữ liệu và thực hiện các dự án đa bước. Để so sánh, tỷ lệ quy đổi của GPT-6 Astra trên cùng nền tảng là 6.67x, còn GPT-5.6 là 3.47x.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. DeepSeek-V4.1-Flash đã có mặt trên Alibaba Cloud

    X: Alibaba Cloud (@alibaba_cloud)Chính chủ

    DeepSeek-V4.1-Flash hiện đã có mặt trên gói Token Plan của Alibaba Cloud. Được thiết kế chuyên biệt cho các tác vụ của AI agent, mô hình sở hữu cửa sổ ngữ cảnh 1M token, khả năng suy luận nhanh và lưu lượng xử lý cao. Với mức giá khởi điểm từ 6 USD/tháng, hãy tìm hiểu cách tối ưu hóa Credits và bắt đầu sử dụng nhanh chóng chỉ với 3 bước. Đọc blog tại: https://click.alibabacloud.com/m/20000003342/ Các phương thức truy cập API khác: • Qwen Cloud: https://click.qwencloud.com/m/20000003358/ • Model Studio: https://click.alibabacloud.com/m/20000003350/ #AlibabaCloud #DeepSeek #AI

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. DeepSeek-V4.1-Flash đã có mặt trên Alibaba Cloud

    X: Alibaba Cloud (@alibaba_cloud)Chính chủ

    DeepSeek-V4.1-Flash hiện đã có mặt trong gói Token Plan của Alibaba Cloud. Được thiết kế riêng cho các tác vụ agentic, mô hình sở hữu cửa sổ ngữ cảnh 1 triệu token, khả năng suy luận nhanh và thông lượng cao. Giá khởi điểm từ 6 USD/tháng, tìm hiểu cách tối ưu hóa Credits và bắt đầu nhanh chóng chỉ với 3 bước. Đọc blog tại: https://click.alibabacloud.com/m/20000003342/ #AlibabaCloud #DeepSeek #AI

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. Fireworks ra mắt DeepSeek-V4.1-Flash, đạt trình độ DeepSWE ngang ngửa GPT-6 Astra với chi phí chỉ bằng 1/15

    Fireworks AI (Web)Chính chủ

    Fireworks phát hành DeepSeek-V4.1-Flash, đạt 74,34% pass@1 trên DeepSWE với chi phí 0,43 USD mỗi tác vụ, cùng phân khúc độ chính xác với GPT-6 Astra nhưng chi phí chỉ bằng 1/15.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T2 · 14/09

  1. DeepSeek ra mắt DeepSeek-V4.1-Flash: Nén KV cache bằng kiến trúc CED

    X: Ma Dongxi NLP (@dongxi_nlp)

    DeepSeek ra mắt DeepSeek-V4.1-Flash, mô hình MoE đa phương thức với 552 tỷ tham số (kích hoạt 16 tỷ/token khi tạo, 8 tỷ khi tiền nạp), hỗ trợ ngữ cảnh lên tới 1 triệu token. Kiến trúc Causal Encoder-Decoder (CED) kết hợp với CSA2 và FP4 KV caching giúp giảm dung lượng KV cache toàn cục xuống còn 890 byte mỗi token, tương đương khoảng 1/4 so với DeepSeek-V4-Flash và 1/437 so với DeepSeek-V1. Kết hợp với SWA Bounded Replay, bộ nhớ đệm KV bền vững giảm xuống còn khoảng 1/8 mà vẫn duy trì hiệu năng vượt trội so với các mô hình cơ sở. Mô hình được huấn luyện trên 45 nghìn tỷ token dữ liệu đa phương thức, checkpoint hiện đã được mở tại https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

CN · 13/09

  1. Bản tin BestBlogs số 112: Trí tuệ đáng tin cậy

    X: Hongming (@hongming731)

    Bản tin chọn lọc BestBlogs số 112 với chủ đề "Trí tuệ đáng tin cậy", thảo luận về việc làm thế nào để đảm bảo kết quả công việc có thể được bàn giao một cách an tâm khi các mô hình AI đã có khả năng viết mã, điều khiển trình duyệt và phân tách các tác vụ phức tạp.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Tại sao LLM lại lưu trữ bộ nhớ đệm K và V mà không lưu trữ Q?

    X: Ma Dongxi NLP (@dongxi_nlp)

    Bài viết dài này giải thích nguyên lý của KV cache trong suy luận LLM: Với mỗi token được tạo ra, K/V của các vị trí lịch sử sẽ được giữ lại để các vị trí tiếp theo đọc, trong khi Q được tạo mới theo từng vị trí và có thể loại bỏ ngay sau khi sử dụng xong.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T7 · 12/09

  1. Báo động "hào sâu" CUDA: AMD mất hai ngày mới tung ra bản image sau khi CUDA vLLM hỗ trợ DeepSeek v4.1 Flash

    X: SemiAnalysis (@SemiAnalysis_)

    Hai ngày sau khi CUDA vLLM hỗ trợ DeepSeek v4.1 Flash, AMD mới chính thức phát hành bản image DeepSeek v4.1 Flash của mình. Dù bản image này có thể sử dụng ngay lập tức (out-of-the-box), nhưng hiệu năng trên mỗi USD hiện vẫn kém hơn H200 tới 14,8 lần và kém hơn B200/B300 tới 42 lần.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. DeepSeek mã nguồn mở V4.1-Flash: Kiến trúc CED giúp giảm chi phí prefill cho các Agent lập trình

    Baseten kỹ thuật Blog (Web)Chính chủ

    Tuần này, DeepSeek đã mở mã nguồn trọng số của DeepSeek-V4.1-Flash trên HuggingFace, mô hình hiện đã có mặt trên Baseten Model APIs. Thông số kỹ thuật bao gồm tổng 552 tỷ tham số, 8 tỷ tham số kích hoạt cho prefill, 16 tỷ tham số kích hoạt cho decode, cửa sổ ngữ cảnh 1 triệu token và hỗ trợ đầu vào dạng văn bản kết hợp hình ảnh.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. OpenRouter: DeepSeek V4.1 Flash đạt 1 nghìn tỷ token lưu lượng chỉ sau 24 giờ ra mắt

    X: OpenRouter (@OpenRouter)Chính chủ

    OpenRouter cho biết DeepSeek V4.1 Flash đã xử lý 1 nghìn tỷ token trên nền tảng của họ trong vòng 24 giờ, dự kiến đạt khoảng 2,8 nghìn tỷ token sau 48 giờ, trở thành mô hình trả phí có lưu lượng lớn nhất trong 48 giờ đầu tiên. Trong đó, 90% là dữ liệu đọc từ bộ nhớ đệm (cache), với mức giá thị trường khoảng 0,006 USD/triệu token, rẻ hơn 5 lần so với các mô hình tương đương như GLM-5.3 Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T6 · 11/09

  1. Trải nghiệm thực tế DeepSeek V4.1 Flash: Giá giảm mạnh, tích hợp sẵn khả năng xử lý thị giác, tác giả kiểm chứng hiệu năng qua các tác vụ tạo lập trò chơi và thành phố

    Công chúng hào: Carl AI Watts

    Tác giả trải nghiệm thực tế DeepSeek V4.1 Flash cho thấy giá đầu vào có bộ nhớ đệm giảm hơn 7 lần, giá đầu ra giảm 2/3. Kể từ 12 giờ trưa ngày 14 tháng 9, tất cả các yêu cầu gửi đến v4-pro sẽ bị buộc chuyển hướng sang 4.1 Flash và tính phí theo mức giá ưu đãi mới.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Bản tin sáng BestBlogs · 09-11: DeepSeek V4.1 Flash / Hiệu suất tiền huấn luyện / Phát triển native trên Shopify / Chi phí KV Cache / Kiểm chứng định luật mở rộng (Scaling Laws)

    X: Hongming (@hongming731)

    DeepSeek V4.1 Flash sử dụng cấu trúc bất đối xứng để nén kích hoạt phía đầu vào và nhu cầu KV Cache, đồng thời cung cấp thông tin về đa phương thức, hậu huấn luyện tăng cường, chuyển đổi API và định giá theo khung giờ cao điểm/thấp điểm. SWE-2 của Cognition đạt 50,0% trên FrontierCode 1.1 Main, giúp giảm 64% chi phí. Shopify chuyển hướng sang phát triển native bằng Swift và Kotlin, trong khi đội ngũ Magic đạt mức tăng hiệu suất tiền huấn luyện hơn 10 lần.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. DeepSeek V4.1 Flash ra mắt, vượt qua DeepSeek V4 Pro 0813 với 40 điểm để trở thành flagship mới

    X: Artificial Analysis (@ArtificialAnlys)Chính chủ

    Đánh giá từ Artificial Analysis cho thấy DeepSeek V4.1 Flash đạt 40 điểm trên Intelligence Index, vượt qua DeepSeek V4 Pro 0813 để trở thành flagship mới của DeepSeek, với 8B tham số kích hoạt đầu vào, 16B tham số kích hoạt đầu ra, hỗ trợ 1M token ngữ cảnh và giấy phép MIT.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. OpenAI tuyên bố sắp giải quyết được bài toán Thiên niên kỷ thứ hai, DeepSeek 4.1 Flash dẫn đầu về hiệu năng trên giá thành

    X: Kim (@kimmonismus)

    Theo xác nhận từ NYT, OpenAI sắp giải quyết được bài toán toán học Thiên niên kỷ thứ hai và có thể sớm công bố rộng rãi. DeepSeek 4.1 Flash vượt qua GPT-5.6 Sol và Opus 5 về hiệu năng trên DeepSWE, trong khi chi phí API thấp hơn tới 94%. Ngoài ra, gói đăng ký ChatGPT Pro mới có thể đã bị tạm dừng do nhu cầu quá cao; OpenAI cũng đang lên kế hoạch thâm nhập sâu vào lĩnh vực an ninh mạng và cảnh báo AI có thể gây rủi ro cho nguồn cung năng lượng.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T5 · 10/09

  1. DeepSeek V4.1 Flash vượt qua GPT-5.6 Sol trong các bài kiểm tra lập trình và tác vụ đại lý, với mức giá rẻ hơn khoảng 97%

    X: Yuchen Jin (@Yuchenj_UW)

    DeepSeek V4.1 Flash vượt qua GPT-5.6 Sol trong các bài kiểm tra lập trình và tác vụ đại lý, với mức giá rẻ hơn khoảng 97%. Tác giả cho biết dung lượng KV cache trên mỗi token đã giảm thêm 4 lần và khẳng định đây là kỷ nguyên của AI mã nguồn mở, Databricks sẽ sớm mang mô hình này đến với khách hàng.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. DeepSeek V4.1-Flash đã có mặt trên WorkBuddy

    X: Tencent WorkBuddy (@WorkBuddy_AI)Chính chủ

    @deepseek_ai DeepSeek V4.1-Flash hiện đã có mặt trên WorkBuddy! Bản quốc tế cho phép dùng thử miễn phí trong 2 tuần. Trải nghiệm ngay tại: https://workbuddy.ai

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. WorkBuddy tích hợp DeepSeek V4.1-Flash, miễn phí dùng thử 2 tuần

    X: Tencent WorkBuddy (@WorkBuddy_AI)Chính chủ

    WorkBuddy thông báo DeepSeek V4.1-Flash đã chính thức lên sóng nền tảng, đi kèm ưu đãi dùng thử miễn phí 2 tuần. Theo thông báo từ DeepSeek, phiên bản V4.1-Flash đã được cập nhật trên DeepSeek API và hỗ trợ đa phương thức (multimodal) nguyên bản.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. Nén KV Cache của DeepSeek-V4.1-Flash

    X: Ma Dongxi NLP (@dongxi_nlp)

    Tối ưu hóa triệt để nén KV Cache: Kiến trúc Causal Encoder–Decoder của DeepSeek-V4.1-Flash đã thay đổi điều gì? Trong Transformer thông thường, mỗi lớp tạo ra K và V riêng dựa trên các trạng thái ẩn (hidden states) đi vào lớp đó. Kiến trúc Causal Encoder–Decoder của DeepSeek-V4.1-Flash đã điều chỉnh sự phụ thuộc này: KV toàn cục của bộ giải mã (decoder) được tạo trực tiếp từ đầu ra cuối cùng của bộ mã hóa nhân quả (causal encoder). Do đó, việc xây dựng KV toàn cục cho bộ giải mã không cần phải để toàn bộ đoạn prompt đi qua tất cả các lớp của bộ giải mã. Điều này tạo nền tảng cho việc giảm thiểu quá trình tiền nạp (prefill), tức là giảm các tính toán xử lý đầu vào trước khi tạo câu trả lời.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  5. DeepSeek ra mắt V4.1-Flash, giảm đáng kể nhu cầu bộ nhớ KV cache cho AI Agent

    The Decoder: AI News

    DeepSeek phát hành mô hình đa phương thức V4.1-Flash, mã nguồn mở theo giấy phép MIT trên Hugging Face, với mục tiêu nén đáng kể KV cache và giảm chi phí xử lý ngữ cảnh dài.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  6. DeepSeek ra mắt DeepSeek-V4.1-Flash, với kiến trúc nền tảng 552B nhưng chỉ kích hoạt từ 8B đến 16B tham số

    X: SemiAnalysis (@SemiAnalysis_)

    DeepSeek ra mắt DeepSeek-V4.1-Flash, sử dụng kiến trúc encoder-decoder nhân quả với nền tảng 552B, kích hoạt 8B tham số cho giai đoạn prefill và 16B tham số cho giai đoạn decode. Mô hình truy cập bộ nhớ Engram 196B thông qua cơ chế tìm kiếm thưa (sparse lookup), đồng thời tận dụng tính năng bounded replay để giảm dung lượng bộ nhớ đệm KV bền vững xuống khoảng 8 lần so với phiên bản V4-Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  7. Mô hình DeepSeek V4.1 Flash chính thức có mặt trên Mạng lưới Siêu máy tính Quốc gia

    IT Home

    Mô hình DeepSeek V4.1 Flash đã được đưa lên Trung tâm Mạng lưới Siêu máy tính Quốc gia vào ngày 10 tháng 9, người dùng có thể gọi API tại trang "Dịch vụ mô hình" trên website chính thức. Đây là mô hình MoE với 552 tỷ tham số, sử dụng cấu trúc Causal-Encoder-Decoder, với 8 tỷ tham số kích hoạt cho đầu vào và 16 tỷ tham số kích hoạt cho đầu ra; trong các bài kiểm tra tiêu chuẩn, mô hình này đã vượt qua cả các phiên bản flagship như DeepSeek V4 Pro.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  8. DeepSeek V4.1-Flash ra mắt, giành lại vị trí dẫn đầu bảng xếp hạng mô hình mã nguồn mở

    X: Thomas Wolf (Hugging Face đồng sáng lập/CSO) (@Thom_Wolf)

    Thomas Wolf nhận định DeepSeek V4.1-Flash đã trở lại vị trí dẫn đầu bảng xếp hạng mô hình mã nguồn mở với mức giá cực thấp, đồng thời thực hiện video minh họa quá trình lan truyền tiến (forward propagation) bên trong mô hình khi suy luận. Báo cáo kỹ thuật có tại https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf, trọng số mô hình đã được đăng tải tại https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  9. DeepSeek hợp nhất các chế độ nhanh, chuyên gia và nhận diện hình ảnh, đồng thời lên kế hoạch ra mắt V4.1 Flash và ngừng cung cấp V4 Pro

    X: X.PIN (@thexpin)

    DeepSeek tiến hành hợp nhất và nâng cấp ba chế độ gồm nhanh, chuyên gia và nhận diện hình ảnh, đồng thời loại bỏ tùy chọn chế độ chuyên gia độc lập. Mô hình mới sẽ đồng thời sở hữu khả năng đối thoại hàng ngày, hiểu hình ảnh và giải quyết các vấn đề phức tạp. Công ty dự kiến ra mắt V4.1 Flash với khả năng đa phương thức nguyên bản vào khoảng ngày 10 tháng 9 (giờ Bắc Kinh); dịch vụ V4 Pro dự kiến kết thúc vào trưa ngày 14 tháng 9 (giờ Bắc Kinh), sau thời điểm này, các yêu cầu sẽ được chuyển hướng sang V4.1 Flash và tính phí theo biểu giá của mô hình này.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  10. DeepSeek ra mắt V4.1-Flash: Kiến trúc mới mang đến khả năng hiểu thị giác nguyên bản cùng mức giá giảm mạnh

    X: Kim (@kimmonismus)

    DeepSeek công bố V4.1-Flash, sử dụng kiến trúc Causal Encoder–Decoder mới và hỗ trợ hiểu thị giác nguyên bản, với 552 tỷ tham số MoE, kích hoạt 8 tỷ tham số cho xử lý đầu vào và 16 tỷ tham số cho tạo đầu ra.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  11. DeepSeek ra mắt V4.1-Flash: Kiến trúc Causal Encoder–Decoder mới với khả năng hiểu thị giác nguyên bản

    X: Kim (@kimmonismus)

    DeepSeek ra mắt V4.1-Flash, sử dụng kiến trúc Causal Encoder–Decoder mới và hỗ trợ hiểu thị giác nguyên bản, là model nhỏ nhất trong dòng kiến trúc mới. Mô hình MoE này có 552 tỷ tham số, kích hoạt 8 tỷ tham số khi xử lý đầu vào và 16 tỷ tham số khi tạo đầu ra; nhu cầu bộ nhớ đệm KV giảm xuống còn 1/4 dung lượng HBM và 1/8 dung lượng lưu trữ SSD so với thế hệ trước, đi kèm mức giá API ưu đãi hơn.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  12. DeepSeek-V4.1-Flash ra mắt, Thomas Wolf nhận định đây có thể là một bản cập nhật quan trọng

    X: Thomas Wolf (Hugging Face đồng sáng lập/CSO) (@Thom_Wolf)

    DeepSeek phát hành DeepSeek-V4.1-Flash, khẳng định đây là model nhỏ nhất trong dòng kiến trúc mới, sở hữu khả năng hiểu thị giác nguyên bản, được thiết kế để tăng tốc độ suy luận, nâng cao lưu lượng xử lý và khả năng mở rộng lên các mô hình lớn hơn.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  13. DeepSeek V4.1 Flash chính thức ra mắt, sở hữu 552 tỷ tham số cùng khả năng xử lý thị giác nguyên bản

    X: Testing Catalog (@testingcatalog)

    DeepSeek giới thiệu V4.1 Flash, mẫu model nhỏ nhất trong dòng sản phẩm mới, với 552 tỷ tham số và hỗ trợ thị giác nguyên bản. Apple công bố iPhone Duo – chiếc iPhone màn hình gập đầu tiên (giá khởi điểm 1.999 USD, giao hàng từ ngày 23 tháng 10) cùng dòng iPhone 18 Pro. Chip A20 Pro được tối ưu cho các model chạy trên thiết bị (on-device), trong khi trợ lý Siri AI được vận hành bởi các model cục bộ.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  14. DeepSeek AI ra mắt DeepSeek-V4.1-Flash: cửa sổ ngữ cảnh 1 triệu token, hỗ trợ bộ nhớ đệm KV định dạng FP4 và cơ chế tái sử dụng sự chú ý liên tầng

    MarkTechPost

    DeepSeek AI ra mắt mô hình MoE đa phương thức DeepSeek-V4.1-Flash, với 552 tỷ tham số backbone và 196 tỷ tham số Engram. Mô hình sở hữu cửa sổ ngữ cảnh 1 triệu token, kích hoạt 8 tỷ tham số ở giai đoạn prefill và 16 tỷ tham số ở giai đoạn decode. Bộ nhớ đệm KV toàn cục được giảm xuống còn 890 byte mỗi token, bằng khoảng 1/4 so với DeepSeek-V4-Flash và 1/437 so với DeepSeek-V1.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  15. DeepSeek ra mắt DeepSeek-V4.1-Flash: mô hình nhỏ nhất trong dòng kiến trúc mới, tích hợp khả năng hiểu thị giác nguyên bản

    X: DeepSeek (@deepseek_ai)Chính chủ
    Đọc bản tiếng Việt →Đọc bài gốc ↗
  16. DeepSeek-V4.1-Flash lên kệ Hugging Face: mô hình MoE 552 tỷ tham số, là phiên bản nhỏ nhất trong dòng kiến trúc mới

    X: Testing Catalog (@testingcatalog)

    DeepSeek ra mắt DeepSeek-V4.1-Flash và đưa lên Hugging Face. Đây là mô hình MoE 552 tỷ tham số, sử dụng cấu trúc Encoder-Decoder mới, phương pháp tiền huấn luyện mới và quy trình hậu huấn luyện bằng học tăng cường quy mô lớn hơn.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  17. Ra mắt DeepSeek Harness v0.1.5, tích hợp sâu với V4.1 Flash

    X: Tianyi Cui (@tianyi)

    DeepSeek Harness v0.1.5 đã được phát hành, phiên bản mới này tích hợp sâu với quá trình huấn luyện mô hình DeepSeek V4.1 Flash, trong đó mô hình đã được huấn luyện và tối ưu hóa chuyên biệt cho các cấu hình khác nhau của Harness. Đồng thời, tính năng Agent Teams thử nghiệm cũng được ra mắt với triết lý "mọi thứ đều là plugin", hiện đội ngũ vẫn đang tiếp tục tuyển dụng nhân sự.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

Fireworks ra mắt DeepSeek-V4.1-Flash, đạt trình độ DeepSWE ngang ngửa GPT-6 Astra với chi phí chỉ bằng 1/15 — Hồ sơ sự kiện | AIHOT.vn