26/09

Thứ Bảy · 1 tin
QbitAI
NgànhĐiểm AI 92/100

Tinh chọnGoogle TPU chạy Kimi nhanh hơn 57% so với GPU NVIDIA nhờ khung suy luận DeepSeek

Đội ngũ đứng sau vLLM vừa công bố bước đột phá khi tối ưu hóa khung suy luận DeepSeek, giúp Google TPU vượt mặt GPU NVIDIA với hiệu suất tăng 57% khi vận hành mô hình Kimi.


Vì sao đáng đọc: Tin tức kỹ thuật quan trọng về tối ưu hóa hạ tầng AI, thách thức sự thống trị của NVIDIA và mở ra tiềm năng lớn cho việc sử dụng TPU trong suy luận mô hình ngôn ngữ lớn.

25/09

Thứ Sáu · 1 tin
vLLM Blog chính thức
Sản phẩmĐiểm AI 66/100

Tinh chọnvLLM tích hợp tính năng đóng dấu bản quyền văn bản không mất dữ liệu bằng Gumbel-max

vLLM vừa bổ sung thuật toán Gumbel-max vào pipeline lấy mẫu của Model Runner v2, cho phép đóng dấu bản quyền văn bản mà không làm giảm chất lượng, đồng thời hỗ trợ giải mã suy đoán và duy trì tính đa dạng của nội dung.


Vì sao đáng đọc: Bài viết cung cấp nguyên lý thuật toán đóng dấu bản quyền, phương án khóa kép và khử trùng lặp cùng dữ liệu thông lượng thực tế, giúp độc giả đánh giá tính khả thi và chi phí khi kích hoạt watermark trong môi trường sản xuất.

24/09

Thứ Năm · 1 tin
SemiAnalysis@SemiAnalysis_
Hướng dẫnĐiểm AI 54/100

TPUv7 đạt 700 tok/s với Kimi K3: Vượt GB200 NVL72 tới 56% nhờ tối ưu hóa megakernel

ALERT ALERT ALERT 🚨 🚨 🚨 VLLM MAINTAINERS HAVE JUST SHOWN THAT TPUv7 CAN GET 700 tok/s/user, 56% …

DịchCác nhà phát triển vLLM công bố TPUv7 đạt tốc độ 700 tok/s/user trên mô hình Kimi K3 sau khi tối ưu megakernel, vượt trội 56% so với hệ thống GB200 NVL72. Kết quả này cho thấy tiềm năng lớn từ việc tối ưu hóa phần mềm cho hạ tầng TPU.

23/09

Thứ Tư · 2 tin
vLLM Blog chính thức
Sản phẩmĐiểm AI 73/100

Tinh chọnvLLM ra mắt vllm-metal v0.28.0: Hỗ trợ phục vụ suy luận đồng thời trên Apple Silicon

vLLM chính thức phát hành vllm-metal v0.28.0, mang bộ lập lịch V1, paged KV cache và server tương thích OpenAI lên chip Apple Silicon thông qua MLX và Metal.


Vì sao đáng đọc: Lần đầu tiên chính thức phát hành vllm-metal, sử dụng packed varlen attention và paged KV để giải quyết vấn đề dịch vụ yêu cầu đồng thời trên Mac, đồng thời cung cấp dữ liệu chuẩn mực đồng thời có thể tái lập.

21/09

Thứ Hai · 1 tin

20/09

Chủ Nhật · 1 tin
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 62/100

Cùng sự kiệnAlibaba ra mắt Qwen-Image-2.1: Mô hình tạo và chỉnh sửa ảnh tích hợp, hỗ trợ vLLM-Omni ngay từ ngày đầu

Thanks @vllm_project for the day-0 support! 🙌 Generate, edit, transparent output - one model, ready…

DịchQwen-Image-2.1 kết hợp kiến trúc 7.1B DiT và Qwen3-VL-8B, cho phép tạo, chỉnh sửa và xuất ảnh trong suốt trong cùng một mô hình. Người dùng có thể triển khai ngay với sự hỗ trợ từ vLLM-Omni.

Cùng sự kiện, tinh chọn hiển thị «Alibaba ra mắt Qwen-Image-2.1: Mô hình 7B tích hợp tạo và chỉnh sửa ảnh trong một checkpoint»

19/09

Thứ Bảy · 1 tin
NVIDIA Technical Blog: Agentic AI / Generative AI
Hướng dẫnĐiểm AI 58/100

NVIDIA ra mắt AIPerf: Công cụ đo lường hiệu năng suy luận LLM quy mô lớn trên vLLM

NVIDIA giới thiệu AIPerf, phiên bản nâng cấp của GenAI-Perf với kiến trúc đa tiến trình giúp loại bỏ nút thắt cổ chai khi đo lường hiệu năng. Công cụ hỗ trợ đa dạng mô hình truy vấn và các kịch bản tải thực tế, tối ưu cho việc kiểm thử hệ thống LLM quy mô lớn.

18/09

Thứ Sáu · 2 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 37/100

vLLM và bài toán kiểm soát chất lượng trên hạ tầng AMD

Great blog from Kevin Lu at @vllm_project about quality control at the inference engine. Unfortunate…

DịchBài viết từ SemiAnalysis chỉ ra rằng sự thiếu hụt hạ tầng kiểm thử ổn định cho AMD khiến chất lượng phần mềm vLLM trên nền tảng này kém xa so với CUDA, gây ra tình trạng gián đoạn CI thường xuyên.

16/09

Thứ Tư · 2 tin

14/09

Thứ Hai · 1 tin
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

inclusionAI ra mắt SingProbe: Công cụ kiểm soát an toàn mô hình AI siêu nhẹ

SingProbe là công cụ kiểm soát an toàn dựa trên mô hình Gemma-4-26B, với tham số chỉ 5.67M giúp tối ưu hóa hiệu suất mà không làm chậm quá trình suy luận. Công cụ này hỗ trợ phát hiện ảo tưởng và rủi ro bảo mật, tương thích tốt với SGLang và vLLM.

13/09

Chủ Nhật · 1 tin
JiQiZhiXin
NgànhĐiểm AI 92/100

Tinh chọnTối ưu hóa MiniMax H3 trên vLLM-Omni: Đột phá tốc độ tạo video thời gian thực

Bài viết phân tích cách vLLM-Omni và FastVideo FastH3 giải quyết các nút thắt hệ thống trong MiniMax H3, giúp rút ngắn thời gian tạo video 10 giây xuống dưới 9 giây thông qua tối ưu hóa toàn diện từ DiT đến đóng gói MP4.


Vì sao đáng đọc: Nội dung chuyên sâu về kỹ thuật tối ưu hóa hạ tầng cho mô hình video tạo sinh, giải quyết bài toán thực tế về độ trễ hệ thống, rất có giá trị cho kỹ sư AI.

12/09

Thứ Bảy · 1 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 40/100

NVIDIA vLLM hỗ trợ DeepSeek-V4.1 Flash ngay ngày đầu ra mắt

On the Day 0 release of DeepSeekv4.1 Flash, NVIDIA vLLM works out of the box with zero issues across…

DịchNVIDIA vLLM đã hỗ trợ hoàn hảo cho cả 6 dòng chip từ H100 đến GB300 ngay khi DeepSeek-V4.1 Flash vừa trình làng, trong khi phía AMD vẫn chưa thể vận hành mô hình này.

11/09

Thứ Sáu · 1 tin

09/09

Thứ Tư · 1 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 44/100

vLLM cập nhật hỗ trợ DSpark kết hợp song song hóa đường ống (Pipeline Parallelism)

Spec Decoding (DSpark) finally works with Pipeline Parallelism in vLLM!! 🔥 A lot of the GPU poor/pr…

DịchvLLM hiện đã cho phép DSpark hoạt động cùng Pipeline Parallelism, giúp các mô hình siêu lớn (như Kimi K3 2.8T) tận dụng được khả năng suy luận dự đoán ngay cả khi phải chia nhỏ trọng số trên nhiều máy.

08/09

Thứ Ba · 4 tin
vLLM Blog chính thức
Hướng dẫnĐiểm AI 63/100

Tinh chọnvLLM kết hợp AgentX: Tối ưu hóa toàn diện cho các tác vụ suy luận AI Agent thực tế

Đội ngũ vLLM công bố tối ưu hóa hiệu suất cho các tác vụ AI Agent, đạt tốc độ ấn tượng 83K tokens/giây trên mỗi GPU với mô hình DeepSeek V4 Pro dựa trên chuẩn AgentX.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tăng tốc độ xử lý cho các hệ thống AI Agent, rất hữu ích cho các kỹ sư và nhà phát triển ứng dụng LLM.
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 54/100

OpenBMB ra mắt MiniCPM5-2B: Mô hình 2.6B mạnh mẽ với khả năng suy luận linh hoạt

Thank you @vllm_project for the day-0 support 🙌

DịchOpenBMB vừa trình làng MiniCPM5-2B, mô hình 2.6B hỗ trợ ngữ cảnh 131K và linh hoạt chuyển đổi giữa chế độ suy luận (Think) và phản hồi trực tiếp. Đặc biệt, mô hình đã được hỗ trợ chính thức ngay từ ngày đầu trên vLLM, giúp tối ưu hóa hiệu suất triển khai.

05/09

Thứ Bảy · 1 tin
Aravind Srinivas (Perplexity CEO)@AravSrinivas
Sản phẩmĐiểm AI 36/100

Perplexity ra mắt kiến trúc mô hình pplx-embed: Tối ưu độ trễ vượt trội so với vLLM

Join us if you want to work on hard inference and infrastructure engineering problems!

DịchPerplexity vừa công bố kiến trúc phục vụ mô hình pplx-embed, giúp tăng tốc đáng kể các tác vụ embedding và reranking trên quy mô dữ liệu khổng lồ, vượt xa hiệu năng của vLLM.

04/09

Thứ Sáu · 1 tin

02/09

Thứ Tư · 2 tin
MiniMax@MiniMax_AI
Sản phẩmĐiểm AI 52/100

MiniMax đạt tốc độ tạo video 10 giây chỉ trong 8,7 giây nhờ công nghệ mới

This is what open-source intelligence is for. Built on vLLM-Omni and @haoailab's FastH3, with @NVID…

DịchMiniMax vừa công bố bước tiến đột phá khi kết hợp vLLM-Omni và FastH3, cho phép tạo video 10,1 giây kèm âm thanh đồng bộ chỉ trong 8,7 giây, đạt tốc độ nhanh hơn thời gian phát thực tế.

Sky Computing Lab@haoailab
Sản phẩmĐiểm AI 50/100

FastVideo FastH3 Dense: Tạo video 10 giây kèm âm thanh chỉ trong 8.7 giây trên vLLM-Omni

Checkout FastVideo's FastH3 Dense served on @vllm_project vLLM-Omni! This is the power of open sourc…

DịchĐội ngũ FastVideo tích hợp FastH3 Dense vào vLLM-Omni, cho phép tạo video 10.1 giây kèm âm thanh đồng bộ với tốc độ nhanh hơn thời gian thực. Dự án đã mở mã nguồn với sự hỗ trợ tối ưu hóa từ NVIDIA.

30/08

Chủ Nhật · 1 tin

29/08

Thứ Bảy · 1 tin

27/08

Thứ Năm · 1 tin
Ma Dongxi NLP@dongxi_nlp
Hướng dẫnĐiểm AI 51/100

Hướng dẫn thiết lập môi trường Machine Learning trên DGX Spark

I've put together an up-to-date, validated DGX Spark setup for ML experiments such as post-training: …

DịchHướng dẫn cấu hình tối ưu cho DGX Spark bao gồm PyTorch 2.13 trên CUDA 13, nhân huấn luyện đã kiểm chứng qua GB10 và môi trường vLLM biệt lập, giúp tăng hiệu suất cho các thử nghiệm hậu huấn luyện.

26/08

Thứ Tư · 2 tin
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnQwen3.8-Flash-Next chính thức được hỗ trợ trên vLLM ngay từ ngày ra mắt

Amazing! 🥳 Thanks @vllm_project for getting Qwen3.8-Flash-Next running on NVIDIA and AMD from day 0…

DịchMô hình đa phương thức MoE Qwen3.8-Flash-Next với 125B tham số đã được vLLM hỗ trợ trên cả GPU NVIDIA và AMD. Người dùng có thể trải nghiệm ngay khả năng xử lý ngữ cảnh lên tới 1 triệu token thông qua phiên bản vLLM mới nhất.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»

25/08

Thứ Ba · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 49/100

Cảnh báo: Mô hình ngôn ngữ lớn (LLM) có thể chiếm quyền điều khiển máy chủ qua lỗ hổng suy luận

Các mô hình AI độc hại có thể khai thác lỗ hổng trong các công cụ suy luận như vLLM để thực thi mã tùy ý trên máy chủ. Việc phổ biến các mô hình mã nguồn mở đang làm gia tăng đáng kể rủi ro bảo mật này.

22/08

Thứ Bảy · 1 tin

13/08

Thứ Năm · 1 tin
Tổng 33 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (58 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “vLLM” | AIHOT.vn