← Về bảng nóng
SỰ KIỆNĐã lắng xuống

SGLang ra mắt Weight Cache Daemon

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

Đội ngũ SGLang đã giới thiệu Weight Cache Daemon, sử dụng cơ chế ánh xạ không sao chép (zero-copy) CUDA IPC để giảm thời gian tải trọng số mô hình từ khoảng 495 giây xuống còn khoảng 0,63 giây, tăng tốc khoảng 785 lần và giảm 93,9% thời gian khởi động toàn trình.

Trình quản lý này duy trì các trọng số đã được lượng tử hóa trong bộ nhớ GPU, hỗ trợ chia sẻ giữa nhiều thực thể và chuyển đổi dự phòng dưới một giây, đây là giai đoạn đầu tiên của Khung phục hồi công cụ nhanh (Fast Engine Recovery Framework).

Ant Group Bailing công bố trình quản lý này cho SGLang vào ngày 22 tháng 8 năm 2026. Với mô hình Ling-2.6-1T FP8, thời gian tải trọng số đạt khoảng 0,63 giây, nhanh hơn khoảng 780 lần so với tải từ ổ đĩa, giúp tổng thời gian khởi động công cụ giảm từ 8,8 phút xuống còn khoảng 0,53 phút.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 22/08 · 12:31.

Diễn biến mới nhất

Ant Group Bailing thông báo ra mắt trình quản lý bộ nhớ đệm trọng số (Weight Cache Daemon) cho SGLang, giúp rút ngắn thời gian khởi động xuống còn 0,53 phút.

Chính chủ · 2 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 2 bài · tất cả · mới trước

T7 · 22/08

  1. Ant Group Bailing ra mắt Weight Cache Daemon cho SGLang

    X: Ant Ling (@AntLingAGI)Chính chủ

    Hôm nay, chúng tôi chính thức ra mắt Weight Cache Daemon cho SGLang. 🚀 Trên mô hình Ling-2.6-1T FP8, công cụ này giúp rút ngắn thời gian tải trọng số xuống còn khoảng 0,63 giây, nhanh hơn khoảng 780 lần so với tải từ ổ cứng, đồng thời giảm tổng thời gian khởi động engine từ 8,8 phút xuống còn khoảng 0,53 phút. Dưới đây là cơ chế hoạt động của nó.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. SGLang ra mắt Weight Cache Daemon, hiện thực hóa việc khởi động lại engine trong chưa đầy một giây

    LMSYS: Blog (nhóm Chatbot Arena)Chính chủ

    Đội ngũ SGLang vừa ra mắt Weight Cache Daemon, giúp giảm thời gian tải trọng số mô hình từ khoảng 495 giây xuống còn khoảng 0,63 giây (tăng tốc khoảng 785 lần) thông qua cơ chế ánh xạ không sao chép (zero-copy) CUDA IPC, qua đó giảm 93,9% thời gian khởi động toàn trình. Daemon này duy trì các trọng số đã được lượng tử hóa trong bộ nhớ GPU, hỗ trợ chia sẻ giữa nhiều instance và chuyển đổi dự phòng trong chưa đầy một giây. Đây là giai đoạn đầu tiên của Fast Engine Recovery Framework.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

SGLang ra mắt Weight Cache Daemon — Hồ sơ sự kiện | AIHOT.vn