SGLang ra mắt Weight Cache Daemon
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Đội ngũ SGLang đã giới thiệu Weight Cache Daemon, sử dụng cơ chế ánh xạ không sao chép (zero-copy) CUDA IPC để giảm thời gian tải trọng số mô hình từ khoảng 495 giây xuống còn khoảng 0,63 giây, tăng tốc khoảng 785 lần và giảm 93,9% thời gian khởi động toàn trình.
Trình quản lý này duy trì các trọng số đã được lượng tử hóa trong bộ nhớ GPU, hỗ trợ chia sẻ giữa nhiều thực thể và chuyển đổi dự phòng dưới một giây, đây là giai đoạn đầu tiên của Khung phục hồi công cụ nhanh (Fast Engine Recovery Framework).
Ant Group Bailing công bố trình quản lý này cho SGLang vào ngày 22 tháng 8 năm 2026. Với mô hình Ling-2.6-1T FP8, thời gian tải trọng số đạt khoảng 0,63 giây, nhanh hơn khoảng 780 lần so với tải từ ổ đĩa, giúp tổng thời gian khởi động công cụ giảm từ 8,8 phút xuống còn khoảng 0,53 phút.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 22/08 · 12:31.
Diễn biến mới nhất
Ant Group Bailing thông báo ra mắt trình quản lý bộ nhớ đệm trọng số (Weight Cache Daemon) cho SGLang, giúp rút ngắn thời gian khởi động xuống còn 0,53 phút.
Chính chủ · 2 bài
Nghe trực tiếp từ bên liên quan
- X: Ant Ling (@AntLingAGI)Ant Group Bailing ra mắt Weight Cache Daemon cho SGLang
- LMSYS: Blog (nhóm Chatbot Arena)SGLang ra mắt Weight Cache Daemon, hiện thực hóa việc khởi động lại engine trong chưa đầy một giây
Dòng thời gian đưa tin
Đang hiện 2 bài · tất cả · mới trước
T7 · 22/08
Ant Group Bailing ra mắt Weight Cache Daemon cho SGLang
X: Ant Ling (@AntLingAGI)Chính chủHôm nay, chúng tôi chính thức ra mắt Weight Cache Daemon cho SGLang. 🚀 Trên mô hình Ling-2.6-1T FP8, công cụ này giúp rút ngắn thời gian tải trọng số xuống còn khoảng 0,63 giây, nhanh hơn khoảng 780 lần so với tải từ ổ cứng, đồng thời giảm tổng thời gian khởi động engine từ 8,8 phút xuống còn khoảng 0,53 phút. Dưới đây là cơ chế hoạt động của nó.
SGLang ra mắt Weight Cache Daemon, hiện thực hóa việc khởi động lại engine trong chưa đầy một giây
LMSYS: Blog (nhóm Chatbot Arena)Chính chủĐội ngũ SGLang vừa ra mắt Weight Cache Daemon, giúp giảm thời gian tải trọng số mô hình từ khoảng 495 giây xuống còn khoảng 0,63 giây (tăng tốc khoảng 785 lần) thông qua cơ chế ánh xạ không sao chép (zero-copy) CUDA IPC, qua đó giảm 93,9% thời gian khởi động toàn trình. Daemon này duy trì các trọng số đã được lượng tử hóa trong bộ nhớ GPU, hỗ trợ chia sẻ giữa nhiều instance và chuyển đổi dự phòng trong chưa đầy một giây. Đây là giai đoạn đầu tiên của Fast Engine Recovery Framework.