Tại HUAWEI CONNECT 2026, Huawei giới thiệu OceanStor M900, hệ thống lưu trữ Context Memory cho SuperPoD với khả năng truy cập NPU-to-SSD đạt độ trễ 60μs và băng thông cụm lên tới 40 TB/s.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong hạ tầng phần cứng cho AI, giải quyết nút thắt cổ chai về bộ nhớ KV-cache cho các mô hình ngôn ngữ lớn quy mô cực lớn.
23/09
Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Flash-dLLM là khung tăng tốc suy luận không cần huấn luyện cho các mô hình ngôn ngữ khuếch tán (dLLM), sử dụng cơ chế KV cache thông minh để tự động hóa quy trình dự đoán và kiểm chứng.
C2C là phương thức mới cho phép các LLM trao đổi thông tin trực tiếp qua KV-Cache thay vì văn bản. Kỹ thuật này giúp tăng độ chính xác lên tới 14,2% và cải thiện tốc độ xử lý gấp 2,5 lần so với các phương pháp truyền thống.
Đại học Thanh Hoa và InnoPeak vừa công bố mã nguồn mở C2C, cho phép các tác nhân AI trao đổi dữ liệu trực tiếp qua KV-Cache thay vì văn bản, giúp tối ưu hóa hiệu suất truyền tải thông tin giữa các mô hình.
AGENTIC TRAFFIC NOW MAKES UP MORE THAN 70% OF ALL INFERENCE TRAFFIC 🚀 Agentic workloads are chara…
DịchTheo SemiAnalysis, các tác nhân AI (Agent) hiện chiếm hơn 70% lưu lượng suy luận. Báo cáo chỉ ra các đặc điểm tải công việc đặc thù như khả năng tái sử dụng KV-cache cao qua các vòng hội thoại và sự gia tăng nhanh chóng của ngữ cảnh từ hệ thống và công cụ.