Flash-dLLM là khung tăng tốc suy luận không cần huấn luyện cho các mô hình ngôn ngữ khuếch tán (dLLM), sử dụng cơ chế KV cache thông minh để tự động hóa quy trình dự đoán và kiểm chứng.
Dự án mã nguồn mở mini-AGI cho phép huấn luyện mô hình ngôn ngữ từ đầu trên GPU 8GB, sử dụng cơ chế lưu trữ tham số theo chuyên gia trên ổ cứng để vượt qua giới hạn bộ nhớ VRAM.
Nghiên cứu giới thiệu phương pháp mới giúp kiểm soát bốn điểm nghẽn bộ nhớ chính khi huấn luyện mô hình MoE, đảm bảo hiệu suất ổn định ngay cả với ngữ cảnh cực dài và quy mô lớn.
CUDA Agent là hệ thống học tăng cường giúp LLM tự động viết mã CUDA, đạt tốc độ vượt trội gấp 2.11 lần so với torch.compile và tỷ lệ thành công lên tới 98.8%.