Ant Group giới thiệu Ling-3.0-flash, mô hình suy luận hỗn hợp với 124 tỷ tham số nhưng chỉ kích hoạt 5,1 tỷ, giúp tối ưu hiệu năng vượt trội so với thế hệ tiền nhiệm.
Đội ngũ Ant Group và RadixArk đã tối ưu hóa mô hình Ling-3.0-flash, giúp tăng tốc độ giải mã đơn yêu cầu từ 288 lên 606 tok/s và giảm độ trễ TPOT xuống còn 1.53 ms nhờ kiến trúc MoE cải tiến.
Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa suy luận mô hình MoE trên phần cứng Blackwell, mang lại giá trị thực tiễn cao cho cộng đồng kỹ thuật.
Tổng 2 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (18 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả