24/09

Thứ Năm · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 48/100

Nghiên cứu mới từ Google: Tải mô hình là 'nút thắt' chính gây độ trễ khi khởi động LLM lượng tử hóa

New Google paper shows for small quantized LLMs on serverless CPUs, 55-70% of cold-start latency is …

DịchNghiên cứu của Google chỉ ra rằng 55-70% độ trễ khởi động của các LLM lượng tử hóa trên CPU serverless đến từ việc tải trọng số mô hình. Việc tăng dung lượng RAM cấp phát có thể giúp tối ưu hóa đáng kể tốc độ suy luận.

22/09

Thứ Ba · 2 tin

21/09

Thứ Hai · 1 tin

18/09

Thứ Sáu · 1 tin

15/09

Thứ Ba · 2 tin
Databricks: Blog
NgànhĐiểm AI 39/100

Dịch vụ Postgres được quản lý của Lakebase: Những gánh nặng vận hành nào đã được loại bỏ?

Lakebase của Databricks vận hành PostgreSQL trên hạ tầng serverless, tự động hóa các tác vụ như vá lỗi, mở rộng quy mô, sao lưu và phục hồi. Giải pháp này tối ưu hóa hiệu suất ghi gấp 5 lần và hỗ trợ các tính năng chuyên sâu như pgvector hay PostGIS mà không cần quản lý hạ tầng thủ công.

09/09

Thứ Tư · 1 tin

14/08

Thứ Sáu · 2 tin
Alibaba Cloud@alibaba_cloud
NgànhĐiểm AI 34/100

Cùng sự kiệnMô hình Qwen3.8-Max chính thức có mặt trên nền tảng DigitalOcean Serverless Inference

Qwen3.8-Max is live on DigitalOcean Serverless Inference. Launching side by side with DigitalOcean a…

DịchAlibaba Cloud vừa đưa mô hình Qwen3.8-Max lên dịch vụ Serverless Inference của DigitalOcean, cho phép người dùng triển khai và vận hành các ứng dụng AI quy mô lớn một cách mượt mà.

Cùng sự kiện, bài đại diện «Qwen3.8-27B sắp ra mắt: Đếm ngược đến thế hệ mô hình mới từ Alibaba»

13/08

Thứ Năm · 1 tin
Tổng 11 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (28 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Serverless” | AIHOT.vn