New Google paper shows for small quantized LLMs on serverless CPUs, 55-70% of cold-start latency is …
DịchNghiên cứu của Google chỉ ra rằng 55-70% độ trễ khởi động của các LLM lượng tử hóa trên CPU serverless đến từ việc tải trọng số mô hình. Việc tăng dung lượng RAM cấp phát có thể giúp tối ưu hóa đáng kể tốc độ suy luận.
Sau hai năm thử nghiệm, Cloudflare đã chính thức hỗ trợ Python như một ngôn ngữ hạng nhất trên nền tảng Workers thông qua công nghệ WebAssembly và Pyodide, cho phép lập trình viên triển khai ứng dụng serverless bằng Python một cách ổn định.
Cloudflare vừa đưa Python trở thành ngôn ngữ lập trình chính thức trên nền tảng Workers, giúp các nhà phát triển dễ dàng triển khai ứng dụng serverless bằng Python.
Cloudflare vừa đưa Python Workers lên giai đoạn sẵn sàng sử dụng (GA), chính thức biến Python thành ngôn ngữ hạng nhất trên nền tảng của họ, cho phép triển khai và mở rộng ứng dụng trực tiếp một cách dễ dàng.
Bài viết đề xuất khung đánh giá 5 tiêu chí quan trọng, bao gồm khả năng phân tách nhánh (branch isolation) và kiến trúc serverless, giúp xác định cơ sở dữ liệu phù hợp cho khối lượng công việc của AI Agent.
Cloudflare vừa bổ sung khả năng phân quyền truy cập chi tiết cho từng Workers, cho phép cấp quyền hạn chế cho thành viên, CI tokens và AI agents để đảm bảo an toàn khi triển khai và giám sát hệ thống.
Lakebase của Databricks vận hành PostgreSQL trên hạ tầng serverless, tự động hóa các tác vụ như vá lỗi, mở rộng quy mô, sao lưu và phục hồi. Giải pháp này tối ưu hóa hiệu suất ghi gấp 5 lần và hỗ trợ các tính năng chuyên sâu như pgvector hay PostGIS mà không cần quản lý hạ tầng thủ công.
Cloudflare Workers hiện hỗ trợ Node.js mặc định, nâng giới hạn ứng dụng lên 64MB và cải tiến hệ thống registry với cơ chế biên dịch lười (lazy compilation) cùng bộ nhớ đệm dùng chung, giúp tối ưu hiệu suất và trải nghiệm lập trình.
Qwen3.8-Max is live on DigitalOcean Serverless Inference. Launching side by side with DigitalOcean a…
DịchAlibaba Cloud vừa đưa mô hình Qwen3.8-Max lên dịch vụ Serverless Inference của DigitalOcean, cho phép người dùng triển khai và vận hành các ứng dụng AI quy mô lớn một cách mượt mà.
Qwen3.8-Max is live on DigitalOcean Serverless Inference. Launching side by side with DigitalOcean a…
DịchAlibaba vừa đưa mô hình Qwen3.8-Max lên nền tảng DigitalOcean Serverless Inference, cho phép người dùng triển khai các ứng dụng AI quy mô lớn một cách mượt mà ngay từ ngày ra mắt.
Bài viết chia sẻ kỹ thuật giúp Databricks xử lý thách thức về quy mô khi triển khai cấu hình mạng cho hàng chục triệu máy chủ ảo serverless mỗi ngày, đảm bảo tính ổn định cho hạ tầng.