Tin ngành
RadixArk hợp tác cùng Google Cloud đưa SGLang lên TPU, tối ưu hóa chạy mô hình AI
(giờ Việt Nam)
Tóm tắt AI
RadixArk và Google Cloud tích hợp khung suy luận SGLang vào Google TPU, cho phép nhà phát triển chạy mượt mà các mô hình như Gemma, Qwen và DeepSeek thông qua SGL-JAX.
Bản dịch AI
RadixArk và Google Cloud đang hợp tác để đưa SGLang lên các TPU, mang đến cho các nhà phát triển sự linh hoạt tối đa khi chạy các khối lượng công việc trên phần cứng tùy chọn.
SGLang là một framework suy luận mã nguồn mở được xây dựng để đạt lưu lượng cao và độ trễ thấp ở quy mô sản xuất. Với hơn 30.000 lượt sao trên GitHub và hơn 1.700 người đóng góp, framework này đang chạy trên hàng trăm nghìn GPU trên toàn thế giới và tạo ra hàng nghìn tỷ token trong môi trường sản xuất mỗi ngày. RadixArk hiện là đơn vị duy trì dự án SGLang.
Hiện tại, các nhà phát triển có thể chạy SGLang trên các thế hệ TPU mới nhất thông qua SGL-JAX, với sự hỗ trợ cho các dòng mô hình ngôn ngữ lớn và mô hình đa phương thức phổ biến bao gồm Gemma, Qwen, DeepSeek, GLM, Mimo, Kimi, Ling, MiniMax và Grok, cũng như các mô hình khuếch tán (diffusion models) để tạo video và hình ảnh như Wan và Flux. Cuối năm nay, RadixArk sẽ ra mắt SGL-torchtpu như một backend TPU thuần PyTorch bổ sung, với các tính năng như thực thi eager (eager execution), tương thích với hệ sinh thái PyTorch và hỗ trợ MPMD. Điều này sẽ cho phép bất kỳ nhà nghiên cứu hoặc kỹ sư AI nào trong ngành chạy các LLM với SGLang trên TPU của Google bằng các công cụ PyTorch tiêu chuẩn, với hiệu suất cao, khả năng mở rộng và các tính năng tiên tiến nhất. Các tính năng này bao gồm việc chạy các mô hình mở hàng đầu ở kích thước đầy đủ trên các TPU đa máy chủ (multi-host), với chất lượng tương đương các tiêu chuẩn đã công bố, cùng với các kỹ thuật song song hóa (dữ liệu, tensor, chuyên gia, ngữ cảnh và pipeline), Radix Cache, HiCache, lượng tử hóa và giải mã suy đoán (speculative decoding) — được vận hành bởi các nhân TPU Pallas do RadixArk, Google và cộng đồng SGLang xây dựng.
Trong tương lai, SGLang sẽ cho phép các mô hình mở mới chạy trên TPU ngay trong ngày chúng chạy trên GPU, với sự hỗ trợ "Ngày 0" (Day 0) này sẽ được mở rộng cho mọi thế hệ TPU mới.
Những điều này biến TPU thành một giải pháp thay thế dễ dàng và tiết kiệm chi phí cho việc suy luận tiên tiến. Các đội ngũ có thể chạy cùng một API và tính năng SGLang mà họ sử dụng trên GPU, với sự tự do lựa chọn phần cứng dựa trên nhu cầu khối lượng công việc và hiệu năng trên giá thành.
"Sứ mệnh của RadixArk là làm cho cơ sở hạ tầng AI tiên tiến trở nên mở và dễ tiếp cận với mọi nhà phát triển. SGLang là hiện thân của điều đó, và chúng tôi rất hào hứng khi được hợp tác với Google Cloud để mang hiệu suất và sự linh hoạt của nó đến với hệ sinh thái TPU," Ying Sheng, CEO của RadixArk cho biết.
"Để thực sự thúc đẩy đổi mới AI tiên tiến, các nhà phát triển phải có quyền tự do lựa chọn và sử dụng các nền tảng huấn luyện và phục vụ AI với hiệu suất, độ tin cậy, khả năng mở rộng và chi phí tốt hơn," Bill Jia, Phó chủ tịch Kỹ thuật, Core ML/AI tại Google chia sẻ. "Sự hợp tác của chúng tôi với RadixArk là một bước tiến quan trọng trong việc hiện thực hóa tầm nhìn về tính không đồng nhất có thể lập trình, nơi phần mềm đóng vai trò là cầu nối mở thay vì cơ chế khóa chặt. Bằng cách đưa framework phục vụ lưu lượng cao SGLang lên các TPU của Google, chúng tôi đang loại bỏ hiệu quả 'thuế di chuyển' cho các nhà phát triển, cho phép họ chạy các khối lượng công việc sản xuất một cách liền mạch trên các lựa chọn phần cứng (ví dụ: GPU, TPU) và framework AI (ví dụ: PyTorch, JAX) của họ bằng cách sử dụng chính xác cùng các API suy luận SGLang."
SGL-JAX, một nỗ lực chung của RadixArk và cộng đồng SGLang, hiện đã có sẵn tại github.com/sgl-project/sglang-jax.
Gia đình SGL luôn chào đón những người đóng góp mới để cùng nhau xây dựng một công cụ phục vụ (serving engine) mở và hiệu suất cao!
Bài viết được AI dịch và tổng hợp tự động từ LMSYS: Blog (Chatbot Arena ). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.