Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
75

Sản phẩm

Hetzner phát triển dịch vụ suy luận LLM mới

(giờ Việt Nam)

Tóm tắt AI

Nhà cung cấp dịch vụ đám mây Hetzner đang xây dựng nền tảng suy luận LLM có tên Sliplane, tận dụng hạ tầng sẵn có của hãng. Thông tin chi tiết về thời điểm ra mắt, danh mục mô hình và giá cước hiện vẫn chưa được công bố.

Bản dịch AI

Hetzner Inference: First Look

Hetzner đang thử nghiệm với việc suy luận LLM (LLM inference).

Đây không phải là câu mà tôi nghĩ mình sẽ viết, nhưng tôi thấy nó khá thú vị:)

Trước khi có bất kỳ ai chuyển khối lượng công việc AI thực tế (production AI workloads) của mình sang Hetzner: đây hoàn toàn là một thử nghiệm. Không có thanh toán, không có SLA, không có cam kết vận hành và hiện tại chỉ có một mô hình duy nhất. Hetzner cho biết họ muốn tìm hiểu xem liệu người dùng có thực sự cần dịch vụ này hay không, hệ thống mở rộng như thế nào, những tính năng nào quan trọng và nó có thể xử lý loại tải công việc nào.

Vì vậy, đây không phải là một đợt ra mắt sản phẩm hoàn thiện. Đây là cách Hetzner đưa một thứ gì đó ra mắt sớm cho người dùng để xem điều gì sẽ xảy ra. Tôi thực sự thích cách tiếp cận này.

Hetzner Inference là gì?

Hetzner Inference là một API tương thích với OpenAI chạy trên cơ sở hạ tầng của riêng Hetzner. Bạn tạo một API token trong bảng điều khiển Experiments, trỏ client OpenAI vào URL cơ sở của Hetzner và sử dụng nó giống như hầu hết các API suy luận khác.

Hiện tại, mô hình duy nhất khả dụng là Qwen/Qwen3.6-35B-A3B-FP8. Đây là mô hình Mixture-of-Experts với 35 tỷ tham số, trong đó có 3 tỷ tham số hoạt động. Nó chấp nhận cả văn bản và hình ảnh, có cửa sổ ngữ cảnh 262K và sử dụng trọng số được lượng tử hóa FP8.

Đó là một mô hình hoàn toàn hợp lý cho một thử nghiệm. Nó đủ nhỏ để phục vụ mà không cần một cụm GPU khổng lồ, nhưng vẫn đủ hữu ích để kiểm tra API với các khối lượng công việc thực tế.

Hetzner cũng đã xuất bản một hướng dẫn ngắn để kết nối OpenCode với API này, nếu bạn muốn thử mà không cần viết bất kỳ dòng mã nào.

Tôi đã dùng thử

Vì API này tương thích với OpenAI nên việc tích hợp gần như không có gì đặc biệt:

Tùy chọn enable_thinking rất đáng để nhắc đến. Nếu không có nó, mô hình có thể tiêu tốn một lượng ngân sách hoàn thiện đáng kể cho việc suy luận trước khi đưa ra câu trả lời hiển thị. Tùy chọn này hoạt động trong các bài kiểm tra của tôi, nhưng nó không được Hetzner ghi lại trong tài liệu, vì vậy tôi sẽ chưa xây dựng bất kỳ thứ gì quan trọng dựa trên cấu trúc yêu cầu cụ thể đó.

Tôi đã thực hiện một vài bài kiểm tra nhỏ vào ngày 23 tháng 7 năm 2026. Tôi không muốn biến bài viết này thành một báo cáo điểm chuẩn khổng lồ, vì sản phẩm đang trong giai đoạn thử nghiệm và các điểm chuẩn so sánh với nó có thể sẽ nhanh chóng trở nên lỗi thời. Nhưng các con số sơ bộ là:

Thật nhanh! Đó cũng chỉ là một bài kiểm tra từ một client tại một thời điểm nhất định. Nó không phải là SLA và không nói lên được điều gì về những gì sẽ xảy ra khi nhiều người cùng sử dụng dịch vụ một lúc.

Bản thân mô hình này gần như đúng với những gì tôi mong đợi. Nó tuân theo hầu hết các hướng dẫn về định dạng và truy xuất, xử lý hình ảnh chính xác, nhưng thất bại ở hai câu hỏi số học rất đơn giản. Tóm lại: một LLM nhỏ, hơi tệ một chút:D

Sản phẩm thú vị hơn mô hình

Endpoint Qwen khá thú vị, nhưng tôi không nghĩ mô hình hiện tại là phần đáng quan tâm nhất.

Phần thú vị nằm ở lý do tại sao Hetzner lại thử nghiệm suy luận ngay từ đầu.

Mọi thứ từ đây trở đi hoàn toàn là suy đoán của tôi. Tôi không có thông tin nội bộ và không ai tại Hetzner nói với tôi về kế hoạch của họ. Tôi chỉ đang nhìn vào sản phẩm và cố gắng kết nối các dữ kiện lại với nhau.

Suy luận với trọng số mở (Open-weight inference) là một thị trường hàng hóa. Mọi người đều có thể tải xuống cùng một trọng số, chạy phần mềm phục vụ (serving software) gần như giống hệt nhau và cung cấp một API tương thích với OpenAI. Việc chuyển đổi nhà cung cấp cũng rất dễ dàng, đặc biệt là với các sản phẩm như OpenRouter hoặc LiteLLM cho những ai tự lưu trữ.

Điều đó khiến việc tạo ra biên lợi nhuận lớn trở nên khó khăn trừ khi bạn có một lợi thế nào đó. Thông thường điều đó có nghĩa là:

Hetzner rất giỏi trong việc mua phần cứng, đưa chúng vào các trung tâm dữ liệu của riêng mình và vận hành với cấu trúc chi phí cực kỳ hiệu quả. Đó về cơ bản là toàn bộ công ty. Nếu có ai đó có thể biến suy luận thành một sản phẩm cơ sở hạ tầng có biên lợi nhuận thấp khác, thì Hetzner ít nhất là một ứng cử viên đáng tin cậy.

Ngoài ra còn có một câu chuyện hay về hiệu suất sử dụng ở đây. Một GPU bare-metal được thuê sẽ thuộc về một khách hàng, bất kể khách hàng đó có sử dụng nó hay không. Một API suy luận có thể chia sẻ công suất GPU cho nhiều người dùng và giữ cho phần cứng luôn hoạt động. Nếu Hetzner có công suất GPU dư thừa — hoặc có kế hoạch xây dựng một đội ngũ GPU lớn hơn nhiều — thì một sản phẩm suy luận có thể giúp biến công suất đó thành doanh thu.

Một lần nữa, tôi không biết liệu đây có thực sự là những gì họ đang làm hay không. Nó chỉ đơn giản là có ý nghĩa về mặt kinh tế đối với tôi.

Câu hỏi lớn là phần cứng

Đây là điểm mà tôi vẫn chưa bị thuyết phục.

Dòng máy chủ GPU chuyên dụng công khai hiện tại của Hetzner sử dụng hai loại GPU:

Đó là những GPU mạnh mẽ, và RTX PRO 6000 96 GB là một cỗ máy suy luận khá tốt cho các mô hình cỡ nhỏ và trung bình. Các tệp FP8 cho mô hình Qwen hiện tại của Hetzner có dung lượng khoảng 38 GB, với mức sử dụng VRAM thực tế cao hơn con số đó tùy thuộc vào độ dài ngữ cảnh, kích thước bộ nhớ đệm và thiết lập phục vụ.

Nhưng đây là các GPU máy trạm, không phải là các hệ thống đa GPU mật độ cao mà bạn cần cho các mô hình mở thực sự lớn.

Lấy GLM-5 làm ví dụ cực đoan. Nó có 754 tỷ tham số và công thức phục vụ chính thức chia nó trên tám GPU. Ngay cả với việc lượng tử hóa mạnh mẽ, bạn cũng đang nói đến hàng trăm gigabyte VRAM. Trên thực tế, đó là phần cứng loại B200/B300 hoặc tương tự, với các liên kết rất nhanh giữa nhiều GPU.

Hetzner hiện không cung cấp loại phần cứng đó trong dòng sản phẩm bare-metal công khai của mình.

Tất nhiên, điều đó không cho chúng ta biết những gì nằm sau API thử nghiệm. Hetzner có thể sử dụng phần cứng nội bộ hoàn toàn khác, và một sản phẩm suy luận công khai không nhất thiết phải phản ánh danh mục máy chủ chuyên dụng của họ.

Tuy nhiên, đây là phần tôi đang theo dõi.

Nếu Hetzner tiếp tục chỉ phục vụ một hoặc hai mô hình nhỏ hơn, tôi không thực sự thấy nó trở thành một nhà cung cấp suy luận quan trọng. Đó sẽ là một thử nghiệm thú vị, nhưng không hơn gì thế.

Nếu thử nghiệm này là bước đầu tiên hướng tới các cụm GPU lớn hơn, một danh mục mô hình phù hợp và phần cứng loại B200/B300, thì nó sẽ trở nên thú vị hơn nhiều. Hetzner đã có sẵn các trung tâm dữ liệu, mạng lưới, kinh nghiệm phần cứng, vị thế tại châu Âu và danh tiếng về giá cả cạnh tranh. Sự kết hợp đó có thể khiến họ trở thành một đối thủ đáng gờm.

Hiện tại, API này nhanh, miễn phí và rất thú vị để thử nghiệm. Đối với tôi, câu hỏi thú vị không phải là họ sẽ thêm mô hình nhỏ nào tiếp theo, mà là liệu Hetzner có đầu tư vào phần cứng cần thiết để phục vụ các mô hình lớn hay không.

Chào thân ái,

Jonas

HetznerLLMCloudSliplaneHạ tầng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.