Sản phẩm
Cloudflare hợp nhất Workers AI và AI Gateway thành một nền tảng điều khiển AI duy nhất
(giờ Việt Nam)
Tóm tắt AI
Cloudflare tích hợp Workers AI và AI Gateway vào một hệ thống quản lý tập trung, giúp nhà phát triển dễ dàng theo dõi, thanh toán và định tuyến thông minh giữa các GPU nội bộ và nhà cung cấp AI bên ngoài.
Bản dịch AI

AI Gateway và Workers AI ban đầu là những sản phẩm riêng biệt, nhưng theo thời gian, chúng tôi nhận thấy nhu cầu của người dùng đang dần hội tụ. Với AI Gateway, bạn có thể ủy quyền (proxy) các yêu cầu đến bất kỳ nhà cung cấp mô hình nào và nhận được các tính năng tích hợp sẵn như khả năng quan sát (observability), ghi nhật ký, kiểm soát truy cập và bảo mật. Trên Workers AI, chúng tôi lưu trữ các mô hình trên cơ sở hạ tầng GPU do chúng tôi quản lý, cung cấp một API endpoint mà bạn có thể tận dụng để truy cập vào dịch vụ suy luận (inference-as-a-service).
Kiến trúc của các sản phẩm này trông có vẻ khác nhau, nhưng đối với người dùng cuối, chúng đều đạt được cùng một mục tiêu: kết nối bạn với các mô hình thông qua một bảng điều khiển (control plane) tinh vi. Hôm nay, chúng tôi rất hào hứng chia sẻ kế hoạch về việc hợp nhất các sản phẩm này thành một lộ trình thống nhất, để bạn có thể kết nối với bất kỳ nhà cung cấp mô hình nào (bao gồm cả Workers AI), đồng thời quản lý các yếu tố như khả năng quan sát, thanh toán, bảo mật và ghi nhật ký từ một bảng điều khiển duy nhất.
Đây là bước tiếp theo hướng tới những kế hoạch lớn mà chúng tôi đang ấp ủ — hãy đọc tiếp để tìm hiểu ý nghĩa của một bảng điều khiển thống nhất đối với tương lai của việc định tuyến mô hình (model routing).
Hợp nhất binding và API
Chúng tôi đã gợi ý về việc các sản phẩm này đang trở nên thống nhất hơn thông qua các điểm truy cập (entrypoints): Workers binding và REST API. Chúng tôi có một AI binding mà bạn có thể sử dụng để gọi cả AI Gateway và Workers AI. Không còn khái niệm về AI Gateway và Workers AI binding riêng biệt nữa: tất cả đều đi qua cùng một lộ trình. Chúng tôi đã triển khai ý tưởng về một gateway "mặc định" cách đây vài tháng, vì vậy nếu bạn chưa từng thiết lập AI Gateway trước đây, bạn vẫn có thể tự động kế thừa khả năng quan sát và ghi nhật ký của AI Gateway. Tất nhiên, bạn vẫn có thể chỉ định gateway riêng nếu muốn chia nhỏ các ứng dụng thành nhiều dự án.
Đây là cách gọi binding trông như thế nào nếu bạn đang gọi Workers AI thông qua AI Gateway:
Chúng tôi cũng đã công bố một REST API thống nhất duy nhất — endpoint /ai/ cho phép bạn thực hiện các lệnh gọi tương tự tới Workers AI thông qua AI Gateway.
Việc làm này cho phép chúng tôi hợp nhất các điểm truy cập vào AI Gateway và Workers AI, vì vậy bạn không cần phải lựa chọn xem nên sử dụng sản phẩm nào trước: tất cả đều đã được tích hợp sẵn mọi thứ cần thiết.
Khả năng quan sát và kiểm soát tự động cho tất cả người dùng Workers AI
Một trong những lợi ích tức thì nhất của sự hội tụ này là bạn không còn cần phải tạo AI Gateway một cách thủ công trước khi bắt đầu theo dõi lưu lượng suy luận của mình. Nếu bạn chưa từng thiết lập gateway trước đây, chỉ cần truyền "default" làm ID gateway trong các lệnh gọi binding hoặc REST API, và AI Gateway sẽ tự động tạo nó ngay trong yêu cầu xác thực đầu tiên.
Với tính năng này, mọi yêu cầu đều được ghi lại cùng với toàn bộ payload của yêu cầu và phản hồi, số lượng token được theo dõi theo từng mô hình và bạn nhận được thông tin phân bổ chi phí mà không cần thiết lập bảng điều khiển. Nếu sau này bạn cần nhiều hơn mức gateway mặc định — ví dụ như muốn có các quy tắc lưu trữ đệm (caching) tùy chỉnh hoặc phân chia lưu lượng theo ứng dụng — bạn có thể tạo một gateway có tên riêng và trỏ các yêu cầu của mình vào đó chỉ bằng cách thay đổi một tham số.
Đây là cách thực hiện trong binding. Trước đây, bạn gọi trực tiếp Workers AI:
Bây giờ, hãy thêm đối số thứ ba để định tuyến qua AI Gateway và nhận được khả năng quan sát đầy đủ:
Hãy truy cập bảng điều khiển Cloudflare AI Gateway và bạn sẽ thấy mọi yêu cầu: phân tích độ trễ, mức sử dụng token, tỷ lệ lỗi, cùng các prompt và phản hồi chính xác. Đối với các đội ngũ đang gỡ lỗi hành vi mô hình hoặc kiểm toán đầu ra của AI, đây là một sự nâng cấp lớn so với việc phải "mò mẫm trong bóng tối".
Mới: sử dụng tín dụng AI Gateway cho Workers AI
Một điều mới mà chúng tôi ra mắt hôm nay là khả năng sử dụng tín dụng AI Gateway cho Workers AI. Trước đây, bạn chỉ có thể sử dụng tín dụng AI Gateway cho các nhà cung cấp mô hình bên ngoài (ví dụ: OpenAI, Anthropic) nhưng chưa thể áp dụng cho việc sử dụng Workers AI. Cuối cùng, chúng tôi đã kích hoạt hệ thống để cho phép thanh toán thống nhất cho Workers AI. Điều này có nghĩa là bạn có thể nạp một ví đầy tín dụng, sau đó chọn chi tiêu cho OpenAI, Anthropic, Workers AI hoặc bất kỳ nhà cung cấp nào mà chúng tôi hỗ trợ.
Vì hiện tại chúng tôi đang cung cấp dịch vụ thanh toán trả trước cho Workers AI và muốn khuyến khích người dùng sử dụng lộ trình mới này, chúng tôi cũng cung cấp giới hạn tốc độ (rate limits) cao hơn trên các mô hình Workers AI nếu bạn sử dụng thanh toán thống nhất của AI Gateway. Vui lòng tham khảo tài liệu dành cho nhà phát triển để biết thông tin cập nhật về giới hạn tốc độ, cũng như cách yêu cầu giới hạn tốc độ cao hơn.
Sắp ra mắt: định tuyến ưu tiên mô hình (model-first routing)
Với tất cả lưu lượng suy luận của bạn chảy qua một bảng điều khiển duy nhất, chúng tôi có thể bắt đầu đưa ra các quyết định thông minh hơn về cách phục vụ từng yêu cầu, bắt đầu từ mô hình bạn muốn, thay vì nhà cung cấp mà bạn phải quản lý. Định tuyến ưu tiên nhà cung cấp buộc bạn phải suy nghĩ về cơ sở hạ tầng: "Tôi nên gọi nhà cung cấp nào? Nếu họ bị sập thì sao?". Định tuyến ưu tiên mô hình sẽ đảo ngược điều đó. Bạn chỉ cần suy nghĩ về những gì mình cần — một mô hình suy luận mạnh mẽ, một công cụ tóm tắt nhanh, một mô hình embedding giá rẻ — và bảng điều khiển sẽ xử lý việc chọn nhà cung cấp, chuyển đổi dự phòng (failover) và cân bằng tải.
Ngày nay, nếu muốn gọi một mô hình, bạn phải biết nhà cung cấp nào đang lưu trữ nó. Nếu nhà cung cấp đó bị sập hoặc giới hạn tốc độ của bạn, ứng dụng của bạn sẽ bị gián đoạn. Chúng tôi đang tiến tới một thế giới nơi bạn chỉ cần chỉ định mô hình, còn AI Gateway sẽ xử lý phần còn lại.
Theo cách này, bạn có thể yêu cầu Kimi K2.7 Code mà không cần quan tâm liệu nó đến từ Workers AI, API riêng của Moonshot hay một nhà cung cấp khác lưu trữ cùng các trọng số đó. Nếu Workers AI có đủ năng lực, bạn sẽ nhận được lợi ích từ cơ sở hạ tầng được quản lý của chúng tôi. Nếu Workers AI đạt ngưỡng giới hạn, gateway sẽ tự động cân bằng tải bạn sang một nhà cung cấp khác có thể phục vụ cùng mô hình đó. Bạn vẫn có thể chọn gắn bó với một nhà cung cấp duy nhất nếu muốn, nhưng định tuyến ưu tiên mô hình mang lại cho bạn sự linh hoạt hơn nếu bạn quan tâm đến khả năng phục hồi. Chúng tôi làm việc với các nhà cung cấp đã được kiểm duyệt, vì vậy chất lượng đầu ra của mô hình vẫn là ưu tiên hàng đầu, đồng thời cũng sẽ có thể tuân thủ các yêu cầu như Không lưu giữ dữ liệu (Zero Data Retention - ZDR).
Điều này cũng có nghĩa là khả năng phục hồi tốt hơn theo mặc định. Nếu phiên bản mô hình của một nhà cung cấp gặp sự cố, lưu lượng truy cập sẽ chuyển sang nhà cung cấp khác mà không cần các bước thử lại ở cấp ứng dụng hoặc logic dự phòng phức tạp trong Workers của bạn. Gateway coi tính khả dụng của mô hình là một vấn đề định tuyến. Chúng tôi hy vọng sẽ thử nghiệm điều này trong những tháng tới cho tất cả người dùng AI Gateway và Workers AI.
Tiếp theo: định tuyến thông minh (smart routing)
Bước tiến tiếp theo của định tuyến vượt xa khả năng chuyển đổi dự phòng đơn giản. Chúng tôi đang xây dựng hệ thống định tuyến thông minh có thể hiểu những gì bạn đang yêu cầu và chọn mô hình phù hợp cho công việc đó mà không cần bất kỳ cấu hình nào.
Thay vì chỉ định mô hình, bạn có thể để gateway tự quyết định. Bên dưới lớp vỏ, một bộ phân loại chạy trên Workers AI sẽ đọc prompt của bạn và dự đoán đó là loại tác vụ gì (lập trình, nghiên cứu, tóm tắt, hỏi đáp chung), mức độ phức tạp ra sao và ngữ cảnh quan trọng đến mức nào. Sau đó, một bộ chấm điểm heuristic sẽ ánh xạ điều đó tới mô hình tốt nhất từ một nhóm các mô hình được tuyển chọn. Đối với các đội ngũ muốn kiểm soát, bạn vẫn có thể chỉ định chính xác các mô hình. Đối với những người còn lại, lộ trình không cần cấu hình (zero-config) có nghĩa là bạn nhận được hiệu quả kinh tế và hiệu suất tốt hơn mà không cần duy trì logic định tuyến của riêng mình. Chúng tôi hiện đang thử nghiệm nội bộ và sẽ tích cực kiểm tra, lặp lại trong vài tuần tới trước khi phát hành.
Bắt đầu ngay hôm nay
Nếu bạn đã sử dụng Workers AI, cách dễ nhất để thử nghiệm là bắt đầu định tuyến các lệnh gọi hiện tại của bạn thông qua một gateway mặc định. Bạn sẽ ngay lập tức nhận được tính năng ghi nhật ký yêu cầu, theo dõi token và phân bổ chi phí mà không cần thay đổi bất kỳ điều gì khác trong cách bạn gọi các mô hình.
Nếu bạn đã sử dụng AI Gateway, việc thêm Workers AI vào quy trình cũng đơn giản như việc gọi một mô hình Workers AI. Hãy nạp tiền vào ví AI Gateway của bạn và bạn sẽ nhận được tính năng thanh toán thống nhất trên mọi nhà cung cấp mà chúng tôi hỗ trợ, cộng với giới hạn tốc độ cao hơn trên các mô hình Workers AI.
Hãy thiết lập gateway đầu tiên của bạn, duyệt qua danh mục mô hình Workers AI và bắt đầu xây dựng ngay hôm nay.
Bài viết được AI dịch và tổng hợp tự động từ Cloudflare Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.