Sản phẩm
Unity AI Gateway ra mắt tính năng định tuyến thông minh: Giảm 30% chi phí vận hành AI mà vẫn giữ nguyên chất lượng
(giờ Việt Nam)
Tóm tắt AI
Databricks giới thiệu tính năng định tuyến thông minh trên Unity AI Gateway, giúp tự động tối ưu hóa việc lựa chọn mô hình cho các tác vụ lập trình, từ đó cắt giảm hơn 30% chi phí suy luận mà không làm giảm hiệu suất.
Bản dịch AI

Ranh giới về giá cả và hiệu năng cho các tác vụ lập trình có sự đa dạng rất lớn về các mô hình và công cụ hỗ trợ (harness): chỉ riêng trong năm 2026, chúng ta đã thấy 33 mô hình mới được ra mắt. Trong bài viết trước về việc đánh giá hiệu năng dựa trên cơ sở mã nguồn Databricks, chúng tôi nhận thấy các mô hình được phân nhóm theo cấp độ năng lực và phần lớn công việc hàng ngày (ví dụ: bật/tắt một flag, chỉnh sửa một tệp đơn lẻ, sửa lỗi đã xác định rõ phạm vi) không cần đến những mô hình đắt đỏ nhất.
Vậy làm thế nào để giảm chi phí lập trình AI mà không làm ảnh hưởng đến năng suất của nhà phát triển? Một trong những cơ hội lớn nhất là khớp từng tác vụ với mô hình phù hợp thay vì mặc định mọi tác vụ đều sử dụng tùy chọn mạnh nhất (và đắt nhất). Chỉ riêng việc tận dụng các mô hình chi phí thấp hơn có thể giúp bạn tiết kiệm hơn 50%, nhưng điều này lại vô cùng khó khăn đối với người dùng. Với sự bùng nổ của các mô hình tuyệt vời và các công cụ hỗ trợ mạnh mẽ, người dùng các tác nhân (agent) lập trình liên tục phải đối mặt với tình trạng quá tải lựa chọn. Thay vì lãng phí thời gian cố gắng chọn mô hình tốt nhất cho mọi tác vụ, nhiều người đang thiết lập mô hình mạnh nhất cho mọi nỗ lực và bỏ qua các lựa chọn khác. Thay vì yêu cầu người dùng phải lựa chọn hoặc kìm hãm năng suất bằng các giới hạn cứng nhắc, chúng tôi biết mình cần phải đổi mới.

Đó là lý do tại sao chúng tôi ra mắt tính năng kiểm soát chi phí lớn tiếp theo trong Unity AI Gateway: Smart Routing, hiện đã có bản Beta. Unity AI Gateway cung cấp một nền tảng tập trung để truy cập AI, quản lý chi tiêu và thực thi các biện pháp kiểm soát trên toàn bộ doanh nghiệp của bạn, và Smart Routing bổ sung khả năng tối ưu hóa thông minh bằng cách tự động khớp các tác vụ với mô hình phù hợp dựa trên độ phức tạp. Smart Routing hoạt động trực tiếp trong Claude Code và Codex, cho phép bạn tối ưu hóa các công cụ mà nhà phát triển đang sử dụng.
Và chúng tôi không chỉ dừng lại ở việc định tuyến mô hình (model routing). Với Omnigent, công cụ meta-harness của chúng tôi dành cho các tác nhân lập trình, các nhóm có thể tận dụng toàn bộ sức mạnh của Smart Routing bằng cách tối ưu hóa trên cả mô hình và công cụ lập trình, mang đến cho nhà phát triển sự kết hợp phù hợp cho tác vụ mà không cần phải tự mình lựa chọn.
Kết quả đã nói lên tất cả: Trên các khối lượng công việc lập trình nội bộ, Smart Routing vượt trội hơn bất kỳ mô hình đơn lẻ nào với chi phí mỗi tác vụ chỉ bằng 65% so với một mô hình hàng đầu như Opus 5. Trên các bài kiểm tra hiệu năng công khai, Smart Routing đạt hiệu suất tương đương Opus 5 với chi phí chưa bằng một nửa.

Đây là những gì chúng tôi đã rút ra được:
Hãy cùng tìm hiểu cách chúng tôi xây dựng hệ thống này.
Định tuyến mô hình thông minh hoạt động như thế nào?
Định tuyến mô hình thông minh chọn mô hình phù hợp nhất cho một tác vụ dựa trên các yếu tố như độ phức tạp, năng lực và chi phí. Đối với các tác nhân lập trình, một quyết định quan trọng là khi nào việc định tuyến đó nên diễn ra.
Nhìn chung có hai phương pháp định tuyến:
Cách thức hoạt động của Smart Router của chúng tôi
Chúng tôi đã chọn phương pháp định tuyến nhận biết tác vụ (task-aware routing) để duy trì hiệu quả bộ nhớ đệm (cache) trong khi vẫn khớp từng tác vụ lập trình với mô hình và công cụ hỗ trợ phù hợp. Vấn đề thú vị nhất là đánh giá độ khó của một tác vụ trước khi bắt đầu. Chúng tôi muốn bắt đầu đơn giản, vì vậy bộ định tuyến của chúng tôi hiện sử dụng một chính sách duy nhất và áp dụng cho mọi tác vụ theo cùng một cách.
Đầu tiên, chúng tôi phân loại tác vụ. Để làm điều này, chúng tôi sử dụng một mô hình chi phí thấp, độ trễ thấp để đọc mô tả tác vụ và gắn nhãn nó với một vài trường ngữ nghĩa: phần nào của hệ thống thay đổi, prompt chứa bằng chứng mã nguồn nào (một đoạn mã, một traceback, hoặc không có gì cụ thể), lỗi xuất hiện như thế nào, bản sửa lỗi có vẻ cục bộ đến mức nào và nó thuộc loại dự án nào. Từ đó, bộ định tuyến suy ra loại tác vụ và ngôn ngữ lập trình. Việc sử dụng một mô hình tiên phong (frontier model) sẽ gây tốn kém cho mọi yêu cầu (ngay cả những yêu cầu đơn giản mà chúng tôi muốn tiết kiệm), vì vậy bộ trích xuất được thiết kế nhỏ và nhanh một cách có chủ đích.
Sau đó, chúng tôi xác định lớp mô hình nào là tốt nhất. Bộ định tuyến mặc định chọn một mô hình cỡ trung bình và sử dụng các nhãn để điều chỉnh theo cả hai hướng, nâng cấp lên mô hình đắt tiền hơn khi tác vụ đòi hỏi năng lực và kiến thức cấp độ tiên phong, hoặc hạ cấp xuống mô hình rẻ hơn khi không cần thiết. Điều này có nghĩa là một chính sách duy nhất có thể tận dụng toàn bộ bộ mô hình.
Những kết quả ban đầu rất hứa hẹn. So với bài kiểm tra hiệu năng nội bộ của chúng tôi, nơi mà chưa có phòng thí nghiệm nào tiếp cận được, chúng tôi đã thấy mức tiết kiệm 35%. So với các bài kiểm tra lập trình công khai chứng minh kết quả của chúng tôi có tính tổng quát, chúng tôi đã đạt được mức tiết kiệm chi phí 56%. Chúng tôi kỳ vọng con số này sẽ tăng lên khi chúng tôi hiểu rõ hơn về các trường hợp sử dụng của chính mình và với các đối tác thiết kế của mình.
Làm thế nào để bạn định tuyến các tác vụ lập trình trên các mô hình và công cụ hỗ trợ?
Smart Routing xử lý quyết định định tuyến, nhưng sau đó bạn cần có khả năng thực thi nó. Nó hoạt động nguyên bản bên trong Claude Code và Codex, nhưng đối với các tác nhân lập trình, chúng tôi thấy hiệu suất tốt hơn bằng cách chọn không chỉ mô hình phù hợp mà còn cả công cụ lập trình phù hợp. Việc giúp các kỹ sư tận dụng mô hình và công cụ đã chọn đòi hỏi một lớp nằm trên các phiên lập trình riêng lẻ để điều phối giữa chúng. Đây là lý do tại sao chúng tôi xây dựng Omnigent.

Smart Routing được triển khai trong Omnigent ở hai cấp độ:
Thứ nhất, các nhà phát triển sử dụng Omnigent có thể chọn Smart Routing thay vì chọn thủ công một công cụ lập trình cụ thể. Sau đó, Omnigent tự động chọn cả công cụ và mô hình cho từng tác vụ, với việc định tuyến mô hình được hỗ trợ bởi Smart Routing trong Unity AI Gateway. Thiết kế này mang lại cho nhà phát triển và quản trị viên sự tự do để cung cấp các tùy chỉnh, chẳng hạn như hướng dẫn cấp tổ chức hoặc tùy chọn sử dụng lịch sử trò chuyện trước đó, mà không cần thay đổi client mỗi lần.
Điều này cũng có nghĩa là tất cả các lần khởi chạy tác nhân phụ (sub-agent) đều đi qua API Smart Routing, cho phép các tác nhân phụ tận dụng một công cụ và mô hình khác. Prompt ban đầu của người dùng thường không được xác định rõ ràng và khó đánh giá về độ phức tạp, vì vậy các tác nhân phụ cho phép bạn điều chỉnh công việc mới dựa trên thông tin mới, với bộ nhớ đệm mới và hướng dẫn rõ ràng. Một tác vụ đơn lẻ có thể trải qua các quyết định định tuyến tinh tế trong quá trình lập kế hoạch và công việc của tác nhân phụ song song (ví dụ: bạn có thể định tuyến các tác vụ tóm tắt cơ sở mã lớn sang các mô hình rẻ hơn trong khi thiết kế kiến trúc với các mô hình đắt tiền hơn), dẫn đến mức tiết kiệm đáng kể hơn nữa.
Làm thế nào để bạn đánh giá liệu việc định tuyến mô hình có hiệu quả không?
Định tuyến mô hình hiệu quả cần tối ưu hóa cho cả chi phí và năng suất của nhà phát triển, chứ không chỉ riêng chi phí. Việc có các tín hiệu phản hồi là rất quan trọng vì bộ định tuyến vẫn là công nghệ sơ khai cần được lặp lại đáng kể. Bước đầu tiên của chúng tôi ở đây là ghi lại tất cả các dấu vết (trace) của phiên lập trình để đánh giá sau này. Chúng tôi muốn xem xét cả chi phí và trải nghiệm của nhà phát triển – chúng tôi không muốn tối ưu hóa chi phí mà làm ảnh hưởng đến năng suất.
Với Unity AI Gateway, các dấu vết cho các tác nhân lập trình có thể được ghi lại vào Unity Catalog. Đây là dữ liệu cực kỳ nhạy cảm và cần được quản lý bởi các chính sách gắn thẻ và truy cập tinh vi trong hầu hết các doanh nghiệp trưởng thành.
Chúng tôi đã sử dụng cả mô hình AI và đánh giá của con người để phân tích các dấu vết nhằm đánh giá những thay đổi đối với bộ định tuyến. Khi chúng tôi chạy phân tích này trên các phiên của chính mình trước khi định tuyến, chúng tôi nhận thấy một phần lớn các phiên đang chi tiêu ngân sách cho mô hình tiên phong vào những công việc không cần thiết, đơn giản vì mô hình mặc định là mô hình đắt nhất. Trong thực tế, cách để xác thực rằng bộ định tuyến hữu ích là liên tục theo dõi các chỉ số sau:

Hướng đi tiếp theo của chúng tôi với định tuyến mô hình thông minh
Chúng tôi tin rằng đây là một lĩnh vực có cơ hội đáng kể và dự định tiếp tục thực hiện nghiên cứu chuyên sâu tại đây. Mọi thứ vẫn còn sớm, vì vậy chúng tôi còn nhiều điều phải học hỏi. Thách thức đầu tiên của chúng tôi là dữ liệu đánh giá hiệu năng không đáng tin cậy, không khớp với hành vi thực tế của người dùng. Các tác vụ đánh giá thường được thiết kế quá hoàn hảo, mỗi tác vụ đều là một tuyên bố công việc khép kín. Trong khi các bộ định tuyến hoạt động tốt trên các tác vụ như vậy, các phiên thực tế thường không hề giống như vậy.
Vì vậy, chúng tôi đang nghiên cứu một vài hướng đi mới để thu thập thêm thông tin và thử nghiệm các kỹ thuật mới:
Định tuyến thường được quảng bá như một cách để chi tiêu ít hơn. Mặc dù hầu hết các lợi ích của chúng tôi đến từ việc trả giá thấp hơn cho công việc dễ dàng, nhưng cùng một cơ chế đó có thể giúp chúng ta quyết định khi nào nên chi tiêu nhiều hơn để đạt được kết quả tốt hơn. Valuemaxxing (tối đa hóa giá trị) có hai mặt: chọn mô hình rẻ khi nó đủ dùng và tự tin chi tiêu nhiều hơn khi giá trị mang lại xứng đáng.
Các công cụ lập trình thường khuyến khích người dùng tiêu thụ ngày càng nhiều token, nhưng điều chúng tôi thực sự muốn là tối ưu hóa sản lượng hiệu quả trên mỗi đô la, không phải trên mỗi token. Việc chọn một mô hình rẻ hơn, nhanh hơn khi nó đủ dùng không chỉ giúp tiết kiệm tiền. Nó còn giúp tiết kiệm thời gian và giữ cho năng lực của các mô hình tiên phong vốn khan hiếm luôn sẵn sàng cho các tác vụ thực sự cần đến chúng.
Hãy thử Smart Routing ngay hôm nay
Smart Routing hiện đã có bản Beta thông qua Unity AI Gateway. Nó tự động định tuyến các tác vụ lập trình đến đúng mô hình dựa trên độ phức tạp, giúp các nhóm đạt được hiệu suất cấp độ tiên phong với mức tiết kiệm chi phí hơn 30% bằng cách chọn mô hình tốt nhất cho mọi tác vụ. Đối với các nhóm muốn giảm chi phí lập trình AI mà không hạn chế sự lựa chọn hoặc năng suất của nhà phát triển, Smart Routing cung cấp một giải pháp thay thế cho việc chọn mô hình thủ công hoặc dựa vào các giới hạn chi tiêu cứng nhắc. Và với Omnigent, bạn có thể mở rộng định tuyến thông minh trên cả các mô hình và công cụ lập trình.
Để bắt đầu, hãy truy cập các trang tài liệu của chúng tôi:
Tìm hiểu thêm về Unity AI Gateway bằng cách truy cập trang web của chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.