Databricks: Blog
92

Thủ thuật

Databricks tiết lộ cách cắt giảm 1 triệu USD chi phí lãng phí cho AI Agent chỉ trong một giờ

(giờ Việt Nam)

Tóm tắt AI

Đội ngũ kỹ thuật tại Databricks chia sẻ phương pháp tối ưu hóa quy trình vận hành, giúp loại bỏ khoản lãng phí 1 triệu USD mỗi năm phát sinh từ việc sử dụng AI Agent quá mức.

Bản dịch AI

How we eliminated $1 million a year of wasted AI agent spend in one hour

Các kỹ sư tại Databricks phụ thuộc rất nhiều vào các AI agent để tinh giản và tăng tốc công việc của họ. Đổi lại, các agent này không chỉ cần quyền truy cập vào nhiều Foundation Models khác nhau mà còn cần cả các MCP server với những công cụ cho phép truy cập vào các tài nguyên liên quan (ví dụ: nhật ký hệ thống, bảng dữ liệu sử dụng, phiếu hỗ trợ, wiki). Trong một bài blog trước, chúng tôi đã chia sẻ rằng việc quản lý chi phí AI ở quy mô lớn đòi hỏi phải tối ưu hóa không chỉ việc lựa chọn mô hình mà còn cả cách các agent sử dụng công cụ. Trong bài viết này, chúng tôi mô tả cách chúng tôi tìm kiếm các khoản tiết kiệm chi phí trong việc sử dụng công cụ của các agent, những thách thức gặp phải trên chặng đường đó, và cách OTel tracing trong Unity Gateway đã rút ngắn con đường từ phân tích đến tiết kiệm 1,2 triệu USD/năm xuống chỉ còn một giờ.

Việc cho phép các lập trình viên tự xây dựng agent của riêng họ là một bước đột phá lớn về năng suất, nhưng khi mức độ sử dụng tăng lên, chúng tôi cũng phải đối mặt với chi phí ngày càng cao. Chúng tôi bắt đầu điều tra một số phương án tối ưu hóa, và một nghi vấn mà chúng tôi đặt ra là chi phí ẩn từ các lệnh gọi công cụ (tool calls) bị lỗi. Cụ thể, khi các công cụ hoạt động không đúng, agent thực hiện lệnh gọi hiếm khi báo lỗi rõ ràng. Thay vào đó, nó thử lại, đoán mò và cuối cùng tìm cách giải quyết vấn đề, âm thầm tiêu tốn token và thời gian của lập trình viên trong suốt quá trình đó. Kiểu lãng phí này rất nguy hiểm: từ bên ngoài, tác vụ vẫn hoàn thành, và bảng điều khiển chi phí tổng hợp có thể chỉ hiển thị mức tăng 10% trong chi phí token, điều này dễ bị hiểu nhầm là do tăng trưởng sử dụng.

Chúng tôi đã điều tra nghi vấn này trong đội ngũ agent của mình bằng cách sử dụng tính năng tracing của Unity Gateway và Genie One. Chúng tôi đã tìm thấy bảy lỗi nhỏ trong các server công cụ của mình, gây lãng phí ước tính 499.000 USD/năm tiền token và khoảng 12.000 giờ kỹ thuật mỗi năm cho thời gian chờ đợi của agent. Tổng cộng, đây là mức thiệt hại ước tính 1,2 triệu USD/năm về năng suất.

Việc tìm ra cả bảy lỗi, định lượng và sửa chữa chúng chỉ mất khoảng một giờ. Bài viết này mô tả quy trình chúng tôi đã thực hiện và những bài học rút ra về việc xây dựng công cụ cho các agent.

Cách giám sát hoạt động của AI agent và MCP

Khi chúng tôi triển khai rộng rãi các AI agent tại Databricks cho công việc lập trình và quy trình làm việc nội bộ, việc quản lý hoặc thậm chí hiểu đầy đủ về chi phí là điều không thể vì chúng tôi thiếu khả năng quan sát các lệnh gọi công cụ và hoạt động tổng thể của các agent. Để giải quyết vấn đề này, chúng tôi đã tận dụng Unity Gateway, công cụ tự động phát ra các OpenTelemetry trace cho tất cả các lệnh gọi công cụ MCP, bao gồm tên công cụ, đối số, lỗi (nếu có), số lượng token, độ trễ và ID phiên kết nối các lệnh gọi lại với nhau. Các trace đó được lưu vào một bảng duy nhất ghi lại chính xác những gì các agent của chúng tôi đã thực hiện trong bất kỳ khoảng thời gian nào. Không cần thêm công cụ đo lường mới nào, và vì gateway vốn đã nằm trên đường đi của mọi lệnh gọi, nên dữ liệu luôn sẵn sàng để sử dụng.

Điều này giúp việc quản lý chi phí AI agent trở nên khả thi hơn, thay vì chỉ nhìn vào tổng chi phí token, chúng ta có thể quy đổi chi phí lãng phí cho các công cụ, lỗi và phiên làm việc cụ thể của agent.

Giờ đây khi dữ liệu đã sẵn sàng, bước tiếp theo là khám phá:

Thông thường, phần tốn kém nhất của loại phân tích này là viết SQL và tìm hiểu lược đồ dữ liệu (schema). Nhưng với Genie One, chúng tôi chỉ cần trỏ nó vào bảng trace, đặt những câu hỏi chính xác bằng tiếng Anh thông thường và nhận lại câu trả lời trong vài phút. Hầu hết thời gian trong một giờ đó chúng tôi dành để đọc các câu trả lời thay vì viết truy vấn.

Những gì các trace đã tiết lộ: Cách các lỗi công cụ MCP đẩy chi phí AI agent lên cao

Genie One đã biến một nghi vấn mơ hồ ("các agent dường như bị kẹt khi gọi Jira") thành một danh sách lỗi được xếp hạng và định lượng chỉ trong vài phút. Dưới đây là ví dụ từ một khoảng thời gian 24 giờ, cho thấy các lỗi trong server công cụ Jira và Google Drive/Docs của chúng tôi:

Lỗi

Số lỗi/ngày

Chi phí token hàng năm

Thời gian chờ hàng năm

Tỷ lệ lặp lại

Jira: KeyError: 'fields' (get)

137

250.000 USD

2.500 giờ

~30%

Jira: đối tượng 'list' không có thuộc tính 'split'

535

87.000 USD

4.850 giờ

30,5%

Jira: KeyError: 'fields' (search)

32

58.000 USD

580 giờ

~30%

GDrive: Lựa chọn trường không hợp lệ

417

46.000 USD

2.740 giờ

54,5%

Jira: đối số kwarg analysis_prompt không mong đợi

121

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.