Databricks: Blog
85

Sản phẩm

Databricks ra mắt 'Big Book of AgentOps': Cẩm nang toàn diện về vận hành AI Agent

(giờ Việt Nam)

Tóm tắt AI

Databricks vừa công bố 'Big Book of AgentOps', tài liệu hướng dẫn chuyên sâu về quy trình xây dựng, triển khai và vận hành các tác nhân AI (AI Agents) trong môi trường thực tế.

Bản dịch AI

Announcing the Databricks Big Book of AgentOps

AgentOps là gì?

AgentOps là kỷ luật vận hành để xây dựng, triển khai và cải tiến các AI agent trong môi trường thực tế (production). Nó kết hợp kiến trúc, đánh giá, khả năng quan sát, quản trị, bảo mật và quản lý chi phí thành một quy trình mà các đội ngũ có thể lặp lại.

Một AI agent không chỉ đơn thuần là một mô hình tạo ra phản hồi. Các agent có thể chọn công cụ trong thời gian thực (runtime), truy xuất dữ liệu doanh nghiệp, gọi API và tự mình thực hiện các tác vụ gồm nhiều bước. Mỗi khả năng đó đều là nơi có thể xảy ra sự cố, chẳng hạn như lệnh gọi công cụ bị lỗi, quyền hạn quá rộng hoặc chi phí tăng đột biến ngoài dự kiến.

AgentOps tồn tại để ngăn chặn sự phức tạp đó trở thành gánh nặng. Nếu được thực hiện tốt, nó sẽ làm cho hệ thống trở nên đủ tin cậy để mọi người đặt niềm tin và đủ đơn giản để một đội ngũ có thể thực sự vận hành nó.

Tại sao các AI agent cần AgentOps?

Generative AI đã chuyển dịch từ giai đoạn thử nghiệm sang ứng dụng doanh nghiệp nhanh hơn hầu hết các làn sóng công nghệ khác. Thách thức tiếp theo là biến các dự án thí điểm đầy hứa hẹn thành những hệ thống mà mọi người có thể dựa vào.

Hầu hết các đội ngũ đều bị đình trệ trước những câu hỏi vận hành tương tự nhau:

Để trả lời những câu hỏi đó, cần nhiều hơn là một mô hình mạnh mẽ hơn. Nó đòi hỏi một mô hình vận hành cho chính agent đó.

Đây là lĩnh vực quen thuộc. MLOps đã trưởng thành khi các đội ngũ đưa các mô hình machine learning ra khỏi môi trường notebook và đi vào thực tế. LLMOps tiếp nối sau đó, bổ sung các phương pháp thực hành cho việc quản lý phiên bản prompt và mô hình, phục vụ phân tán (distributed serving) và kiểm soát chi phí. AgentOps là lớp tiếp theo và mở rộng kỷ luật đó sang các hệ thống có khả năng suy luận, sử dụng công cụ và tự mình hành động.

Một agent trong môi trường thực tế cần có các ranh giới rõ ràng về những gì công cụ của nó có thể chạm tới, một bản ghi có thể truy xuất được về quá trình thực thi nhiều bước, một cách để đo lường chất lượng, một kế hoạch cho những tình huống thất bại và sự đồng thuận đủ lớn giữa các bộ phận kỹ thuật, sản phẩm, bảo mật, tuân thủ và tài chính để không ai cảm thấy bất ngờ khi nó được ra mắt.

Trải nghiệm khách hàng là minh chứng cho điều này. Agent tri thức text-to-code của FactSet đã phát triển từ một mô hình nền tảng đơn lẻ thành một hệ thống agent hoàn chỉnh và mang lại mức cải thiện độ chính xác lên tới 44%. Đọc câu chuyện của FactSet.

The Big Book of AgentOps hệ thống hóa các phương pháp giúp các đội ngũ doanh nghiệp thực hiện quá trình chuyển đổi đó: các mô hình kiến trúc, quy trình phân phối theo giai đoạn, các vòng lặp đánh giá và phản hồi, quản trị, quản lý chi phí và các quyết định của các bên liên quan nhằm xác định liệu một agent có thực sự đạt đến giai đoạn triển khai thực tế hay không.

Nội dung bên trong The Big Book of AgentOps

Cuốn sách đi từ các khái niệm đến triển khai qua sáu chương.

1. Hiểu về kiến trúc AI agent

Các agent không giống như một lệnh gọi LLM theo kiểu hỏi-đáp (prompt-and-response).

Ghi nhật ký (logging), cổng đánh giá (evaluation gates), quản trị, khôi phục (rollback) và giám sát đều quan trọng, nhưng các yêu cầu sẽ thay đổi tùy theo bốn kiến trúc agent. Chúng tôi phác thảo từng kiến trúc và các yêu cầu vận hành tương ứng để bạn dễ dàng tham khảo.

Ngoài ra, quan trọng không kém là các anti-pattern (phản mẫu) khiến các dự án thí điểm không thể ra mắt: bắt đầu với một trường hợp sử dụng quá rộng, vội vàng áp dụng điều phối đa agent (multi-agent orchestration) trước khi sự phức tạp đó thực sự cần thiết, có một vòng lặp suy luận không cần thiết và để việc đánh giá lại sau cùng. Chúng tôi chia sẻ danh sách những lỗi phổ biến mà chúng tôi từng thấy để bạn có thể tránh được những sai lầm tương tự.

2. Các mô hình kiến trúc triển khai AI agent

Kiến trúc triển khai có phạm vi từ đơn giản đến phức tạp tùy thuộc vào trường hợp sử dụng và nhu cầu của tổ chức. Chúng tôi đề cập đến bốn mô hình triển khai, từ việc triển khai trong một workspace Databricks đơn lẻ cho đến thiết lập phức tạp nhất: cấu trúc doanh nghiệp đa tài khoản, đa agent. Mỗi mô hình đều đi kèm với hướng dẫn về cách lựa chọn và chuyển đổi giữa các mô hình khi nhu cầu của bạn thay đổi. Ở mỗi giai đoạn, Unity Catalog, Unity Gateway và MLflow vẫn là cốt lõi để hỗ trợ kiến trúc.

3. Vòng đời dự án AgentOps

Một lộ trình gồm bảy giai đoạn, bắt đầu từ cách thành lập đội ngũ, chọn trường hợp sử dụng, cho đến thiết lập cơ sở hạ tầng dữ liệu, các vòng lặp đánh giá và các phương pháp quản trị tốt nhất.

Chúng tôi làm nổi bật những điểm quan trọng cần lưu ý cho từng giai đoạn. Ví dụ, chi phí là một phần quan trọng của vòng đời. Một yêu cầu duy nhất của người dùng có thể kích hoạt nhiều lệnh gọi mô hình khi tính đến các sub-agent, các lần thử lại (retries) và kiểm tra rào chắn (guardrail checks). Điều đó khiến việc phân bổ mức sử dụng, đặt giới hạn và thiết lập trách nhiệm giải trình rõ ràng về chi phí trở nên cực kỳ quan trọng.

4. Áp dụng các nguyên tắc DevOps cho AI agent

Các đội ngũ cần lặp lại nhanh chóng để phát triển một agent chất lượng cao. Họ cũng cần phát triển agent dựa trên những tiến bộ ở biên giới nghiên cứu và phản ứng với nhu cầu thay đổi của tổ chức. Để giải quyết vấn đề này, chúng tôi làm nổi bật cách các nguyên tắc về dòng chảy (flow), phản hồi và học tập liên tục, được rút ra từ The DevOps Handbook, cung cấp một nền tảng hữu ích để vận hành các hệ thống AI agent.

Áp dụng các nguyên tắc này vào hệ thống agent nghĩa là xây dựng một tập dữ liệu đánh giá chuẩn (golden evaluation dataset) từ các dấu vết thực tế, hiệu chỉnh các trình đánh giá tự động (automated judges) dựa trên phản hồi của chuyên gia trong lĩnh vực (SME) và sử dụng kết quả đánh giá để định hướng những gì cần xây dựng tiếp theo. Một ví dụ thực tế về agent email khách hàng cho thấy sự kết hợp giữa đánh giá của con người, trình đánh giá dựa trên mô hình và các kiểm tra dựa trên quy tắc mà không cần biến mỗi bản phát hành thành một cuộc kiểm toán thủ công.

5. Cách vận hành AI agent

Một trình tự lập kế hoạch gồm sáu bước giúp các đội ngũ tập trung nỗ lực vào nơi thực sự thay đổi kết quả: lập bản đồ quy trình làm việc của con người, chuyển đổi nó thành kiến trúc kỹ thuật, xác định nhu cầu quan sát theo từng vai trò (persona), thiết kế khả năng truy xuất (tracing) vào hệ thống, ánh xạ kiểm soát truy cập vào dữ liệu và công cụ, đồng thời xác định những gì có thể tái sử dụng.

Một agent hỗ trợ khách hàng viễn thông áp dụng trình tự này vào thực tế, từ các lược đồ dữ liệu, các công cụ có sẵn cho một sub-agent thanh toán, cho đến các kiểm soát chi tiết giúp ngăn chặn việc một khách hàng nhìn thấy dữ liệu của khách hàng khác.

6. Quản lý các bên liên quan cho AI agent trong môi trường thực tế

Kỹ thuật tốt không đảm bảo một agent sẽ được đưa vào sản xuất. Rất nhiều dự án có nền tảng kỹ thuật tốt lại bị đình trệ vì các vấn đề con người.

Sự sẵn sàng cho môi trường thực tế phụ thuộc vào việc các bên liên quan được đồng bộ hóa trên toàn tổ chức, từ các nhà tài trợ điều hành và chủ sở hữu sản phẩm đến các SME, bộ phận bảo mật, tuân thủ và tài chính. Phần này cung cấp một ma trận RACI thực tế giúp làm rõ quyền sở hữu đối với các quyết định thường bị tắc nghẽn và gợi ý nhịp độ giao tiếp cho các giai đoạn dự án trước và sau khi ra mắt. Các quy trình đội ngũ này đảm bảo các vòng lặp phản hồi của SME được chặt chẽ, việc giám sát và đánh giá vận hành sau khi ra mắt diễn ra suôn sẻ, và các dự án mang lại giá trị lâu dài.

Các phương pháp AgentOps tốt nhất cho AI agent trong môi trường thực tế

Bắt đầu với các kiến trúc AI agent đơn giản

Chọn một trường hợp sử dụng được xác định rõ ràng với các chỉ số thành công cụ thể trước khi nghĩ đến việc điều phối. Đưa một bản mẫu hoạt động được cho các bên liên quan xem sớm. Hãy để những gì bạn học được, chứ không phải một lộ trình được xây dựng sẵn, quyết định những gì cần xây dựng tiếp theo.

DXC Technology đã đi theo con đường này trong khi mở rộng danh mục AI của mình. Công ty hiện đang vận hành ba AI agent trong môi trường thực tế, có thêm tám agent khác đang trong giai đoạn thí điểm hoặc phát triển, và đã cắt giảm 30% tổng chi phí sở hữu nền tảng sau khi chuyển sang Databricks. Đọc câu chuyện của DXC Technology.

Xây dựng đánh giá AI agent ngay từ ngày đầu tiên

Đánh giá là yếu tố cho phép một đội ngũ tự tin ra mắt agent và tiếp tục cập nhật nó một cách an toàn sau đó. Hãy bắt đầu với việc các SME xem xét các dấu vết thực tế, thay vì một vài câu lệnh chat được chọn thủ công. Sự đánh giá của con người đó sẽ làm nổi bật các chế độ thất bại, xây dựng một tập đánh giá đại diện và hiệu chỉnh các trình đánh giá tự động vốn sẽ đảm nhận các kiểm tra định kỳ sau này.

Databricks tích hợp trực tiếp điều này vào nền tảng: đánh giá agent, các trình đánh giá hỗ trợ bởi AI và phân tích dựa trên dấu vết (trace-based analysis) cho phép các đội ngũ tìm ra các vấn đề trong môi trường thực tế, đào sâu vào nguyên nhân gốc rễ và kiểm tra bản sửa lỗi trước khi triển khai lại.

AI AgentDatabricksAgentOpsKỹ thuật AIVận hành AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.