Tin ngành
Zepto ứng dụng AI Agent trên Databricks và MLflow để tối ưu hóa dịch vụ khách hàng
(giờ Việt Nam)
Tóm tắt AI
Zepto triển khai chiến lược 'đánh giá là ưu tiên' khi xây dựng AI Agent trên nền tảng Databricks và MLflow, giúp nâng cao độ tin cậy và khả năng mở rộng cho hệ thống hỗ trợ khách hàng thời gian thực.
Bản dịch AI

Nỗ lực của Zepto nhằm mang đến dịch vụ hỗ trợ khách hàng đáng tin cậy và theo thời gian thực
Zepto là một trong những nền tảng thương mại nhanh (quick-commerce) phát triển nhanh nhất tại Ấn Độ, với hàng ngàn sản phẩm, hiện diện tại hơn 60 thành phố và thời gian giao hàng được tính bằng phút. Trong một lĩnh vực kinh doanh mà tốc độ chính là sản phẩm, dịch vụ hỗ trợ khách hàng cũng phải vận hành nhanh chóng tương đương.
Để đáp ứng kỳ vọng đó, Zepto vận hành dịch vụ hỗ trợ khách hàng trên một hệ thống AI đa tác nhân (multi-agent AI system) xử lý hơn một trăm ngàn yêu cầu mỗi ngày. Ban đầu, đội ngũ có thể xây dựng và triển khai các tác nhân một cách nhanh chóng. Câu hỏi khó hơn là làm thế nào để duy trì độ tin cậy của các tác nhân đó khi khối lượng công việc tăng lên, các danh mục mở rộng và hành vi khách hàng liên tục thay đổi. Zepto đã hợp tác với Databricks để giải quyết vấn đề này, không phải bằng cách tung ra thêm nhiều tác nhân, mà bằng cách biến việc đánh giá trở thành phương thức cốt lõi để xây dựng, kiểm thử và vận hành các tác nhân.
Bài viết này sẽ đi sâu vào hành trình đó: kiến trúc hệ thống, khung đánh giá trên Databricks và MLflow, các câu chuyện thực tế trong sản xuất nơi hệ thống chứng minh giá trị, cùng những kết quả và bài học rút ra.
Tại sao tư duy "cứ triển khai tác nhân đi" lại thất bại khi mở rộng quy mô
Trong một doanh nghiệp có nhịp độ cao, tư duy "cứ triển khai tác nhân đi" vẫn hiệu quả cho đến khi nó đổ vỡ ở quy mô lớn. Với hơn 100.000 yêu cầu được xử lý bởi AI mỗi ngày, ngay cả tỷ lệ lỗi 1% cũng tạo ra hàng ngàn kết quả tồi tệ và gây thất thoát doanh thu thực tế mỗi ngày.
Áp lực ập đến theo những đợt sóng không đều. Các sự kiện thời tiết, lễ hội Diwali và thời điểm bắt đầu mùa hè đã tạo ra những đợt tăng đột biến về số lượng yêu cầu. Việc mở rộng từ thực phẩm sang quần áo, đồ điện tử và mỹ phẩm đã kéo theo các quy trình hoàn tiền, đổi trả và trả hàng mới. Trong khi đó, cơ sở khách hàng đa dạng và đa ngôn ngữ hơn đã mang đến nhiều loại yêu cầu hỗ trợ phong phú hơn—và các dạng lỗi mới xuất hiện sau mỗi vài tuần.
Vấn đề sâu xa hơn chính là khoảng cách đảm bảo (assurance gap). Các hệ thống tác nhân vận hành như những quy trình làm việc đa bước—phân loại ý định, truy xuất kiến thức, phân tích dữ liệu đầu vào, suy luận để đưa ra quyết định, gọi các công cụ giao dịch và tạo phản hồi—vì vậy lỗi có thể xuất hiện ở bất kỳ đâu trong suốt quá trình đó, chứ không chỉ ở câu trả lời cuối cùng.
Khoảng cách đảm bảo này dẫn đến những vấn đề cụ thể:
Mục tiêu đã trở nên rõ ràng: thiết kế một khung đánh giá trên Databricks và MLflow để nó đóng vai trò là hạ tầng AI cốt lõi, nơi các tác nhân được xây dựng và vận hành.
Tại sao cần Khung đánh giá và kết quả của nó
Một khung đánh giá mạnh mẽ ảnh hưởng trực tiếp đến năm trục sẵn sàng cho sản xuất:
Với Databricks + MLflow làm nền tảng đánh giá và kiến trúc tác nhân ưu tiên đánh giá, Zepto đã đạt được:
Chi phí & hiệu quả
Chất lượng & uy tín
Hiệu suất & vận hành
Xây dựng Khung đánh giá: Vòng lặp kép để tạo sự tự tin và kiểm soát
Cốt lõi của phương pháp này là mô hình vòng lặp kép: vòng lặp phát triển và vòng lặp sản xuất, được kết nối bởi một cổng kiểm soát chất lượng (quality gate). Phần này phác thảo cách các vòng lặp đó phối hợp với nhau.

Cùng với nhau, hai vòng lặp này đảm bảo các tác nhân được xây dựng và vận hành trong tầm kiểm soát. Mọi lỗi đều được tự động ghi lại, phản hồi và khắc phục. Kết quả là, các tác nhân được xây dựng với sự tự tin, vận hành trong tầm kiểm soát và liên tục cải thiện để xử lý các lỗi sản xuất tốt hơn theo thời gian. Vòng lặp kép nằm ở trung tâm của khung làm việc của chúng tôi.
Giai đoạn 0: Kích hoạt Truy vết (Tracing): Tác nhân minh bạch ngay từ thiết kế
Mỗi lần gọi tác nhân đều phát ra một dấu vết thực thi phong phú, ghi lại các câu lệnh (prompts), kết quả hoàn thành, tài liệu được truy xuất, các lệnh gọi công cụ, độ trễ và lộ trình quyết định, giúp toàn bộ quy trình có thể quan sát được ở mức độ chi tiết thay vì chỉ nhìn vào đầu vào và đầu ra cuối cùng.
Chúng tôi đã kích hoạt điều này bằng phương pháp lai sử dụng MLflow. Một dòng lệnh duy nhất, mlflow.<library>.autolog, sẽ bật tính năng truy vết tự động, và decorator @mlflow.trace sẽ thêm các span tùy chỉnh ở bất cứ nơi nào chúng tôi cần chi tiết hơn. Các dấu vết được phát ra theo thời gian thực dưới dạng các span OpenTelemetry với ID duy nhất để chúng có thể kết hợp được, và việc tích hợp MLflow với Unity Catalog giúp tập trung hóa việc ghi nhật ký vào các bảng Delta.
Giai đoạn 1: Thiết lập các chiều đánh giá: Trụ cột và Cổng kiểm soát
Khi đã kích hoạt truy vết, bước tiếp theo là nắm bắt từ góc nhìn của mỗi bên liên quan: "Thành công đối với tác nhân này có ý nghĩa gì với bạn?". Chúng tôi chính thức hóa điều này thành các trụ cột đánh giá, mỗi trụ cột đi kèm với các cổng kiểm soát cụ thể.

Điều này biến cuộc tranh luận giữa nhiều bên thành một hợp đồng chung có thể đo lường được. Các tác nhân được đánh giá dựa trên các chiều thực sự quan trọng đối với từng bên liên quan. Các trụ cột điển hình bao gồm trải nghiệm khách hàng, hiệu quả vận hành, rủi ro và tuân thủ, cùng tác động tài chính; mỗi trụ cột đều có các ngưỡng số rõ ràng phải đạt được trước khi triển khai.
Giai đoạn 2: Tập dữ liệu vàng (Golden Dataset): Nền tảng của độ tin cậy
Tập dữ liệu vàng là nguồn sự thật duy nhất để đánh giá hành vi của tác nhân trong vòng lặp phát triển. Nó cần phải:
Mọi bên liên quan cùng tham gia định hình tập dữ liệu, ví dụ như đội ngũ bảo mật đóng góp các ví dụ về các mô hình đối kháng như tấn công tiêm câu lệnh (prompt injection), tấn công danh tính, nỗ lực trích xuất dữ liệu; điều này đảm bảo độ tin cậy được đo lường dựa trên tất cả các kịch bản thực tế cũng như việc sử dụng thông thường.

Các tập dữ liệu là một tài sản sống, và chất lượng của chúng tăng dần theo thời gian. Khoảng cách giữa độ chính xác trong phát triển và sản xuất chính là một tín hiệu về chất lượng tập dữ liệu. Zepto đã đầu tư ổn định vào các tập dữ liệu đánh giá MLflow trong sáu tháng, từ 500 ví dụ với khoảng cách độ chính xác dev–prod là 8 điểm, lên 2.000 ví dụ với khoảng cách 2 điểm, và đạt 5.247 ví dụ với khoảng cách 0,4 điểm. Mỗi giờ dành cho chất lượng tập dữ liệu giúp tiết kiệm khoảng mười giờ gỡ lỗi sản xuất, vì vậy tập dữ liệu vàng trở thành hệ số nhân 10x: mỗi lỗi sản xuất sẽ bổ sung các dấu vết lỗi vào tập dữ liệu vàng và làm cho hệ thống trở nên mạnh mẽ hơn cho tất cả các phiên bản tương lai.
Giai đoạn 3: Tự động hóa Kỹ thuật câu lệnh (Prompt Engineering): Tự động tạo và tự động tối ưu hóa
Thay vì viết thủ công các câu lệnh, chúng tôi biến kỹ thuật câu lệnh thành một quy trình tự động dựa trên dữ liệu. Thiết kế câu lệnh là giai đoạn quan trọng nơi các kỹ sư dành phần lớn thời gian, và chất lượng của câu lệnh có tác động không cân xứng đến chất lượng và hiệu suất đầu ra của tác nhân.
Sử dụng tính năng tối ưu hóa câu lệnh của MLflow, chúng tôi đăng ký một câu lệnh ban đầu, tạo và tối ưu hóa các biến thể dựa trên cùng các bộ chấm điểm (scorers) dùng để kiểm soát triển khai, chạy đánh giá A/B tự động và triển khai kết quả tốt nhất. Bộ tối ưu hóa suy ngẫm với một mô hình mạnh mẽ và chấm điểm các ứng viên sản xuất bằng một mô hình rẻ hơn để quá trình tìm kiếm luôn đảm bảo tính tiết kiệm chi phí trong sản xuất. Điều này giúp giảm bớt việc thử nghiệm câu lệnh thủ công, cải thiện độ chính xác và đảm bảo rằng các cải tiến câu lệnh luôn được đo lường dựa trên tập dữ liệu vàng trước khi đưa vào sản xuất.

Giai đoạn 4: Xác định các bộ chấm điểm và thiết lập Hội đồng AI (AI Jury)
Với các dấu vết đổ về trong vòng lặp sản xuất, chúng ta cần chấm điểm chúng dựa trên các chiều quan trọng đối với chất lượng tác nhân (các chiều đánh giá). Hãy coi đây là một hội đồng AI, nơi mỗi bộ chấm điểm phát huy thế mạnh riêng của mình. MLflow cung cấp ba tùy chọn để tạo các bộ chấm điểm.
Chúng tôi chỉ sử dụng các bộ chấm điểm dựa trên LLM khi cần sự phán đoán giống con người và dựa vào các quy tắc đơn giản khi logic xác định là đủ. Chúng tôi hiệu chỉnh các "giám khảo" dựa trên nhãn của con người để đạt được sự đồng thuận từ 80–90% và sử dụng nhiều giám khảo cho các quyết định có rủi ro cao.
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.