Thủ thuật
LangChain xây dựng kiến trúc dữ liệu Agent-First: Tăng hiệu suất phân tích tự phục vụ gấp 40 lần
(giờ Việt Nam)
Tóm tắt AI
LangChain kết hợp Hex, dbt và các mô hình ngữ nghĩa để tạo ra hệ thống dữ liệu thông minh, cho phép truy vấn bằng ngôn ngữ tự nhiên với độ tin cậy cao, giúp quy mô phân tích tự phục vụ tăng vọt 40 lần.
Bản dịch AI
Trong năm qua, đội ngũ dữ liệu của chúng tôi đã suy nghĩ lại về cách thức phát triển hạ tầng (stack) để hỗ trợ các tác nhân AI (agents). Hầu hết các hạ tầng dữ liệu doanh nghiệp đều được xây dựng xoay quanh bảng điều khiển (dashboards), báo cáo và quy trình làm việc SQL. Những công cụ đó vẫn hữu ích, nhưng các agent đã thay đổi những gì mà lớp dữ liệu cần cung cấp.
Một agent có thể trả lời nhiều câu hỏi hơn khi nó có các định nghĩa rõ ràng, nguồn dữ liệu đáng tin cậy, bối cảnh kinh doanh và quyền truy cập vào logic đằng sau dữ liệu đó. Nếu thiếu bối cảnh, nó vẫn có thể tạo ra mã SQL, nhưng các câu trả lời sẽ khó được tin tưởng hơn. Agent có thể bỏ lỡ các định nghĩa đặc thù của công ty, sử dụng sai bảng dữ liệu hoặc trả lời một câu hỏi theo cách đúng về mặt kỹ thuật nhưng lại không thực sự hữu ích cho doanh nghiệp.
Chúng tôi muốn giúp việc truy cập dữ liệu trên toàn công ty trở nên dễ dàng hơn, đồng thời cung cấp cho các agent đủ bối cảnh để trả lời câu hỏi một cách chính xác và giải thích cách chúng đưa ra kết quả đó.
Chúng tôi đã thực hiện một bước chuyển đổi lớn về kiến trúc, chuyển từ hạ tầng dữ liệu tập trung vào công cụ BI truyền thống sang hạ tầng được thiết kế cho phân tích tự phục vụ (self-serve), chia sẻ bối cảnh và sử dụng cho agent.
Kết quả chính
Nơi chúng tôi bắt đầu
Trước khi chuyển đổi, gần như mọi yêu cầu về dữ liệu đều phải thông qua đội ngũ dữ liệu. Vào thời điểm đó, đội ngũ này chỉ có một người.
Công cụ BI truyền thống hiện có hoạt động tốt cho các báo cáo định sẵn, nhưng nó lại thiếu linh hoạt. Việc phân tích khám phá rất khó để cộng tác, khó chia sẻ và khó để bất kỳ ai ngoài đội ngũ dữ liệu có thể tự mình tìm hiểu trừ khi dữ liệu đã được mô hình hóa và hiển thị trong lớp BI.
Tất cả những điều này tạo ra một nút thắt cổ chai. Mọi người trong công ty đều có những câu hỏi hay, nhưng để trả lời chúng thường đòi hỏi một thành viên trong đội ngũ dữ liệu phải diễn giải câu hỏi, tìm mô hình phù hợp, viết hoặc điều chỉnh truy vấn, xác thực kết quả và gửi lại câu trả lời. Đội ngũ dữ liệu đã dành quá nhiều thời gian để xử lý các yêu cầu đơn lẻ thay vì tập trung vào phân tích chuyên sâu, mô hình hóa và các dự án liên chức năng.
Chúng tôi cần một hạ tầng ưu tiên agent (agent-first stack) có thể hỗ trợ nhiều loại người dùng khác nhau cùng một lúc.
Một số người muốn các bảng điều khiển bóng bẩy. Một số muốn sử dụng notebook và SQL. Một số khác lại muốn một giao diện hội thoại có thể giúp họ trả lời câu hỏi mà không cần biết dữ liệu nằm ở đâu. Các kỹ sư và người vận hành kỹ thuật cần sự linh hoạt, trong khi nhiều người dùng kinh doanh lại cần một cách thức khám phá an toàn và có hướng dẫn hơn.
Chúng tôi cũng muốn có một nơi tập trung duy nhất cho công việc dữ liệu. Chúng tôi đã cân nhắc việc giữ lại công cụ BI cũ và thêm một công cụ mới, nhưng điều đó sẽ làm phân mảnh việc sử dụng, bối cảnh và độ tin cậy giữa hai hệ thống.
Cách chúng tôi đánh giá công cụ
Chúng tôi tìm kiếm nhiều hơn là một sự thay thế cho bảng điều khiển.
Khi đánh giá các nhà cung cấp khác nhau, chúng tôi muốn một đơn vị xây dựng các tính năng AI trực tiếp vào sản phẩm và coi trải nghiệm agent là một phần của quy trình làm việc cốt lõi. Chúng tôi cũng muốn một bố cục notebook giúp người dùng kỹ thuật và kỹ sư dễ dàng xây dựng những gì họ cần mà không phải chờ đợi đội ngũ dữ liệu cho mỗi lần lặp lại.
Đối với người dùng không chuyên về kỹ thuật, chúng tôi cần một nơi mà họ có thể đặt câu hỏi kinh doanh, nhận được câu trả lời sơ bộ hợp lý và hiểu được agent đã sử dụng những nguồn dữ liệu nào.
Cuối cùng, chúng tôi đã chọn Hex. Nó hoạt động tốt với bảng điều khiển, notebook và phân tích hội thoại, giúp việc lựa chọn một không gian làm việc dữ liệu tập trung duy nhất trở nên dễ dàng hơn.
Mọi người hiện tương tác với agent của Hex thông qua nhiều bề mặt (surfaces):
Việc có phạm vi tiếp cận rộng là rất quan trọng để áp dụng công nghệ. Quyền truy cập agent sẽ hữu ích nhất khi mọi người có thể sử dụng nó ngay tại nơi họ làm việc. Một quản lý sản phẩm có thể muốn hỏi về hành vi người dùng trong Hex. Một đồng nghiệp trong nhóm GTM có thể muốn hỏi về pipeline từ Slack. Một người dùng kỹ thuật có thể muốn tương tác thông qua CLI hoặc MCP.
Chúng tôi đã thấy rất nhiều trường hợp sử dụng đa dạng giữa các nhóm:
Đây là những loại câu hỏi từng tạo ra hàng đợi chờ đợi cho đội ngũ dữ liệu. Giờ đây, bước đầu tiên thường có thể thực hiện trực tiếp trong công cụ, với đội ngũ dữ liệu sẵn sàng hỗ trợ xác thực, phân tích chuyên sâu hơn hoặc đưa ra các quyết định cần sự chặt chẽ hơn.
Những gì đã thay đổi sau khi chúng tôi chuyển đổi
Chúng tôi đã chuyển đổi 100% khỏi công cụ BI cũ trong vòng sáu tuần.
Ngày nay, 100% công ty sử dụng hạ tầng dữ liệu ưu tiên agent của chúng tôi, thông qua Hex, dưới một hình thức nào đó.
Khoảng 70% người dùng có quyền truy cập chỉ đọc (read-only) và khoảng 30% có quyền truy cập agent. Các vai trò này được tự phục vụ thông qua bộ phận IT, vì vậy bất kỳ ai cũng có thể yêu cầu quyền truy cập agent khi họ cần.
Rất nhiều cuộc hội thoại đó đại diện cho những câu hỏi trước đây vốn phải thông qua đội ngũ dữ liệu. Tuy nhiên, đội ngũ dữ liệu không hoàn toàn biến mất khỏi quy trình làm việc. Những câu hỏi đến với chúng tôi giờ đây phức tạp hơn và có giá trị cao hơn. Chúng tôi dành nhiều thời gian hơn cho công việc cần bối cảnh kinh doanh sâu sắc, mô hình hóa dữ liệu mạnh mẽ hơn hoặc sự phối hợp liên chức năng.
Đây chính là mục tiêu của chúng tôi. Chúng tôi muốn việc tự phục vụ xử lý nhiều hơn các phân tích đơn giản, đồng thời giúp đội ngũ dữ liệu dễ dàng tập trung vào những công việc tạo ra tác động kinh doanh thực sự.
Cách chúng tôi suy nghĩ về bối cảnh
Trải nghiệm agent phụ thuộc vào bối cảnh.
Chúng ta càng mô tả rõ ràng về doanh nghiệp, dữ liệu, chỉ số và quy trình nội bộ, agent càng có thể trả lời các câu hỏi về công ty tốt hơn. Việc cung cấp bối cảnh chính là yếu tố giúp các agent tạo ra các phân tích hữu ích từ việc truy cập dữ liệu thô.
Đối với chúng tôi, bối cảnh đến từ nhiều nơi. Mỗi lớp cung cấp cho agent một loại thông tin khác nhau.
Cách chúng tôi định nghĩa các mô hình dữ liệu
dbt là một trong những nơi chính mà chúng tôi quản lý bối cảnh về các mô hình dữ liệu của mình. Bối cảnh đó tồn tại trong cả SQL và các định nghĩa bằng văn bản.
Mỗi bảng và cột nên giúp một người hiểu dữ liệu đó đại diện cho cái gì, nên được sử dụng như thế nào và đâu là các trường hợp biên (edge cases). Những định nghĩa đó cũng giúp ích cho agent.
Một định nghĩa cột yếu có thể nói là:
Điều đó chính xác về mặt kỹ thuật, nhưng nó không cho người đọc biết nhiều thông tin.
Một định nghĩa mạnh hơn sẽ nói là:
Định nghĩa này cung cấp cho agent bối cảnh kinh doanh, các giá trị được phép, hướng dẫn diễn giải và quy tắc lọc mặc định. Nó cũng làm giảm khả năng ai đó nhận được câu trả lời đúng về mặt kỹ thuật nhưng lại dựa trên cách diễn giải kinh doanh sai lệch.
Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.