# S&P Global Energy biến dữ liệu cấu trúc thành hội thoại với Databricks Genie Agents và MCP

- Nguồn: Databricks: Blog
- Thời gian phát hành: 2026-09-25 23:00 (giờ Việt Nam)
- Điểm AI: 48/100
- Link AIHOT.vn: https://aihot.vn/items/8373b097d134d719
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuh6xynu06ocro55kgpecqjp
- Link gốc: https://www.databricks.com/blog/data-dialogue-how-sp-global-energy-made-its-structured-data-estate-conversational-databricks

## Tóm tắt AI

S&P Global Energy đã triển khai Databricks Genie Agents dưới dạng máy chủ MCP được quản lý, cho phép khách hàng truy vấn dữ liệu cấu trúc thông qua ngôn ngữ tự nhiên một cách an toàn và hiệu quả.

## Thân bài

![From Data to Dialogue: How S&P Global Energy Made Its Structured Data Estate Conversational with Databricks Genie Agents and MCP](https://www.databricks.com/sites/default/files/2026-09/Untitled-design-11.png)

> Mục tiêu của S&P Global là cải thiện căn bản cách khách hàng khám phá và tiêu thụ thông tin chi tiết từ các sản phẩm dữ liệu và nghiên cứu của chúng tôi. Mặc dù tìm kiếm và tóm tắt bằng AI rất quan trọng, nhưng giá trị kinh doanh lớn hơn đến từ việc cho phép ra quyết định nhanh hơn thông qua truy cập ngôn ngữ tự nhiên vào dữ liệu đáng tin cậy, phân tích đa hàng hóa phong phú hơn và khả năng kết nối các thông tin chi tiết vốn tồn tại riêng biệt trong các mảng kinh doanh. Các AI agent giúp khách hàng khám phá các mối quan hệ, tạo nghiên cứu hiệu quả hơn và rút ra thông tin có thể hành động từ tập hợp thông tin rộng lớn hơn so với trước đây. —Priyanka John, Phó Chủ tịch, S&P Global Energy

Nếu bạn đã từng cố gắng cung cấp một kho dữ liệu có cấu trúc lớn và phức tạp cho các AI agent và trợ lý, có lẽ bạn đã gặp phải bức tường giống như chúng tôi: các agent chỉ tốt khi chúng có thể tiếp cận ngữ cảnh, và dữ liệu doanh nghiệp hiếm khi nằm ở một nơi gọn gàng, được ghi chép đầy đủ.

Tại [S&P Global Energy,](https://www.spglobal.com/energy/en) dữ liệu của chúng tôi trải dài trên các lĩnh vực Hóa chất, Dầu thô, Sản phẩm tinh chế, Khí đốt & Điện, Khí thiên nhiên hóa lỏng (LNG) và nhiều lĩnh vực khác — và mỗi loại hàng hóa tự nó là một tập hợp dữ liệu phong phú. Riêng LNG đã bao gồm thông số kỹ thuật cơ sở hạ tầng, hàng hóa, sự cố, các yếu tố cơ bản về cung cầu, netback, giá lịch sử và dự báo, cùng các hợp đồng. Hóa chất bao gồm công suất, sản xuất, hiệu suất sử dụng, thương mại, nhu cầu theo mục đích sử dụng cuối và theo sản phẩm phái sinh, thay đổi hàng tồn kho, và cán cân cung-cầu theo quốc gia và khu vực. Các loại hàng hóa khác của chúng tôi cũng tuân theo các mô hình tương tự. Dữ liệu này nằm trên Databricks và một số nguồn không phải Databricks.

Mục tiêu của chúng tôi đầy tham vọng nhưng dễ hiểu: làm cho toàn bộ kho dữ liệu có cấu trúc của chúng tôi sẵn sàng cho việc tiêu thụ bên ngoài bởi các AI agent thông qua Model Context Protocol (MCP) — để các agent và trợ lý của khách hàng, cũng như của chính chúng tôi, có thể đặt câu hỏi bằng ngôn ngữ tự nhiên và nhận được các câu trả lời đáng tin cậy, được quản trị.

Chúng tôi đã đánh giá một vài phương pháp. Cách hiệu quả nhất đối với chúng tôi, với khoảng cách lớn, là [Databricks Genie Agents](https://www.databricks.com/product/genie/agents), được triển khai dưới dạng các [MCP servers](https://docs.databricks.com/aws/en/agents/mcp-tools/genie-agent) được quản lý, kết hợp thành các gói theo miền cụ thể với một lớp proxy MCP.

Trong bài viết này, bạn sẽ tìm hiểu:

- Cách các chuyên gia về chủ đề (SME) của chúng tôi quản lý các Genie Agent tập trung — mỗi nhóm tập dữ liệu trong mỗi loại hàng hóa một agent — mà không cần viết một dòng mã agent nào.
- Cách mỗi Genie Agent tự động trở thành một MCP server được quản trị, sẵn sàng kết nối vào bất kỳ client hoặc agent tương thích MCP nào.
- Cách chúng tôi sử dụng proxy dựa trên FastMCP để kết hợp nhiều Genie MCP server thành các điểm cuối tổng hợp cho các câu hỏi đa miền.
- Tại sao kiến trúc này rút ngắn đáng kể thời gian đưa các sản phẩm dữ liệu hỗ trợ bởi AI ra thị trường.

> Genie Agents cho phép các chuyên gia miền của chúng tôi trực tiếp sản phẩm hóa kiến thức của họ về dữ liệu. Những gì từng mất cả một chu kỳ phát triển giờ đây chỉ mất vài ngày, và mọi câu trả lời đều nằm trong phạm vi quản trị của chúng tôi. —Priyanka John, Phó Chủ tịch, S&P Global Energy

### Thách thức: Dữ liệu có cấu trúc dễ lưu trữ, khó đối thoại

Các mô hình ngôn ngữ lớn rất giỏi trong việc đối thoại và suy luận, nhưng chúng không thể trả lời các câu hỏi về dữ liệu của bạn trừ khi bạn xây dựng một cầu nối đến đó. Đối với dữ liệu doanh nghiệp có cấu trúc, cầu nối đó trong lịch sử thường là một trong những cách sau:

1. Các đường ống text-to-SQL được xây dựng thủ công — mạnh mẽ nhưng dễ hỏng. Mỗi thay đổi về lược đồ, mỗi tên cột mơ hồ, mỗi định nghĩa chỉ số đặc thù của miền (“Điều gì được tính là một ngày sự cố?”) đều trở thành một nhiệm vụ kỹ thuật.
2. API tùy chỉnh cho từng trường hợp sử dụng — mỗi mẫu câu hỏi mới cần một điểm cuối mới, một sprint mới, một bản phát hành mới.
3. Xuất dữ liệu sang các công cụ AI bên ngoài — điều này làm trùng lặp dữ liệu, phá vỡ tính cập nhật và nằm ngoài phạm vi quản trị của bạn.

Mỗi phương pháp này đều có chung một vấn đề: những người hiểu dữ liệu nhất — các SME và nhà phân tích của chúng tôi — không phải là những người xây dựng lớp truy cập. Mọi thông tin chi tiết đều phải thông qua một danh sách chờ kỹ thuật. Thời gian đưa ra thị trường cho một trải nghiệm dữ liệu đối thoại mới của chúng tôi được tính bằng tháng.

Chúng tôi cần một phương pháp mà các chuyên gia miền có thể trực tiếp quản lý và xuất bản quyền truy cập đối thoại vào dữ liệu, bộ phận kỹ thuật có thể chuẩn hóa cách các agent kết nối, và việc quản trị vẫn được tập trung. Đó chính xác là những gì Genie Agents cộng với MCP đã mang lại cho chúng tôi.

### Kiến trúc: Genie Agents đóng vai trò là lớp ngữ nghĩa, MCP đóng vai trò là hợp đồng

![Reference architecture ](https://www.databricks.com/sites/default/files/inline-images/image1_128.png?v=1790291334)

Kiến trúc của chúng tôi có ba lớp, và mỗi lớp được sở hữu bởi những người phù hợp nhất với nó. Sơ đồ trên cho thấy luồng end-to-end — bao gồm những gì nằm trong mạng lưới S&P Global Energy và những gì nằm trong môi trường client bên ngoài.

### Lớp 1: Các SME quản lý một Genie Agent cho mỗi nhóm tập dữ liệu

Đây là nơi phép màu bắt đầu, và đáng chú ý là nó không yêu cầu mã nguồn.

Các SME của chúng tôi bắt đầu bằng việc chọn các bảng liên quan đến một miền kinh doanh:

- Nếu các bảng đã nằm trong Databricks, họ sử dụng chúng trực tiếp thông qua Unity Catalog.
- Nếu dữ liệu nằm trong nguồn không phải Databricks, họ đưa nó vào thông qua các kết nối [Lakehouse Federation](https://docs.databricks.com/aws/en/sql/language-manual/sql-ref-federated-queries) — không di chuyển dữ liệu, không có đường ống trùng lặp. Các bảng liên kết xuất hiện cùng với các bảng gốc và kế thừa cùng một sự quản trị.

Sau đó, họ nhóm các bảng liên quan và tạo một Genie Agent cho mỗi nhóm tập dữ liệu — không phải một agent khổng lồ cho mỗi loại hàng hóa. Mỗi danh mục con của một loại hàng hóa trở thành một Genie Agent tập trung riêng. Ví dụ, trong LNG:

- Genie Agent về Tài sản & Hợp đồng LNG — tài sản, nhà vận hành, dự báo công suất và hợp đồng dài hạn
- Genie Agent về Hàng hóa LNG — theo dõi hàng hóa, hợp đồng vận chuyển, điểm đi/đến và các điều khoản thương mại
- Genie Agent về Đấu thầu LNG — các gói thầu với bên phát hành, khối lượng và thời hạn giao hàng
- Genie Agent về Sự cố LNG — các sự cố và sự kiện bảo trì ảnh hưởng đến công suất
- Genie Agent về Cung & Cầu LNG — các yếu tố cơ bản với phân tách khu vực và lịch sử kịch bản
- Genie Agent về Netback LNG — netback từ giá trung tâm, cước vận chuyển, bay hơi và tổn thất
- Genie Agent về Giá LNG — các đường cong giá lịch sử và dự báo

Mọi loại hàng hóa khác đều tuân theo mô hình tương tự với các danh mục con của riêng nó. Ví dụ, Hóa chất có các Genie Agent cấp nhóm cho công suất, sản xuất, hiệu suất sử dụng công suất, thương mại, nhu cầu theo mục đích sử dụng cuối và theo sản phẩm phái sinh, thay đổi hàng tồn kho, và cán cân cung-cầu theo quốc gia và khu vực; Dầu thô, Sản phẩm tinh chế, và Khí đốt & Điện cũng được tổ chức tương tự. Kết quả là một đội ngũ các Genie Agent nhỏ, phạm vi hẹp thay vì một vài công cụ AI rời rạc, cồng kềnh.

Bên trong mỗi agent, các SME thêm ngữ cảnh giúp text-to-SQL thực sự hoạt động trong thế giới thực: mô tả về bảng và cột, truy vấn mẫu, tài sản đáng tin cậy cho các chỉ số quan trọng và định nghĩa kinh doanh (ví dụ: “lưu trữ nổi được định nghĩa là hàng hóa nằm chờ từ 3 ngày trở lên trên các tàu di chuyển dưới tốc độ ngưỡng”). Đây là bước mà các giải pháp text-to-SQL chung chung bỏ qua — và đây là bước quyết định liệu người dùng có tin tưởng vào câu trả lời hay không.

Thông tin chi tiết quan trọng về tổ chức: quản lý dữ liệu đã trở thành một hoạt động chuyên môn, không phải hoạt động kỹ thuật. Người hiểu rõ “lưu trữ nổi” nghĩa là gì trong ngữ cảnh LNG chính là người dạy cho Genie biết điều đó.

### Lớp 2: Mỗi Genie Agent tự động trở thành một MCP server

Đây là nơi Databricks đã thực hiện phần việc nặng nhọc thay cho chúng ta. Mỗi Genie Agent được cung cấp sẵn dưới dạng một MCP server do Databricks quản lý, tại một endpoint có dạng:

https://<workspace-hostname>/api/2.0/mcp/genie/{genie_space_id}

Không cần phải triển khai hay lưu trữ bất cứ thứ gì. Mỗi server cung cấp một giao diện công cụ nhỏ gọn, sạch sẽ — về cơ bản là hai công cụ cho mỗi agent:

1. Một công cụ truy vấn (genie_query_space) — agent gửi một câu hỏi bằng ngôn ngữ tự nhiên đến agent.
2. Một công cụ phản hồi (genie_poll_response) — agent thực hiện thăm dò với cùng ID hội thoại và ID tin nhắn để truy xuất phản hồi đầy đủ khi nó sẵn sàng, bao gồm cả SQL được tạo và tập kết quả.

Mô hình hai công cụ, hỏi-rồi-thăm dò này tỏ ra rất phù hợp cho các khối lượng công việc của agent: các câu hỏi chạy bất đồng bộ trên SQL warehouse, và agent thực hiện thăm dò với ID hội thoại và ID tin nhắn do công cụ truy vấn trả về cho đến khi có phản hồi.

Quan trọng không kém, các server được quản lý này được kiểm soát bởi Unity Catalog. Một Genie Agent — hoặc người dùng đứng sau nó — chỉ có thể tiếp cận các agent và bảng dữ liệu cơ sở mà họ có quyền truy cập. Xác thực được xử lý bởi nền tảng. Chúng tôi không cần phải xây dựng một lớp bảo mật xung quanh quyền truy cập AI của mình; chúng tôi kế thừa lớp bảo mật sẵn có.

### Lớp 3: Kết hợp các Genie Agent theo nhóm thành các gói hàng hóa với FastMCP proxy

Mỗi Genie Agent cho một nhóm tập dữ liệu giúp từng agent tập trung và chính xác hơn. Nhưng các câu hỏi kinh doanh thực tế thường xuyên đan xen giữa các nhóm: “Các sự cố gần đây tại Sabine Pass đã ảnh hưởng thế nào đến phí vận chuyển hàng hóa vào châu Á?” tác động đến cả Genie Agent về Sự cố (Outages) và Hàng hóa (Cargo), và các câu hỏi liên quan đến nhiều loại hàng hóa như “Giá naphtha đang ảnh hưởng thế nào đến biên lợi nhuận sản xuất hóa chất?” tiếp cận cả Genie Agent về Sản phẩm tinh chế (Refined Products) và Hóa chất (Chemicals).

Thay vì xây dựng một agent khổng lồ (điều này làm giảm chất lượng câu trả lời) hoặc buộc mọi client phải cấu hình hàng tá server riêng biệt, chúng tôi đã sử dụng các khả năng proxy và kết hợp của FastMCP để tạo ra các endpoint MCP tổng hợp — thường là một endpoint cho mỗi loại hàng hóa, gắn các server Genie MCP cấp nhóm của hàng hóa đó phía sau một server duy nhất với các công cụ được đặt tên theo không gian (name-spaced). Các thành phần tổng hợp cấp cao hơn có thể gộp nhiều loại hàng hóa theo cùng cách thức:

from fastmcp import FastMCP

# Mỗi Genie Agent cấp nhóm là một MCP server được quản lý trên Databricks cargo = FastMCP.as_proxy(genie_mcp_config(“lng_cargo_agent_id”), name=“cargo”) outages = FastMCP.as_proxy(genie_mcp_config(“lng_outages_agent_id”), name=“outages”) netbacks = FastMCP.as_proxy(genie_mcp_config(“lng_netbacks_agent_id”), name=“netbacks”)

# Kết hợp các Genie nhóm thành một gói hàng hóa lng = FastMCP(name=“lng-composite”) lng.mount(cargo, prefix=“cargo”) lng.mount(outages, prefix=“outages”) lng.mount(netbacks, prefix=“netbacks”)

# Mô hình tương tự được lặp lại cho Hóa chất, Dầu thô, Sản phẩm tinh chế, Than đá …

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.databricks.com/blog/data-dialogue-how-sp-global-energy-made-its-structured-data-estate-conversational-databricks>
