Sản phẩm
Google ra mắt Data Commons trên Spanner Graph: Hợp nhất dữ liệu công cộng và riêng tư
(giờ Việt Nam)
Tóm tắt AI
Google Cloud chính thức phát hành Data Commons trên Spanner Graph, cho phép doanh nghiệp kết hợp dữ liệu nội bộ với các tập dữ liệu công cộng để xây dựng tri thức đồ thị (knowledge graph) mạnh mẽ.
Bản dịch AI

Để đưa ra các quyết định sáng suốt, doanh nghiệp thường cần kết nối dữ liệu nội bộ với dữ liệu tham chiếu công khai nhằm tạo ra một đồ thị tri thức (knowledge graph) liên kết các thực thể trong thế giới thực và mối quan hệ giữa chúng. Tuy nhiên, việc kết nối dữ liệu từ thế giới công khai và riêng tư vốn dĩ rất phức tạp. Hôm nay, chúng tôi đang đơn giản hóa các kết nối này với việc ra mắt chính thức Data Commons trên Spanner Graph và bản xem trước của Data Commons Platform mới, giúp hợp nhất tri thức riêng của bạn với các đồ thị tri thức từ những tập dữ liệu công khai.
Dự án Data Commons bao quát hỗ trợ sứ mệnh của Google trong việc tổ chức thông tin của thế giới và làm cho thông tin đó trở nên hữu ích và có thể truy cập được trên toàn cầu. Data Commons hợp nhất các tập dữ liệu công khai rời rạc từ hơn 100 nhà cung cấp uy tín, bao gồm Liên Hợp Quốc, Ngân hàng Thế giới, Cục Thống kê Dân số Hoa Kỳ, Eurostat, WHO và NOAA, với hơn 400 tỷ điểm dữ liệu được cấu trúc bằng các định nghĩa Schema.org tiêu chuẩn. Data Commons cung cấp các công cụ khám phá dữ liệu, công cụ MCP và các API dựa trên đám mây để truy cập và tích hợp các tập dữ liệu sạch này.
Data Commons tích hợp thông tin công khai trên nhiều lĩnh vực, bao gồm nông nghiệp, nhân khẩu học, kinh tế, môi trường và y tế. Cách tiếp cận tiêu chuẩn hóa này mở ra các trường hợp sử dụng mạnh mẽ, chẳng hạn như cho phép bạn phân tích xu hướng GDP quốc gia, lập bản đồ mức độ ô nhiễm khói bụi theo khu vực, theo dõi sự công bằng trong y tế tại địa phương hoặc phân bổ nhân khẩu học theo thời gian, tất cả đều sử dụng dữ liệu đã được tiền xử lý và chuẩn hóa cho bạn.
Các chiều dữ liệu của đồ thị tri thức Data Commons
Chiều dữ liệu
Quy mô
Mô tả kỹ thuật
Các quan sát thống kê
Hơn 400 tỷ
Các điểm dữ liệu chỉ số cá nhân
Các cạnh đồ thị (Graph edges)
Hơn 2,6 tỷ
Các mối quan hệ
Các nút đồ thị tri thức (Knowledge graph nodes)
Hơn 1,7 tỷ
Các thực thể tiêu chuẩn hóa
Nguồn dữ liệu
Hơn 100 nhà cung cấp
Các tổ chức uy tín
Data Commons cung cấp một lượng lớn dữ liệu hành chính công khai có ý nghĩa cho người dùng trên cơ sở hạ tầng dựa trên đám mây dễ dàng sử dụng.
Cơ sở hạ tầng hiện đại được vận hành bởi Spanner Graph
Khi chúng tôi xây dựng Data Commons lần đầu tiên, mục tiêu của chúng tôi là tổng hợp các tập dữ liệu công khai khổng lồ, rời rạc bằng cách sử dụng các công cụ có sẵn vào thời điểm đó. Nền tảng này dựa vào Bigtable như một lớp lưu trữ đệm (caching layer), đây là một chiến lược hiệu quả để xử lý các truy vấn quy mô lớn khi chưa có công nghệ cơ sở dữ liệu đồ thị gốc.
Ngày nay, chúng tôi đã chuyển đổi kiến trúc của mình sang mô hình đồ thị gốc với Spanner Graph, mang lại sự tiện lợi của giao diện kiểu SQL và khả năng biểu đạt đồ thị cho Spanner, cùng với tính sẵn sàng cao, khả năng mở rộng ngang, tính nhất quán giao dịch đa vùng và hỗ trợ ngôn ngữ truy vấn đồ thị ISO/IEC 39075 (GQL) gốc.
Bằng cách áp dụng lược đồ Spanner Graph đa thực thể, chúng tôi biểu diễn các thực thể dưới dạng các nút và các liên kết miền của chúng dưới dạng các cạnh đồ thị động, cho phép chúng tôi loại bỏ các cấu trúc bộ nhớ đệm được tính toán trước và thực hiện các truy vấn mối quan hệ phức tạp trực tiếp trong cơ sở dữ liệu bằng GQL.
Kiến trúc này cũng đơn giản hóa các đường ống (pipelines) của chúng tôi bằng cách loại bỏ nhu cầu về các chỉ mục phức tạp, được tính toán trước vốn đòi hỏi việc xây dựng lại trong bộ nhớ tốn kém và nhiều bản chụp (snapshots). Spanner Graph cho phép cập nhật gia tăng cho các tập dữ liệu cụ thể mà không cần làm mới toàn bộ cơ sở dữ liệu, trong khi các lần đọc cũ (stale reads) duy trì các bản chụp dữ liệu nhất quán trong quá trình nhập dữ liệu.
Những lợi ích chính khi chuyển sang Spanner Graph
Lưu trữ hợp nhất và cập nhật gia tăng: Bằng cách sử dụng lược đồ đa thực thể của Spanner Graph, nền tảng thay thế các bộ nhớ đệm phức tạp bằng một mô hình hỗ trợ nhập dữ liệu gia tăng, cho phép cập nhật có mục tiêu cho các tập dữ liệu cụ thể.
Duyệt đồ thị động thông qua GraphRAG: Hệ thống thực thi các truy vấn đa chặng như điều hướng các phân cấp từ lục địa → quốc gia → tiểu bang → quận → thành phố ngay lập tức. Điều này loại bỏ sự phụ thuộc vào các bộ nhớ đệm tĩnh và cho phép các quy trình làm việc GraphRAG, nơi cơ sở dữ liệu ánh xạ các truy vấn ngôn ngữ tự nhiên trực tiếp sang các thao tác duyệt khớp đường dẫn có cấu trúc.
Các bản chụp dữ liệu nhất quán: Tận dụng Spanner TrueTime và các lần đọc cũ, nền tảng cung cấp cho bạn một bản chụp dữ liệu nhất quán về phiên bản, duy trì tính toàn vẹn trên các nút phân tán sau các chu kỳ nhập dữ liệu hàng loạt.
Phân tích vận hành ở quy mô lớn: Công cụ dạng cột của Spanner quét hiệu quả các tập dữ liệu chuỗi thời gian khổng lồ bằng cách chỉ đọc các trường cần thiết, trong khi sự liên kết với BigQuery tận dụng công nghệ Data Boost của Spanner để thực hiện các phép tổng hợp phức tạp thông qua EXTERNAL_QUERY trong một môi trường biệt lập, giúp cô lập lưu lượng truy cập sản xuất.
Kết nối các hệ thống với khả năng tương tác SDMX 3.0
Để tạo điều kiện thuận lợi cho việc sử dụng dữ liệu thống kê phức tạp, Data Commons áp dụng một triển khai tinh gọn của tiêu chuẩn kỹ thuật Statistical Data and Metadata eXchange (SDMX). Là một đặc tả ISO, SDMX cung cấp một cách tiếp cận nhất quán để mô tả và trao đổi dữ liệu thống kê cùng với thông tin siêu dữ liệu thống kê mô tả.
Trong bản cập nhật Data Commons Platform này, chúng tôi đã thêm hỗ trợ cho tiêu chuẩn kỹ thuật SDMX phiên bản 3.0, cung cấp khả năng tích hợp sẵn với các công cụ của bên thứ ba như Tableau, Flourish và Observable cho các tập dữ liệu đa chiều. Điều này có thể thực hiện được nhờ sử dụng các định dạng API tiêu chuẩn SDMX-JSON và SDMX-CSV 2.0 trên hai điểm cuối có giá trị cao:
API khả dụng (Availability API): Một cơ chế khám phá theo chương trình để xác định các chiều, biến và phạm vi ngày hiện có mà không cần đọc các giá trị thô.
API dữ liệu (Data API): Truy xuất các quan sát và siêu dữ liệu thực tế, sử dụng các tham số được đặt tên để giúp ngăn mã bị lỗi khi các chiều dữ liệu được thêm vào.
Chuyển đổi các phiên bản riêng của Data Commons Platform
Đối với các tổ chức muốn xây dựng các phiên bản riêng của Data Commons Platform, kiến trúc hiện đại mới này giải quyết các giới hạn mở rộng cũ và đơn giản hóa việc sơ đồ hóa dữ liệu. Các nhà phát triển có thể khởi tạo một phiên bản riêng của Data Commons Platform bằng cách tận dụng cùng công nghệ có khả năng mở rộng đang vận hành phiên bản Data Commons của Google. Với tư cách là một phiên bản riêng, người dùng giữ toàn quyền kiểm soát dữ liệu của riêng mình và có khả năng hạn chế quyền truy cập, đồng thời cho phép các truy vấn ngôn ngữ tự nhiên kết hợp kết quả từ dữ liệu riêng của họ với dữ liệu công khai của Google được lưu trữ trên phiên bản Google Data Commons. Bằng cách liên kết giữa đồ thị tri thức công khai của chúng tôi và đồ thị tri thức riêng chứa dữ liệu của chính bạn, bạn có thể kích hoạt các trường hợp sử dụng mới thú vị, đồng thời duy trì sự cô lập dữ liệu và đảm bảo không có sự trùng lặp dữ liệu.
Ví dụ, một doanh nghiệp bán lẻ có thể kết hợp dữ liệu công khai như xu hướng GDP quốc gia, phân tích nhân khẩu học theo khu vực và thống kê việc làm với dữ liệu doanh nghiệp của riêng họ, bao gồm lịch sử bán hàng, chỉ số hiệu suất cửa hàng và hậu cần chuỗi cung ứng. Điều này cho phép các nhà phân tích đối chiếu các chỉ số kinh tế vĩ mô công khai với các giao dịch của công ty họ để tối ưu hóa việc phân phối hàng hóa và xác định các thị trường chưa được khai thác.

Bài viết được AI dịch và tổng hợp tự động từ Google Cloud: Databases. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.