Databricks: Blog
85

Thủ thuật

Databricks hướng dẫn cách xây dựng các sản phẩm dữ liệu chất lượng và đáng tin cậy

(giờ Việt Nam)

Tóm tắt AI

Databricks chia sẻ lộ trình giúp doanh nghiệp kiến tạo các sản phẩm dữ liệu chất lượng cao, đảm bảo độ tin cậy làm nền tảng vững chắc cho quá trình chuyển đổi AI và dữ liệu.

Bản dịch AI

Building High-Quality and Trusted Data Products with Databricks

Giới thiệu

Các tổ chức hướng tới việc trở thành doanh nghiệp dựa trên dữ liệu và AI thường cần cung cấp cho các nhóm nội bộ những sản phẩm dữ liệu đáng tin cậy và chất lượng cao. Việc xây dựng các sản phẩm dữ liệu như vậy đảm bảo rằng tổ chức thiết lập được các tiêu chuẩn và nền tảng chân thực về kinh doanh cho các mục tiêu dữ liệu và AI của mình. Một phương pháp đặt chất lượng và khả năng sử dụng lên hàng đầu là thông qua việc sử dụng mô hình data mesh để dân chủ hóa quyền sở hữu và quản lý tài sản dữ liệu. Các bài blog của chúng tôi (Phần 1, Phần 2) cung cấp hướng dẫn về cách khách hàng có thể tận dụng Databricks trong doanh nghiệp của họ để giải quyết các trụ cột nền tảng của data mesh, trong đó một trụ cột là "dữ liệu như một sản phẩm" (data as a product).

Mặc dù ý tưởng coi dữ liệu là sản phẩm có thể đã trở nên phổ biến cùng với sự xuất hiện của data mesh, chúng tôi nhận thấy rằng việc áp dụng tư duy sản phẩm vẫn tạo được tiếng vang ngay cả với những khách hàng chưa chọn áp dụng data mesh. Bất kể cấu trúc tổ chức hay kiến trúc dữ liệu như thế nào, việc ra quyết định dựa trên dữ liệu vẫn là nguyên tắc chỉ đạo phổ quát. Chất lượng và khả năng sử dụng dữ liệu là yếu tố tối quan trọng để đảm bảo các quyết định dựa trên dữ liệu này được đưa ra trên những thông tin hợp lệ. Blog này sẽ phác thảo một số khuyến nghị của chúng tôi về việc xây dựng các sản phẩm dữ liệu sẵn sàng cho doanh nghiệp, cả về mặt tổng quát lẫn cụ thể với Databricks.

Các sản phẩm dữ liệu cuối cùng sẽ mang lại giá trị khi người dùng và ứng dụng có được dữ liệu phù hợp vào đúng thời điểm, với chất lượng phù hợp và ở định dạng phù hợp. Mặc dù giá trị này theo truyền thống được hiện thực hóa dưới dạng vận hành hiệu quả hơn thông qua chi phí thấp hơn, quy trình nhanh hơn và giảm thiểu rủi ro, các sản phẩm dữ liệu hiện đại cũng có thể mở đường cho các dịch vụ gia tăng giá trị mới và các cơ hội chia sẻ dữ liệu trong ngành hoặc hệ sinh thái đối tác của tổ chức.

Sản phẩm dữ liệu (Data Products)

Mặc dù sản phẩm dữ liệu có thể được định nghĩa theo nhiều cách khác nhau, nhưng chúng thường phù hợp với định nghĩa trong cuốn Data Jujitsu: The Art of Turning Data into Product của DJ Patil: "Để bắt đầu,..., một định nghĩa tốt về sản phẩm dữ liệu là một sản phẩm tạo điều kiện cho mục tiêu cuối cùng thông qua việc sử dụng dữ liệu". Do đó, sản phẩm dữ liệu không bị giới hạn ở dữ liệu dạng bảng; chúng cũng có thể là các mô hình ML, bảng điều khiển (dashboard), v.v. Để áp dụng tư duy sản phẩm như vậy vào dữ liệu, chúng tôi đặc biệt khuyến nghị mỗi sản phẩm dữ liệu nên có một chủ sở hữu sản phẩm dữ liệu (data product owner).

Figure 1: Key aspects of a data product

Các chủ sở hữu sản phẩm dữ liệu quản lý việc phát triển và giám sát việc sử dụng cũng như hiệu suất của các sản phẩm dữ liệu của họ. Để làm được điều này, họ phải hiểu rõ hoạt động kinh doanh cốt lõi và có khả năng chuyển đổi các yêu cầu của người tiêu dùng dữ liệu thành thiết kế cho một sản phẩm dữ liệu chất lượng cao, dễ sử dụng. Cùng với những người khác trong tổ chức, họ thu hẹp khoảng cách giữa kinh doanh và các đồng nghiệp kỹ thuật như kỹ sư dữ liệu. Chủ sở hữu sản phẩm dữ liệu chịu trách nhiệm đảm bảo rằng các sản phẩm trong danh mục của họ tuân thủ các tiêu chuẩn của tổ chức trên các đặc tính về độ tin cậy.

Có năm đặc tính chính mà một sản phẩm dữ liệu phải đáp ứng:

Vòng đời sản phẩm dữ liệu

Một vòng đời sản phẩm dữ liệu điển hình bao gồm các giai đoạn sau:

Figure 2: Typical lifecycle of a data product

Trong hình trên, chủ sở hữu sản phẩm dữ liệu chịu trách nhiệm cho tất cả các giai đoạn, bắt đầu từ khi hình thành cho đến khi ngừng sử dụng một sản phẩm dữ liệu. Tuy nhiên, trách nhiệm đối với các nhiệm vụ riêng lẻ có thể được chia sẻ với các bên liên quan khác như quản trị viên dữ liệu (data steward), kỹ sư dữ liệu, v.v.

Các phương pháp hay nhất để triển khai sản phẩm dữ liệu

Việc triển khai các sản phẩm dữ liệu chất lượng cao với Databricks đòi hỏi một cách tiếp cận thấu đáo vượt ra ngoài việc thực thi kỹ thuật đơn thuần. Hãy bắt đầu bằng việc thiết lập quyền sở hữu rõ ràng, với các chủ sở hữu sản phẩm dữ liệu chuyên trách, những người hiểu cả nhu cầu kinh doanh và yêu cầu kỹ thuật. Xác định trước các hợp đồng dữ liệu (data contract) toàn diện bao gồm các chỉ số chất lượng, định nghĩa lược đồ, chính sách sử dụng và các tham số bảo mật để đảm bảo sự thống nhất giữa nhà sản xuất và người tiêu dùng.

Khi xây dựng các đường ống (pipeline), hãy sử dụng Delta Live Tables (DLT) với các kiểm soát chất lượng được thực hiện trực tiếp trong mã của bạn, tận dụng các kỳ vọng và ràng buộc tích hợp sẵn để xác thực dữ liệu ở từng giai đoạn. Triển khai phương pháp phát triển theo giai đoạn với các môi trường phát triển, thử nghiệm và sản xuất riêng biệt để đảm bảo chất lượng trước khi xuất bản. Tự động hóa việc giám sát bằng cách sử dụng Lakehouse Monitoring, thiết lập cảnh báo cho các ngưỡng chỉ số chất lượng để phát hiện sớm các vấn đề.

Tài liệu hóa kỹ lưỡng trong Unity Catalog, sử dụng cả thông số kỹ thuật và bối cảnh kinh doanh để giúp người dùng hiểu và sử dụng đúng các sản phẩm dữ liệu của bạn. Để đạt hiệu quả quản trị, hãy chuẩn hóa các quy ước đặt tên và siêu dữ liệu (metadata) trên các sản phẩm dữ liệu để cải thiện khả năng khám phá và khả năng tương tác. Cuối cùng, hãy triển khai một vòng lặp phản hồi chính thức với người tiêu dùng để liên tục cải thiện các sản phẩm dữ liệu của bạn dựa trên các mô hình sử dụng thực tế và nhu cầu của người dùng.

Nền tảng Databricks Data + AI có thể được tận dụng cho một số hoạt động liên quan đến vòng đời sản phẩm dữ liệu:

Đối với một số hoạt động trong vòng đời sản phẩm dữ liệu, chẳng hạn như thiết kế sản phẩm dữ liệu và hợp đồng dữ liệu, Databricks hiện chưa có các tính năng hỗ trợ. Các quy trình này nên được thực hiện bên ngoài Nền tảng Databricks Data + AI và kết quả sau đó được tài liệu hóa trong Unity Catalog khi sản phẩm dữ liệu đã được xuất bản.

Hợp đồng dữ liệu (Data Contracts)

Hợp đồng dữ liệu là một cách chính thức để liên kết các miền (domain) và thực hiện quản trị liên kết (federated governance). Nhà sản xuất dữ liệu nên cung cấp hợp đồng này; tuy nhiên, nó nên được thiết kế với sự cân nhắc đến người tiêu dùng. Hợp đồng nên được xây dựng theo cách mà mọi loại người dùng đều có thể sử dụng được.

Một hợp đồng dữ liệu điển hình có các thuộc tính sau:

Ngoài ra, các tài sản hỗ trợ như sổ tay (notebook), bảng điều khiển, v.v. có thể được cung cấp để giúp người tiêu dùng hiểu và phân tích sản phẩm dữ liệu, từ đó tạo điều kiện cho việc áp dụng dễ dàng hơn.

Nhóm quản trị dữ liệu

Một nhóm quản trị dữ liệu trong doanh nghiệp thường bao gồm đại diện từ các nhóm khác nhau như chủ sở hữu doanh nghiệp, chuyên gia tuân thủ và bảo mật, và các chuyên gia dữ liệu. Nhóm này nên đóng vai trò là Trung tâm Xuất sắc (CoE) cho các chủ đề tuân thủ và bảo mật dữ liệu, đồng thời hỗ trợ chủ sở hữu sản phẩm dữ liệu – người chịu trách nhiệm về sản phẩm dữ liệu đó. Họ đóng vai trò quan trọng trong việc định hình hợp đồng dữ liệu bằng cách mở rộng các chính sách sử dụng cũng như ảnh hưởng đến quyết định về việc ai được phép sử dụng sản phẩm dữ liệu. Đối với các tổ chức lớn, một nhóm như vậy có thể giúp định hướng và chuẩn hóa quy trình xây dựng hợp đồng dữ liệu phù hợp với các chức năng toàn cầu như văn phòng quản lý dữ liệu.

Xuất bản và Chứng nhận

Mặc dù đã có các hợp đồng dữ liệu, việc quản trị các sản phẩm dữ liệu vẫn là một chủ đề rộng lớn, bao gồm các khía cạnh như kiểm soát truy cập, phân loại Thông tin nhận dạng cá nhân (PII) và các chính sách sử dụng khác nhau, tất cả đều có thể khác nhau giữa các tổ chức. Tuy nhiên, một xu hướng nhất quán mà chúng tôi quan sát được liên quan đến việc xuất bản các sản phẩm dữ liệu. Khi người tiêu dùng gặp phải ngày càng nhiều tập dữ liệu, họ thường yêu cầu sự đảm bảo rằng dữ liệu đã được tuyển chọn, chuẩn hóa và phê duyệt chính thức để sử dụng. Ví dụ, một trường hợp sử dụng báo cáo hoặc quản lý dữ liệu tổng thể trong một tổ chức lớn có thể đòi hỏi mức độ nhất quán về ngữ nghĩa và khả năng tương tác cao giữa các tài sản dữ liệu đa dạng trong doanh nghiệp.

Đây là nơi khái niệm 'chứng nhận' sản phẩm dữ liệu trở nên có giá trị đối với một số sản phẩm dữ liệu nhất định. Trong quy trình này, nhà sản xuất dữ liệu trước tiên có thể đề xuất một đặc tả hợp đồng dữ liệu, thường phải được xem xét bởi quản trị viên hoặc nhóm quản trị dữ liệu. Sau khi được phê duyệt, các quy trình Tích hợp liên tục/Triển khai liên tục (CI/CD) có thể được chạy để triển khai các đường ống sản xuất ghi dữ liệu vật lý vào các tài khoản lưu trữ đám mây của khách hàng. Dữ liệu này sau đó có thể được xuất bản và dễ dàng khám phá thông qua các bảng, chế độ xem (view) hoặc thậm chí là các volume trong Unity Catalog đối với dữ liệu phi bảng. Trong bối cảnh này, Unity Catalog hỗ trợ sử dụng các thẻ (tag) cũng như markdown để chỉ ra trạng thái chứng nhận và chi tiết của một sản phẩm dữ liệu.

Figure 3: Data product 'certification' process

Một số khách hàng thậm chí có thể chọn quảng bá các sản phẩm dữ liệu đã được chứng nhận của họ bằng cách xuất bản một danh mục riêng tư tương ứng trong Databricks Marketplace với các hướng dẫn toàn diện và ví dụ sử dụng. Hơn nữa, các REST API của Databricks và khả năng tích hợp với các giải pháp danh mục doanh nghiệp như Alation, Atlan, Coalesce và Collibra cũng tạo điều kiện cho việc khám phá dễ dàng các sản phẩm dữ liệu đã được chứng nhận thông qua nhiều kênh, ngay cả những kênh bên ngoài Databricks.

Các trường hợp sử dụng và Câu chuyện thành công

Ô tô: Nền tảng thông minh phương tiện của Rivian. Rivian, nhà sản xuất xe điện, sử dụng Databricks để xử lý dữ liệu cảm biến IoT từ hơn 25.000 phương tiện đang lưu thông, mỗi phương tiện tạo ra hàng terabyte dữ liệu mỗi ngày. Nhóm hệ thống hỗ trợ người lái tiên tiến (ADAS) của họ sử dụng nền tảng này để phân tích dữ liệu đo từ xa bao gồm thông tin về độ nghiêng, độ lăn, tốc độ, hệ thống treo và hoạt động của túi khí, giúp Rivian hiểu được hiệu suất phương tiện và mô hình lái xe. Bằng cách tận dụng Nền tảng Databricks Lakehouse, họ đã đạt được mức tăng hiệu suất thời gian chạy từ 30%-50%, dẫn đến thông tin chi tiết nhanh hơn và độ chính xác của mô hình được cải thiện. Cách tiếp cận dựa trên dữ liệu này cho phép Rivian thực hiện bảo trì dự đoán, tối ưu hóa độ tin cậy của linh kiện và liên tục cải thiện trải nghiệm lái xe của khách hàng.

Chăm sóc sức khỏe: Cá nhân hóa đơn thuốc của Walgreens. Walgreens, một trong những chuỗi nhà thuốc lớn nhất nước Mỹ, đã chuyển đổi trải nghiệm bệnh nhân bằng cách sử dụng Databricks để xử lý dữ liệu đơn thuốc ở quy mô lớn. Với hơn 825 triệu đơn thuốc được thực hiện hàng năm tại gần 9.000 địa điểm, Walgreens đã xây dựng nền tảng Thông tin, Dữ liệu và Thông tin chi tiết (IDI) của họ trên Databricks để xử lý 40.000 sự kiện dữ liệu mỗi giây. Điều này đã tối ưu hóa chuỗi cung ứng của họ bằng cách điều chỉnh mức tồn kho phù hợp để tiết kiệm hàng triệu đô la và tăng năng suất dược sĩ lên 20%. Nền tảng này cho phép các dược sĩ cung cấp dịch vụ chăm sóc tốt hơn với hồ sơ bệnh nhân mạnh mẽ bao gồm cảnh báo tương tác thuốc, thay đổi hồ sơ thuốc và các thông tin quan trọng khác để quản lý đơn thuốc an toàn hơn.

Sản xuất: Phân tích dựa trên AI của Mahindra. Mahindra & Mahindra Limited, một tập đoàn sản xuất toàn cầu, đã triển khai các giải pháp AI cấp doanh nghiệp bằng cách sử dụng Databricks để nâng cao hoạt động trên toàn bộ doanh nghiệp của họ. Bot GenAI dành cho các nhà phân tích tài chính của họ đã giúp giảm 70% thời gian dành cho các công việc thường ngày, cho phép các nhóm tập trung vào các sáng kiến chiến lược có giá trị cao hơn. Công ty đang tận dụng Nền tảng Databricks Data + AI cho nhiều trường hợp sử dụng, bao gồm chatbot "Tiếng nói khách hàng" được xây dựng với mô hình ngôn ngữ lớn (LLM) mã nguồn mở DBRX của Databricks, tích hợp cả dữ liệu nội bộ thông qua Delta Lake và dữ liệu bên ngoài từ các trang web và mạng xã hội. Cách tiếp cận toàn diện này đang giúp Mahindra thúc đẩy tăng trưởng, nâng cao trải nghiệm khách hàng và tối ưu hóa hiệu quả hoạt động.

Viễn thông: Kiến trúc Data Mesh của T-Mobile. T-Mobile đã triển khai thành công kiến trúc data mesh bằng cách sử dụng Databricks để dân chủ hóa quyền truy cập dữ liệu trong khi vẫn duy trì bảo mật và quản trị. Gã khổng lồ viễn thông này đã tích hợp lakehouse của mình vào một Data Mesh bằng cách sử dụng Unity Catalog và Delta Sharing, cho phép các nhóm trên toàn doanh nghiệp truy cập và sử dụng dữ liệu trong khi vẫn duy trì một mô hình bảo mật hợp lý và dễ hiểu. Cách tiếp cận này đã trao quyền cho các nhóm miền (domain team) tạo và quản lý các sản phẩm dữ liệu của riêng họ trong khi vẫn đảm bảo quản trị nhất quán, tăng tốc các sáng kiến phân tích trên toàn tổ chức và cải thiện việc ra quyết định dựa trên dữ liệu.

Xu hướng tương lai trong sản phẩm dữ liệu. Tương lai của các sản phẩm dữ liệu đang được định hình bởi một số xu hướng mới nổi sẽ tác động đến cách các tổ chức tận dụng các nền tảng như Databricks. Các sản phẩm dữ liệu thời gian thực đang trở nên nổi bật khi các doanh nghiệp yêu cầu những thông tin chi tiết cập nhật ngày càng nhanh, với các kiến trúc truyền phát (streaming) đang trở thành tiêu chuẩn cho các sản phẩm dữ liệu vận hành quan trọng. Chúng ta cũng đang thấy sự gia tăng của việc tự tạo sản phẩm dữ liệu (self-service), với các chuyên gia miền kinh doanh sử dụng các giao diện low-code/no-code để xác định và xây dựng các sản phẩm dữ liệu trong khi vẫn duy trì các rào cản quản trị.

Các sản phẩm dữ liệu được làm giàu bằng AI, tự động kết hợp các tính năng và thông tin chi tiết từ học máy, đang trở nên phổ biến hơn, làm mờ ranh giới giữa dữ liệu truyền thống và tài sản AI. Các kiến trúc data mesh đang trưởng thành, với việc các tổ chức triển khai quản trị tính toán liên kết (federated computational governance) giúp cân bằng giữa các tiêu chuẩn trung tâm và quyền tự chủ của miền. Các sản phẩm dữ liệu liên tổ chức vượt qua ranh giới doanh nghiệp một cách an toàn đang xuất hiện, với các phòng sạch dữ liệu (data clean room) và tính toán bảo mật quyền riêng tư cho phép tạo ra những thông tin chi tiết hợp tác mới.

Các hợp đồng dữ liệu đang phát triển để bao gồm các đảm bảo chất lượng, kiểm soát quyền riêng tư và quyền sử dụng tinh vi hơn, trở thành các đặc tả có thể thực thi thay vì tài liệu tĩnh. Phân tích nhúng trong các ứng dụng vận hành đang phát triển, với các sản phẩm dữ liệu được thiết kế đặc biệt để cung cấp thông tin chi tiết trong ứng dụng thay vì các môi trường phân tích riêng biệt. Cuối cùng, các chỉ số bền vững đang được kết hợp vào các sản phẩm dữ liệu, theo dõi tác động môi trường cùng với các KPI kinh doanh truyền thống để hỗ trợ báo cáo ESG và các sáng kiến xanh.

Kết luận

DatabricksDữ liệuAIQuản trị dữ liệuChuyển đổi số
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.