Thủ thuật
Cách ứng dụng AI_Functions trong kho dữ liệu Databricks: Các trường hợp sử dụng tiêu biểu
(giờ Việt Nam)
Tóm tắt AI
Bài viết hướng dẫn cách tích hợp trực tiếp các tính năng AI vào quy trình SQL trên Databricks, giúp doanh nghiệp xử lý dữ liệu phi cấu trúc ngay trong kho dữ liệu một cách hiệu quả.
Bản dịch AI

Tại hầu hết các tổ chức, kho dữ liệu (data warehouse) lưu trữ dữ liệu có cấu trúc, trong khi dữ liệu phi cấu trúc được lưu trong hồ dữ liệu (data lake). Cách làm này hoạt động hiệu quả đối với các khối lượng công việc phân tích, vốn tiêu thụ dữ liệu có cấu trúc ở quy mô lớn để phục vụ các báo cáo định kỳ hàng ngày.
Tuy nhiên, các khối lượng công việc AI lại yêu cầu đầu vào khác biệt. Các mô hình AI thường cần phân tích dữ liệu phi cấu trúc - như đánh giá, phiếu hỗ trợ (support tickets) và tệp PDF - rồi kết hợp chúng với dữ liệu có cấu trúc để huấn luyện, xây dựng và vận hành mô hình. Vì vậy, một chuyên gia phân tích muốn biết cảm nhận (sentiment) từ các phiếu hỗ trợ phải gửi dữ liệu ra một dịch vụ bên ngoài, chờ kết quả dự đoán, rồi ghép nối thủ công chúng trở lại bảng. Quy trình này chậm chạp, dễ bị lỗi khi lược đồ (schema) thay đổi, đồng thời tạo ra các rủi ro không đáng có về bảo mật và quản trị.
AI Functions giải quyết vấn đề này bằng cách đưa AI trực tiếp đến nơi lưu trữ dữ liệu của bạn, thay vì phải chuyển dữ liệu sang một môi trường AI riêng biệt. Bạn có thể gọi các mô hình ngay trong các truy vấn SQL tiêu chuẩn, giữ cho toàn bộ quá trình suy luận (inference) nằm trong các đường ống (pipelines) hiện có và tuân thủ quản trị của Unity Catalog. Kiến trúc này thay đổi căn bản cách bạn làm việc với AI trong kho dữ liệu của mình:

Bạn có thể sử dụng các AI functions này từ bất kỳ đâu trên Databricks, bao gồm notebooks, Lakeflow Spark Declarative Pipelines và Workflow. Tuy nhiên, trong bài viết này, chúng tôi sẽ tập trung cụ thể vào việc gọi các hàm này từ Databricks Lakehouse. Các trường hợp sử dụng dưới đây sẽ cho thấy cách bạn tích hợp các AI functions này vào các khối lượng công việc cần kết hợp dữ liệu có cấu trúc trong kho dữ liệu với dữ liệu phi cấu trúc, dù là từ bên ngoài kho dữ liệu hay do chính bạn tạo ra thông qua các hàm hỗ trợ GenAI.
Trường hợp sử dụng 1: Trí tuệ tài liệu, từ tệp thô đến các hàng có cấu trúc
ai_parse_document đóng vai trò là cầu nối nhập liệu, chuyển đổi nội dung tệp nhị phân thô - như PDF hoặc hình ảnh - thành văn bản có thể đọc được. Sau khi phân tích cú pháp, ai_extract sẽ xử lý việc trích xuất chi tiết các khóa và giá trị cụ thể. Cách tiếp cận kết hợp này loại bỏ nhu cầu về các đường ống OCR tùy chỉnh dễ lỗi hoặc các dịch vụ phân tích của bên thứ ba vốn thường bị hỏng khi lược đồ thay đổi.
Trong trường hợp sử dụng này, chúng tôi trỏ ai_parse_document vào một Databricks volume chứa các hóa đơn. Sau khi các hóa đơn được phân tích, AI parse document sẽ tạo ra kết quả dưới dạng JSON, sau đó được chuyển đến hàm ai_extract, nơi chúng ta xác định các thực thể muốn trích xuất từ các hóa đơn đó. Kết quả thu được là một bảng có cấu trúc với các trường thông tin mong muốn từ hóa đơn.
Nguồn gốc dữ liệu (lineage) giờ đây được theo dõi từ tệp PDF thô đến các hàng đã trích xuất trong một kế hoạch truy vấn duy nhất. Cầu nối mà mọi người thường phải tự xây dựng thủ công - bao gồm dịch vụ Python OCR, lệnh gọi LLM và bước làm phẳng JSON - tất cả đều được gộp gọn vào trong truy vấn.
Demo notebook: Trí tuệ tài liệu
Trường hợp sử dụng 2: Phân tích cảm nhận trên phản hồi của khách hàng
Hàm ai_classify thực hiện phân loại zero-shot, ánh xạ các phản hồi dạng văn bản tự do vào một tập hợp các nhãn do người dùng định nghĩa mà không cần huấn luyện mô hình. Quá trình này biến văn bản phi cấu trúc, hỗn loạn thành các cột có thể truy vấn và quản trị được, giúp dữ liệu về cảm nhận và chủ đề sẵn sàng ngay lập tức cho các bảng điều khiển BI và báo cáo điều hành.
Trong ví dụ này, chúng tôi muốn phân loại các đánh giá của khách hàng từ bảng bronze.nps_responses thành các nhóm: tích cực, tiêu cực, trung lập và hỗn hợp.
Demo notebook: Phân tích cảm nhận
Trường hợp sử dụng 3: Dịch thuật nội tuyến cho dữ liệu đa ngôn ngữ
Với ai_translate, bạn có thể chuẩn hóa dữ liệu đa ngôn ngữ sang một ngôn ngữ đích duy nhất ngay trong lớp truy vấn. Điều này ngăn chặn tình trạng phân mảnh và cô lập dữ liệu (data silos), cho phép tất cả các phân tích hạ nguồn (bao gồm cả phân loại và trích xuất) hoạt động trên toàn bộ tập dữ liệu toàn cầu thay vì chỉ xử lý các phần dữ liệu tiếng Anh.
Trong ví dụ này, chúng tôi trích xuất cảm nhận từ các đánh giá khách hàng khác nhau và sau đó dịch chúng sang tiếng Anh.
Demo notebook: Dịch thuật và chuẩn hóa
Trường hợp sử dụng 4: Phân loại và điều hướng ở quy mô lớn
Tập trung vào hiệu quả vận hành, ai_classify chuyển đổi các đầu vào dạng tự do như phiếu hỗ trợ hoặc bản ghi cuộc gọi thành các danh mục có thể hành động. Bằng cách xác định mục đích và mức độ khẩn cấp của phản hồi ngay tại thời điểm nhập liệu, nó cho phép điều hướng thông minh, tự động đến các nhóm phù hợp hoặc các hệ thống phản hồi tự động.
Trong trường hợp sử dụng dưới đây, chúng tôi nhập các phiếu hỗ trợ khác nhau từ một bảng và sau đó sử dụng ai_classify để xác định mục đích của người dùng và mức độ khẩn cấp của phiếu.
Demo notebook: Phân loại và điều hướng
Trường hợp sử dụng 5: Trích xuất dữ liệu có cấu trúc từ cuộc gọi bán hàng với ai_extract
Hàm ai_extract được thiết kế để khai thác thông tin bán cấu trúc từ nội dung dài, chẳng hạn như bản ghi cuộc gọi bán hàng, và chuyển đổi văn bản tường thuật thành các trường dữ liệu rời rạc, có cấu trúc. Điều này mang lại giá trị đáng kể bằng cách đưa thông tin định tính trực tiếp vào các công cụ BI, biến các cuộc hội thoại nói thành các chỉ số có thể truy vấn như giai đoạn giao dịch và các cảnh báo rủi ro.
Trong trường hợp sử dụng này, chúng tôi khai thác một bản ghi dài để xác định bước tiếp theo, giai đoạn giao dịch, cảnh báo rủi ro và lý do rủi ro là gì, để nhân viên kinh doanh có thể thực hiện hành động dựa trên kết quả của cuộc họp đã tạo ra bản ghi đó.
Demo notebook: Trích xuất cuộc gọi bán hàng
Trường hợp sử dụng 6: Soạn thảo tạo sinh với ai_query
ai_query là hàm tổng quát nhất và là nền tảng cho các hàm còn lại: nó cho phép bạn gửi một prompt đến bất kỳ điểm phục vụ Foundation Model nào được lưu trữ trên Databricks mà bạn có quyền truy cập, và nó sẽ trả về câu trả lời của mô hình cho từng hàng dữ liệu.
Trong trường hợp sử dụng này, chúng ta có thể sử dụng ai_query để soạn thảo email tiếp cận gia hạn cho mọi tài khoản khách hàng trong bảng giả định gold.renewal_signals, bảng này cho chúng ta biết những tài khoản nào đã sẵn sàng để gia hạn.
Vì bạn là người viết prompt, nó có thể thực hiện bất cứ điều gì mô hình có thể làm, đó là lý do tại sao nó xử lý được các trường hợp mà các hàm chuyên biệt hơn không làm được.
Demo notebook: Soạn thảo tạo sinh
Mẹo chuyên nghiệp cho môi trường sản xuất
Điều này có ý nghĩa gì đối với chiến lược kho dữ liệu của bạn
Điểm chung xuyên suốt cả sáu trường hợp trên là: AI chạy cùng một nơi với phần còn lại của kho dữ liệu: một nền tảng, một mô hình quản trị, một hóa đơn, một bộ đường ống dữ liệu. Bất kỳ dòng SQL ETL hiện có nào của bạn cũng có thể thêm một bước AI mà không cần phải thiết lập một hệ thống riêng để lưu trữ nó, và mỗi tập lệnh Python từng được dùng để dịch, chấm điểm hoặc phân loại dữ liệu bên ngoài giờ đây đều có thể thay thế bằng một dòng lệnh duy nhất.
Vì vậy, hãy bắt đầu với một cột. Hãy chọn khối lượng công việc mà dịch vụ hiện tại đang kém ổn định nhất, viết lại nó dưới dạng một câu lệnh SELECT, chạy thử trên 10.000 hàng và xem kết quả trả về. Bạn sẽ biết ngay sau một lần chạy thử ngắn liệu nó có phù hợp hay không - và bạn sẽ không còn phải trả chi phí vận hành dư thừa khi phải chuyển dữ liệu ra ngoài chỉ để sử dụng nó.
Demo notebooks
Mỗi notebook đều đi kèm với dữ liệu mẫu nội tuyến, các bước SQL chi tiết và kết quả đầu ra mà bạn nên nhận được.
Đọc tiếp
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.