Databricks: Blog
85

Thủ thuật

Databricks ra mắt AI Agent cho dây chuyền sản xuất: Tối ưu hóa bảo trì thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Databricks giới thiệu AI Agent giúp phát hiện lỗi thiết bị và đề xuất sửa chữa trong vài phút, giảm thiểu đáng kể thời gian dừng máy. Hệ thống tích hợp dữ liệu cảm biến thời gian thực và có khả năng giải thích quyết định, giúp kỹ thuật viên vận hành tin tưởng hơn.

Bản dịch AI

Agents for production lines: Trusted decisions in real time

Tóm tắt điều hành

09:14, giữa ca làm việc. Máy chiết rót gặp sự cố. Quản lý dây chuyền chỉ có vài phút, không phải vài giờ, trước khi các thiết bị ở công đoạn sau bắt đầu bị thiếu nguyên liệu. Đội ngũ đã biết phải làm gì về mặt kỹ thuật. Những câu hỏi tốn thời gian hơn là về khâu lập kế hoạch. Liệu chúng ta có thể hoàn thành mục tiêu của ca làm việc không? Liệu đẩy nhanh tốc độ sau đó hay gọi làm thêm giờ sẽ tiết kiệm chi phí hơn? Lỗi tương tự đã từng xảy ra trên dây chuyền này chưa, và ca trước đã khắc phục như thế nào?

Dữ liệu để trả lời cả ba câu hỏi trên đều đã tồn tại, nằm rải rác trên các hệ thống PLCs, SCADA, MES, ERP và LIMS.

ProdLine CoPilot được xây dựng cho khoảng thời gian đó. Nó đọc trạng thái trực tiếp từ Databricks Data Intelligence Platform, chuyển câu hỏi đến chuyên gia trong lĩnh vực đó và thực hiện các phép tính nền tảng (phục hồi lịch trình, mức tiêu hao, rủi ro chất lượng). Kế hoạch trả về đã được kiểm thử dựa trên 1.000 kịch bản lập lịch, cân bằng giữa các yếu tố chi phí, làm thêm giờ và dịch vụ. Quản lý dây chuyền là người đưa ra lựa chọn. Hệ thống sẽ soạn thảo các tài liệu (lệnh sản xuất, lệnh tạm dừng, ghi chú lịch trình) để chờ phê duyệt.

Vấn đề thực sự: giàu dữ liệu, nghèo thông tin chi tiết

Một dây chuyền đóng gói CPG điển hình (đóng chai, đóng hộp, đồ ăn nhẹ, mỹ phẩm) có từ 15–20 máy. Khi máy chiết rót hoặc máy dán nhãn dừng lại, các bộ đệm chỉ có thể duy trì được vài phút trước khi dây chuyền bị thiếu nguyên liệu và sản lượng giảm xuống thấp hơn nhiều so với công suất thiết kế. Chỉ số OEE đẳng cấp thế giới đạt gần 85%; nhiều nhà máy chỉ ở mức 70–75%. Với tốc độ 500 thùng/giờ trong lịch trình 24/5 và lợi nhuận 10 € mỗi thùng, một điểm OEE tương đương khoảng 300.000 € mỗi năm. Thu hẹp khoảng cách 10 điểm trên một dây chuyền sẽ mang lại lợi nhuận hàng triệu euro; trên một nhà máy với hàng chục dây chuyền, con số đó tăng lên rất nhanh.

Dữ liệu để thu hẹp khoảng cách đó đã tồn tại:

Các hệ thống đó không kết nối với nhau. Những người cần câu trả lời (quản lý dây chuyền, trưởng ca, người lập kế hoạch) thường không biết viết SQL.

Mô hình quen thuộc là: báo cáo cuối ca, sau đó là truy vấn của chuyên viên phân tích vào sáng hôm sau, rồi đến cuộc họp RCA (phân tích nguyên nhân gốc rễ) sau đó 24 giờ. Tất cả diễn ra trong khi quyết định phục hồi (tốc độ, làm thêm giờ, CIP) đã được đưa ra ngay trong ca làm việc.

Truyền phát OT (công nghệ vận hành) vào Databricks không chỉ là nâng cấp bảng điều khiển. Việc kết hợp OT với MES, ERP và LIMS trong một lakehouse được quản trị là điều cho phép các tác nhân (agents) suy luận dựa trên trạng thái trực tiếp, tối ưu hóa dưới các ràng buộc thực tế và đưa ra khuyến nghị ngay trong ca làm việc thay vì sau khi sự việc đã rồi.

Truyền phát thời gian thực: từ báo cáo buổi sáng đến tín hiệu trong ca làm việc

Mô hình cũ là thiết lập hệ thống đường ống kiểu Kafka (brokers, partitions, consumer groups) chỉ để di chuyển dữ liệu nhà máy. Zerobus Ingest thay thế điều đó. Nó dựa trên cơ chế đẩy (push-based) và không cần máy chủ (serverless). Bất cứ thứ gì có thể thực hiện các lệnh gọi gRPC hoặc REST (cổng PLC, trình kết nối historian, thiết bị edge) đều có thể đưa các hàng dữ liệu vào các bảng Unity Catalog Delta.

Không cần brokers, không cần partitions; bạn mở rộng quy mô bằng cách mở thêm các kết nối. Kết hợp nó với Lakeflow Spark Declarative Pipelines và bố cục medallion tiêu chuẩn (Bronze, Silver, Gold) cho dữ liệu đo lường từ xa, tín hiệu chất lượng, sự kiện và hàng tồn kho.

MES, ERP và LIMS có tốc độ cập nhật chậm hơn so với dữ liệu OT dưới một giây (mirror, batch hoặc CDC), nhưng chúng nằm cùng các bảng OT trong một danh mục được quản trị thay vì trong một kho dữ liệu riêng biệt.

Khi dữ liệu đã vào, các bảng này sẽ cung cấp cho SQL, Genie, AI Search, Model Serving và các tác nhân, với dòng dõi dữ liệu (lineage) được chia sẻ dưới Unity Catalog. Các tín hiệu dự báo, phục hồi lịch trình và phân tích hạ nguồn đều đọc từ các bảng được quản trị này, vì vậy mỗi khả năng mới đều ghi đè lên bản sao hiện có thay vì phải tự cung cấp tài nguyên riêng.

Zerobus + Delta xử lý việc nhập dữ liệu gần thời gian thực với độ trễ dưới một giây, được quản trị dưới Unity Catalog. Đối với giao diện người dùng trực tiếp trong bản demo này, trình tạo cũng ghi trực tiếp vào Lakebase: một lối tắt để có cảm giác thời gian thực ngay hôm nay, thay vì mô hình dài hạn. Phía đọc dữ liệu mili giây trên cùng các bảng Delta đó là điều mà Lakehouse//RT, kho dữ liệu thời gian thực trên lakehouse của Databricks, sẽ xử lý.

Tại sao chọn Databricks

Nhiều nhà máy chạy báo cáo ở một nơi và các mô hình ở một nơi khác, vì vậy bản thân dây chuyền cuối cùng có nhiều hơn một phiên bản sự thật trên các hệ thống. Sự chia tách đó làm hỏng các copilots trong ca làm việc:

Lakehouse trên Databricks xóa bỏ sự chia tách đó tại mỗi điểm trong ba điểm trên. Chỉ có một bản sao dữ liệu (Delta mở trên lưu trữ đám mây, không phải trích xuất riêng cho từng khối lượng công việc). Quản trị nằm trên bản sao đó trong Unity Catalog, vì vậy quyền của chuyên viên phân tích và quyền của tác nhân đều đến từ cùng một nguồn. Và truyền phát, SQL, AI, phục vụ mô hình đều chạy trên một nền tảng, vì vậy báo cáo buổi sáng và màn hình trực tiếp hiển thị cùng một con số.

Các chuyên gia và trình tối ưu hóa đọc cùng các bảng được quản trị mà các đường ống của bạn duy trì. Không có cơ sở dữ liệu AI riêng biệt.

Giải phẫu hệ thống tác nhân dây chuyền sản xuất

Trình điều phối (Orchestrator)

Trình điều phối là cửa ngõ. Nó chấp nhận câu hỏi bằng ngôn ngữ tự nhiên, tải trạng thái hiện tại từ Unity Catalog (máy móc, sự kiện, lịch trình, hàng tồn kho, chất lượng, ràng buộc) và chuyển ý định đến đúng chuyên gia.

Mỗi cuộc gọi đều đọc trạng thái UC mới nhất trước khi LLM bắt đầu. Hệ thống đưa ra khuyến nghị và soạn thảo các tài liệu (phiếu yêu cầu, phê duyệt, ghi chú ca làm việc). Việc thực thi vẫn thuộc về quản lý dây chuyền, bộ phận chất lượng và bảo trì.

Bộ nhớ hội thoại ngắn hạn nằm trong Lakebase, kho lưu trữ sự cố quá khứ nằm trong AI Search. Model Serving phục vụ các mô hình và MLflow theo dõi mọi cuộc gọi.

Tại sao là một danh sách chuyên gia (roster), không phải một tác nhân lớn

Một tác nhân chung chung thường đơn giản hóa quá mức hoặc mất tập trung. Phân tích nguyên nhân gốc rễ (RCA) khi dừng máy, hàng tồn kho và tính toán lịch trình cần dữ liệu khác nhau và phép toán khác nhau. Một danh sách các chuyên gia giúp mỗi câu lệnh (prompt) trở nên hẹp và mỗi công cụ nhắm đúng vào câu hỏi.

Ví dụ, Downtime Analyst không tiêu tốn ngữ cảnh vào các bảng hàng tồn kho, và Schedule Optimizer không lấy các hàng kiểm tra chất lượng thô theo cách mà bộ phận Chất lượng thực hiện.

Các công cụ mà các chuyên gia thực sự gọi

Các chuyên gia gọi một tập hợp nhỏ các công cụ cố định. SQL Query và Genie Space thực hiện các lệnh đọc được quản trị, giống như cách phần còn lại của tổ chức thực hiện. Calculator chạy các phép tính OEE, phục hồi và tiêu hao bằng Python (NumPy và Pandas) dựa trên dữ liệu đo lường từ Databricks SQL. Anomaly Detector chạy Z-score và khoảng tứ phân vị (IQR) trên các cửa sổ trượt trực tiếp trên các bảng đó. Plan & Constraints lưu giữ giới hạn tốc độ mỗi dây chuyền, cửa sổ CIP, quy tắc chuyển đổi và chính sách làm thêm giờ. Similar Cases truy xuất các sự cố lịch sử từ Databricks AI Search.

Chuyển hướng đến trình giải quyết thực sự, không chỉ là trò chuyện

Nhiều copilots sản xuất chỉ là các lớp vỏ LLM mỏng. ProdLine chuyển hướng đến các trình giải quyết thực sự (loại mà các nhóm nghiên cứu vận hành sử dụng), thông qua ngôn ngữ tự nhiên.

Con người trong vòng lặp (Human-in-the-loop): khép kín vòng lặp mà không cần thêm công việc

Không có gì được thực thi nếu không có sự phê duyệt của con người. Quản lý dây chuyền chịu trách nhiệm phục hồi, bộ phận chất lượng chịu trách nhiệm giữ và giải phóng hàng, bộ phận bảo trì chịu trách nhiệm lệnh sản xuất. Mục đích là giảm tải nhận thức khi phải chuyển đổi giữa bảng tính, bộ đàm và bảng điều khiển, chứ không phải để loại bỏ người quản lý sản xuất.

Nó phải trả lời ba câu hỏi trong vòng chưa đầy một phút: chuyện gì đang xảy ra, các lựa chọn thực tế là gì và mỗi lựa chọn tốn kém bao nhiêu về sản lượng, làm thêm giờ, chất lượng và dịch vụ.

Các cổng phê duyệt (theo thiết kế):

Bản demo hiện tại bao gồm vòng lặp suy luận và khuyến nghị. Bước tiếp theo là khép kín vòng lặp với các lệnh ghi ngược lại hệ thống, tất cả đều được thiết kế dưới dạng bản nháp thay vì tự động điều khiển.

Việc bàn giao CMMS là một bản nháp lệnh sản xuất (lỗi đã chẩn đoán, phạm vi khuyến nghị, thời gian mục tiêu, linh kiện cần thiết) để người lập kế hoạch lên lịch. Đối với chất lượng, QMS và LIMS nhận được bản ghi sai lệch đã điền sẵn (lô, máy, ID mẫu, mức độ nghiêm trọng, hướng xử lý khuyến nghị) mà trưởng bộ phận chất lượng sẽ xem xét và quyết định. MES và hệ thống lập kế hoạch và lập lịch nâng cao (APS) nhận bản cập nhật lịch trình nháp với các điều chỉnh tốc độ, làm thêm giờ, thay đổi trình tự và lý do phục hồi, được ghi lại để thực hiện ca làm việc.

Khả năng truy xuất nguồn gốc tuân theo cùng một lộ trình: mỗi khuyến nghị lưu trữ các đầu vào, giả định, ràng buộc, người phê duyệt và kết quả từ đầu đến cuối, hỗ trợ bàn giao giữa các ca và cải tiến liên tục.

DatabricksAI AgentSản xuấtBảo trì dự đoánCông nghiệp 4.0
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.