Tin ngành
AIOps là gì? Tối ưu hóa vận hành IT bằng trí tuệ nhân tạo
(giờ Việt Nam)
Tóm tắt AI
AIOps ứng dụng AI và học máy để tự động hóa việc phát hiện lỗi, phân tích nguyên nhân gốc rễ và xử lý sự cố IT, giúp giảm thiểu thời gian chết và áp lực cho đội ngũ vận hành.
Bản dịch AI

Artificial Intelligence for IT Operations (AIOps) ứng dụng AI và học máy vào các hoạt động CNTT để phát hiện các điểm bất thường, tương quan các sự kiện, xác định nguyên nhân gốc rễ và kích hoạt phản hồi nhanh hơn bất kỳ quy trình thủ công nào.
Gartner đã đặt ra thuật ngữ này vào năm 2017. Vậy tại sao bây giờ bạn mới đọc về nó?
Bởi vì cơ sở hạ tầng vận hành các ứng dụng của bạn vào năm 2026 không còn giống với những gì mà các công cụ giám sát truyền thống được xây dựng để phục vụ. Bạn đang quản lý hàng trăm microservices, các phụ thuộc đa đám mây (multi-cloud), khối lượng công việc AI và các hệ thống dựa trên tác nhân (agent-driven) tạo ra nhiều tín hiệu vận hành trong một giờ hơn mức một kỹ sư trực ca có thể đọc trong một tuần.
Khoảng cách đó chính là nơi AIOps hiện đang được định vị để lấp đầy. Hướng dẫn này giải thích cách thức hoạt động, vị trí phù hợp và những điều cần đánh giá trước khi chọn một nền tảng.
AIOps làm được gì và không làm được gì
AIOps phân tích dữ liệu từ nhật ký (logs), dấu vết (traces), sự kiện và cấu trúc liên kết mạng để phát hiện các vấn đề và dự đoán lỗi trước khi chúng trở thành sự cố.

Nó nằm giữa khả năng quan sát (observability) và hành động. Khả năng quan sát cho biết điều gì đang xảy ra trên các hệ thống. AIOps tiếp nhận tín hiệu đó, giảm nhiễu, kết nối các sự kiện liên quan và giúp các kỹ sư nền tảng quyết định bước tiếp theo cần làm gì. Nó không thay thế khả năng quan sát, DevOps hay sự phán đoán của con người. Nó giúp cả ba quy trình này trở nên nhanh chóng hơn.
Tại sao lại là bây giờ?
Khi cơ sở hạ tầng ngày càng trở nên phân tán, khối lượng dữ liệu vận hành, độ phức tạp của các phụ thuộc và tốc độ thay đổi đều tăng lên. Các công cụ giám sát truyền thống không đáp ứng được những nhu cầu ngày càng tăng này và thường tạo ra quá nhiều nhiễu, thiếu bối cảnh rõ ràng để ưu tiên các mối đe dọa. Kết quả là, các nhóm dữ liệu gặp khó khăn trong việc xác định các tín hiệu quan trọng trước khi sự cố ảnh hưởng đến người dùng.
Khi các nhóm tận dụng AI và học máy trong vận hành CNTT, họ tối ưu hóa để:
Những yếu tố này đặc biệt hướng tới việc phát hiện mối đe dọa sớm hơn và phục hồi nhanh hơn. Chúng không có nghĩa là AIOps giải quyết được tất cả các nút thắt tự động hóa hoặc loại bỏ nhu cầu về kỹ sư.
Các thành phần cốt lõi của AIOps là gì?
Khi đánh giá một nền tảng AIOps, điều quan trọng là phải hiểu các khối xây dựng chính và cách chúng hoạt động trong các lĩnh vực của mình:

Với những thành phần cốt lõi này, hãy cùng xem cách chúng kết hợp với nhau trong phần tiếp theo.
AIOps hoạt động như thế nào?
Quy trình AIOps bắt đầu bằng việc thu thập tín hiệu từ các ứng dụng, cơ sở hạ tầng, mạng và dịch vụ đám mây. Dữ liệu sau đó trải qua quá trình làm sạch, trong đó các tín hiệu trùng lặp, không đầy đủ hoặc không nhất quán được sắp xếp thành định dạng mà AIOps có thể phân tích.
Ví dụ, hệ thống của bạn phát hiện ứng dụng đột ngột bắt đầu trả về số lượng lớn lỗi Giao diện lập trình ứng dụng (API). AIOps so sánh hành vi hiện tại của ứng dụng với các mô hình trước đó và gắn cờ sự gia tăng lỗi này là bất thường.
Với tính năng tương quan sự kiện, nền tảng AIOps kết nối các lỗi API với các tín hiệu khác, chẳng hạn như sự gia tăng đột ngột về tải cơ sở dữ liệu hoặc một lần triển khai gần đây. Phân tích nguyên nhân khả dĩ sau đó sẽ kiểm tra các tín hiệu được kết nối này để xác định các nguyên nhân có thể xảy ra. Thay vì xử lý riêng lẻ lỗi API, tải cơ sở dữ liệu và việc triển khai, AIOps xác định lần triển khai gần đây là nguồn gốc khả dĩ của sự cố.
Giai đoạn cuối cùng là phản hồi có hướng dẫn hoặc tự động. Tùy thuộc vào quy trình làm việc, AIOps có thể đề xuất hành động khắc phục, mở phiếu hỗ trợ (ticket), thông báo cho nhóm phù hợp hoặc tự động thực thi phản hồi đã xác định trước như khôi phục (rollback) bản triển khai.
Các hành động có rủi ro cao hơn nên yêu cầu sự tham gia của con người (human-in-the-loop) để cho phép các kỹ sư xem xét và phê duyệt phản hồi trước khi nó ảnh hưởng đến môi trường sản xuất (production).
Các loại AIOps chính là gì?
Các loại AIOps phụ thuộc vào những gì phù hợp nhất với tổ chức, phạm vi hoạt động, các hệ thống cần quản lý và mức độ kết nối trong cơ sở hạ tầng.
Các phương pháp tiếp cận tập trung vào miền (domain-centric) và không phụ thuộc vào miền (domain-agnostic) là hai loại AIOps chính. Không loại nào thay thế trực tiếp cho loại kia; chúng đều có thế mạnh và sự đánh đổi riêng:
AIOps tập trung vào miền tập trung vào một lĩnh vực cụ thể, chẳng hạn như quản lý đám mây, hiệu suất mạng hoặc giám sát ứng dụng. Phương pháp tiếp cận tập trung vào miền là lựa chọn hàng đầu để khắc phục sự cố trong một miền cụ thể; nó cung cấp bối cảnh sâu hơn và phân tích chuyên biệt hơn trong môi trường đó.

AIOps không phụ thuộc vào miền hoạt động trên nhiều môi trường CNTT, thu thập và phân tích dữ liệu từ các hệ thống như ứng dụng, mạng, cơ sở hạ tầng đám mây và lưu trữ. Ngược lại với phương pháp tập trung vào miền, các nền tảng AIOps không phụ thuộc vào miền phù hợp nhất để giải quyết các vấn đề rộng hơn. Điều này làm cho nó phù hợp hơn với các tổ chức quản lý cơ sở hạ tầng phức tạp, có tính kết nối cao, nơi các sự cố thường vượt qua ranh giới vận hành.
AIOps tập trung vào miền có thể cung cấp chiều sâu lớn hơn và thông tin chuyên biệt hơn trong một miền duy nhất, trong khi AIOps không phụ thuộc vào miền cung cấp phạm vi rộng hơn và khả năng hiển thị bao quát hơn trên các hệ thống và công cụ.
Các trường hợp sử dụng AIOps phổ biến
Các trường hợp sử dụng AIOps trải rộng trên nhiều lĩnh vực vận hành CNTT; một số ứng dụng phổ biến nhất bao gồm:
Phân tích nguyên nhân gốc rễ
AIOps giúp xác định chính xác nguyên nhân có thể gây ra tình trạng ngừng hoạt động, lỗi hoặc vấn đề hiệu suất. Thay vì coi sự gia tăng lỗi API là một sự cố riêng lẻ, AIOps có thể tương quan nó với một lần triển khai gần đây, lỗi cơ sở dữ liệu hoặc thay đổi cấu hình mạng.
Phát hiện bất thường
AIOps liên tục quét dữ liệu hệ thống để thiết lập đường cơ sở và phát hiện các sai lệch có thể dẫn đến sự cố và lỗi.
Giám sát hiệu suất
AIOps có thể giám sát các môi trường CNTT trên đám mây, tại chỗ (on-premises) và môi trường lai với các dịch vụ và phụ thuộc được kết nối với nhau. Điều này giúp xác định các xu hướng và ưu tiên các vấn đề thông qua việc giám sát liên tục và tương quan hiệu suất.
Tiếp nhận và di chuyển lên đám mây
Việc di chuyển lên đám mây tạo ra các phụ thuộc mới giữa các khối lượng công việc, API, dịch vụ và cơ sở hạ tầng. AIOps lập bản đồ các mối quan hệ này, giám sát những thay đổi trong hành vi hệ thống và xác định các nút thắt tiềm ẩn trước khi chúng làm gián đoạn các dịch vụ quan trọng. AIOps cung cấp khả năng hiển thị rõ ràng hơn vào các môi trường lai và đa đám mây trong quá trình di chuyển.
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.