Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Thời gian kéo dài 14 Giờ học
Đề cương khóa học
Giới thiệu về AIOps
- AIOps là gì và vì sao nó quan trọng
- Giám sát truyền thống so với khả năng quan sát do AIOps thúc đẩy
- Kiến trúc AIOps và các thành phần chính
Thu thập và Chuẩn hóa dữ liệu hoạt động
- Các loại dữ liệu quan sát: chỉ số, nhật ký và vết theo dõi (traces)
- Thu thập dữ liệu từ nhiều nguồn (máy chủ, container, đám mây)
- Sử dụng các tác nhân (agents) và bộ xuất dữ liệu (exporters) (Prometheus, Beats, Fluentd)
Tương quan dữ liệu và Phát hiện bất thường
- Tương quan chuỗi thời gian và các phương pháp thống kê
- Sử dụng các mô hình ML để phát hiện bất thường
- Phát hiện sự cố xuyên suốt các hệ thống phân tán
Cảnh báo và Giảm nhiễu
- Thiết kế các quy tắc và ngưỡng cảnh báo thông minh
- Ức chế, loại bỏ trùng lặp và nhóm các cảnh báo
- Tích hợp với Alertmanager, Slack, PagerDuty hoặc Opsgenie
Phân tích nguyên nhân gốc rễ và Trực quan hóa
- Sử dụng bảng điều khiển (dashboards) để trực quan hóa chỉ số và phát hiện xu hướng
- Khám phá các sự kiện và dòng thời gian cho phân tích nguyên nhân gốc rễ (RCA)
- Theo dõi sự cố xuyên suốt các lớp bằng các công cụ theo dõi phân tán (distributed tracing)
Tự động hóa và Sửa chữa
- Kích hoạt các kịch bản hoặc luồng công việc tự động từ các sự cố
- Tích hợp với các hệ thống ITSM (ServiceNow, Jira)
- Các trường hợp sử dụng: tự sửa chữa (self-healing), mở rộng quy mô, định tuyến lại lưu lượng
Các nền tảng AIOps mã nguồn mở và thương mại
- Tổng quan về các công cụ: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Các tiêu chí đánh giá để lựa chọn nền tảng AIOps
- Demo và thực hành với bộ stack đã chọn
Tóm tắt và Các bước tiếp theo
Yêu cầu
- Hiểu biết về các khái niệm vận hành CNTT và giám sát hệ thống
- Kinh nghiệm sử dụng các công cụ hoặc bảng điều khiển (dashboards) giám sát
- Nắm vững các định dạng cơ bản của nhật ký và chỉ số
Đối tượng tham gia
- Các nhóm vận hành chịu trách nhiệm về hạ tầng và ứng dụng
- Kỹ sư Độ tin cậy tại hiện trường (Site Reliability Engineers - SREs)
- Các nhóm giám sát và quan sát (observability) CNTT