Liên hệ với chúng tôi

Đề cương khóa học

Khung cảnh Quan sát do AI

  • Từ bảng điều khiển đến hội thoại: sự chuyển dịch sang khả năng quan sát tăng cường bởi AI
  • Năng lực LLM liên quan đến quan sát: tóm tắt, suy luận, khớp mẫu
  • Mô hình kiến trúc: nhúng AI vào các ngăn xếp quan sát hiện có

Truy vấn Telemetry bằng Ngôn ngữ Tự nhiên

  • Text-to-PromQL: chuyển đổi ngôn ngữ tự nhiên thành truy vấn giám sát
  • Truy vấn NL cho kho lưu trữ nhật ký Elasticsearch, OpenSearch và Loki
  • Tạo SQL từ ngôn ngữ tự nhiên cho telemetry có cấu trúc
  • Xây dựng một tác nhân trợ lý truy vấn với khả năng sử dụng công cụ và nhận biết ngữ cảnh

Phân tích Nhật ký do LLM Thúc đẩy

  • Phân tích cú pháp và cấu trúc hóa nhật ký tự động bằng LLM
  • Phát hiện bất thường trong luồng nhật ký sử dụng độ tương đồng nhúng
  • Cụm nhật ký và khám phá mẫu ở quy mô lớn
  • Tạo giải thích dễ hiểu từ các chuỗi nhật ký thô

Cảnh báo Thông minh và Làm phong phú Sự cố

  • Kết hợp và loại bỏ trùng lặp cảnh báo với hiểu biết ngữ nghĩa
  • Thu thập ngữ cảnh sự cố tự động từ sách hướng dẫn vận hành (runbooks), sự cố trước đây và tài liệu
  • Chuyển hướng cảnh báo thông minh dựa trên hiểu biết nội dung và chuyên môn nhóm
  • Giảm mệt mỏi do cảnh báo bằng việc giảm nhiễu do AI thúc đẩy

Phân tích Nguyên nhân Gốc rễ có Hỗ trợ AI

  • Tạo giả thuyết từ tương quan telemetry đa nguồn
  • Chuỗi chứng cứ: kết nối các triệu chứng trên chỉ số, nhật ký và dấu vết (traces)
  • Khắc phục sự cố có hướng dẫn với các phiên chẩn đoán AI tương tác
  • Xây dựng một tác nhân phân tích nguyên nhân gốc rễ với quá trình điều tra từng bước

Phản ứng và Giao tiếp Tự động hóa Sự cố

  • Tạo tóm tắt sự cố và cập nhật trạng thái từ telemetry
  • Viết dự thảo sau sự cố tự động với tái tạotimeline
  • Giao tiếp cho các bên liên quan được cá nhân hóa cho đối tượng kỹ thuật và điều hành
  • Gợi ý sách hướng dẫn vận hành (runbook) và khuyến nghị khắc phục tự động

ML cho Quan sát

  • Dự báo chuỗi thời gian cho lập kế hoạch dung lượng và dự đoán bất thường
  • Các mô hình nền tảng để phát hiện bất thường zero-shot trên các chỉ số (metrics)
  • Lập bản đồ phụ thuộc dịch vụ dựa trên nhúng và khám phá topologie
  • Đào tạo và triển khai các mô hình ML nhẹ nhàng bên cạnh các quy trình quan sát

Triển khai Sản xuất và Đạo đức

  • Xét nghiệm về độ trễ và chi phí cho khả năng quan sát AI theo thời gian thực
  • Bảo mật dữ liệu: đảm bảo LLM không làm rò rỉ telemetry nhạy cảm
  • Giám sát của con người: khi nào chẩn đoán AI cần xác minh từ người vận hành
  • Đo lường tác động: MTTD, MTTR và các chỉ số trải nghiệm trực tiếp (on-call)

Yêu cầu

  • Kinh nghiệm với các công cụ quan sát như Prometheus, Grafana, Datadog hoặc OpenTelemetry.
  • Quen thuộc với khái niệm quản lý nhật ký và chỉ số (metrics).
  • Kỹ năng viết kịch bản Python cơ bản để xử lý dữ liệu.

Đối tượng

  • Kỹ sư SRE và quan sát áp dụng công cụ tăng cường AI.
  • Kỹ sư nền tảng xây dựng các quy trình giám sát thế hệ mới.
  • Trưởng nhóm DevOps đang đánh giá việc tích hợp LLM vào quy trình sự cố.
 14 Giờ

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan