Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Đề cương khóa học
Giới thiệu về Agentic AI cho Vận hành
- Từ các runbook tĩnh đến các agent suy luận: sự tiến hóa của tự động hóa IT
- Cấu trúc của agent: vòng lặp suy luận, sử dụng công cụ, bộ nhớ và lập kế hoạch
- Khi nào nên tự động hóa và khi nào nên giữ con người trong vòng lặp
Các Framework và Kiến trúc Agent
- Mô hình agent đơn: ReAct, Plan-and-Execute và vòng lặp gọi công cụ
- kiến trúc đa agent: mô hình giám sát viên, phân cấp và bầy đàn
- So sánh framework: LangGraph, CrewAI, AutoGen và các agent tùy chỉnh
- Xây dựng agent vận hành đầu tiên của bạn: truy vấn giám sát, chẩn đoán, đề xuất
Tích hợp Công cụ cho Vận hành IT
- Kết nối agent với các API của Prometheus, Grafana, Datadog và PagerDuty
- Truy vấn nhật ký bằng agent: tích hợp Elasticsearch, Loki và Splunk
- Sử dụng công cụ hạ tầng: kubectl, Terraform, Ansible thông qua các hành động của agent
- Thiết kế các giao diện công cụ an toàn với xác thực tham số và tính idempotency
Tự động hóa Phản ứng Sự cố
- Phân loại sự cố tự động: phân loại mức độ nghiêm trọng và định tuyến
- Tạo giả thuyết nguyên nhân gốc rễ và thu thập bằng chứng
- Khắc phục tự động: các hành động khởi động lại, mở rộng, quay lại và failover
- Xây dựng agent runbook sự cố với các mức độ tự chủ tăng dần
An toàn, Rào chắn (Guardrails) và Human-in-the-Loop
- Phân loại hành động: chỉ đọc, rủi ro thấp, rủi ro cao và hủy diệt
- Các chốt phê duyệt và chính sách nâng cấp cho các thao tác quan trọng
- Mô hình rào chắn: danh sách cho phép hành động, giới hạn phạm vi ảnh hưởng và đảm bảo quay lại
- Nhật ký kiểm toán và nguồn gốc quyết định cho việc tuân thủ
Điều phối Đa Agent cho Các Sự cố Phức tạp
- Tôn điều phối các agent chuyên gia: agent phân loại, agent chẩn đoán, agent khắc phục
- Giao tiếp giữa các agent và quản lý ngữ cảnh chung
- Giải quyết xung đột khi các agent đề xuất các hành động mâu thuẫn
- Mô phỏng sự cố lớn đầu-cuối với phản ứng đa agent
Quan sát (Observability) và Đánh giá
- Theo dõi chuỗi suy luận của agent để gỡ lỗi và kiểm toán
- Đánh giá chất lượng quyết định của agent: độ chính xác (precision), độ nhạy (recall), thời gian đến giải quyết
- Vòng lặp phản hồi: học hỏi từ việc can thiệp và kết quả của người vận hành
- Đánh theo dõi chi phí và kinh tế token cho các agent vận hành
Triển khai Sản xuất và Vận hành
- Triển khai agent dưới dạng dịch vụ: APIs, webhooks và các tác vụ được lên lịch
- Triển khai tự chủ dần dần: từ chế độ bóng (shadow mode) đến tự khắc phục hoàn toàn
- Runbook cho sự cố của agent: điều gì xảy ra khi bản thân agent bị lỗi
- Xây dựng luận điểm kinh doanh và đo lường ROI cho vận hành tự chủ
Yêu cầu
- Kinh nghiệm với các hoạt động IT, DevOps hoặc thực hành SRE.
- Quen thuộc với lập trình Python và REST APIs.
- Hiểu biết cơ bản về khả năng của LLM và kỹ thuật prompt engineering.
Đối tượng người nghe
- Các kỹ sư SRE và DevOps đang khám phá tự động hóa dựa trên AI.
- Các kỹ sư Platform đang xây dựng hạ tầng tự phục hồi.
- Các trưởng nhóm vận hành IT đang đánh giá agentic AI cho quản lý sự cố.
14 Giờ