Liên hệ với chúng tôi

Đề cương khóa học

Giới thiệu về Học tăng cường và AI Agent

  • Ra quyết định trong môi trường bất định và lập kế hoạch tuần tự
  • Các thành phần chính của RL: agent, môi trường, trạng thái và phần thưởng
  • Vai trò của RL trong các hệ thống AI thích ứng và agent

Quy trình Quyết định Markov (MDP)

  • Định nghĩa hình thức và các thuộc tính của MDP
  • Hàm giá trị, phương trình Bellman và quy hoạch động
  • Đánh giá chính sách, cải thiện và lặp lại

Học tăng cường không dựa trên mô hình (Model-Free Reinforcement Learning)

  • Học Monte Carlo và học Temporal-Difference (TD)
  • Q-learning và SARSA
  • Thực hành: Triển khai các phương pháp RL bảng (tabular) bằng Python

Học tăng cường sâu (Deep Reinforcement Learning)

  • Kết hợp mạng nơ-ron với RL để xấp xỉ hàm
  • Mạng Q sâu (DQN) và trình bày trải nghiệm (experience replay)
  • Kiến trúc Actor-Critic và gradient chính sách
  • Thực hành: Huấn luyện agent bằng DQN và PPO với Stable-Baselines3

Chiến lược Khám phá và Định hình Phần thưởng

  • Cân bằng giữa khám phá và khai thác (ε-greedy, UCB, các phương pháp entropy)
  • Thiết kế hàm phần thưởng và tránh các hành vi ngoài ý muốn
  • Định hình phần thưởng và học theo chương trình (curriculum learning)

Các chủ đề nâng cao về RL và Ra quyết định

  • Học tăng cường đa agent và các chiến lược hợp tác
  • Học tăng cường phân cấp và khung các tùy chọn (options framework)
  • RL ngoại tuyến (Offline RL) và học bắt chước (imitation learning) cho triển khai an toàn hơn

Môi trường Mô phỏng và Đánh giá

  • Sử dụng OpenAI Gym và các môi trường tùy chỉnh
  • Không gian hành động liên tục so với rời rạc
  • Các chỉ số về hiệu suất, độ ổn định và hiệu quả lấy mẫu của agent

Tích hợp RL vào các Hệ thống AI Agent

  • Kết hợp suy luận và RL trong các kiến trúc agent lai
  • Tích hợp học tăng cường với các agent sử dụng công cụ
  • Các yếu tố vận hành cho việc mở rộng quy mô và triển khai

Dự án Tổng kết (Capstone Project)

  • Thiết kế và triển khai một agent học tăng cường cho một tác vụ mô phỏng
  • Phân tích hiệu suất huấn luyện và tối ưu hóa siêu tham số
  • Thể hiện hành vi thích ứng và ra quyết định trong bối cảnh agent

Tổng kết và Các bước tiếp theo

Yêu cầu

  • Kỹ năng lập trình Python thành thạo
  • Hiểu biết vững chắc về các khái niệm học máy và học sâu
  • Quen thuộc với đại số tuyến tính, xác suất và các phương pháp tối ưu hóa cơ bản

Đối tượng tham gia

  • Kỹ sư học tăng cường và nhà nghiên cứu AI ứng dụng
  • Phát triển viên trong lĩnh vực robot và tự động hóa
  • Đội ngũ kỹ thuật đang phát triển các hệ thống AI thích ứng và agent
 28 Giờ

Số người tham gia


Giá cho mỗi học viên

Đánh giá (3)

Các khóa học sắp tới

Các danh mục liên quan