Liên hệ với chúng tôi

Đề cương khóa học

Giới thiệu về Học Củng Cố

  • Tổng quan về học củng cố và các ứng dụng của nó
  • Sự khác biệt giữa học có giám sát, không giám sát và học củng cố
  • Các khái niệm chính: tác nhân, môi trường, phần thưởng và chính sách

Quá trình Ra quyết định Markov (MDP)

  • Hiểu về trạng thái, hành động, phần thưởng và sự chuyển trạng thái
  • Chức năng giá trị và Phương trình Bellman
  • Lập trình động để giải quyết MDP

Các Thuật toán RL Cốt lõi

  • Các phương pháp dạng bảng: Q-Learning và SARSA
  • Các phương pháp dựa trên chính sách: Thuật toán REINFORCE
  • Các khung Actor-Critic và ứng dụng của chúng

Học Củng Cố Sâu

  • Giới thiệu về Deep Q-Networks (DQN)
  • Phát lại trải nghiệm và mạng đích
  • Độ dốc chính sách và các phương pháp RL sâu nâng cao

Các Khung và Công cụ RL

  • Giới thiệu về OpenAI Gym và các môi trường RL khác
  • Sử dụng PyTorch hoặc TensorFlow để phát triển mô hình RL
  • Huấn luyện, kiểm thử và đánh giá hiệu chuẩn tác nhân RL

Các Thách thức trong RL

  • Cân bằng giữa khám phá và khai thác trong huấn luyện
  • Đặt ra và giải quyết vấn đề phần thưởng thưa và gán công (credit assignment)
  • Tính mở rộng và thách thức tính toán trong RL

Các Hoạt động Thực hành

  • Triển khai các thuật toán Q-Learning và SARSA từ đầu
  • Huấn luyện một tác nhân dựa trên DQN để chơi một trò chơi đơn giản trong OpenAI Gym
  • Điều chỉnh mô hình RL để cải thiện hiệu suất trong các môi trường tùy chỉnh

Tóm tắt và Các Bước Tiếp Theo

Yêu cầu

  • Hiểu biết vững chắc về nguyên tắc và thuật toán học máy
  • Khả năng lập trình Python thành thạo
  • Quen thuộc với mạng nơ-ron và các khung học sâu

Đối tượng

  • Kỹ sư học máy
  • Chuyên gia AI
 14 Giờ

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan