Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Đề cương khóa học
Giới thiệu về Học Củng Cố
- Tổng quan về học củng cố và các ứng dụng của nó
- Sự khác biệt giữa học có giám sát, không giám sát và học củng cố
- Các khái niệm chính: tác nhân, môi trường, phần thưởng và chính sách
Quá trình Ra quyết định Markov (MDP)
- Hiểu về trạng thái, hành động, phần thưởng và sự chuyển trạng thái
- Chức năng giá trị và Phương trình Bellman
- Lập trình động để giải quyết MDP
Các Thuật toán RL Cốt lõi
- Các phương pháp dạng bảng: Q-Learning và SARSA
- Các phương pháp dựa trên chính sách: Thuật toán REINFORCE
- Các khung Actor-Critic và ứng dụng của chúng
Học Củng Cố Sâu
- Giới thiệu về Deep Q-Networks (DQN)
- Phát lại trải nghiệm và mạng đích
- Độ dốc chính sách và các phương pháp RL sâu nâng cao
Các Khung và Công cụ RL
- Giới thiệu về OpenAI Gym và các môi trường RL khác
- Sử dụng PyTorch hoặc TensorFlow để phát triển mô hình RL
- Huấn luyện, kiểm thử và đánh giá hiệu chuẩn tác nhân RL
Các Thách thức trong RL
- Cân bằng giữa khám phá và khai thác trong huấn luyện
- Đặt ra và giải quyết vấn đề phần thưởng thưa và gán công (credit assignment)
- Tính mở rộng và thách thức tính toán trong RL
Các Hoạt động Thực hành
- Triển khai các thuật toán Q-Learning và SARSA từ đầu
- Huấn luyện một tác nhân dựa trên DQN để chơi một trò chơi đơn giản trong OpenAI Gym
- Điều chỉnh mô hình RL để cải thiện hiệu suất trong các môi trường tùy chỉnh
Tóm tắt và Các Bước Tiếp Theo
Yêu cầu
- Hiểu biết vững chắc về nguyên tắc và thuật toán học máy
- Khả năng lập trình Python thành thạo
- Quen thuộc với mạng nơ-ron và các khung học sâu
Đối tượng
- Kỹ sư học máy
- Chuyên gia AI
14 Giờ