Đề cương khóa học
1. Giới thiệu về Học tăng cường sâu
- Học tăng cường là gì?
- Sự khác biệt giữa Học có giám sát, Học không giám sát và Học tăng cường
- Ứng dụng của DRL trong năm 2025 (robot, y tế, tài chính, hậu cần)
- Hiểu vòng lặp tương tác giữa tác nhân và môi trường
2. Nền tảng của Học tăng cường
- Quá trình ra quyết định Markov (MDP)
- Trạng thái, Hành động, Phần thưởng, Chính sách và hàm Giá trị
- Mâu thuẫn giữa Khám phá (Exploration) và Khai thác (Exploitation)
- Phương pháp Monte Carlo và Học chệnh lệch thời gian (Temporal-Difference - TD)
3. Triển khai các thuật toán RL cơ bản
- Các phương pháp bảng (Tabular methods): Lập trình động, Đánh giá chính sách và Lặp lại
- Q-Learning và SARSA
- Khám phá epsilon-greedy và các chiến lược suy giảm
- Triển khai môi trường RL với OpenAI Gymnasium
4. Chuyển đổi sang Học tăng cường sâu
- Hạn chế của các phương pháp bảng
- Sử dụng mạng neural để xấp xỉ hàm
- Kiến trúc và quy trình của Deep Q-Network (DQN)
- Phát lại trải nghiệm (Experience replay) và mạng mục tiêu (target networks)
5. Các thuật toán DRL nâng cao
- Double DQN, Dueling DQN và Phát lại trải nghiệm có ưu tiên
- Phương pháp Gradient Chính sách: Thuật toán REINFORCE
- Kiến trúc Actor-Critic (A2C, A3C)
- Tối ưu hóa chính sách gần kề (Proximal Policy Optimization - PPO)
- Soft Actor-Critic (SAC)
6. Làm việc với không gian hành động liên tục
- Thách thức trong điều khiển liên tục
- Sử dụng DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Công cụ và khung làm việc thực tiễn
- Sử dụng Stable-Baselines3 và Ray RLlib
- Ghi log và giám sát với TensorBoard
- Điều chỉnh siêu tham số cho các mô hình DRL
8. Kỹ thuật thiết kế phần thưởng và thiết kế môi trường
- Định hình phần thưởng và cân bằng hình phạt
- Các khái niệm chuyển giao từ mô phỏng sang thực tế (sim-to-real)
- Tạo môi trường tùy chỉnh trong Gymnasium
9. Môi trường quan sát một phần và khả năng tổng quát hóa
- Xử lý thông tin trạng thái không đầy đủ (POMDPs)
- Các phương pháp dựa trên bộ nhớ sử dụng LSTM và RNN
- Cải thiện độ bền và khả năng tổng quát hóa của tác nhân
10. Lý thuyết trò chơi và Học tăng cường đa tác nhân
- Giới thiệu về môi trường đa tác nhân
- Hợp tác so với cạnh tranh
- Ứng dụng trong huấn luyện đối kháng và tối ưu hóa chiến lược
11. Nghiên cứu tình huống và ứng dụng thực tế
- Mô phỏng lái xe tự động
- Định giá động và các chiến lược giao dịch tài chính
- Robot và tự động hóa công nghiệp
12. Khắc phục sự cố và Tối ưu hóa
- Chẩn đoán quá trình huấn luyện không ổn định
- Quản lý độ thưa của phần thưởng và hiện tượng quá khớp
- Mở rộng các mô hình DRL trên GPU và các hệ thống phân tán
13. Tổng kết và Các bước tiếp theo
- Ôn lại kiến trúc DRL và các thuật toán chính
- Xu hướng ngành và hướng nghiên cứu (ví dụ: RLHF, các mô hình lai)
- Tài nguyên và tài liệu đọc thêm
Yêu cầu
- Thành thạo lập trình Python
- Hiểu biết về Giải tích và Đại số tuyến tính
- Kiến thức cơ bản về Xác suất và Thống kê
- Kinh nghiệm xây dựng các mô hình máy học sử dụng Python cùng NumPy hoặc TensorFlow/PyTorch
Đối tượng tham gia
- Các nhà phát triển quan tâm đến AI và các hệ thống thông minh
- Các nhà khoa học dữ liệu đang khám phá các khung làm việc cho học tăng cường
- Các kỹ sư Học máy làm việc với các hệ thống tự trị
Đánh giá (3)
Tôi thực sự thích phần cuối khi chúng tôi dành thời gian để làm quen với CHAT GPT. Phòng học không được bố trí tốt cho hoạt động này - thay vì một bàn lớn, vài bàn nhỏ để chúng tôi có thể chia thành nhóm nhỏ và thảo luận sẽ giúp ích hơn nhiều.
Nola - Laramie County Community College
Khóa học - Artificial Intelligence (AI) Overview
Dịch thuật bằng máy
Làm việc dựa trên các nguyên lý cơ bản một cách tập trung, và chuyển sang áp dụng các trường hợp nghiên cứu trong cùng một ngày
Maggie Webb - Department of Jobs, Regions, and Precincts
Khóa học - Artificial Neural Networks, Machine Learning, Deep Thinking
Dịch thuật bằng máy
Đó là việc sử dụng dữ liệu thực tế của công ty. Giảng viên có cách tiếp cận rất tốt bằng cách khiến học viên tham gia và cạnh tranh
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Khóa học - Applied AI from Scratch in Python
Dịch thuật bằng máy