Đề cương khóa học
Giới thiệu về Học tăng cường và AI Agent
- Ra quyết định trong môi trường bất định và lập kế hoạch tuần tự
- Các thành phần chính của RL: agent, môi trường, trạng thái và phần thưởng
- Vai trò của RL trong các hệ thống AI thích ứng và agent
Quy trình Quyết định Markov (MDP)
- Định nghĩa hình thức và các thuộc tính của MDP
- Hàm giá trị, phương trình Bellman và quy hoạch động
- Đánh giá chính sách, cải thiện và lặp lại
Học tăng cường không dựa trên mô hình (Model-Free Reinforcement Learning)
- Học Monte Carlo và học Temporal-Difference (TD)
- Q-learning và SARSA
- Thực hành: Triển khai các phương pháp RL bảng (tabular) bằng Python
Học tăng cường sâu (Deep Reinforcement Learning)
- Kết hợp mạng nơ-ron với RL để xấp xỉ hàm
- Mạng Q sâu (DQN) và trình bày trải nghiệm (experience replay)
- Kiến trúc Actor-Critic và gradient chính sách
- Thực hành: Huấn luyện agent bằng DQN và PPO với Stable-Baselines3
Chiến lược Khám phá và Định hình Phần thưởng
- Cân bằng giữa khám phá và khai thác (ε-greedy, UCB, các phương pháp entropy)
- Thiết kế hàm phần thưởng và tránh các hành vi ngoài ý muốn
- Định hình phần thưởng và học theo chương trình (curriculum learning)
Các chủ đề nâng cao về RL và Ra quyết định
- Học tăng cường đa agent và các chiến lược hợp tác
- Học tăng cường phân cấp và khung các tùy chọn (options framework)
- RL ngoại tuyến (Offline RL) và học bắt chước (imitation learning) cho triển khai an toàn hơn
Môi trường Mô phỏng và Đánh giá
- Sử dụng OpenAI Gym và các môi trường tùy chỉnh
- Không gian hành động liên tục so với rời rạc
- Các chỉ số về hiệu suất, độ ổn định và hiệu quả lấy mẫu của agent
Tích hợp RL vào các Hệ thống AI Agent
- Kết hợp suy luận và RL trong các kiến trúc agent lai
- Tích hợp học tăng cường với các agent sử dụng công cụ
- Các yếu tố vận hành cho việc mở rộng quy mô và triển khai
Dự án Tổng kết (Capstone Project)
- Thiết kế và triển khai một agent học tăng cường cho một tác vụ mô phỏng
- Phân tích hiệu suất huấn luyện và tối ưu hóa siêu tham số
- Thể hiện hành vi thích ứng và ra quyết định trong bối cảnh agent
Tổng kết và Các bước tiếp theo
Yêu cầu
- Kỹ năng lập trình Python thành thạo
- Hiểu biết vững chắc về các khái niệm học máy và học sâu
- Quen thuộc với đại số tuyến tính, xác suất và các phương pháp tối ưu hóa cơ bản
Đối tượng tham gia
- Kỹ sư học tăng cường và nhà nghiên cứu AI ứng dụng
- Phát triển viên trong lĩnh vực robot và tự động hóa
- Đội ngũ kỹ thuật đang phát triển các hệ thống AI thích ứng và agent
Đánh giá (3)
Người hướng dẫn rất kiên nhẫn và hữu ích. Anh ấy am hiểu rõ về chủ đề.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Khóa học - Agentic AI for Business Automation: Use Cases & Integration
Dịch thuật bằng máy
Phần lý thuyết và thực hành được pha trộn tốt
Ion Mironescu - Facultatea S.A.I.A.P.M.
Khóa học - Agentic AI for Enterprise Applications
Dịch thuật bằng máy
Phần kết hợp giữa lý thuyết và thực hành, giữa các góc nhìn ở mức độ cao và thấp
Ion Mironescu - Facultatea S.A.I.A.P.M.
Khóa học - Autonomous Decision-Making with Agentic AI
Dịch thuật bằng máy