CentraleSupélec — Apprentissage par renforcement
Apprentissage par renforcement — CentraleSupélec
Refonte du cours PARL, structurée en quatre séances de cours et quatre TD sous forme de notebooks, chaque TD reprenant le sujet du cours qui le précède.
Supports en préparation. Les diaporamas et les notebooks ne sont pas encore diffusés publiquement ; ils seront ajoutés ici au fur et à mesure.
Cours
| # | Séance | Contenu |
|---|---|---|
| 1 | Introduction et MDP | Processus de décision markoviens, retour, fonctions de valeur, équations de Bellman |
| 2 | Programmation dynamique | Évaluation de politique, itération sur la politique, itération sur la valeur |
| 3 | Prédiction sans modèle | Méthodes de Monte-Carlo, différences temporelles TD(0) |
| 4 | Contrôle sans modèle | Monte-Carlo control, SARSA, Q-Learning |
Travaux dirigés
Quatre notebooks, alignés sur les quatre cours : programmation dynamique, itération sur la valeur, Monte-Carlo, différences temporelles. Ils partagent une bibliothèque commune d’environnements et de tracés.
Voir aussi la formation Deep Reinforcement Learning que je propose en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.