CentraleSupélec — Apprentissage par renforcement
Apprentissage par renforcement — CentraleSupélec
Refonte du cours PARL, structurée en quatre séances de cours, chacune suivie d’une feuille de TD écrite qui reprend le sujet du cours précédent.
Les sources LaTeX vivent dans un dépôt privé ; les PDF diffusés sont publiés sur github.com/cetiennec/cours-pdf et servis directement depuis GitHub — cliquez un titre pour un aperçu en ligne, ou « open » pour le PDF en plein écran.
Cours
Séance 1 : processus de décision markoviens, retour, fonctions de valeur, équations de Bellman. Séance 2 : évaluation de politique, itération sur la politique, itération sur la valeur. Séance 3 : méthodes de Monte-Carlo, différences temporelles TD(0). Séance 4 : Monte-Carlo control, SARSA, Q-Learning, et une ouverture sur le deep RL.
TD écrits
Les feuilles de TD des séances 3 et 4, ainsi que les notebooks, sont en préparation.
Voir aussi la formation Deep Reinforcement Learning que je propose en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.