CentraleSupélec — Apprentissage par renforcement

CentraleSupélec — Apprentissage par renforcement

Apprentissage par renforcement — CentraleSupélec

Refonte du cours PARL, structurée en quatre séances de cours, chacune suivie d’une feuille de TD écrite qui reprend le sujet du cours précédent.

Les sources LaTeX vivent dans un dépôt privé ; les PDF diffusés sont publiés sur github.com/cetiennec/cours-pdf et servis directement depuis GitHub — cliquez un titre pour un aperçu en ligne, ou « open » pour le PDF en plein écran.

Cours

1 — Introduction et MDP open ↗
2 — Programmation dynamique open ↗
3 — Prédiction sans modèle open ↗
4 — Contrôle sans modèle et deep RL open ↗

Séance 1 : processus de décision markoviens, retour, fonctions de valeur, équations de Bellman. Séance 2 : évaluation de politique, itération sur la politique, itération sur la valeur. Séance 3 : méthodes de Monte-Carlo, différences temporelles TD(0). Séance 4 : Monte-Carlo control, SARSA, Q-Learning, et une ouverture sur le deep RL.

TD écrits

TD — Introduction et MDP open ↗
TD — Programmation dynamique open ↗

Les feuilles de TD des séances 3 et 4, ainsi que les notebooks, sont en préparation.


Voir aussi la formation Deep Reinforcement Learning que je propose en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.