CentraleSupélec — Apprentissage par renforcement

CentraleSupélec — Apprentissage par renforcement

Apprentissage par renforcement — CentraleSupélec

Refonte du cours PARL, structurée en quatre séances de cours et quatre TD sous forme de notebooks, chaque TD reprenant le sujet du cours qui le précède.

Supports en préparation. Les diaporamas et les notebooks ne sont pas encore diffusés publiquement ; ils seront ajoutés ici au fur et à mesure.

Cours

#SéanceContenu
1Introduction et MDPProcessus de décision markoviens, retour, fonctions de valeur, équations de Bellman
2Programmation dynamiqueÉvaluation de politique, itération sur la politique, itération sur la valeur
3Prédiction sans modèleMéthodes de Monte-Carlo, différences temporelles TD(0)
4Contrôle sans modèleMonte-Carlo control, SARSA, Q-Learning

Travaux dirigés

Quatre notebooks, alignés sur les quatre cours : programmation dynamique, itération sur la valeur, Monte-Carlo, différences temporelles. Ils partagent une bibliothèque commune d’environnements et de tracés.


Voir aussi la formation Deep Reinforcement Learning que je propose en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.