Apprentissage par renforcement
Cours d’introduction au Reinforcement-Learning, structurée en quatre séances de cours, chacune suivie d’un TD.
Cours
- Séance 1 : processus de décision markoviens, retour, fonctions de valeur, équations de Bellman.
- Séance 2 : évaluation de politique, itération sur la politique, itération sur la valeur.
- Séance 3 : méthodes de Monte-Carlo, différences temporelles TD(0).
- Séance 4 : Monte-Carlo control, SARSA, Q-Learning, et une ouverture sur le deep RL.
TD écrits
Les feuilles de TD des séances 3 et 4, ainsi que les notebooks, sont en préparation.
Voir aussi la formation Deep Reinforcement Learning que j’ai réalisé en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.