Apprentissage par renforcement

Apprentissage par renforcement

Cours d’introduction au Reinforcement-Learning, structurée en quatre séances de cours, chacune suivie d’un TD.

Cours

Cours 1 : Introduction et MDP open ↗
Cours 2 : Programmation dynamique open ↗
Cours 3 : Prédiction sans modèle open ↗
Cours 4 : Contrôle sans modèle et deep RL open ↗
  • Séance 1 : processus de décision markoviens, retour, fonctions de valeur, équations de Bellman.
  • Séance 2 : évaluation de politique, itération sur la politique, itération sur la valeur.
  • Séance 3 : méthodes de Monte-Carlo, différences temporelles TD(0).
  • Séance 4 : Monte-Carlo control, SARSA, Q-Learning, et une ouverture sur le deep RL.

TD écrits

TD : Introduction et MDP open ↗
TD : Programmation dynamique open ↗

Les feuilles de TD des séances 3 et 4, ainsi que les notebooks, sont en préparation.

Voir aussi la formation Deep Reinforcement Learning que j’ai réalisé en entreprise, sur les mêmes fondamentaux mais orientée mise en pratique avec Stable-Baselines3 et Gym.