Reinforcement Learning: Algorithms and Applications

linfo2275  2026-2027  Louvain-la-Neuve

Reinforcement Learning: Algorithms and Applications
5.00 crédits
30.0 h + 15.0 h
Q2
Préalables
Intelligence artificielle, tel que couvert par LINFO1361
Thèmes abordés
  • Fondements de l’apprentissage par renforcement (RL)
  • Bandits multi-bras et exploration/exploitation
  • Processus de décision de Markov (MDP)
  • Résolution par programmation dynamique
  • Méthodes de Monte Carlo
  • Méthodes de Temporal Difference Learning (Q-learning)
  • Apprentissage par renforcement profond
  • Approximations de valeur (DQN et variantes)
  • Méthodes de policy gradient (REINFORCE, AC, PPO)
  • Arbres de recherche de Monte-Carlo
  • Large Reasoning Models et RL from Human Feedback
  • Applications aux jeux et environnements simulés
  • Enjeux contemporains, limites et perspectives du RL
Acquis
d'apprentissage

A la fin de cette unité d’enseignement, l’étudiant est capable de :

Eu égard au référentiel AA du programme « Master en sciences informatiques », ce cours contribue au développement, à l’acquisition et à l’évaluation des acquis d’apprentissage suivants :
  • SINF1.M4
  • SINF2.1-4
  • SINF5.3-4
  • SINF6.1, SINF6.4, SINF6.5
Les étudiants ayant suivi ce cours seront capables de :
  • Modéliser un problème en termes de processus de décision de Markov
  • Implémenter des algorithmes de RL classiques (Q-Learning, Monte Carlo, etc.)
  • Comprendre les enjeux de l’exploration et de l’approximation des fonctions de valeur
  • Implémenter des algorithmes de RL contemporains (DQN, REINFORCE, PPO, etc.)
  • Décrire le fonctionnement des Large Reasoning Models et leur usage dans le RL from Human Feedback
  • Appliquer le RL sur des environnements simulés (jeux, tâches de contrôle)
  • Lire, comprendre, et analyser des articles scientifiques dans le domaine du RL
  • Analyser les performances et les limites des approches implémentées
 
Contenu
Le cours s’articule autour de trois grands thèmes :
  1. Les algorithmes classiques d’apprentissage par renforcement.
  2. Les algorithmes d’apprentissage profond par renforcement.
  3. L’utilisation de ces algorithmes dans plusieurs outils du monde réel.
Ces thèmes sont ensuite divisés en une séquence de modules regroupant des sujets connexes. Le contenu exact des modules peut être légèrement modifié au cours du quadrimestre.
  • Introduction générale au RL (agent, environnement, états, actions, récompenses, politique, fonctions de valeurs, convergence). 
  • Bandits multi-bras (Exploration/Exploitation, ε-greedy, upper confidence bound, softmax, Thompson sampling, Regrets).
  • Processus de décision de Markov : formalisme et dynamique (Propriété de Markov, Politiques stochastiques vs déterministes, Fonctions action-valeur, équation de Bellman, Optimalité).
  • Résolution par programmation dynamique (policy evaluation, policy iteration, value iteration).
  • Méthodes de Monte Carlo (estimation de valeurs d’états et valeur d’actions, convergence).
  • Temporal Difference Learning (Bootstrap, TD(0), Variance, Apprentissage en ligne).
  • Algorithme de Q-learning.
  • Arbres de recherche de Monte-Carlo et variantes profondes.
  • Approximation de fonction et Deep Q-Networks (Gradient, Approximation non linéaire, DQN).
  • Apprentissage par imitation (behavioral cloning, DaGGER).
  • Méthodes d'approximation de politiques (REINFORCE, Actor-Critic, Proximal Policy Optimization).
  • Apprentissage par renforcement pour les LLMs (RLHF, RLAIF, RLVR, DPO, etc.).
  • Apprentissage par renforcement pour les jeux (AlphaGo, AlphaZero, MuZero, etc.).
Méthodes d'enseignement
Ce cours comprend des cours magistraux, un travail de groupe, et des tâches individuelles.
Modes d'évaluation
des acquis des étudiants
En première session, l'évaluation se compose de deux parties:
  • Examen final individuel et récapitulatif (50%). L'utilisation de l'IA n'est pas permise pour cette évaluation. L'examen peut être répondu en anglais ou en français.
  • Exercices personnels (20%) : des exercices à réaliser individuellement seront demandés tout au long de la session. L'utilisation de l'IA n'est pas permise pour cette évaluation.
  • Projet en équipe (30%): implémentation d'un agent basé sur l'apprentissage par renforcement. L'utilisation de l'IA est permise pour cette évaluation, suivant les règles définies par la faculté.
Mise en garde: pour obtenir une note de passage au cours (>= 10/20), il est nécessaire d'avoir au minimum une note supérieure ou égale à 20/50 pour l'examen final. Si cette condition n'est pas respectée, seule la note de l'examen est comptabilisée. En effet, l'examen final évalue des compétences critiques non couvertes par les autres évaluations, indispensables à la validation de l'UE.
En seconde session, l'examen et les exercices personnels peuvent être refaits selon la même pondération et modalités.  La note de projet est acquise pour l'ensemble des sessions et ne peut pas être refait pour l'année académique. 
En cas de réinscription, toute évaluation (incluant le projet) doit être repassée. 
Ressources
en ligne
Page Moodle du cours (https://moodle.uclouvain.be/course/view.php?id=10915)
Bibliographie
Part of the content is based on the following book:
  • Reinforcement Learning: An Introduction (2nd Edition) - http://incompleteideas.net/book/the-book-2nd.html
This book is available for free. It is not required to follow the course, and material appearing only in the book is not part of the
exam material. It nevertheless provides an excellent and comprehensive introduction to the foundations and classical algorithms of reinforcement learning. Its website also offers complementary resources related to the book. Additional resources and scientific papers will be provided throughout the semester, particularly for topics in deep reinforcement learning and recent applications.
Faculté ou entité
en charge


Programmes / formations proposant cette unité d'enseignement (UE)

Intitulé du programme
Sigle
Crédits
Prérequis
Acquis
d'apprentissage
Master [120] en science des données, orientation statistique

Master [120] : ingénieur civil en chimie et science des matériaux

Master [120] : ingénieur civil des constructions

Master [120] : ingénieur civil biomédical

Master [120] : bioingénieur en gestion des forêts et des espaces naturels

Master [120] : bioingénieur en sciences et technologies de l'environnement

Master [120] : ingénieur civil mécanicien

Master [120] : ingénieur civil électricien

Master [120] : ingénieur civil physicien

Master [120] : bioingénieur en chimie et bioindustries

Master [120] : ingénieur civil en informatique

Master [120] en sciences informatiques

Master [120] : ingénieur civil électromécanicien

Master [120] : ingénieur civil en mathématiques appliquées

Master [120] : ingénieur civil en science des données

Certificat d'université : Statistique et science des données (15/30 crédits)

Master [120] : bioingénieur en sciences agronomiques

Master [120] en science des données, orientation technologies de l'information

Master [120] : ingénieur civil en génie de l'énergie