Enseignants
Langue
d'enseignement
d'enseignement
Préalables
Intelligence artificielle, tel que couvert par LINFO1361
Thèmes abordés
- Fondements de l’apprentissage par renforcement (RL)
- Bandits multi-bras et exploration/exploitation
- Processus de décision de Markov (MDP)
- Résolution par programmation dynamique
- Méthodes de Monte Carlo
- Méthodes de Temporal Difference Learning (Q-learning)
- Apprentissage par renforcement profond
- Approximations de valeur (DQN et variantes)
- Méthodes de policy gradient (REINFORCE, AC, PPO)
- Arbres de recherche de Monte-Carlo
- Large Reasoning Models et RL from Human Feedback
- Applications aux jeux et environnements simulés
- Enjeux contemporains, limites et perspectives du RL
Acquis
d'apprentissage
d'apprentissage
A la fin de cette unité d’enseignement, l’étudiant est capable de : | |
Eu égard au référentiel AA du programme « Master en sciences informatiques », ce cours contribue au développement, à l’acquisition et à l’évaluation des acquis d’apprentissage suivants :
|
|
Contenu
Le cours s’articule autour de trois grands thèmes :
- Les algorithmes classiques d’apprentissage par renforcement.
- Les algorithmes d’apprentissage profond par renforcement.
- L’utilisation de ces algorithmes dans plusieurs outils du monde réel.
- Introduction générale au RL (agent, environnement, états, actions, récompenses, politique, fonctions de valeurs, convergence).
- Bandits multi-bras (Exploration/Exploitation, ε-greedy, upper confidence bound, softmax, Thompson sampling, Regrets).
- Processus de décision de Markov : formalisme et dynamique (Propriété de Markov, Politiques stochastiques vs déterministes, Fonctions action-valeur, équation de Bellman, Optimalité).
- Résolution par programmation dynamique (policy evaluation, policy iteration, value iteration).
- Méthodes de Monte Carlo (estimation de valeurs d’états et valeur d’actions, convergence).
- Temporal Difference Learning (Bootstrap, TD(0), Variance, Apprentissage en ligne).
- Algorithme de Q-learning.
- Arbres de recherche de Monte-Carlo et variantes profondes.
- Approximation de fonction et Deep Q-Networks (Gradient, Approximation non linéaire, DQN).
- Apprentissage par imitation (behavioral cloning, DaGGER).
- Méthodes d'approximation de politiques (REINFORCE, Actor-Critic, Proximal Policy Optimization).
- Apprentissage par renforcement pour les LLMs (RLHF, RLAIF, RLVR, DPO, etc.).
- Apprentissage par renforcement pour les jeux (AlphaGo, AlphaZero, MuZero, etc.).
Méthodes d'enseignement
Ce cours comprend des cours magistraux, un travail de groupe, et des tâches individuelles.
Modes d'évaluation
des acquis des étudiants
des acquis des étudiants
En première session, l'évaluation se compose de deux parties:
En seconde session, l'examen et les exercices personnels peuvent être refaits selon la même pondération et modalités. La note de projet est acquise pour l'ensemble des sessions et ne peut pas être refait pour l'année académique.
En cas de réinscription, toute évaluation (incluant le projet) doit être repassée.
- Examen final individuel et récapitulatif (50%). L'utilisation de l'IA n'est pas permise pour cette évaluation. L'examen peut être répondu en anglais ou en français.
- Exercices personnels (20%) : des exercices à réaliser individuellement seront demandés tout au long de la session. L'utilisation de l'IA n'est pas permise pour cette évaluation.
- Projet en équipe (30%): implémentation d'un agent basé sur l'apprentissage par renforcement. L'utilisation de l'IA est permise pour cette évaluation, suivant les règles définies par la faculté.
En seconde session, l'examen et les exercices personnels peuvent être refaits selon la même pondération et modalités. La note de projet est acquise pour l'ensemble des sessions et ne peut pas être refait pour l'année académique.
En cas de réinscription, toute évaluation (incluant le projet) doit être repassée.
Ressources
en ligne
en ligne
Page Moodle du cours (https://moodle.uclouvain.be/course/view.php?id=10915)
Bibliographie
Part of the content is based on the following book:
exam material. It nevertheless provides an excellent and comprehensive introduction to the foundations and classical algorithms of reinforcement learning. Its website also offers complementary resources related to the book. Additional resources and scientific papers will be provided throughout the semester, particularly for topics in deep reinforcement learning and recent applications.
- Reinforcement Learning: An Introduction (2nd Edition) - http://incompleteideas.net/book/the-book-2nd.html
exam material. It nevertheless provides an excellent and comprehensive introduction to the foundations and classical algorithms of reinforcement learning. Its website also offers complementary resources related to the book. Additional resources and scientific papers will be provided throughout the semester, particularly for topics in deep reinforcement learning and recent applications.
Faculté ou entité
en charge
en charge
Programmes / formations proposant cette unité d'enseignement (UE)
Intitulé du programme
Sigle
Crédits
Prérequis
Acquis
d'apprentissage
d'apprentissage
Master [120] en science des données, orientation statistique
Master [120] : ingénieur civil en chimie et science des matériaux
Master [120] : ingénieur civil des constructions
Master [120] : ingénieur civil biomédical
Master [120] : bioingénieur en gestion des forêts et des espaces naturels
Master [120] : bioingénieur en sciences et technologies de l'environnement
Master [120] : ingénieur civil mécanicien
Master [120] : ingénieur civil électricien
Master [120] : ingénieur civil physicien
Master [120] : bioingénieur en chimie et bioindustries
Master [120] : ingénieur civil en informatique
Master [120] en sciences informatiques
Master [120] : ingénieur civil électromécanicien
Master [120] : ingénieur civil en mathématiques appliquées
Master [120] : ingénieur civil en science des données
Certificat d'université : Statistique et science des données (15/30 crédits)
Master [120] : bioingénieur en sciences agronomiques
Master [120] en science des données, orientation technologies de l'information
Master [120] : ingénieur civil en génie de l'énergie