Improving Human Judgment Estimation using Reinforcement Learning with Verifiable Rewards
cental | Louvain-la-Neuve
Doctorant : Sebastian Loftus (website)
Promotrice : Marie-Catherine de Marneffe (website)
Source de financement : Projet FSR 2024 « Towards robust Natural Language Understanding: Taking into account cognitive bias that leads to multiple interpretations »
Début : septembre 2025
Résumé (FR)
À l'heure actuelle, les grands modèles de langage (LLM) peinent à représenter fidèlement la diversité des perspectives humaines. En raison de leur entraînement sur des corpus massifs dominés par des opinions majoritaires, ils tendent à surgénéraliser ces positions au détriment des points de vue minoritaires. Cette homogénéisation peut favoriser la reproduction de stéréotypes et contribuer à l’exclusion de groupes marginalisés dans des applications sensibles comme la sélection de candidats ou les systèmes de surveillance. Alors que le traitement automatique des langues (TAL) considère traditionnellement la variabilité des annotations comme du « bruit » à réduire, des travaux récents suggèrent que les désaccords entre annotateurs constituent un signal informationnel essentiel pour concevoir des modèles plus équitables. Plutôt que de lisser ces divergences, il devient pertinent de les intégrer explicitement dans les objectifs d’apprentissage.
Dans cette perspective, ma recherche vise à structurer la pluralité des points de vue générés par les LLMs afin de mieux refléter la diversité réelle des jugements humains. J’explore comment l’apprentissage par renforcement peut introduire de la variabilité dans les LLMs via le mécanisme de récompense, au-delà de tâches objectives et vérifiables comme les mathématiques ou la programmation. Je formule l’hypothèse qu’un mécanisme de double récompense (une récompense de raisonnement qui encourage l’exploration de multiples justifications, ainsi qu’une mesure de similarité entre la distribution des sorties du modèle et celle des annotations humaines) permettra de mieux capturer la diversité inhérente aux jugements humains à travers plusieurs types de tâches de Traitement Automatique du Langage social. L’objectif est de développer des technologies robustes capables de dépasser la seule perspective majoritaire afin de refléter toute l’étendue de la compréhension humaine.
Résumé (EN)
Large Language Models (LLMs) currently struggle to accurately represent the diversity of human perspectives, often overgeneralizing in favor of majority opinions found in training data. This erasure of minority viewpoints can lead to harmful stereotyping and the disenfranchisement of marginalized groups in downstream applications, such as candidate screening or safety monitoring. While traditional Natural Language Processing often dismisses label ambiguity as "noise," recent scholars suggest these disagreements are valuable signals for fair model development. To address this, my research aims to amplify the variety of viewpoints within LLMs to more accurately reflect genuine human diversity. I investigate how Reinforcement Learning can introduce variation in LLMs via its reward mechanism, beyond objective, verifiable tasks like mathematics or coding.
I hypothesize that a dual-reward mechanism (a reasoning reward to incentivize the exploration of multiple rationales and a measurement of similarity between model outputs and human-annotated label variations) will enable us to capture inherent human diversity across three tasks from social Natural Language Processing. The ultimate goal is to enable robust language technology that transcends majority demographics to reflect the full breadth of human understanding.
-
-
Article de journalLoftus, S., Mülthaler, A., Hoeken, S., Zarrieß, S., & Alaçam, Ö. (2025). Using LLMs and Preference Optimization for Agreement-Aware HateWiC Classification. Proceedings of the The 9th Workshop on Online Abuse and Harms (WOAH), 9, 538-547. (Original work published 2025)
-
-
-
Article de journalPeng, S., Sun, Z., Loftus, S., & Plank, B. (2024). Different Tastes of Entities: Investigating Human Label Variation in Named Entity Annotations. Workshop on Understanding Implicit and Underspecified Language, 3, 73-81. https://doi.org/10.18653/v1/2024.unimplicit-1.7 (Original work published 2024)
-