Recherche : quelques projets antérieurs
cental | Louvain-la-Neuve
Nous proposons ici un aperçu chronologique de nombreux projets menés au CENTAL au fil des années :
- outils d'analyse de corpus et de veille linguistique ;
- ressources et plateformes pour l'apprentissage des langues ;
- traitement du langage médical;
- analyse socio-linguistique des nouveaux médias;
- extraction d'information et de connaissances ;
- projets combinant le TAL à d'autres disciplines (vision par ordinateur, synthèse vocale).
Ils témoignent de la diversité des collaborations nouées par le centre, tant avec des partenaires académiques qu'avec des entreprises et institutions publiques.
Pour un aperçu des axes de recherche actuels du CENTAL et de quelques projets en cours, consultez la page Axes de recherches.
Mené de 2016 à 2018 avec le soutien de la Région wallonne (DGO6, programme BEWARE) et le parrainage d'Altissia, ce projet visait à développer une plateforme d'apprentissage des langues en ligne plus « intelligente » : mobile, personnalisée et adaptée au profil de chaque apprenant, intégrant des mécanismes de gamification et un accompagnement en direct (approche mixte combinant e-learning et interaction en classe virtuelle), grâce à l'intelligence artificielle et aux technologies du langage. Il s'inscrivait dans un partenariat de longue date entre le CENTAL et Altissia (spécialisée dans l'e-learning, notamment pour le programme Erasmus+ Online Linguistic Support), qui avait déjà donné lieu à des outils de normalisation de texte et de correction orthographique développés par le CENTAL et licenciés à Altissia dans le cadre d'un projet RW First Spin Off.
Chercheurs : Dr L. Zilio, Dr. R. Wilkens.
Mené de 2016 à 2018 avec le soutien initial du FNRS, ce projet interdisciplinaire (linguistique, psychologie, sociologie) étudiait les compétences de la population face aux nouveaux médias de communication (réseaux sociaux, messages électroniques...). Partant de l'hypothèse que leur usage, y compris par des locuteurs de plus en plus jeunes, ne conduit pas à une incompétence linguistique, sociale ou psychologique mais à une « pluricompétence » permettant à chacun d'adapter son code et son comportement selon la situation, l'interlocuteur ou le médium, le projet a mené une enquête à grande échelle pour explorer le potentiel créatif des locuteurs à travers leur discours.
Coordination : L.-A. Cougnon.
Collaborateurs : C. Fairon, A. Pizarro Pedraza (linguistique), M. Mikolajczak, B. Galand (psychologie), H. Draelants (sociologie).
Partenaire industriel : Moodwalk.
Mené de 2014 à 2017 avec le soutien de la Région wallonne (DGO6, programme Germaine Tillion), ce projet visait à permettre l'archivage raisonné des arguments mobilisés dans les débats publics (politiques, scientifiques, sociétaux...), en partant du principe que tout texte est un assemblage d'affirmations (descriptives, prescriptives, appréciatives ou performatives) reliées entre elles ainsi qu'à des acteurs, références et thèmes. Le projet a développé une plateforme collaborative open source permettant de cartographier, pour chaque affirmation, les prises de position des différents acteurs et leurs justifications, à destination de la pédagogie, de la recherche, mais aussi du grand public, des médias et du monde industriel. Il réunissait le CENTAL, le GIRSEF (UCLouvain) et le PReCISE (Université de Namur).
Équipe : L.-A. Cougnon, B. Delvaux, C. Fairon, F. Gilson, S. Roekhaut, P.-Y. Schobbens.
Parrainage : Audaxis, Early Tracks.
Mené de 2014 à 2017 avec le soutien d'Innoviris (programme Strategic Platforms e-health), le projet iMEDIATE (Interoperability of Medical Data Through Information Extraction and Term Encoding) visait à assurer l'interopérabilité des données médicales au sein des dossiers patients électroniques, alors que plus de 70 % de ces données se présentent sous forme de texte libre peu ou pas structuré. La recherche a porté sur le développement de technologies de TAL et d'extraction d'information permettant de construire automatiquement, à partir des textes cliniques, une représentation structurée des données patient en s'appuyant sur les nomenclatures médicales existantes (ICD-10, SNOMED). Quatre outils ont été développés : un analyseur qui repère, pour chaque hôpital, les différentes façons de désigner un même terme médical ; un système qui structure automatiquement les dossiers patients à partir du texte et des données existantes ; un assistant qui suggère les codes nécessaires à l'encodage administratif des actes médicaux (dont dépend le financement des hôpitaux) ; et un moteur de recherche permettant de retrouver les documents pertinents à travers plusieurs sources.
Coordination : CENTAL (UCLouvain), avec PRISME (UCLouvain), l'École de Santé Publique (ULB) et Termisti (ISTI).
Equipe CENTAL : Damien De Meyere, Thomas François, Cédrick Fairon.
Parrainage : Cliniques Erasme, Cliniques universitaires Saint-Luc, Chirec.
Publications
De Meyere, Damien ; Klein, Thierry ; François, Thomas ; Debongnie, Jean-Claude ; Radulescu, Cristina ; Mbengo, Nicole ; Ouro Koura, Maliki ; Coppieters 't Wallant, Yves ; Fairon, Cédrick. Automatic annotation of medical reports using SNOMED-CT: a flexible approach based on medical knowledge databases. 7th Language & Technology Conference: Human Language Technologies as a Challenge for Computer Science and Linguistics (Poznań, Poland, du 27/11/2015 au 29/11/2015). In: Proceedings of the 7th Language & Technology Conference, Fundacja Uniwersytetu im. A. Mickiewicza: Poznań, Poland, 2015. 978-83-932640-8-7, p. 519-523. [http://hdl.handle.net/2078.1/171882]
Hansart, Charlotte ; De Meyere, Damien ; Watrin, Patrick ; Bittar, André ; Fairon, Cédrick. CENTAL at SemEval-2016 Task 12: a linguistically fed CRF model for medical and temporal information extraction.10th International Workshop on Semantic Evaluation (SemEval-2016) (San Diego, California, du 16/06/2016 au 17/06/2016). In: Proceedings of the 10th International Workshop on Semantic Evaluation (SemEval-2016), Association for Computational Linguistics2016, p. 1286-1291 [http://hdl.handle.net/2078.1/175562]
Lemaire, Nathalie ; François, Thomas ; Debongnie, Jean-Claude ; De Meyere, Damien ; Fauquert, Benjamin ; et. al. L’enrichissement terminologique d’usage du projet iMediate : une collaboration tripartite terminologie/TALN/sciences de la santé. Second Congrès international du Réseau de Lexicographie (RELEX) (Universidade de Santiago de Compostela, du 05/10/2015 au 07/10/2015). In: La terminologie, un besoin pour la société actuelle, 2016 [http://hdl.handle.net/2078.1/184536]
ReSyf est une ressource de synonymes du français dans laquelle chaque synonyme est gradué selon des caractéristiques intra-lexicales (longueur, structure syllabique et morphologique, polysémie...) et psycholinguistiques (fréquence d'usage), afin de refléter sa difficulté de lecture et de compréhension. La version 1.2 comprend plus de 57 000 lemmes désambiguïsés, issus de JeuxDeMots et filtrés à l'aide de Lexique 3 et du TLFi. ReSyf est utilisé comme ressource pédagogique pour les apprenants du français ainsi que dans des outils de simplification automatique de textes. La ressource est consultable et téléchargeable à l'adresse suivante : cental.uclouvain.be/resyf.
Contributeurs : N. Gala, M. B. Billami (Aix-Marseille Université), T. François, C. Fairon (CENTAL, UCLouvain), D. Bernhard (Université de Strasbourg).
Publications
Billami, M., François, T. et Gala, N. ReSyf: a French lexicon with ranked synonyms In Proceedings of COLING 2018, August, 20-26, Santa Fe, USA.
François, T., Billami, M.B., Gala, N. et Bernhard, D. Bleu, contusion, ecchymose : tri automatique de synonymes en fonction de leur difficulté de lecture et compréhension In Actes de la 23e Conférence sur le Traitement Automatique des Langues Naturelles (TALN 2016). Paris, France, 4-8 July.
Gala, N., Billami, M. B., François, T. et Bernhard, D. (2015) Graded lexicons: new resources for educational purposes and much more. 22nd Computer-assisted language learning conference (EUROCALL-2015). Padova (Italie), août 2015. (lien http://pageperso.lif.univ-mrs.fr/~nuria.gala/publis/Galaetal_Eurocall2015_abstract.pdf)
Gala, N. et François, T. et Bernhard, D. et Fairon, C. Un modèle pour prédire la complexité lexicale et graduer les mots In Actes de la 21e Conférence sur le Traitement automatique des Langues Naturelles (TALN 2014), Marseille, 91-102.
Gala, N., François, T. et Fairon, C. Towards a French lexicon with difficulty measures: NLP helping to bridge the gap between traditional dictionaries and specialized lexicons. In Proceedings of Electronic lexicography in the 21st century: thinking outside the paper (eLEX-2013). Tallinn, Estonia, octobre 2013.
Mené de 2011 à 2013 avec le soutien du programme européen Eurostars, le projet Biographe réunissait plusieurs partenaires publics et industriels européens autour d'un objectif commun : construire et structurer automatiquement des informations biographiques à partir de documents variés (CV, pages web, dépêches d'actualité, rapports...). Les résultats ont été intégrés dans une plateforme de recherche multilingue couvrant le français, l'allemand, le néerlandais et l'anglais.
Chercheurs : P. Watrin, J.-L. Bouraoui, S. Weiser, O. Morozova.
Promoteur : C. Fairon.
Partenaires industriels : Sinequa, Belga, 123people, Jobanova.
Partenaire académique : CIS (Université Ludwig Maximilians-Munich).
Mené de janvier 2011 à 2014 avec le soutien du programme WIST 3.0 de la Région wallonne, le projet ELIT-IT s'attaquait à un défi organisationnel : identifier et cartographier les experts et leurs compétences au sein d'une entreprise, alors que ces informations circulent surtout de façon informelle (blogs, emails, réunions) et évoluent trop vite pour les grilles de compétences traditionnelles, coûteuses à maintenir à jour. Le projet a développé un ensemble d'outils combinant extraction d'information et fouille de texte pour repérer les compétences dans les sources informelles, théorie des graphes et fouille de données pour cartographier les liens entre personnes, compétences et documents, et recherche d'information pour permettre la recherche d'experts au sein de l'organisation, tout en intégrant un volet juridique sur la protection de la vie privée (notamment pour l'analyse des emails).
Chercheurs : A. Dessy (CENTAL), I. Kivimäki (ICTEAM), F. Omrani (CRID), D. Verdegem (IRIDIA).
Conseillers : H. Bersini, C. Fairon, F. Fouss, K. Françoisse, P. Francq, Y. Poullet, M. Saerens.
Partenaire industriel : IRIS.
Mené avec le soutien du programme européen Safer Internet, le projet iCOP visait à développer une boîte à outils légale destinée aux services de police de l'UE pour aider à identifier du matériel d'abus sexuel sur mineurs circulant sur les réseaux peer-to-peer (P2P). La contribution du CENTAL portait sur un module d'analyse de tendances combinant classification de texte et extraction terminologique : à partir des noms de fichiers, métadonnées et descriptions associées (souvent bruités, mal orthographiés ou codés), le système identifiait les fichiers susceptibles de contenir ce type de contenu et en extrayait des termes normalisés, permettant aux enquêteurs de suivre l'évolution du vocabulaire utilisé sur ces réseaux.
Chercheurs : R. Beaufort, C. Fairon, A. Panchenko.
Mené de décembre 2010 à mai 2013 avec le soutien du programme WIST 3.0 de la Région wallonne, le projet SPORTIC visait la couverture automatique et à faible coût d'évènements sportifs, à l'aide d'un réseau de caméras connecté à des logiciels dédiés. La plateforme permettait la synthèse automatique d'annotations décrivant finement les actions du match, la production autonome d'une vidéo représentative de l'évènement, et la génération de résumés audiovisuels personnalisés pour les professionnels comme pour le grand public. Le projet réunissait trois disciplines complémentaires : la vision intelligente pour l'analyse multi-caméras, la linguistique pour la génération automatique de commentaires cohérents et adaptés, et la synthèse vocale expressive pour restituer l'intensité du jeu.
Chercheurs : S. Audrit, N. Danhier.
Promoteurs : R. Beaufort, C. De Vleeschouwer, T. Dutoit, C. Fairon.
Partenaires industriels : Acapela Group, ACIC.
Lancé en 2008 au CENTAL dans le cadre d'un projet régional wallon sur la correction orthographique, PLATON est une plateforme d'apprentissage de l'orthographe assistée par ordinateur (ALAO/ELAO), destinée aux apprenants natifs comme allophones de niveau avancé. Elle repose sur la dictée comme exercice central, avec vocalisation automatique par synthèse de la parole et correction automatique des fautes basée sur des méthodes d'alignement et d'analyse linguistique, adaptant une technologie développée initialement pour SMS4Science.
La technologie a ensuite été reprise et industrialisée par la société Altissia sous le nom Ortalia, un outil grand public proposant un parcours progressif de dictées en ligne avec corrections et explications grammaticales automatiques, mis gratuitement à disposition des étudiants et du personnel de l'UCLouvain.
Chercheurs : R. Beaufort, S. Roekhaut.
Promoteur : C. Fairon.
Ce projet, mené à partir d'avril 2008 grâce à un mandat FIRST Post-Doc de la Région wallonne, s'appuyait sur l'expertise acquise par le CENTAL en langage SMS (via les projets « Faites don de vos SMS à la Science » et sms4science) pour développer, avec le centre de recherche Multitel, un système de synthèse vocale capable de vocaliser correctement les SMS, dont le langage est en effet si éloigné de la norme écrite (contractions, agglutinations, simplifications) que les systèmes classiques ne parvenaient pas à le traiter correctement. L'opérateur Proximus a testé le système tout au long de son développement, dans la perspective d'offrir ce service aux personnes ne pouvant accéder au contenu textuel des SMS (déficience visuelle, conducteurs, clients de téléphonie fixe).
Chercheur : R. Beaufort
Promoteur : C. Fairon
Partenaires industriels : Multitel, Proximus
Ce projet visait à étudier la communication par SMS et le langage qu'elle véhicule, en réunissant des chercheurs de plusieurs pays sous la coordination du CENTAL pour constituer de vastes corpus de SMS comparables dans un grand nombre de langues. L'équipe belge assurait la mise en place technique et la cohésion des différents projets nationaux, chacun étant piloté par une équipe universitaire locale en collaboration avec le CENTAL pour la collecte et le traitement des données.
Chercheure : L.-A. Cougnon
Promoteur : C. Fairon
Partenaire industriel : Belgacom/Proximus
Ce projet, mené de janvier 2007 à 2011 avec le soutien du programme Prospective Research for Brussels (IRSIB), visait à automatiser, à l'aide d'outils d'extraction d'information, le codage des lettres de sortie hospitalière selon la classification internationale des maladies (ICD-9-CM), un travail alors réalisé manuellement par des documentalistes pour la communication avec les soins extra-hospitaliers et la déclaration à la sécurité sociale.
Chercheure : J. Medori
Promoteurs : C. Fairon, B. Debande
Partenaire : Cliniques universitaires Saint-Luc
Ce projet, lancé en 2007 et financé par l'Institut d’encouragement de la Recherche Scientifique et de l’Innovation de Bruxelles (Programmes Spin-Off in Brussels), visait à développer des logiciels et services d'extraction d'information et d'ingénierie des connaissances permettant de structurer l'information textuelle non structurée (presse, PV, courriers, pages web) en connaissance exploitable, en combinant des approches linguistiques et statistiques. Les premiers produits s'appuyaient sur B-Ontology, une base de connaissance biographique développée avec l'agence de presse Belga, avant d'envisager une extension vers des services sur mesure pour les entreprises et institutions publiques.
Chercheur : P. Watrin
Promoteur : C. Fairon
Parrain : J. Leenknegt, Agence Belga
Ce projet, mené à partir d'octobre 2007 grâce à un mandat d'Aspirant FNRS, visait à développer un modèle de difficulté linguistique capable d'estimer automatiquement la difficulté contextuelle de textes ou de phrases selon l'échelle du CECR, afin de faciliter la conception d'exercices de FLE adaptés à un niveau d'apprentissage donné. La recherche a porté sur la classification automatique de textes selon leur niveau de difficulté, l'évaluation de diverses variables linguistiques comme indices de difficulté, et la comparaison de plusieurs techniques de classification (régression logistique, arbres binaires, etc.), avant validation du modèle auprès d'apprenants.
Chercheur : T. François
Promoteurs : C. Fairon (CENTAL), A.-C. Simon (VALIBEL)
GlossaNet est un service en ligne gratuit, développé dès 1998 à l'Université Paris-Est-Marne-la-Vallée puis poursuivi à l'UCLouvain depuis 2001, qui permet de constituer des corpus à partir de flux RSS, puis d'y effectuer une veille linguistique en enregistrant des requêtes qui sont automatiquement réappliquées à chaque arrivée de nouveaux textes ; les résultats, sous forme de concordances, sont envoyés par email à l'utilisateur. L'outil intègre deux logiciels développés antérieurement, Corporator et Unitex, et a été largement utilisé dans la recherche et l'enseignement en linguistique de corpus et en traitement automatique des langues, ainsi que comme outil de veille d'information par certains utilisateurs.
Chercheurs : C. Fairon, K. Macé, H. Naets