Terminology extraction from bilingual comparable corpora
cental | Louvain-la-Neuve
Doctorant : Giovani Babagbeto
Promoteur : Leonardo Zilio
Fonds de financement : Fonds Spéciaux de Recherche (FSR)
Date de début : février 2026
Résumé (FR)
Cette thèse vise à développer des méthodes robustes d'extraction automatique de terminologie (ATE) bilingue à partir d'un corpus de brevets français-anglais (FR-EN) comparable. Ce travail associe une curation minutieuse du corpus, une annotation semi-automatique et des pipelines d'extraction hybrides combinant l'ATE statistique, la classification de tokens basée sur les transformateurs et l'alignement interlinguistique des embeddings. Les étapes méthodologiques prévues sont les suivantes : (i) constitution d'un corpus organisé de brevets FR-EN, (ii) obtention d'un glossaire bilingue validé, (iii) production d'une référence pilote, (iv) apprentissage de modèles de classification des tokens et (v) production d'une boîte à outils d'extraction reproductible et modulaire. L'évaluation porte sur la précision, le rappel et le score F1 au niveau des segments pour l'extraction
Résumé (EN)
This PhD aims to develop robust methods for bilingual automatic terminology extraction (ATE) from comparable French–English (FR-EN) patent corpus. The work combines careful corpus curation, semi-automatic annotation, and hybrid extraction pipelines that mix statistical ATE, transformer-based token classification, and cross-lingual embedding alignment. Expected methodological steps are: (i) building an organized FR–EN patent corpus, (ii) obtaining a validated bilingual glossary, (iii) producing a pilot gold standard, (iv) training token-classification models and, (v) producing a reproducible, modular extraction toolkit. Evaluation includes span-level precision/recall/F1 for monolingual extraction, and precision@k / top-k accuracy for bilingual alignment; extrinsic impact is measured by integrating the glossary into a machine translation model. The project targets reproducible experiments and publications, and aims to provide practical tools for terminography and domain-adapted translation support.