08/07/2026
L'UCLouvain recherche un (h/f) Gestionnaire de données
- taux d’emploi à convenir (entre 60% et 80% selon les coûts) pour une durée déterminée jusqu’au 31 décembre 2027 (avec possibilité de prolongation)
- pour l'Institut Langage et Communication (ILC), du Secteur des Sciences Humaines (SSH)
- à Louvain-la-Neuve
- entrée en fonction : octobre 2026
Contexte
La recherche actuelle fait un usage massif de données langagières écrites et orales, dans différentes langues (français, espagnol, anglais, néerlandais, etc.). Pour être exploitables, ces données langagières doivent être documentées (métadonnées), anonymisées (afin de respecter les règles sur les données personnelles), enrichies d’annotations (transcription, indexation, analyse thématique, etc.) et déposées dans des bases de données interrogeables en ligne. C’est à ces différentes tâches que le ou la gestionnaire de données contribuera au sein de l’Institut Langage et Communication (ILC), et plus particulièrement du Pôle de recherche en Linguistique (PLIN) et de la plateforme CENTAL (Centre de Traitement Automatique du Langage).
Fonction
En collaboration avec les chercheurs de PLIN/ILC, le ou la gestionnaire de données a pour fonctions de :
• Superviser la chaîne de traitement nécessaire à la constitution de corpus oraux et écrits (acquisition des données, documentation des métadonnées, transcription et annotation, versement dans les bases de données existantes, standardisation et contrôle des formats utilisés).
• Développer, adapter et utiliser des outils de prétraitement et de traitement des données linguistiques (segmentation, alignement texte-son, alignement texte-texte, annotation automatique ou semi-automatique, etc.), en fonction des besoins des projets de recherche.
• Assurer une veille technologique et méthodologique dans le domaine des technologies linguistiques et des infrastructures de données (outils d’acquisition, de traitement et d’analyse des données, automatic speech recognition, tokenisation, modèles de traitement automatique du langage, etc.), évaluer leur pertinence et accompagner leur intégration dans les workflows de recherche.
• Veiller à l’interopérabilité, à la pérennisation et à la réutilisation des données linguistiques, en garantissant leur documentation et leur traitement selon les standards internationaux (notamment ceux promus par CLARIN, OLAC, ORTOLANG, etc.).
• Veiller au respect des cadres juridiques et éthiques liés à la collecte, au traitement, au partage et à la publication des données (notamment le RGPD et les principes de science ouverte), ainsi qu’à l’utilisation de plateformes de diffusion adaptées (par exemple Dataverse).
• Représenter l’UCLouvain dans différents consortiums et réseaux internationaux actifs dans le domaine des données linguistiques.
• Assurer le suivi des demandes d’information, d’accompagnement et de support adressées au centre K CLARIN pour les corpus d’apprenants.
• Apporter un soutien méthodologique et technique aux activités de recherche du projet ARC « PostAILanguage », consacré à l’analyse du langage produit par les grands modèles de langue (LLM) et à l’étude de leur impact sur les usages langagiers humains (30–40 % du temps).
Qualifications et aptitudes requises
Le ou la candidat.e répondra aux qualifications suivantes :
• Titulaire d’un diplôme de Master en Sciences du langage, Traitement automatique du langage ou Linguistique
• Compétences de programmation : maîtrise de Python, bonne connaissance du XML ; des compétences en développement web constituent un atout.
• Compétences en traitement automatique du langage (NLP), notamment dans l’utilisation de méthodes et d’outils d’analyse linguistique automatique (par exemple parsing, tagging, modèles de deep learning).
• Capacité à traiter et analyser des données langagières en français ainsi que dans au moins une des langues suivantes: anglais, néerlandais, espagnol, allemand, ou italien
• Connaissance de l’anglais (B2) et en particulier de l’anglais académique (pour participer à des réunions internationales et éventuellement contribuer à des publications scientifiques)
• Capacité à travailler en équipe, sens de l’écoute, aptitude à analyser les besoins des chercheurs et réactivité dans l’accompagnement des projets
• Des compétences en statistiques appliquées aux données linguistiques constituent un atout.
Votre candidature (fichier unique avec lettre de motivation et curriculum vitae) est à transmettre pour le 31 août à l'adresse suivante : [email protected]
Sur base de ces documents, les candidat·e.s seront, le cas échéant, sélectionné·e.s pour un entretien qui se fera normalement la semaine du 21 septembre.