02/04/2026
🔬 𝐂𝐈𝐓𝐀𝐃𝐄𝐋 𝐑𝐞𝐬𝐞𝐚𝐫𝐜𝐡 | 𝐏𝐚𝐩𝐞𝐫 𝐍𝐞𝐰𝐬
𝐂𝐈𝐓𝐀𝐃𝐄𝐋 𝐚𝐮 𝐋𝐨𝐑𝐞𝐬𝐋𝐌 𝟐𝟎𝟐𝟔, 𝐝𝐞𝐮𝐱 𝐜𝐨𝐧𝐭𝐫𝐢𝐛𝐮𝐭𝐢𝐨𝐧𝐬 𝐩𝐨𝐮𝐫 𝐦𝐞𝐭𝐭𝐫𝐞 𝐥𝐞 𝐌𝐨𝐨𝐫𝐞́ 𝐚𝐮 𝐜œ𝐮𝐫 𝐝𝐞 𝐥'𝐈𝐀 𝐢𝐧𝐜𝐥𝐮𝐬𝐢𝐯𝐞 🌍🇧🇫
Le Workshop on Language Models for Low-Resource Languages (LoResLM 2026) s'est tenu à Rabat au Maroc, en marge de l'𝐄𝐀𝐂𝐋 2026, l'une des conférences phares en traitement automatique des langues. Il réunit les chercheurs qui travaillent à faire exister les langues oubliées dans l'IA. Sur les quelque 7 000 langues parlées dans le monde, une vingtaine seulement bénéficie d'une vraie représentation en NLP. CITADEL, le Centre d'Excellence Interdisciplinaire en Intelligence Artificielle pour le Développement, y a présenté cette année deux travaux distincts, portant chacun une question différente sur le Mooré.
📄 𝐂𝐨𝐧𝐭𝐫𝐢𝐛𝐮𝐭𝐢𝐨𝐧 𝟏 — 𝐅𝐚𝐢𝐫𝐞 𝐩𝐚𝐫𝐥𝐞𝐫 𝐥𝐞𝐬 𝐦𝐚𝐜𝐡𝐢𝐧𝐞𝐬 𝐞𝐧 𝐌𝐨𝐨𝐫𝐞́ 🎙️
"𝐶𝑜𝑛𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑛𝑔 𝑡𝑜 𝑆𝑝𝑒𝑒𝑐ℎ-𝑡𝑜-𝑆𝑝𝑒𝑒𝑐ℎ 𝑇𝑟𝑎𝑛𝑠𝑙𝑎𝑡𝑖𝑜𝑛 𝑓𝑜𝑟 𝐴𝑓𝑟𝑖𝑐𝑎𝑛 𝐿𝑜𝑤-𝑅𝑒𝑠𝑜𝑢𝑟𝑐𝑒 𝐿𝑎𝑛𝑔𝑢𝑎𝑔𝑒𝑠: 𝑆𝑡𝑢𝑑𝑦 𝑜𝑓 𝐹𝑟𝑒𝑛𝑐ℎ–𝑀𝑜𝑜𝑟𝑒́ 𝑃𝑎𝑖𝑟"
𝐅𝐚𝐲𝐜̧𝐚𝐥 𝐎𝐔𝐄𝐃𝐑𝐀𝐎𝐆𝐎, fellow CITADEL a porté ces travaux. Quand on ne sait ni lire ni écrire, une IA qui génère du texte ne sert à rien. L'équipe a donc choisi de travailler directement sur la voix, en construisant un système complet de traduction Français → Mooré à partir de 150 heures d'audio. Wav2Vec-Bert-2.0 assure la reconnaissance vocale avec un taux d'erreur de seulement 4,24 %, tandis que XTTS-v2 produit une synthèse plébiscitée par 77,8 % des locuteurs natifs (MOS 4,36/5). Un agriculteur, un patient, un parent peut désormais recevoir une information en santé ou en éducation dans sa propre langue, sans passer par l'écrit.
Ce modèle est déjà en production et a été utilisé par le gouvernement pour informer de manière inclusive les populations Burkinabè sur les actions fortes du gouvernement - Burkina-en-marche.gov.bf.
📄 𝐂𝐨𝐧𝐭𝐫𝐢𝐛𝐮𝐭𝐢𝐨𝐧 𝟐 — 𝐂𝐨𝐦𝐩𝐫𝐞𝐧𝐝𝐫𝐞 𝐥𝐞 𝐌𝐨𝐨𝐫𝐞́, 𝐩𝐚𝐬 𝐬𝐞𝐮𝐥𝐞𝐦𝐞𝐧𝐭 𝐥𝐞 𝐩𝐫𝐨𝐧𝐨𝐧𝐜𝐞𝐫 🤖
"𝑁𝑒𝑢𝑟𝑎𝑙 𝑀𝑎𝑐ℎ𝑖𝑛𝑒 𝑇𝑟𝑎𝑛𝑠𝑙𝑎𝑡𝑖𝑜𝑛 𝑓𝑜𝑟 𝐹𝑟𝑒𝑛𝑐ℎ–𝑀𝑜𝑜𝑟𝑒́: 𝐴𝑑𝑎𝑝𝑡𝑖𝑛𝑔 𝐿𝑎𝑟𝑔𝑒 𝐿𝑎𝑛𝑔𝑢𝑎𝑔𝑒 𝑀𝑜𝑑𝑒𝑙𝑠 𝑡𝑜 𝐿𝑜𝑤-𝑅𝑒𝑠𝑜𝑢𝑟𝑐𝑒 𝐿𝑎𝑛𝑔𝑢𝑎𝑔𝑒𝑠"
𝐖𝐚𝐥𝐤𝐞𝐫 𝐒𝐭𝐚𝐧𝐢𝐬𝐥𝐚𝐬 𝐑𝐨𝐜𝐤𝐬𝐚𝐧𝐞 𝐂𝐎𝐌𝐏𝐀𝐎𝐑𝐄, fellow CITADEL, a conduit ces travaux durant son stage d'excellence au centre. Parlé par près de 53 % de la population burkinabè, le Mooré reste presque absent des corpus numériques mondiaux. Pour y remédier, l'équipe a adapté trois grands modèles pré-entraînés, NLLB-200, mBART-50 et AfroLM, sur 83 000 paires de phrases Français–Mooré soigneusement validées. Parmi eux, NLLB finement ajusté s'est démarqué comme le plus performant, traçant une voie concrète vers des outils NLP réellement utilisables en Mooré.
Un papier travaille la voix, l'autre le texte. Séparément, chacun comble un manque. Ensemble, ils esquissent les fondations d'une IA qui parle burkinabè.
La présence de CITADEL au LoResLM 2026 le confirme. 𝐎𝐮𝐚𝐠𝐚𝐝𝐨𝐮𝐠𝐨𝐮 𝐩𝐫𝐨𝐝𝐮𝐢𝐭 𝐝𝐞 𝐥𝐚 𝐬𝐜𝐢𝐞𝐧𝐜𝐞 𝐝𝐞 𝐧𝐢𝐯𝐞𝐚𝐮 𝐦𝐨𝐧𝐝𝐢𝐚𝐥, 𝐚𝐮 𝐬𝐞𝐫𝐯𝐢𝐜𝐞 𝐝𝐞 𝐬𝐞𝐬 𝐜𝐨𝐦𝐦𝐮𝐧𝐚𝐮𝐭𝐞́𝐬.