BioLLM : quand l’intelligence artificielle se met au service de la biodiversité
Entre avril et août 2025, l’A-IGÉco a accueilli un stagiaire de master pour une mission bien particulière « Explorer comment les nouveaux outils d’intelligence artificielle pourraient soulager les experts de l’ingénierie écologique d’une tâche à la fois indispensable et chronophage : la lecture et la fouille de donneés dans les documents réglementaires ».

Le constat de départ
Études d’impact, textes de loi, demandes de dérogations pour espèces protégées… Les professionnels de l’évaluation environnementale doivent régulièrement étudier des milliers de documents, souvent très longs et très techniques, pour en extraire les informations qui comptent.
C’est tout l’objet du projet collaboratif BioLLM, soutenu par le programme de recherche ITTECOP du ministère de l’écologie : tester si les modèles de langage (les fameux Large Langage Model « LLM », cette famille d’IA capable de lire et d’extraire de l’information d’un texte) peuvent faire une partie de ce travail fastidieux à notre place.
Un prototype concret
À l’issue du stage, un prototype de plateforme a vu le jour : l’idée est de pouvoir interroger en langage naturel — c’est-à-dire en posant simplement des questions— un corpus de plusieurs milliers de documents réglementaires relatifs à l’évaluation environnementale.
Concrètement, l’IA « lit » les documents, identifie les informations pertinentes et permet de constituer progressivement une base de données consolidée relative à la pratique de l’évaluation environnementale et à la mise en œuvre des politiques publiques liée à la mise en œuvre de la séquence Eviter-Réduire-Compenser (ERC).
Le stage a également permis d’identifier précisément les moyens techniques, matériels et logiciels nécessaires pour consolider ce type de solution : un prérequis indispensable avant toute mise en service à plus grande échelle.
Un parcours semé d’embûches… mais un vrai rebond
Le projet n’a pas été épargné par les imprévus : le corpus documentaire initialement prévu, qui devait être transmis par la DREAL Occitanie via la CRERCO (Communauté Régionale ERC d’Occitanie), partenaire du projet, n’a finalement pas pu être exploité.
L’équipe a donc fait preuve d’agilité en se tournant exclusivement vers les sources accessibles en ligne, réunissant tout de même plus de 5 000 documents. De quoi remplir les objectifs initiaux, quitte à ajuster un peu l’ambition.
Un bilan très encourageant
Le projet a fait l’objet d’une évaluation par le programme ITTECOP, conclue en juillet 2026, avec une note globale « A : très bon ». Les évaluateurs ont notamment salué :
- la qualité scientifique de la démarche et du stage de master réalisé ;
- la clarté du rapport, accessible même aux non-spécialistes de l’IA ;
- la capacité du projet à rebondir face aux obstacles rencontrés ;
- le sérieux de l’exploration d’un cas d’usage très prometteur pour la filière.
La suite ?
Bien que la structure et la longueur des documents réglementaires ainsi que la taxinomie constituent des limites des performances du prototype, des pistes d’amélioration ont d’ores et déjà été identifiées : enrichir l’« ontologie » (la manière d’organiser et de relier les informations), mieux prendre en compte la géographie administrative des documents, et surtout tester l’outil en conditions réelles avec ses futurs utilisateurs.
Si les résultats obtenus avec le prototype se consolident, l’approche pourrait ensuite être étendue à d’autres pans de l’ingénierie écologique où la documentation abonde mais où l’extraction de données reste un casse-tête : veille juridique, veille taxonomique…
Merci et bravo à Salaheddine Srghir pour la réalisation de ces travaux et Julien Ricard pour son encadrement technique.
Sylvain Moulherat, président de l’A-IGEco
Le projet BioLLM est porté par l’A-IGÉco dans le cadre des projets exploratoires ITTECOP ( Recherches 2024).
Les résultats du projet seront présentés lors du séminaire ITTECOP les 19 et 20 novembre à Sophia-Antipolis. En savoir plus.

