Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources
Tony, créateur de Contexte Tech · 1 octobre 2026
Un assistant IA qui répond à une question sur une commune ou un département a un défaut bien connu : quand il ne sait pas, il invente. Un chiffre de population approximatif, un maire qui n’existe pas, une statistique sortie de nulle part.
Les administrations européennes publient pourtant des chiffres fiables, à jour et réutilisables gratuitement. Nous en avons fait cinq datasets d’entraînement, publiés sur Contexte Tech sous licence CC BY 4.0.
Le principe : répondre à partir de la source, ou ne pas répondre
Chaque dataset contient une quarantaine de dialogues au format chat (JSONL), prêts pour le fine-tuning. Ils apprennent trois choses à un modèle :
- répondre uniquement à partir des lignes officielles données dans le message (population, hommes et femmes, densité, évolution) ;
- citer la source à la fin de chaque réponse ;
- refuser poliment les questions hors des données (« Qui est le maire ? », « Quel temps fera-t-il demain ? »), au lieu d’inventer.
C’est petit, volontairement : ce sont des exemples de départ, à compléter avec vos propres données ou à dupliquer pour votre région.
Version 2 (3 octobre) : le chiffre est dans le contexte
Un lecteur de Menéame a pointé le défaut de la première version : quarante dialogues apprennent le format de la réponse, pas des milliers de communes, et l’institut publie de nouveaux chiffres chaque année. Un chiffre donné de mémoire finit toujours par être faux.
Dans la version 2, chaque dialogue contient les lignes officielles dans le message : la bonne ligne et quatre autres, mélangées. Le modèle apprend à y lire le chiffre :
Données de l'INE (recensement municipal au 1er janvier 2025) :
- Torrent (Valence) : 90 928 habitants, 44 395 hommes, 46 533 femmes
- Arucas (Las Palmas) : 39 232 habitants, 19 421 hommes, 19 811 femmes
- …
Question : Combien d'habitants compte Arucas ?
Et quand la ligne demandée n’est pas dans les données, il refuse au lieu de répondre de mémoire, même pour une commune vue ailleurs dans le jeu. Le réglage apprend le comportement ; les chiffres viennent du tableau officiel du moment. Un script vérifie que chaque nombre de chaque réponse figure dans le contexte du dialogue : aucune exception. La version 1 reste téléchargeable dans l’onglet Versions.
Les cinq datasets
| Pays | Source officielle | Dataset |
|---|---|---|
| Allemagne | Statistisches Bundesamt (Destatis), via GovData.de : les 400 arrondissements | assistent-landkreise-deutschland |
| Irlande | Central Statistics Office, via data.gov.ie : les 26 comtés, recensements de 1841 à 2022 | assistant-ireland-counties |
| Pays-Bas | Statistics Netherlands (CBS), via data.overheid.nl : communes et provinces | assistent-gemeenten-nederland |
| Italie | Ministero dell’Interno, via dati.gov.it : les communes au recensement 2021 | assistente-comuni-italia |
| Espagne | Institut national de la statistique (INE), Padrón municipal au 1er janvier 2025 | asistente-municipios-espana |
Chaque fiche indique sa source exacte dans l’onglet Source, et sa situation au regard du RGPD, du droit d’auteur et de l’AI Act dans l’onglet Conformité : aucune donnée personnelle, données publiques sous licence ouverte.
Les utiliser en une ligne
pip install contexte
import contexte
ds = contexte.load("contextetech/assistent-landkreise-deutschland")
print(len(ds), ds[0])
Pour figer une version dans votre code et éviter qu’une mise à jour ne change vos résultats : contexte.load("…", version=1), ou contexte get otvy8c#v1 dans le terminal.
Un site européen pour les acteurs de l’IA, plus transparent
Contexte Tech se veut le site européen des acteurs de l’IA (développeurs, entreprises, chercheurs, administrations) où chaque ressource dit d’où elle vient et ce qu’on a le droit d’en faire :
- la source de chaque fiche, avec le lien vers la donnée d’origine ;
- les versions : chaque modification est conservée, avec les lignes ajoutées ou retirées, et toute version reste téléchargeable ;
- la conformité pour l’Union européenne, les États-Unis et la Chine : données personnelles, droits d’auteur, loi sur l’IA, licence, avec la distinction entre « déclaré » par l’auteur et « vérifié » ;
- la descendance : qui est parti de quelle fiche, et depuis quelle version ;
- des statistiques publiques : vues et téléchargements de chaque fiche.
Pourquoi c’est important
L’AI Act demande aux fournisseurs de modèles de documenter les données d’entraînement. Des données publiques, sourcées et sous licence claire, c’est le cas le plus simple à documenter, et le plus facile à défendre.
Et c’est une façon concrète de réutiliser l’open data européen : ces statistiques existent déjà, elles sont gratuites, et elles rendent les assistants plus fiables.
Vous voulez la même chose pour votre pays ou votre région ? Dupliquez une fiche, remplacez les chiffres par ceux de votre portail open data, et publiez votre version : elle apparaîtra dans l’onglet Descendance de la fiche d’origine.