Europese overheidsdata om AI-assistenten te trainen die hun bronnen vermelden
Tony, maker van Contexte Tech · 1 oktober 2026
Een AI-assistent die een vraag over een gemeente of een provincie beantwoordt, heeft een bekend gebrek: als hij het niet weet, verzint hij iets. Een ongeveer juist inwonertal, een burgemeester die niet bestaat, een statistiek uit het niets.
Toch publiceren Europese overheden betrouwbare, actuele cijfers die gratis hergebruikt mogen worden. Daar hebben we vijf trainingsdatasets van gemaakt, gepubliceerd op Contexte Tech onder de licentie CC BY 4.0.
Het principe: antwoorden op basis van de bron, of niet antwoorden
Elke dataset bevat een veertigtal dialogen in chatformaat (JSONL), klaar voor fine-tuning. Ze leren een model drie dingen:
- alleen antwoorden op basis van de officiële regels die in het bericht staan (bevolking, mannen en vrouwen, dichtheid, ontwikkeling);
- de bron vermelden aan het eind van elk antwoord;
- beleefd weigeren bij vragen buiten de gegevens („Wie is de burgemeester?”, „Wat voor weer wordt het morgen?”), in plaats van iets te verzinnen.
Het is klein, met opzet: het zijn startvoorbeelden, om aan te vullen met je eigen gegevens of te dupliceren voor je eigen regio.
Versie 2 (3 oktober): het cijfer staat in de context
Een lezer van Menéame wees op het gebrek van de eerste versie: veertig dialogen leren de vorm van het antwoord, niet duizenden gemeenten, en het instituut publiceert elk jaar nieuwe cijfers. Een cijfer dat uit het geheugen komt, klopt uiteindelijk altijd niet meer.
In versie 2 bevat elke dialoog de officiële regels in het bericht: de juiste regel en vier andere, door elkaar. Het model leert er het cijfer in te lezen:
Gegevens van het INE (gemeentelijk bevolkingsregister op 1 januari 2025):
- Torrent (Valencia): 90 928 inwoners, 44 395 mannen, 46 533 vrouwen
- Arucas (Las Palmas): 39 232 inwoners, 19 421 mannen, 19 811 vrouwen
- …
Vraag: Hoeveel inwoners heeft Arucas?
En als de gevraagde regel niet in de gegevens staat, weigert het in plaats van uit het geheugen te antwoorden, ook voor een gemeente die elders in de dataset voorkomt. De training leert het gedrag; de cijfers komen uit de officiële tabel van dat moment. Een script controleert dat elk getal in elk antwoord in de context van de dialoog staat: zonder uitzondering. Versie 1 blijft te downloaden op het tabblad Versies.
De vijf datasets
| Land | Officiële bron | Dataset |
|---|---|---|
| Duitsland | Statistisches Bundesamt (Destatis), via GovData.de: de 400 Kreise | assistent-landkreise-deutschland |
| Ierland | Central Statistics Office, via data.gov.ie: de 26 graafschappen, volkstellingen van 1841 tot 2022 | assistant-ireland-counties |
| Nederland | Centraal Bureau voor de Statistiek (CBS), via data.overheid.nl: gemeenten en provincies | assistent-gemeenten-nederland |
| Italië | Ministero dell’Interno, via dati.gov.it: de gemeenten bij de volkstelling van 2021 | assistente-comuni-italia |
| Spanje | Nationaal Instituut voor de Statistiek (INE), Padrón municipal op 1 januari 2025 | asistente-municipios-espana |
Elke resource vermeldt haar precieze bron op het tabblad Bron, en haar situatie ten opzichte van de AVG, het auteursrecht en de AI Act op het tabblad Conformiteit: geen persoonsgegevens, openbare gegevens onder een open licentie.
Ze gebruiken met één regel
pip install contexte
import contexte
ds = contexte.load("contextetech/assistent-landkreise-deutschland")
print(len(ds), ds[0])
Om een versie in je code vast te zetten en te voorkomen dat een update je resultaten verandert: contexte.load("…", version=1), of contexte get otvy8c#v1 in de terminal.
Een Europese site voor wie met AI werkt, transparanter
Contexte Tech wil de Europese site zijn voor iedereen die met AI werkt (ontwikkelaars, bedrijven, onderzoekers, overheden), waar elke resource zegt waar ze vandaan komt en wat je ermee mag doen:
- de bron van elke resource, met de link naar de oorspronkelijke gegevens;
- de versies: elke wijziging wordt bewaard, met de toegevoegde of verwijderde regels, en elke versie blijft te downloaden;
- de conformiteit voor de Europese Unie, de Verenigde Staten en China: persoonsgegevens, auteursrecht, AI-wetgeving, licentie, met het onderscheid tussen „opgegeven” door de auteur en „gecontroleerd”;
- de afstamming: wie van welke resource is vertrokken, en vanaf welke versie;
- openbare statistieken: weergaven en downloads van elke resource.
Waarom dit belangrijk is
De AI Act vraagt aanbieders van modellen om hun trainingsgegevens te documenteren. Openbare gegevens met een bron en een duidelijke licentie zijn het eenvoudigste geval om te documenteren, en het gemakkelijkste om te verdedigen.
En het is een concrete manier om Europese open data te hergebruiken: deze statistieken bestaan al, ze zijn gratis en ze maken assistenten betrouwbaarder.
Wil je hetzelfde voor je land of je regio? Dupliceer een resource, vervang de cijfers door die van je opendataportaal en publiceer je versie: ze verschijnt op het tabblad Afstamming van de oorspronkelijke resource.