Europeiska offentliga data för att träna AI-assistenter som anger sina källor
Tony, skapare av Contexte Tech · 1 oktober 2026
En AI-assistent som svarar på en fråga om en kommun eller ett län har en välkänd brist: när den inte vet, hittar den på. Ett ungefärligt invånarantal, en kommunstyrelseordförande som inte finns, en statistik som kommer från ingenstans.
Ändå publicerar europeiska myndigheter tillförlitliga, aktuella siffror som får återanvändas fritt. Av dem har vi gjort fem träningsdataset, publicerade på Contexte Tech under licensen CC BY 4.0.
Principen: svara utifrån källan, eller inte svara
Varje dataset innehåller ett fyrtiotal dialoger i chattformat (JSONL), klara för fine-tuning. De lär en modell tre saker:
- att bara svara utifrån de officiella rader som ges i meddelandet (befolkning, män och kvinnor, täthet, förändring);
- att ange källan i slutet av varje svar;
- att artigt avböja frågor utanför datan (”Vem är kommunstyrelsens ordförande?”, ”Hur blir vädret i morgon?”), i stället för att hitta på.
Det är litet, med avsikt: det är startexempel, att komplettera med dina egna data eller duplicera för din region.
Version 2 (3 oktober): siffran finns i kontexten
En läsare på Menéame pekade på bristen i den första versionen: fyrtio dialoger lär ut svarets form, inte tusentals kommuner, och institutet publicerar nya siffror varje år. En siffra som ges ur minnet blir till slut alltid fel.
I version 2 innehåller varje dialog de officiella raderna i meddelandet: rätt rad och fyra andra, blandade. Modellen lär sig att läsa siffran där:
Data från INE (kommunal folkbokföring den 1 januari 2025):
- Torrent (Valencia): 90 928 invånare, 44 395 män, 46 533 kvinnor
- Arucas (Las Palmas): 39 232 invånare, 19 421 män, 19 811 kvinnor
- …
Fråga: Hur många invånare har Arucas?
Och när den efterfrågade raden inte finns i datan avböjer den i stället för att svara ur minnet, även för en kommun som förekommer någon annanstans i datasetet. Träningen lär ut beteendet; siffrorna kommer från den officiella tabellen för stunden. Ett skript kontrollerar att varje tal i varje svar finns i dialogens kontext: utan undantag. Version 1 går fortfarande att ladda ner under fliken Versioner.
De fem dataseten
| Land | Officiell källa | Dataset |
|---|---|---|
| Tyskland | Statistisches Bundesamt (Destatis), via GovData.de: de 400 Kreise | assistent-landkreise-deutschland |
| Irland | Central Statistics Office, via data.gov.ie: de 26 grevskapen, folkräkningar från 1841 till 2022 | assistant-ireland-counties |
| Nederländerna | Statistics Netherlands (CBS), via data.overheid.nl: kommuner och provinser | assistent-gemeenten-nederland |
| Italien | Ministero dell’Interno, via dati.gov.it: kommunerna vid folkräkningen 2021 | assistente-comuni-italia |
| Spanien | Spaniens statistikinstitut (INE), Padrón municipal den 1 januari 2025 | asistente-municipios-espana |
Varje resurs anger sin exakta källa under fliken Källa, och sin situation i förhållande till GDPR, upphovsrätten och AI-förordningen under fliken Regelefterlevnad: inga personuppgifter, offentliga data under öppen licens.
Använd dem med en rad
pip install contexte
import contexte
ds = contexte.load("contextetech/assistent-landkreise-deutschland")
print(len(ds), ds[0])
För att låsa en version i din kod och undvika att en uppdatering ändrar dina resultat: contexte.load("…", version=1), eller contexte get otvy8c#v1 i terminalen.
En europeisk webbplats för alla som arbetar med AI, mer transparent
Contexte Tech vill vara den europeiska webbplatsen för alla som arbetar med AI (utvecklare, företag, forskare, myndigheter), där varje resurs talar om var den kommer ifrån och vad man får göra med den:
- källan för varje resurs, med en länk till ursprungsdatan;
- versionerna: varje ändring sparas, med de rader som lagts till eller tagits bort, och varje version går att ladda ner;
- regelefterlevnaden för Europeiska unionen, USA och Kina: personuppgifter, upphovsrätt, AI-lagstiftning, licens, med skillnaden mellan ”angivet” av författaren och ”kontrollerat”;
- härstamningen: vem som utgick från vilken resurs, och från vilken version;
- offentlig statistik: visningar och nedladdningar för varje resurs.
Varför det är viktigt
AI-förordningen kräver att leverantörer av modeller dokumenterar sina träningsdata. Offentliga data med källa och tydlig licens är det enklaste fallet att dokumentera, och det lättaste att försvara.
Och det är ett konkret sätt att återanvända europeiska öppna data: den här statistiken finns redan, den är gratis och den gör assistenterna mer tillförlitliga.
Vill du ha samma sak för ditt land eller din region? Duplicera en resurs, byt ut siffrorna mot dem från din öppna dataportal och publicera din version: den visas under fliken Härstamning för ursprungsresursen.