Europäische Verwaltungsdaten, um KI-Assistenten zu trainieren, die ihre Quellen nennen
Tony, Gründer von Contexte Tech · 1. Oktober 2026
Ein KI-Assistent, den man nach einem Landkreis oder einer Gemeinde fragt, hat eine bekannte Schwäche: Wenn er etwas nicht weiß, erfindet er es. Eine ungefähre Einwohnerzahl, ein Landrat, den es nicht gibt, eine Statistik aus dem Nichts.
Dabei veröffentlichen europäische Verwaltungen verlässliche, aktuelle und frei nutzbare Zahlen. Daraus haben wir fünf Trainingsdatensätze gemacht, veröffentlicht auf Contexte Tech unter CC BY 4.0.
Das Prinzip: aus der Quelle antworten oder gar nicht
Jeder Datensatz enthält rund vierzig Dialoge im Chat-Format (JSONL), bereit für das Fine-Tuning. Sie bringen einem Modell drei Dinge bei:
- nur mit den amtlichen Zeilen antworten, die in der Nachricht stehen (Einwohner, Männer und Frauen, Dichte, Entwicklung);
- am Ende jeder Antwort die Quelle nennen;
- Fragen außerhalb der Daten höflich ablehnen („Wer ist der Landrat?“, „Wie wird das Wetter morgen?“), statt etwas zu erfinden.
Sie sind bewusst klein: Startbeispiele, die man mit eigenen Daten erweitern oder für die eigene Region duplizieren kann.
Version 2 (3. Oktober): Die Zahl steht im Kontext
Ein Leser auf Menéame hat die Schwäche der ersten Version benannt: Vierzig Dialoge lehren das Format der Antwort, nicht Tausende Gemeinden, und die Statistikämter veröffentlichen jedes Jahr neue Zahlen. Eine Zahl aus dem Gedächtnis ist früher oder später falsch.
In Version 2 enthält jeder Dialog die amtlichen Zeilen in der Nachricht: die richtige Zeile und vier weitere, gemischt. Das Modell lernt, die Zahl dort abzulesen:
Daten aus dem Gemeindeverzeichnis (Destatis, Stand 31.12.2024):
- Havelland (Landkreis, Brandenburg, Regionalschlüssel 12063): 170.834 Einwohner (84.262 männlich, 86.572 weiblich), 1.727,31 km², 99 Einwohner je km²
- Stade (Landkreis, Niedersachsen, Regionalschlüssel 03359): 207.700 Einwohner (103.090 männlich, 104.610 weiblich), 1.267,38 km², 164 Einwohner je km²
- …
Frage: Wie viele Einwohner hat Stade?
Und wenn die gefragte Zeile nicht in den Daten steht, lehnt es ab, statt aus dem Gedächtnis zu antworten, auch für einen Kreis, der in einem anderen Dialog vorkommt. Das Fine-Tuning lehrt das Verhalten; die Zahlen kommen aus der aktuellen amtlichen Tabelle. Ein Skript prüft, dass jede Zahl jeder Antwort im Kontext des Dialogs steht: ohne Ausnahme. Version 1 bleibt im Tab Versionen herunterladbar.
Die fünf Datensätze
| Land | Amtliche Quelle | Datensatz |
|---|---|---|
| Deutschland | Statistisches Bundesamt (Destatis), über GovData.de: alle 400 Kreise, Stand 31.12.2024 | assistent-landkreise-deutschland |
| Irland | Central Statistics Office, über data.gov.ie: 26 Grafschaften, Volkszählungen 1841 bis 2022 | assistant-ireland-counties |
| Niederlande | Statistics Netherlands (CBS), über data.overheid.nl: Gemeinden und Provinzen | assistent-gemeenten-nederland |
| Italien | Innenministerium, über dati.gov.it: Gemeinden beim Zensus 2021 | assistente-comuni-italia |
| Spanien | Nationales Statistikinstitut (INE), Einwohnerregister zum 1. Januar 2025 | asistente-municipios-espana |
Jeder Eintrag zeigt seine genaue Quelle und im Reiter Konformität seinen Stand zu DSGVO, Urheberrecht und KI-Verordnung: keine personenbezogenen Daten, öffentliche Daten unter offener Lizenz.
In einer Zeile nutzen
pip install contexte
import contexte
ds = contexte.load("contextetech/assistent-landkreise-deutschland")
print(len(ds), ds[0])
Um eine Version im Code festzulegen: contexte.load("…", version=1), oder contexte get otvy8c#v1 im Terminal.
Eine europäische Plattform für alle, die mit KI arbeiten, und mehr Transparenz
Contexte Tech will die europäische Plattform für alle, die mit KI arbeiten (Entwickler, Unternehmen, Forschung, Verwaltung), sein, in dem jede Ressource sagt, woher sie kommt und was man damit tun darf: ihre Quelle, alle Versionen, ihre Konformität (EU, USA, China), ihre Abstammung und öffentliche Statistiken zu Aufrufen und Downloads.
Warum das wichtig ist
Die KI-Verordnung verlangt von Modellanbietern, ihre Trainingsdaten zu dokumentieren. Öffentliche Daten mit Quelle und klarer Lizenz sind der einfachste Fall, um das zu tun, und der am leichtesten zu vertretende.
Sie möchten dasselbe für Ihr Bundesland oder Ihre Stadt? Duplizieren Sie den deutschen Datensatz, ersetzen Sie die Zahlen durch die Ihres Open-Data-Portals und veröffentlichen Sie Ihre Version: Sie erscheint im Reiter Abstammung des Originals.