Europejskie dane publiczne do trenowania asystentów AI, którzy podają źródła
Tony, twórca Contexte Tech · 1 października 2026
Asystent AI pytany o miasto lub powiat ma dobrze znaną wadę: gdy nie wie, zmyśla. Przybliżona liczba mieszkańców, burmistrz, który nie istnieje, statystyka wzięta znikąd.
A przecież europejskie administracje publiczne publikują wiarygodne, aktualne dane, które każdy może bezpłatnie wykorzystać. Zamieniliśmy je w pięć zbiorów danych treningowych, opublikowanych na Contexte Tech na licencji CC BY 4.0.
Pomysł: odpowiadaj na podstawie źródła albo nie odpowiadaj
Każdy zbiór danych zawiera około czterdziestu dialogów czatu (JSONL), gotowych do fine-tuningu. Uczą model trzech rzeczy:
- odpowiadać wyłącznie na podstawie oficjalnych wierszy podanych w wiadomości (liczba mieszkańców, mężczyźni i kobiety, gęstość zaludnienia, zmiana w czasie);
- podawać źródło na końcu każdej odpowiedzi;
- uprzejmie odmawiać odpowiedzi na pytania spoza danych („Kto jest burmistrzem?”, „Jaka będzie jutro pogoda?”) zamiast zmyślać.
Są celowo małe: to przykłady startowe do rozbudowania własnymi danymi lub do powielenia dla swojego regionu.
Wersja 2 (3 października): liczba jest w kontekście
Czytelnik na Menéame wskazał wadę pierwszej wersji: czterdzieści dialogów uczy formatu odpowiedzi, a nie tysięcy gmin, a urząd statystyczny co roku publikuje nowe dane. Liczba podawana z pamięci w końcu zawsze okazuje się błędna.
W wersji 2 każdy dialog zawiera oficjalne wiersze w wiadomości: właściwy wiersz i cztery inne, w losowej kolejności. Model uczy się odczytywać liczbę właśnie stamtąd:
INE data (municipal register, 1 January 2025):
- Torrent (Valencia/València): 90,928 inhabitants, 44,395 men, 46,533 women
- Arucas (Las Palmas): 39,232 inhabitants, 19,421 men, 19,811 women
- …
Question: How many inhabitants does Arucas have?
A gdy żądanego wiersza nie ma w danych, model odmawia zamiast odpowiadać z pamięci, nawet w przypadku miejsca, które pojawia się gdzie indziej w zbiorze. Fine-tuning uczy zachowania; liczby pochodzą z aktualnej oficjalnej tabeli. Skrypt sprawdza, czy każda liczba w każdej odpowiedzi występuje w kontekście danego dialogu: bez wyjątków. Wersję 1 nadal można pobrać w zakładce Wersje.
Pięć zbiorów danych
| Kraj | Oficjalne źródło | Zbiór danych |
|---|---|---|
| Niemcy | Federalny Urząd Statystyczny (Destatis), przez GovData.de: wszystkie 400 powiatów | assistent-landkreise-deutschland |
| Irlandia | Centralny Urząd Statystyczny, przez data.gov.ie: 26 hrabstw, spisy od 1841 do 2022 | assistant-ireland-counties |
| Holandia | Urząd Statystyczny Holandii (CBS), przez data.overheid.nl: gminy i prowincje | assistent-gemeenten-nederland |
| Włochy | Ministerstwo Spraw Wewnętrznych, przez dati.gov.it: gminy według spisu z 2021 | assistente-comuni-italia |
| Hiszpania | Krajowy Instytut Statystyczny (INE), rejestr gminny z 1 stycznia 2025 | asistente-municipios-espana |
Każdy zasób pokazuje dokładne źródło w zakładce Źródło, a swój status wobec RODO, prawa autorskiego i AI Act w zakładce Zgodność: brak danych osobowych, dane publiczne na otwartej licencji.
Użyj ich w jednej linii
pip install contexte
import contexte
ds = contexte.load("contextetech/assistant-ireland-counties")
print(len(ds), ds[0])
Aby przypiąć wersję w swoim kodzie, tak by aktualizacja nigdy nie zmieniła wyników: contexte.load("…", version=1) albo contexte get 1ligkia#v1 w terminalu.
Europejski serwis dla praktyków AI, z większą przejrzystością
Contexte Tech chce być europejskim serwisem dla praktyków AI (programistów, firm, badaczy, instytucji publicznych), w którym każdy zasób mówi, skąd pochodzi i co wolno z nim zrobić:
- źródło każdego zasobu, z linkiem do oryginalnych danych;
- wersje: każda zmiana jest zachowywana, z dodanymi lub usuniętymi liniami, a każdą wersję można pobrać;
- zgodność dla Unii Europejskiej, Stanów Zjednoczonych i Chin: dane osobowe, prawa autorskie, prawo o AI, licencja, z rozróżnieniem tego, co autor „zadeklarował”, od tego, co „zweryfikowano”;
- pochodzenie: kto zaczął od którego zasobu i od której wersji;
- publiczne statystyki: wyświetlenia i pobrania każdego zasobu.
Dlaczego to ważne
AI Act wymaga od dostawców modeli dokumentowania danych treningowych. Publiczne dane ze źródłem i jasną licencją to najprostszy przypadek do udokumentowania i najłatwiejszy do obrony.
To także konkretny sposób na ponowne wykorzystanie europejskich otwartych danych: te statystyki już istnieją, są bezpłatne i sprawiają, że asystenci są bardziej wiarygodni.
Chcesz tego samego dla swojego kraju lub regionu? Zduplikuj zasób, zastąp liczby danymi z portalu otwartych danych i opublikuj swoją wersję: pojawi się w zakładce Pochodzenie oryginału.