Dados públicos europeus para treinar assistentes de IA que citam as suas fontes
Tony, criador do Contexte Tech · 1 de outubro de 2026
Um assistente de IA que responde a uma pergunta sobre um município ou uma região tem um defeito bem conhecido: quando não sabe, inventa. Um número de habitantes aproximado, um presidente de câmara que não existe, uma estatística saída do nada.
No entanto, as administrações europeias publicam números fiáveis, atualizados e reutilizáveis gratuitamente. Fizemos com eles cinco datasets de treino, publicados no Contexte Tech sob a licença CC BY 4.0.
O princípio: responder a partir da fonte, ou não responder
Cada dataset contém cerca de quarenta diálogos em formato de chat (JSONL), prontos para o fine-tuning. Ensinam três coisas a um modelo:
- responder apenas a partir das linhas oficiais dadas na mensagem (população, homens e mulheres, densidade, evolução);
- citar a fonte no fim de cada resposta;
- recusar com delicadeza as perguntas fora dos dados («Quem é o presidente da câmara?», «Que tempo vai fazer amanhã?»), em vez de inventar.
É pequeno, de propósito: são exemplos de partida, a completar com os seus próprios dados ou a duplicar para a sua região.
Versão 2 (3 de outubro): o número está no contexto
Um leitor do Menéame apontou o defeito da primeira versão: quarenta diálogos ensinam o formato da resposta, não milhares de municípios, e o instituto publica novos números todos os anos. Um número dado de memória acaba sempre por estar errado.
Na versão 2, cada diálogo contém as linhas oficiais na mensagem: a linha certa e outras quatro, misturadas. O modelo aprende a ler nelas o número:
Dados do INE (recenseamento municipal a 1 de janeiro de 2025):
- Torrent (Valência): 90 928 habitantes, 44 395 homens, 46 533 mulheres
- Arucas (Las Palmas): 39 232 habitantes, 19 421 homens, 19 811 mulheres
- …
Pergunta: Quantos habitantes tem Arucas?
E quando a linha pedida não está nos dados, recusa em vez de responder de memória, mesmo para um município visto noutra parte do dataset. O treino ensina o comportamento; os números vêm da tabela oficial do momento. Um script verifica que cada número de cada resposta está no contexto do diálogo: sem exceção. A versão 1 continua disponível para descarregar no separador Versões.
Os cinco datasets
| País | Fonte oficial | Dataset |
|---|---|---|
| Alemanha | Statistisches Bundesamt (Destatis), via GovData.de: os 400 distritos | assistent-landkreise-deutschland |
| Irlanda | Central Statistics Office, via data.gov.ie: os 26 condados, recenseamentos de 1841 a 2022 | assistant-ireland-counties |
| Países Baixos | Statistics Netherlands (CBS), via data.overheid.nl: municípios e províncias | assistent-gemeenten-nederland |
| Itália | Ministero dell’Interno, via dati.gov.it: os municípios no recenseamento de 2021 | assistente-comuni-italia |
| Espanha | Instituto Nacional de Estatística (INE), Padrón municipal a 1 de janeiro de 2025 | asistente-municipios-espana |
Cada recurso indica a sua fonte exata no separador Fonte, e a sua situação face ao RGPD, aos direitos de autor e ao AI Act no separador Conformidade: nenhum dado pessoal, dados públicos sob licença aberta.
Usá-los numa linha
pip install contexte
import contexte
ds = contexte.load("contextetech/assistent-landkreise-deutschland")
print(len(ds), ds[0])
Para fixar uma versão no seu código e evitar que uma atualização mude os seus resultados: contexte.load("…", version=1), ou contexte get otvy8c#v1 no terminal.
Um site europeu para quem trabalha com IA, mais transparente
O Contexte Tech quer ser o site europeu de quem trabalha com IA (programadores, empresas, investigadores, administrações), onde cada recurso diz de onde vem e o que se pode fazer com ele:
- a fonte de cada recurso, com a ligação para o dado original;
- as versões: cada alteração é guardada, com as linhas acrescentadas ou retiradas, e qualquer versão continua disponível para descarregar;
- a conformidade para a União Europeia, os Estados Unidos e a China: dados pessoais, direitos de autor, lei da IA, licença, distinguindo entre «declarado» pelo autor e «verificado»;
- a linhagem: quem partiu de que recurso, e a partir de que versão;
- estatísticas públicas: visualizações e descarregamentos de cada recurso.
Porque é que isto é importante
O AI Act exige que os fornecedores de modelos documentem os dados de treino. Dados públicos, com fonte e sob uma licença clara, são o caso mais simples de documentar, e o mais fácil de defender.
E é uma forma concreta de reutilizar os dados abertos europeus: estas estatísticas já existem, são gratuitas e tornam os assistentes mais fiáveis.
Quer o mesmo para o seu país ou a sua região? Duplique um recurso, substitua os números pelos do seu portal de dados abertos e publique a sua versão: ela aparecerá no separador Linhagem do recurso de origem.