Corpus : articles de Contexte Tech par section
Les articles du blog Contexte Tech découpés par section, avec l'adresse de l'article pour chaque morceau : un corpus prêt pour un RAG.
Chunking : 1 section (titre de niveau 2) = 1 morceau
Preview
| id | Text | Source |
|---|---|---|
contexte-python#0 | contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Introduction Jusqu'ici, utiliser une fiche Contexte Tech dans un programme demandait toujours les mêmes gestes : ouvrir la page, télécharger le fichier, le ranger dans le projet, écrire quelques lignes pour le lire… | https://contextetech.com/articles/contexte-python |
contexte-python#1 | contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Une fiche, une ligne Chaque fiche se charge avec son nom, tel qu'il apparaît en haut de sa page (`auteur/nom`) : Le résultat dépend du type de fiche : - **un dataset** arrive sous forme de lignes prêtes à l'emp… | https://contextetech.com/articles/contexte-python |
contexte-python#2 | contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Le code court, et la ligne de commande Chaque fiche a un code court : la fin de son adresse. Pour `…/fiche-produit-ecommerce-jr6t0n`, c'est `jr6t0n`. Il suffit pour charger la fiche : Et pour ceux qui ne veulent… | https://contextetech.com/articles/contexte-python |
contexte-python#3 | contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Combien ça va coûter ? Avant de brancher un contexte sur un modèle, autant connaître le prix : Vous obtenez le coût estimé en euros, par appel et pour 1 000 appels, sur les principaux modèles d'API. Pour une fic… | https://contextetech.com/articles/contexte-python |
contexte-python#4 | contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Léger et ouvert - **Aucune dépendance** : seulement la bibliothèque standard de Python, l'installation prend une seconde ; - **Lecture seule, sans compte** : le paquet interroge l'[API publique](/api/docs) de Conte… | https://contextetech.com/articles/contexte-python |
contextetech-open-source#0 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Introduction Depuis six mois, je passe une bonne partie de mes journées à « adapter » des modèles de langage à des cas concrets : un prompt système ici, trois exemples few-shot là, un serveur MCP pour que l'ass… | https://contextetech.com/articles/contextetech-open-source |
contextetech-open-source#1 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Ce qu'on y trouve Onze types de ressources, regroupés en trois familles : - **Production** (on utilise le modèle sans le modifier) : contextes, prompts, agents, pipelines RAG ; - **Entraînement** (on le modifi… | https://contextetech.com/articles/contextetech-open-source |
contextetech-open-source#2 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Sous le capot J'ai voulu une pile simple, rapide et entièrement auto-hébergeable : - **Site** : [Astro](https://astro.build) en rendu serveur, avec quelques îlots [Svelte](https://svelte.dev) seulement là où i… | https://contextetech.com/articles/contextetech-open-source |
contextetech-open-source#3 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Un projet souverain Contexte Tech est conçu et hébergé en Europe, sans dépendre des géants américains du cloud : - **Serveur et base de données** chez Scaleway, en France (PostgreSQL managé, serveur dédié) ; -… | https://contextetech.com/articles/contextetech-open-source |
contextetech-open-source#4 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Pourquoi l'AGPL-3.0 J'ai hésité avec Apache-2.0 (la licence des bibliothèques de Hugging Face). J'ai choisi l'**AGPL-3.0** : vous pouvez utiliser et modifier Contexte Tech, à condition de publier vos modificati… | https://contextetech.com/articles/contextetech-open-source |
contextetech-open-source#5 | Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Où en est le projet C'est le début, et je préfère être honnête : le catalogue démarre avec une fiche par type, autour d'un même cas concret (l'anonymisation RGPD de textes avant envoi à un service tiers). Il a … | https://contextetech.com/articles/contextetech-open-source |
donnees-publiques-europeennes-ia#0 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Introduction Un assistant IA qui répond à une question sur une commune ou un département a un défaut bien connu : quand il ne sait pas, il invente. Un chiffre de population approximatif, un maire qui n'exi… | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
donnees-publiques-europeennes-ia#1 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Le principe : répondre à partir de la source, ou ne pas répondre Chaque dataset contient une quarantaine de dialogues au format chat (JSONL), prêts pour le fine-tuning. Ils apprennent trois choses à un mod… | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
donnees-publiques-europeennes-ia#2 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Les cinq datasets | Pays | Source officielle | Dataset | |---|---|---| | Allemagne | Statistisches Bundesamt (Destatis), via GovData.de : les 400 arrondissements | [assistent-landkreise-deutschland](/datas… | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
donnees-publiques-europeennes-ia#3 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Les utiliser en une ligne Pour figer une version dans votre code et éviter qu'une mise à jour ne change vos résultats : `contexte.load("…", version=1)`, ou `contexte get otvy8c#v1` dans le terminal. | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
donnees-publiques-europeennes-ia#4 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Un hub européen pour les acteurs de l'IA, plus transparent Contexte Tech se veut un **hub européen pour les acteurs de l'IA** (développeurs, entreprises, chercheurs, administrations) où chaque ressource di… | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
donnees-publiques-europeennes-ia#5 | Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Pourquoi c'est important L'AI Act demande aux fournisseurs de modèles de documenter les données d'entraînement. Des données publiques, sourcées et sous licence claire, c'est le cas le plus simple à documen… | https://contextetech.com/articles/donnees-publiques-europeennes-ia |
Estimated cost
Input tokens per call : ≈ 9,496
| Model | Per call | Per 1,000 calls |
|---|---|---|
| Mistral Large · Mistral AI | €0.00418 | €4.18 |
| DeepSeek Flash · DeepSeek | €0.00251 | €2.51 |
| DeepSeek V4 Pro · DeepSeek | €0.01 | €11.04 |
| GPT-6 Luna · OpenAI | €0.00084 | €0.84 |
| GPT-6 Sol · OpenAI | €0.02 | €16.73 |
| Claude Sonnet 5.5 · Anthropic | €0.02 | €16.73 |
| Claude Opus 5.5 · Anthropic | €0.03 | €33.45 |
| Self-hosted open-source model (Ollama, vLLM) | €0 in API fees (server cost only) | |
Input cost only, excluding the model's answer. Providers' public standard prices (Mistral AI, DeepSeek, OpenAI, Anthropic) converted from USD to euros at the ECB rate of September 29, 2026. Estimate: 1 token ≈ 3.6 characters.
Common to all 3 regions
Created by the author, no outside source.
Commercial use allowed · credit the author · changes allowed.
Text or data only: no access to files, network or commands.
Hosted in France (Scaleway, Paris). No transfer outside the EU.
European Union · 5/5
No personal data.
No training data: no summary required.
United States · 5/5
No personal data.
No training data: no documentation to publish.
China · 5/5
No personal data.
No training data; AI-generated content published in China must be labelled (2025).
Indicative summary as of 30/09/2026, not a legal certification. Method and sources →
Statistics
Likes : 0 · Comments : 0
Click a counter to show or hide it, hover the chart for details. One view per visitor per day, bots excluded; counting started on 30 September 2026.
- Identifier
- contextetech--articles-contexte-tech
- Type
- Corpora
- File
- articles-contexte-tech.corpus.jsonl
- Format
- JSON Lines (application/jsonl)
- Size
- 16,855 bytes (16.5 KB)
- Encoding
- UTF-8
- Estimated tokens
- ≈ 4,590
- Language
- French
- License
- MIT
- Commercial use
- Allowed
- Personal data
- None
- Version
- 1.0
- Published on
- October 1, 2026 at 6:55 PM
- Updated on
- October 1, 2026 at 6:55 PM
- Storage
- in database
- Uses
- 0
- Likes
- 0
articles-contexte-tech.corpus.jsonl
{"id": "contexte-python#0", "text": "contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Introduction\n\nJusqu'ici, utiliser une fiche Contexte Tech dans un programme demandait toujours les mêmes gestes : ouvrir la page, télécharger le fichier, le ranger dans le projet, écrire quelques lignes pour le lire. Et tout recommencer à chaque mise à jour de la fiche.\n\nC'est fini : le paquet **`contexte`** est publié sur [PyPI](https://pypi.org/project/contexte/).", "source": "https://contextetech.com/articles/contexte-python"}
{"id": "contexte-python#1", "text": "contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Une fiche, une ligne\n\nChaque fiche se charge avec son nom, tel qu'il apparaît en haut de sa page (`auteur/nom`) :\n\n\n\nLe résultat dépend du type de fiche :\n\n- **un dataset** arrive sous forme de lignes prêtes à l'emploi (20 exemples ici), qu'on parcourt comme une liste ;\n- **un prompt** sait se remplir tout seul et signale les variables oubliées :\n\n\n\n- **un contexte few-shot** fournit la consigne système et des messages prêts pour l'API de chat de votre choix (Claude, Mistral…) :", "source": "https://contextetech.com/articles/contexte-python"}
{"id": "contexte-python#2", "text": "contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Le code court, et la ligne de commande\n\nChaque fiche a un code court : la fin de son adresse. Pour `…/fiche-produit-ecommerce-jr6t0n`, c'est `jr6t0n`. Il suffit pour charger la fiche :\n\n\n\nEt pour ceux qui ne veulent pas écrire de Python, le paquet installe aussi une commande :\n\n\n\nChaque téléchargement rappelle la licence de la fiche, pour savoir tout de suite ce qu'on a le droit d'en faire.", "source": "https://contextetech.com/articles/contexte-python"}
{"id": "contexte-python#3", "text": "contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Combien ça va coûter ?\n\nAvant de brancher un contexte sur un modèle, autant connaître le prix :\n\n\n\nVous obtenez le coût estimé en euros, par appel et pour 1 000 appels, sur les principaux modèles d'API. Pour une fiche modèle ouvert, c'est le prix de location d'un GPU adapté, avec la meilleure offre du moment. Les mêmes chiffres sont affichés dans l'onglet **Coût** de chaque fiche.", "source": "https://contextetech.com/articles/contexte-python"}
{"id": "contexte-python#4", "text": "contexte : charger un dataset, un prompt ou un contexte LLM en une ligne de Python — Léger et ouvert\n\n- **Aucune dépendance** : seulement la bibliothèque standard de Python, l'installation prend une seconde ;\n- **Lecture seule, sans compte** : le paquet interroge l'[API publique](/api/docs) de Contexte Tech ;\n- **Licence MIT** : utilisable librement, y compris dans un produit commercial.\n\nChaque fiche du catalogue affiche désormais, dans son onglet **Utilisation**, la commande `pip install contexte` et les deux ou trois lignes pour s'en servir. Il n'y a plus qu'à copier.", "source": "https://contextetech.com/articles/contexte-python"}
{"id": "contextetech-open-source#0", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Introduction\n\nDepuis six mois, je passe une bonne partie de mes journées à « adapter » des modèles de langage à des cas concrets : un prompt système ici, trois exemples few-shot là, un serveur MCP pour que l'assistant lise mes fichiers, une configuration LoRA quand le prompt ne suffit plus. Et à chaque fois, la même frustration : ces briques sont éparpillées. Un prompt dans un gist, un dataset sur Hugging Face, un serveur MCP dans un README, une config Claude Code dans un coin de projet.\n\n**Contexte Tech** est né de là : un seul endroit pour tout ce qui s'adapte sur un modèle IA, rangé, testé, et prêt à copier. Le site est en ligne sur [contextetech.com](https://contextetech.com), et le code de sa première version (v1) est désormais libre.", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "contextetech-open-source#1", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Ce qu'on y trouve\n\nOnze types de ressources, regroupés en trois familles :\n\n- **Production** (on utilise le modèle sans le modifier) : contextes, prompts, agents, pipelines RAG ;\n- **Entraînement** (on le modifie) : datasets de fine-tuning, configurations LoRA, évaluations ;\n- **Extensions** (on lui donne des outils) : serveurs MCP, skills, harness.\n\nChaque fiche s'exporte directement au format de l'outil visé : JSONL pour un dataset, `SKILL.md` pour un skill, `CLAUDE.md` et `settings.json` pour un harness, la configuration `mcpServers` pour un serveur MCP.\n\nDeux choses me tenaient à cœur, parce qu'elles manquent ailleurs :\n\n1. **« Testé sur »** : chaque fiche peut indiquer sur quels modèles elle a été essayée, avec le résultat (réussi, partiel, échec) et un score. Un prompt qui marche sur un modèle et pas sur un autre, c'est la vie quotidienne ; autant l'écrire.\n2. **Le niveau de risque des serveurs MCP et des harness** : avant d'installer un serveur, on veut savoir s'il lit des fichiers, en écrit, sort sur le réseau ou lance des commandes. La fiche l'affiche en clair.\n\n### Un exemple concret\n\n**Le besoin.** Une PME veut faire résumer ses tickets de support par un LLM. Problème : les tickets contiennent des noms, des téléphones, des IBAN. Les envoyer tels quels à un service tiers, c'est une fuite de données personnelles, et un problème RGPD.\n\n**La réponse sur Contexte Tech.** Au lieu de chercher dix ressources à dix endroits, on suit une seule chaîne :\n\n1. le **contexte** [anonymisation-rgpd](https://contextetech.com/contextes/anonymisation-rgpd-pekk5y) remplace les données personnelles par des balises, avant tout envoi :\n\n\n\n2. l'**évaluation** [eval-anonymisation-rgpd](https://contextetech.com/evaluations/eval-anonymisation-rgpd-1lx4w2h) vérifie qu'aucune donnée ne passe, avec des cas de test prêts à lancer ;\n3. si le prompt ne suffit plus, le **dataset** [anonymisation-rgpd-fr](https://contextetech.com/datasets/anonymisation-rgpd-fr-1muzget) et la **configuration LoRA** [mistral7b-anonymisation-qlora](https://contextetech.com/lora/mistral7b-anonymisation-qlora-187bztw) permettent d'entraîner un petit modèle qui tourne en local ;\n4. l'**agent** [agent-tri-documents](https://contextetech.com/agents/agent-tri-documents-wn0rgt) et le **serveur MCP** [mcp-filesystem](https://contextetech.com/serveurs-mcp/mcp-filesystem-1lkmh25) automatisent le traitement d'un dossier entier.\n\nUn besoin, une chaîne de fiches liées entre elles, chacune exportable dans le bon format.", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "contextetech-open-source#2", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Sous le capot\n\nJ'ai voulu une pile simple, rapide et entièrement auto-hébergeable :\n\n- **Site** : [Astro](https://astro.build) en rendu serveur, avec quelques îlots [Svelte](https://svelte.dev) seulement là où il faut de l'interactivité (formulaire de publication, bouton « j'aime »). Tout le reste est du HTML ; la page d'accueil pèse environ 16 Ko.\n- **API** : [FastAPI](https://fastapi.tiangolo.com) et SQLAlchemy asynchrone, PostgreSQL 17 pour les données, Redis pour le cache et les limites anti-abus. Le cache est invalidé par un simple compteur de version incrémenté à chaque publication : pas de purge fine à gérer.\n- **Réseau** : Caddy devant (TLS automatique, HTTP/3), puis le CDN européen Bunny (Slovénie) pour les fichiers statiques, mis en cache un an grâce aux noms de fichiers versionnés.\n- **Cinq langues** (français, anglais, espagnol, allemand, italien). Petite subtilité pour le référencement : une fiche écrite en français n'est indexée qu'en français ; ses versions `/en/…` traduisent l'interface mais pointent vers l'originale en canonique. Sinon, Google voit cinq copies du même texte.\n- **Adresses lisibles et uniques** : `/prompts/resume-article-technique-k3j9a2`. Le suffixe est un hash FNV-1a de l'identifiant interne, calculé à l'identique en Python et en JavaScript. Deux auteurs peuvent choisir le même nom sans se marcher dessus.\n- **Aucun traceur** : pas de cookie publicitaire ; la fréquentation est mesurée par Plausible, auto-hébergé, sans cookie ni donnée personnelle.", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "contextetech-open-source#3", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Un projet souverain\n\nContexte Tech est conçu et hébergé en Europe, sans dépendre des géants américains du cloud :\n\n- **Serveur et base de données** chez Scaleway, en France (PostgreSQL managé, serveur dédié) ;\n- **CDN et DNS** chez Bunny, une société européenne basée en Slovénie ;\n- **E-mails** via Proton, en Suisse, chiffrés et signés (SPF, DKIM, DMARC) ;\n- **Polices, scripts et styles** servis depuis le site lui-même : pas de Google Fonts, pas de CDN tiers ; statistiques Plausible auto-hébergées, sans cookie ;\n- **Éditeur** : une entreprise française, soumise au RGPD.\n\nSeule exception, assumée : le code est publié en miroir sur GitHub et GitLab, parce que c'est là que se trouvent les développeurs. La version de travail, elle, vit sur notre propre serveur.", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "contextetech-open-source#4", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Pourquoi l'AGPL-3.0\n\nJ'ai hésité avec Apache-2.0 (la licence des bibliothèques de Hugging Face). J'ai choisi l'**AGPL-3.0** : vous pouvez utiliser et modifier Contexte Tech, à condition de publier vos modifications si vous le proposez en ligne. C'est la licence de Mastodon ou de Plausible, et elle garantit qu'un hub ouvert reste ouvert.\n\nLes fiches, elles, gardent chacune la licence choisie par leur auteur (MIT, CC BY 4.0…).", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "contextetech-open-source#5", "text": "Contexte Tech passe en open source : un hub pour tout ce qui s'adapte sur un modèle IA — Où en est le projet\n\nC'est le début, et je préfère être honnête : le catalogue démarre avec une fiche par type, autour d'un même cas concret (l'anonymisation RGPD de textes avant envoi à un service tiers). Il a surtout besoin de vos ressources, de vos retours et de vos tests.\n\n- Le site : [contextetech.com](https://contextetech.com)\n- Le code de la v1 : [github.com/contexte-tech/contextetech](https://github.com/contexte-tech/contextetech) (miroir sur GitLab). Le site évolue ensuite dans une v2 développée en interne.\n- Contribuer : lisez `CONTRIBUTING.md`, ou publiez simplement votre première fiche.\n\nSi vous avez un prompt qui vous sert tous les jours, un serveur MCP que vous aimez ou une config Claude Code bien réglée, c'est le bon endroit pour la partager.", "source": "https://contextetech.com/articles/contextetech-open-source"}
{"id": "donnees-publiques-europeennes-ia#0", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Introduction\n\nUn assistant IA qui répond à une question sur une commune ou un département a un défaut bien connu : quand il ne sait pas, il invente. Un chiffre de population approximatif, un maire qui n'existe pas, une statistique sortie de nulle part.\n\nLes administrations européennes publient pourtant des chiffres fiables, à jour et réutilisables gratuitement. Nous en avons fait **cinq datasets d'entraînement**, publiés sur Contexte Tech sous licence CC BY 4.0.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
{"id": "donnees-publiques-europeennes-ia#1", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Le principe : répondre à partir de la source, ou ne pas répondre\n\nChaque dataset contient une quarantaine de dialogues au format chat (JSONL), prêts pour le fine-tuning. Ils apprennent trois choses à un modèle :\n\n1. **répondre uniquement à partir des chiffres officiels** (population, hommes et femmes, densité, évolution) ;\n2. **citer la source** à la fin de chaque réponse ;\n3. **refuser poliment** les questions hors des données (« Qui est le maire ? », « Quel temps fera-t-il demain ? »), au lieu d'inventer.\n\nC'est petit, volontairement : ce sont des exemples de départ, à compléter avec vos propres données ou à dupliquer pour votre région.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
{"id": "donnees-publiques-europeennes-ia#2", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Les cinq datasets\n\n| Pays | Source officielle | Dataset |\n|---|---|---|\n| Allemagne | Statistisches Bundesamt (Destatis), via GovData.de : les 400 arrondissements | [assistent-landkreise-deutschland](/datasets/assistent-landkreise-deutschland-otvy8c) |\n| Irlande | Central Statistics Office, via data.gov.ie : les 26 comtés, recensements de 1841 à 2022 | [assistant-ireland-counties](/datasets/assistant-ireland-counties-1ligkia) |\n| Pays-Bas | Statistics Netherlands (CBS), via data.overheid.nl : communes et provinces | [assistent-gemeenten-nederland](/datasets/assistent-gemeenten-nederland-1hf6f66) |\n| Italie | Ministero dell'Interno, via dati.gov.it : les communes au recensement 2021 | [assistente-comuni-italia](/datasets/assistente-comuni-italia-6r7ptx) |\n| Espagne | Institut national de la statistique (INE), Padrón municipal au 1er janvier 2025 | [asistente-municipios-espana](/datasets/asistente-municipios-espana-1s8456t) |\n\nChaque fiche indique sa source exacte dans l'onglet **Source**, et sa situation au regard du RGPD, du droit d'auteur et de l'AI Act dans l'onglet **Conformité** : aucune donnée personnelle, données publiques sous licence ouverte.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
{"id": "donnees-publiques-europeennes-ia#3", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Les utiliser en une ligne\n\nPour figer une version dans votre code et éviter qu'une mise à jour ne change vos résultats : `contexte.load(\"…\", version=1)`, ou `contexte get otvy8c#v1` dans le terminal.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
{"id": "donnees-publiques-europeennes-ia#4", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Un hub européen pour les acteurs de l'IA, plus transparent\n\nContexte Tech se veut un **hub européen pour les acteurs de l'IA** (développeurs, entreprises, chercheurs, administrations) où chaque ressource dit d'où elle vient et ce qu'on a le droit d'en faire :\n\n- **la source** de chaque fiche, avec le lien vers la donnée d'origine ;\n- **les versions** : chaque modification est conservée, avec les lignes ajoutées ou retirées, et toute version reste téléchargeable ;\n- **la conformité** pour l'Union européenne, les États-Unis et la Chine : données personnelles, droits d'auteur, loi sur l'IA, licence, avec la distinction entre « déclaré » par l'auteur et « vérifié » ;\n- **la descendance** : qui est parti de quelle fiche, et depuis quelle version ;\n- **des statistiques publiques** : vues et téléchargements de chaque fiche.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
{"id": "donnees-publiques-europeennes-ia#5", "text": "Des données publiques européennes pour entraîner des assistants IA qui citent leurs sources — Pourquoi c'est important\n\nL'AI Act demande aux fournisseurs de modèles de documenter les données d'entraînement. Des données publiques, sourcées et sous licence claire, c'est le cas le plus simple à documenter, et le plus facile à défendre.\n\nEt c'est une façon concrète de réutiliser l'open data européen : ces statistiques existent déjà, elles sont gratuites, et elles rendent les assistants plus fiables.\n\nVous voulez la même chose pour votre pays ou votre région ? **Dupliquez une fiche**, remplacez les chiffres par ceux de votre portail open data, et publiez votre version : elle apparaîtra dans l'onglet **Descendance** de la fiche d'origine.", "source": "https://contextetech.com/articles/donnees-publiques-europeennes-ia"}
Load the corpus (Python)
import json
chunks = [json.loads(l) for l in open("articles-contexte-tech.corpus.jsonl")]
for c in chunks[:3]:
print(c.get("id"), "|", c.get("source"), "|", c["text"][:80])
# Vectorisez ensuite chaque c["text"] et gardez c["source"] pour citer la source dans la réponse
Community
No comments yet. Share your feedback, it will help the next person.