Quel modèle d'IA pour un RAG sur vos documents ?
Un assistant qui répond à partir de vos documents (RAG) : documentation produit, procédures, base de connaissances.
DeepSeek V4.1 Flash
0,27 € / 1,07 € par million de tokens (entrée / sortie)
Sur la ligne de Pareto, indice de capacités de 155 pour un prix bas : adapté aux longs passages lus à chaque question.
Coût pour 1 million de questions d'environ 4 000 tokens lus (question et passages) et 400 écrits : 1 496 €.
Voir dans le classement →Qwen3.8 27B
Gratuit à l'usage : coût de votre machine (une carte graphique de 24 Go suffit en quantification Q4, embeddings compris).
Poids ouverts sous licence Apache 2.0 : avec un modèle d'embeddings local, ni les documents ni les questions ne quittent votre serveur.
Voir dans le classement →Claude Sonnet 5.5
1,78 € / 8,91 € par million de tokens (entrée / sortie)
Sur la ligne de Pareto, avec l'un des meilleurs indices de capacités : mieux à même de dire « je ne sais pas » quand les passages ne contiennent pas la réponse.
Coût pour 1 million de questions d'environ 4 000 tokens lus (question et passages) et 400 écrits : 10 692 €.
Voir dans le classement →Pourquoi ces choix
Pour un RAG, la qualité dépend d'abord de la recherche des passages (le modèle d'embeddings et le découpage des documents), puis du modèle qui rédige la réponse. Chaque question fait lire plusieurs milliers de tokens : le prix d'entrée pèse plus que celui de sortie.
Passer à l'action
Données : indice Epoch AI (CC BY 4.0), prix officiels des éditeurs convertis au taux BCE, mis à jour le 2026-10-03 · Classement des modèles IA : intelligence, benchmarks et prix