Welches KI-Modell für RAG über Ihre Dokumente?
Ein Assistent, der aus Ihren Dokumenten antwortet (RAG): Produktdokumentation, Abläufe, Wissensdatenbank.
DeepSeek V4.1 Flash
0,27 € / 1,07 € pro Million Tokens (Eingabe / Ausgabe)
Auf der Pareto-Linie, Capabilities Index von 155 zu niedrigem Preis: geeignet für die langen Passagen, die bei jeder Frage gelesen werden.
Kosten für 1 Million Fragen mit etwa 4.000 gelesenen Tokens (Frage und Passagen) und 400 geschriebenen: 1.496 €.
Im Ranking ansehen →Qwen3.8 27B
Kostenlos in der Nutzung: nur die Kosten Ihrer Hardware (eine Grafikkarte mit 24 GB genügt mit Q4-Quantisierung, Embeddings inklusive).
Offene Gewichte unter Apache-2.0-Lizenz: Mit einem lokalen Embedding-Modell verlassen weder Dokumente noch Fragen Ihren Server.
Im Ranking ansehen →Claude Sonnet 5.5
1,78 € / 8,91 € pro Million Tokens (Eingabe / Ausgabe)
Auf der Pareto-Linie, mit einem der besten Werte im Capabilities Index: sagt eher „Ich weiß es nicht“, wenn die Passagen die Antwort nicht enthalten.
Kosten für 1 Million Fragen mit etwa 4.000 gelesenen Tokens (Frage und Passagen) und 400 geschriebenen: 10.692 €.
Im Ranking ansehen →Warum diese Wahl
Bei RAG hängt die Qualität zuerst von der Suche nach den richtigen Passagen ab (Embedding-Modell und Aufteilung der Dokumente), dann vom Modell, das die Antwort schreibt. Jede Frage liest mehrere Tausend Tokens: Der Eingabepreis wiegt schwerer als der Ausgabepreis.
Umsetzen
Daten: Epoch-AI-Index (CC BY 4.0), offizielle Preise der Anbieter zum EZB-Kurs umgerechnet, aktualisiert am 2026-10-03 · Ranking der KI-Modelle: Intelligenz, Benchmarks und Preis