Entscheiden Ranking der KI-Modelle: Intelligenz, Benchmarks und Preis Ranking der KI-Modelle: Intelligenz, Benchmarks und Preis Jeder Punkt ist ein Modell: je höher, desto besser bewertet; je weiter links, desto günstiger. Klicken Sie auf ein Modell, um nur dieses zu sehen.
Alle Modelle Offene Gewichte Nur API
Interessantester Bereich 140 150 160 170 0,10 € 0,30 € 1,00 € 3,00 € 10,00 € 30,00 € Preis pro Million Tokens (€, 3/4 Eingabe + 1/4 Ausgabe, log. Skala) Epoch Capabilities Index (ECI) Claude Opus 5.5 (Anthropic) · Wert 167,3 · 3,56 € / 17,82 € Claude Opus 5.5 Claude Sonnet 5.5 (Anthropic) · Wert 165,2 · 1,78 € / 8,91 € Claude Sonnet 5.5 Claude Haiku 4.5 (Anthropic) · Wert 142,4 · 0,89 € / 4,45 € Claude Haiku 4.5 GPT-5.6 Sol (OpenAI) · Wert 161,8 · 3,56 € / 17,82 € GPT-5.6 Sol Gemini 3.8 Flash (Google) · Wert 156,9 · 0,67 € / 3,34 € Gemini 3.8 Flash Grok 4.5 (xAI) · Wert 154,0 · 1,78 € / 5,35 € Grok 4.5 GLM-5.3 (Z.ai) · Wert 155,8 · 1,25 € / 3,92 € GLM-5.3 GLM-5.3 Flash (Z.ai) · Wert 151,9 · 0,13 € / 0,45 € GLM-5.3 Flash DeepSeek V4.1 Flash (DeepSeek) · Wert 155,0 · 0,27 € / 1,07 € DeepSeek V4.1 Flash DeepSeek V4 Pro (DeepSeek) · Wert 155,4 · 1,18 € / 3,53 € DeepSeek V4 Pro Mistral Medium 3.5 (Mistral AI) · Wert 141,4 · 1,34 € / 6,68 € Mistral Medium 3.5 GPT-6 Astra (OpenAI) · Wert 166,5 · 8,91 € / 44,54 € GPT-6 Astra Claude Fable 5.1 (Anthropic) · Wert 164,8 · 8,91 € / 44,54 € Claude Fable 5.1 Gemini 3.7 Flash (Google) · Wert 157,4 · 0,67 € / 3,34 € Gemini 3.7 Flash Gemini 3.5 Flash-Lite (Google) · Wert 145,1 · 0,27 € / 2,23 € Gemini 3.5 Flash-Lite Grok 4.6 (xAI) · Wert 156,6 · 1,78 € / 5,35 € Grok 4.6 Offene Gewichte Nur API Pareto-Linie Claude Opus 5.5 🇺🇸 Anthropic · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 167,3 Platz 1 von 37 beim Wert · Konfidenzintervall 164,0–172,0
Preis pro Million Tokens · gemischt 7,13 € Platz 13 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 90,6 %
SWE-bench Verified — nicht gemessen
FrontierMath 91,2 %
SimpleQA Verified 72,2 %
MATH Level 5 — nicht gemessen
Auf der Pareto-Linie: Kein Modell ist zugleich besser und günstiger.
Claude Sonnet 5.5 🇺🇸 Anthropic · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 165,2 Platz 3 von 37 beim Wert · Konfidenzintervall 161,8–169,4
Preis pro Million Tokens · gemischt 3,56 € Platz 12 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 95,6 %
SWE-bench Verified — nicht gemessen
FrontierMath 88,8 %
SimpleQA Verified 46,5 %
MATH Level 5 — nicht gemessen
Auf der Pareto-Linie: Kein Modell ist zugleich besser und günstiger.
Claude Haiku 4.5 🇺🇸 Anthropic · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 142,4 Platz 30 von 37 beim Wert · Konfidenzintervall 139,5–144,3
Preis pro Million Tokens · gemischt 1,78 € Platz 7 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 71,2 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified 13,2 %
MATH Level 5 96,4 %
Nicht auf der Pareto-Linie: bei Wert und Preis von 6 übertroffen.
GPT-5.6 Sol 🇺🇸 OpenAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 161,8 Platz 5 von 37 beim Wert · Konfidenzintervall 159,3–165,3
Preis pro Million Tokens · gemischt 7,13 € Platz 13 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 93,5 %
SWE-bench Verified — nicht gemessen
FrontierMath 89,1 %
SimpleQA Verified 69,7 %
MATH Level 5 — nicht gemessen
Aktionspreis, mindestens bis 21.11.2026
Nicht auf der Pareto-Linie: bei Wert und Preis von 1 übertroffen.
GPT-5.6 Terra 🇺🇸 OpenAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 159,8 Platz 6 von 37 beim Wert · Konfidenzintervall 157,1–162,8
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 93,3 %
SWE-bench Verified — nicht gemessen
FrontierMath 86,0 %
SimpleQA Verified 43,2 %
MATH Level 5 — nicht gemessen
GPT-5.6 Luna 🇺🇸 OpenAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 156,4 Platz 13 von 37 beim Wert · Konfidenzintervall 154,1–158,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 91,6 %
SWE-bench Verified — nicht gemessen
FrontierMath 82,1 %
SimpleQA Verified 41,0 %
MATH Level 5 — nicht gemessen
Gemini 3.8 Flash 🇺🇸 Google · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 156,9 Platz 9 von 37 beim Wert · Konfidenzintervall 154,6–160,4
Preis pro Million Tokens · gemischt 1,34 € Platz 4 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 95,4 %
SWE-bench Verified — nicht gemessen
FrontierMath 68,4 %
SimpleQA Verified 69,7 %
MATH Level 5 — nicht gemessen
bis 31.12.2026, danach 1,50 $ / 7,50 $
Nicht auf der Pareto-Linie: bei Wert und Preis von 0 übertroffen.
Muse Spark 1.3 🇺🇸 Meta · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 156,9 Platz 9 von 37 beim Wert · Konfidenzintervall 154,7–159,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond — nicht gemessen
SWE-bench Verified — nicht gemessen
FrontierMath 74,4 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Grok 4.5 🇺🇸 xAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 154,0 Platz 17 von 37 beim Wert · Konfidenzintervall 152,3–156,1
Preis pro Million Tokens · gemischt 2,67 € Platz 10 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 93,4 %
SWE-bench Verified — nicht gemessen
FrontierMath 57,2 %
SimpleQA Verified 48,3 %
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 5 übertroffen.
Qwen3.8 Max 🇨🇳 Alibaba · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 156,6 Platz 11 von 37 beim Wert · Konfidenzintervall 154,5–158,8
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 92,7 %
SWE-bench Verified — nicht gemessen
FrontierMath 74,7 %
SimpleQA Verified 45,8 %
MATH Level 5 — nicht gemessen
GLM-5.3 🇨🇳 Z.ai · Offene Gewichte: ja · Lizenz: MIT
Alle Modelle anzeigen Wert 155,8 Platz 14 von 37 beim Wert · Konfidenzintervall 153,7–158,3
Preis pro Million Tokens · gemischt 1,92 € Platz 8 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 90,9 %
SWE-bench Verified — nicht gemessen
FrontierMath 68,8 %
SimpleQA Verified 41,0 %
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 2 übertroffen.
Ressourcen, um es selbst zu betreiben →
GLM-5.3 Flash 🇨🇳 Z.ai · Offene Gewichte: ja · Lizenz: MIT
Alle Modelle anzeigen Wert 151,9 Platz 18 von 37 beim Wert · Konfidenzintervall 149,4–154,3
Preis pro Million Tokens · gemischt 0,21 € Platz 1 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 90,2 %
SWE-bench Verified — nicht gemessen
FrontierMath 55,8 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Auf der Pareto-Linie: Kein Modell ist zugleich besser und günstiger.
Ressourcen, um es selbst zu betreiben →
DeepSeek V4.1 Flash 🇨🇳 DeepSeek · Offene Gewichte: ja · Lizenz: MIT
Alle Modelle anzeigen Wert 155,0 Platz 16 von 37 beim Wert · Konfidenzintervall 148,8–157,6
Preis pro Million Tokens · gemischt 0,47 € Platz 2 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond — nicht gemessen
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Preis zur Hauptzeit, halber Preis in der Nebenzeit
Auf der Pareto-Linie: Kein Modell ist zugleich besser und günstiger.
Ressourcen, um es selbst zu betreiben →
DeepSeek V4 Pro 🇨🇳 DeepSeek · Offene Gewichte: ja · Lizenz: MIT
Alle Modelle anzeigen Wert 155,4 Platz 15 von 37 beim Wert · Konfidenzintervall 153,7–157,6
Preis pro Million Tokens · gemischt 1,76 € Platz 6 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 91,7 %
SWE-bench Verified — nicht gemessen
FrontierMath 64,6 %
SimpleQA Verified 52,9 %
MATH Level 5 — nicht gemessen
Preis zur Hauptzeit, halber Preis in der Nebenzeit
Nicht auf der Pareto-Linie: bei Wert und Preis von 2 übertroffen.
Ressourcen, um es selbst zu betreiben →
Qwen3.8 27B 🇨🇳 Alibaba · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 149,4 Platz 21 von 37 beim Wert · Konfidenzintervall 147,4–151,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond — nicht gemessen
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Qwen3.5 397B 🇨🇳 Alibaba · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 146,7 Platz 24 von 37 beim Wert · Konfidenzintervall 144,8–148,2
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 86,4 %
SWE-bench Verified — nicht gemessen
FrontierMath 31,2 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
MiniMax M3 🇨🇳 MiniMax · Offene Gewichte: ja · Lizenz: MiniMax Community License
Alle Modelle anzeigen Wert 147,0 Platz 23 von 37 beim Wert · Konfidenzintervall 142,7–149,8
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 90,9 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Gemma 4 31B 🇺🇸 Google · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 142,8 Platz 29 von 37 beim Wert · Konfidenzintervall 140,3–144,9
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 75,8 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified 10,4 %
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Mistral Medium 3.5 🇫🇷 Mistral AI · Offene Gewichte: ja · Lizenz: Modified MIT
Alle Modelle anzeigen Wert 141,4 Platz 32 von 37 beim Wert · Konfidenzintervall 138,4–143,7
Preis pro Million Tokens · gemischt 2,67 € Platz 9 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond — nicht gemessen
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 8 übertroffen.
Ressourcen, um es selbst zu betreiben →
Mistral Small 3.2 🇫🇷 Mistral AI · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 131,7 Platz 37 von 37 beim Wert · Konfidenzintervall 126,6–133,9
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 49,1 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
gpt-oss-120b 🇺🇸 OpenAI · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 139,9 Platz 33 von 37 beim Wert · Konfidenzintervall 135,3–142,3
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 75,8 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
gpt-oss-20b 🇺🇸 OpenAI · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 137,8 Platz 35 von 37 beim Wert · Konfidenzintervall 133,0–139,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 60,8 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Llama 4 Maverick 🇺🇸 Meta · Offene Gewichte: ja · Lizenz: Llama 4
Alle Modelle anzeigen Wert 132,2 Platz 36 von 37 beim Wert · Konfidenzintervall 128,0–134,1
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 67,0 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 73,0 %
Ressourcen, um es selbst zu betreiben →
GPT-6 Astra 🇺🇸 OpenAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 166,5 Platz 2 von 37 beim Wert · Konfidenzintervall 163,1–171,1
Preis pro Million Tokens · gemischt 17,82 € Platz 15 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 95,8 %
SWE-bench Verified — nicht gemessen
FrontierMath 93,7 %
SimpleQA Verified 75,6 %
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 1 übertroffen.
Claude Fable 5.1 🇺🇸 Anthropic · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 164,8 Platz 4 von 37 beim Wert · Konfidenzintervall 161,8–169,1
Preis pro Million Tokens · gemischt 17,82 € Platz 15 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond — nicht gemessen
SWE-bench Verified — nicht gemessen
FrontierMath 90,2 %
SimpleQA Verified 70,8 %
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 2 übertroffen.
Gemini 3.7 Flash 🇺🇸 Google · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 157,4 Platz 8 von 37 beim Wert · Konfidenzintervall 155,4–160,1
Preis pro Million Tokens · gemischt 1,34 € Platz 4 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 94,8 %
SWE-bench Verified — nicht gemessen
FrontierMath 71,6 %
SimpleQA Verified 69,2 %
MATH Level 5 — nicht gemessen
bis 31.12.2026, danach 1,50 $ / 7,50 $
Auf der Pareto-Linie: Kein Modell ist zugleich besser und günstiger.
Gemini 3.5 Flash-Lite 🇺🇸 Google · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 145,1 Platz 26 von 37 beim Wert · Konfidenzintervall 142,5–146,7
Preis pro Million Tokens · gemischt 0,76 € Platz 3 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 83,3 %
SWE-bench Verified — nicht gemessen
FrontierMath 26,0 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 2 übertroffen.
Grok 4.6 🇺🇸 xAI · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 156,6 Platz 11 von 37 beim Wert · Konfidenzintervall 154,7–158,9
Preis pro Million Tokens · gemischt 2,67 € Platz 10 von 16 beim Preis
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 94,0 %
SWE-bench Verified — nicht gemessen
FrontierMath 66,0 %
SimpleQA Verified 49,3 %
MATH Level 5 — nicht gemessen
Nicht auf der Pareto-Linie: bei Wert und Preis von 2 übertroffen.
Qwen3.7 Flash 🇨🇳 Alibaba · Offene Gewichte: nein · Lizenz: Proprietär
Alle Modelle anzeigen Wert 144,6 Platz 27 von 37 beim Wert · Konfidenzintervall 142,4–147,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 82,3 %
SWE-bench Verified — nicht gemessen
FrontierMath 19,3 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Kimi K3 🇨🇳 Moonshot AI · Offene Gewichte: ja · Lizenz: Kimi K3 license
Alle Modelle anzeigen Wert 157,6 Platz 7 von 37 beim Wert · Konfidenzintervall 154,9–160,4
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 93,1 %
SWE-bench Verified — nicht gemessen
FrontierMath 72,2 %
SimpleQA Verified 50,6 %
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Kimi K2.7 Code 🇨🇳 Moonshot AI · Offene Gewichte: ja · Lizenz: —
Alle Modelle anzeigen Wert 150,0 Platz 20 von 37 beim Wert · Konfidenzintervall 148,1–151,8
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 87,9 %
SWE-bench Verified — nicht gemessen
FrontierMath 54,0 %
SimpleQA Verified 36,5 %
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Inkling 🇺🇸 Thinking Machines · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 148,6 Platz 22 von 37 beim Wert · Konfidenzintervall 145,7–150,6
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 88,3 %
SWE-bench Verified — nicht gemessen
FrontierMath 33,3 %
SimpleQA Verified 40,3 %
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Inkling Small 🇺🇸 Thinking Machines · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 150,2 Platz 19 von 37 beim Wert · Konfidenzintervall 147,5–152,1
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 88,5 %
SWE-bench Verified — nicht gemessen
FrontierMath 46,3 %
SimpleQA Verified 19,1 %
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Nemotron 3 Ultra 🇺🇸 Nvidia · Offene Gewichte: ja · Lizenz: OpenMDW-1.1
Alle Modelle anzeigen Wert 146,2 Platz 25 von 37 beim Wert · Konfidenzintervall 143,9–148,1
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 85,4 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Qwen3.6 35B-A3B 🇨🇳 Alibaba · Offene Gewichte: ja · Lizenz: —
Alle Modelle anzeigen Wert 143,9 Platz 28 von 37 beim Wert · Konfidenzintervall 141,2–146,0
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 84,8 %
SWE-bench Verified — nicht gemessen
FrontierMath 20,4 %
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Gemma 4 26B A4B 🇺🇸 Google · Offene Gewichte: ja · Lizenz: Apache 2.0
Alle Modelle anzeigen Wert 141,8 Platz 31 von 37 beim Wert · Konfidenzintervall 138,4–143,4
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 73,2 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Qwen3.5 9B 🇨🇳 Alibaba · Offene Gewichte: ja · Lizenz: —
Alle Modelle anzeigen Wert 139,5 Platz 34 von 37 beim Wert · Konfidenzintervall 136,4–141,3
Preis pro Million Tokens — Kein offizieller Preis vom Anbieter veröffentlicht: Dieses Modell erscheint nicht im Diagramm.
Benchmarks (bestes von Epoch gemessenes Ergebnis) GPQA Diamond 79,0 %
SWE-bench Verified — nicht gemessen
FrontierMath — nicht gemessen
SimpleQA Verified — nicht gemessen
MATH Level 5 — nicht gemessen
Ressourcen, um es selbst zu betreiben →
Modell Anbieter Offene Gewichte Lizenz Wert Preis Eingabe / Ausgabe Mischpreis GPQA Diamond Claude Opus 5.5 Pareto 🇺🇸 Anthropic nein Proprietär 167,3 3,56 € / 17,82 € 7,13 € 90,6 % GPT-6 Astra 🇺🇸 OpenAI nein Proprietär 166,5 8,91 € / 44,54 € 17,82 € 95,8 % Claude Sonnet 5.5 Pareto 🇺🇸 Anthropic nein Proprietär 165,2 1,78 € / 8,91 € 3,56 € 95,6 % Claude Fable 5.1 🇺🇸 Anthropic nein Proprietär 164,8 8,91 € / 44,54 € 17,82 € — GPT-5.6 Sol 🇺🇸 OpenAI nein Proprietär 161,8 3,56 € / 17,82 € 7,13 € 93,5 % GPT-5.6 Terra 🇺🇸 OpenAI nein Proprietär 159,8 nicht veröffentlicht — 93,3 % Kimi K3 🇨🇳 Moonshot AI ja Kimi K3 license 157,6 nicht veröffentlicht — 93,1 % Gemini 3.7 Flash Pareto 🇺🇸 Google nein Proprietär 157,4 0,67 € / 3,34 € 1,34 € 94,8 % Gemini 3.8 Flash 🇺🇸 Google nein Proprietär 156,9 0,67 € / 3,34 € 1,34 € 95,4 % Muse Spark 1.3 🇺🇸 Meta nein Proprietär 156,9 nicht veröffentlicht — — Qwen3.8 Max 🇨🇳 Alibaba nein Proprietär 156,6 nicht veröffentlicht — 92,7 % Grok 4.6 🇺🇸 xAI nein Proprietär 156,6 1,78 € / 5,35 € 2,67 € 94,0 % GPT-5.6 Luna 🇺🇸 OpenAI nein Proprietär 156,4 nicht veröffentlicht — 91,6 % GLM-5.3 🇨🇳 Z.ai ja MIT 155,8 1,25 € / 3,92 € 1,92 € 90,9 % DeepSeek V4 Pro 🇨🇳 DeepSeek ja MIT 155,4 1,18 € / 3,53 € 1,76 € 91,7 % DeepSeek V4.1 Flash Pareto 🇨🇳 DeepSeek ja MIT 155,0 0,27 € / 1,07 € 0,47 € — Grok 4.5 🇺🇸 xAI nein Proprietär 154,0 1,78 € / 5,35 € 2,67 € 93,4 % GLM-5.3 Flash Pareto 🇨🇳 Z.ai ja MIT 151,9 0,13 € / 0,45 € 0,21 € 90,2 % Inkling Small 🇺🇸 Thinking Machines ja Apache 2.0 150,2 nicht veröffentlicht — 88,5 % Kimi K2.7 Code 🇨🇳 Moonshot AI ja — 150,0 nicht veröffentlicht — 87,9 % Qwen3.8 27B 🇨🇳 Alibaba ja Apache 2.0 149,4 nicht veröffentlicht — — Inkling 🇺🇸 Thinking Machines ja Apache 2.0 148,6 nicht veröffentlicht — 88,3 % MiniMax M3 🇨🇳 MiniMax ja MiniMax Community License 147,0 nicht veröffentlicht — 90,9 % Qwen3.5 397B 🇨🇳 Alibaba ja Apache 2.0 146,7 nicht veröffentlicht — 86,4 % Nemotron 3 Ultra 🇺🇸 Nvidia ja OpenMDW-1.1 146,2 nicht veröffentlicht — 85,4 % Gemini 3.5 Flash-Lite 🇺🇸 Google nein Proprietär 145,1 0,27 € / 2,23 € 0,76 € 83,3 % Qwen3.7 Flash 🇨🇳 Alibaba nein Proprietär 144,6 nicht veröffentlicht — 82,3 % Qwen3.6 35B-A3B 🇨🇳 Alibaba ja — 143,9 nicht veröffentlicht — 84,8 % Gemma 4 31B 🇺🇸 Google ja Apache 2.0 142,8 nicht veröffentlicht — 75,8 % Claude Haiku 4.5 🇺🇸 Anthropic nein Proprietär 142,4 0,89 € / 4,45 € 1,78 € 71,2 % Gemma 4 26B A4B 🇺🇸 Google ja Apache 2.0 141,8 nicht veröffentlicht — 73,2 % Mistral Medium 3.5 🇫🇷 Mistral AI ja Modified MIT 141,4 1,34 € / 6,68 € 2,67 € — gpt-oss-120b 🇺🇸 OpenAI ja Apache 2.0 139,9 nicht veröffentlicht — 75,8 % Qwen3.5 9B 🇨🇳 Alibaba ja — 139,5 nicht veröffentlicht — 79,0 % gpt-oss-20b 🇺🇸 OpenAI ja Apache 2.0 137,8 nicht veröffentlicht — 60,8 % Llama 4 Maverick 🇺🇸 Meta ja Llama 4 132,2 nicht veröffentlicht — 67,0 % Mistral Small 3.2 🇫🇷 Mistral AI ja Apache 2.0 131,7 nicht veröffentlicht — 49,1 %
Methode Wert: Capabilities Index von Epoch AI, der viele von Epoch gemessene Benchmarks zusammenfasst (GPQA, SWE-bench, FrontierMath…). Preis: offizielle Tarife der Anbieter, zum EZB-Kurs in Euro umgerechnet; der Mischpreis gewichtet die Eingabe mit 3/4 und die Ausgabe mit 1/4. Ohne offiziellen Preis steht ein Modell in der Tabelle, aber nicht im Diagramm.
Quellen: Werte: Epoch AI, Capabilities & benchmarking (CC BY 4.0), Stand 2026-09-28 · Preise: Seiten der Anbieter, geprüft am 2026-10-03 · Lizenzen: Arena-Datensatz (CC BY 4.0) · EZB-Kurs vom 2026-10-02: 1 € = 1,1225 $
Häufige Fragen Was bedeutet „offene Gewichte“? Gewichte sind die Milliarden Zahlen, die enthalten, was ein Modell gelernt hat. Ein Modell mit offenen Gewichten lässt sich herunterladen und auf dem eigenen Rechner ausführen; ein geschlossenes Modell ist nur über die API seines Anbieters erreichbar. Offene Gewichte heißt nicht Open Source: Die Lizenz kann die Nutzung einschränken.
Wie wird die Intelligenz der Modelle gemessen? Mit dem Capabilities Index von Epoch AI (ECI), der die Ergebnisse vieler Benchmarks kombiniert: wissenschaftliches Denken (GPQA Diamond), Programmieren (SWE-bench Verified), Mathematik (FrontierMath), Faktentreue (SimpleQA Verified).
Woher stammen die Preise? Von den offiziellen Preisseiten der Anbieter, in Dollar pro Million Tokens, zum Referenzkurs der Europäischen Zentralbank in Euro umgerechnet. Der Mischpreis zählt 3/4 des Eingabepreises und 1/4 des Ausgabepreises.
Was ist die Pareto-Linie? Sie verbindet die Modelle, die kein anderes zugleich bei Intelligenz und Preis übertrifft: die derzeit besten Kompromisse.
War diese Information hilfreich?