Decyzje Ranking modeli AI: inteligencja, benchmarki i cena Ranking modeli AI: inteligencja, benchmarki i cena Każdy punkt to model: im wyżej, tym lepiej wypada; im bardziej na lewo, tym jest tańszy. Kliknij model, aby zobaczyć go osobno.
Wszystkie modele Otwarte wagi Tylko API
Najbardziej atrakcyjny obszar 140 150 160 170 0,10 € 0,30 € 1,00 € 3,00 € 10,00 € 30,00 € Cena za milion tokenów (€, 3/4 wejście + 1/4 wyjście, skala logarytmiczna) Epoch Capabilities Index (ECI) Claude Opus 5.5 (Anthropic) · Wynik 167,3 · 3,56 € / 17,82 € Claude Opus 5.5 Claude Sonnet 5.5 (Anthropic) · Wynik 165,2 · 1,78 € / 8,91 € Claude Sonnet 5.5 Claude Haiku 4.5 (Anthropic) · Wynik 142,4 · 0,89 € / 4,45 € Claude Haiku 4.5 GPT-5.6 Sol (OpenAI) · Wynik 161,8 · 3,56 € / 17,82 € GPT-5.6 Sol Gemini 3.8 Flash (Google) · Wynik 156,9 · 0,67 € / 3,34 € Gemini 3.8 Flash Grok 4.5 (xAI) · Wynik 154,0 · 1,78 € / 5,35 € Grok 4.5 GLM-5.3 (Z.ai) · Wynik 155,8 · 1,25 € / 3,92 € GLM-5.3 GLM-5.3 Flash (Z.ai) · Wynik 151,9 · 0,13 € / 0,45 € GLM-5.3 Flash DeepSeek V4.1 Flash (DeepSeek) · Wynik 155,0 · 0,27 € / 1,07 € DeepSeek V4.1 Flash DeepSeek V4 Pro (DeepSeek) · Wynik 155,4 · 1,18 € / 3,53 € DeepSeek V4 Pro Mistral Medium 3.5 (Mistral AI) · Wynik 141,4 · 1,34 € / 6,68 € Mistral Medium 3.5 GPT-6 Astra (OpenAI) · Wynik 166,5 · 8,91 € / 44,54 € GPT-6 Astra Claude Fable 5.1 (Anthropic) · Wynik 164,8 · 8,91 € / 44,54 € Claude Fable 5.1 Gemini 3.7 Flash (Google) · Wynik 157,4 · 0,67 € / 3,34 € Gemini 3.7 Flash Gemini 3.5 Flash-Lite (Google) · Wynik 145,1 · 0,27 € / 2,23 € Gemini 3.5 Flash-Lite Grok 4.6 (xAI) · Wynik 156,6 · 1,78 € / 5,35 € Grok 4.6 Otwarte wagi Tylko API Linia Pareto Claude Opus 5.5 🇺🇸 Anthropic · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 167,3 1. miejsce z 37 pod względem wyniku · przedział ufności 164,0–172,0
Cena za milion tokenów · łączona 7,13 € 13. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 90,6 %
SWE-bench Verified — nie zmierzono
FrontierMath 91,2 %
SimpleQA Verified 72,2 %
MATH Level 5 — nie zmierzono
Na linii Pareto: żaden model nie jest jednocześnie lepszy i tańszy.
Claude Sonnet 5.5 🇺🇸 Anthropic · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 165,2 3. miejsce z 37 pod względem wyniku · przedział ufności 161,8–169,4
Cena za milion tokenów · łączona 3,56 € 12. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 95,6 %
SWE-bench Verified — nie zmierzono
FrontierMath 88,8 %
SimpleQA Verified 46,5 %
MATH Level 5 — nie zmierzono
Na linii Pareto: żaden model nie jest jednocześnie lepszy i tańszy.
Claude Haiku 4.5 🇺🇸 Anthropic · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 142,4 30. miejsce z 37 pod względem wyniku · przedział ufności 139,5–144,3
Cena za milion tokenów · łączona 1,78 € 7. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 71,2 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified 13,2 %
MATH Level 5 96,4 %
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 6.
GPT-5.6 Sol 🇺🇸 OpenAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 161,8 5. miejsce z 37 pod względem wyniku · przedział ufności 159,3–165,3
Cena za milion tokenów · łączona 7,13 € 13. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 93,5 %
SWE-bench Verified — nie zmierzono
FrontierMath 89,1 %
SimpleQA Verified 69,7 %
MATH Level 5 — nie zmierzono
promotional price, at least until 11/21/2026
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 1.
GPT-5.6 Terra 🇺🇸 OpenAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 159,8 6. miejsce z 37 pod względem wyniku · przedział ufności 157,1–162,8
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 93,3 %
SWE-bench Verified — nie zmierzono
FrontierMath 86,0 %
SimpleQA Verified 43,2 %
MATH Level 5 — nie zmierzono
GPT-5.6 Luna 🇺🇸 OpenAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 156,4 13. miejsce z 37 pod względem wyniku · przedział ufności 154,1–158,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 91,6 %
SWE-bench Verified — nie zmierzono
FrontierMath 82,1 %
SimpleQA Verified 41,0 %
MATH Level 5 — nie zmierzono
Gemini 3.8 Flash 🇺🇸 Google · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 156,9 9. miejsce z 37 pod względem wyniku · przedział ufności 154,6–160,4
Cena za milion tokenów · łączona 1,34 € 4. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 95,4 %
SWE-bench Verified — nie zmierzono
FrontierMath 68,4 %
SimpleQA Verified 69,7 %
MATH Level 5 — nie zmierzono
until 12/31/2026, then $1.50 / $7.50
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 0.
Muse Spark 1.3 🇺🇸 Meta · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 156,9 9. miejsce z 37 pod względem wyniku · przedział ufności 154,7–159,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond — nie zmierzono
SWE-bench Verified — nie zmierzono
FrontierMath 74,4 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Grok 4.5 🇺🇸 xAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 154,0 17. miejsce z 37 pod względem wyniku · przedział ufności 152,3–156,1
Cena za milion tokenów · łączona 2,67 € 10. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 93,4 %
SWE-bench Verified — nie zmierzono
FrontierMath 57,2 %
SimpleQA Verified 48,3 %
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 5.
Qwen3.8 Max 🇨🇳 Alibaba · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 156,6 11. miejsce z 37 pod względem wyniku · przedział ufności 154,5–158,8
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 92,7 %
SWE-bench Verified — nie zmierzono
FrontierMath 74,7 %
SimpleQA Verified 45,8 %
MATH Level 5 — nie zmierzono
GLM-5.3 🇨🇳 Z.ai · Otwarte wagi: tak · Licencja: MIT
Zobacz wszystkie modele Wynik 155,8 14. miejsce z 37 pod względem wyniku · przedział ufności 153,7–158,3
Cena za milion tokenów · łączona 1,92 € 8. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 90,9 %
SWE-bench Verified — nie zmierzono
FrontierMath 68,8 %
SimpleQA Verified 41,0 %
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 2.
Zasoby do samodzielnego uruchomienia →
GLM-5.3 Flash 🇨🇳 Z.ai · Otwarte wagi: tak · Licencja: MIT
Zobacz wszystkie modele Wynik 151,9 18. miejsce z 37 pod względem wyniku · przedział ufności 149,4–154,3
Cena za milion tokenów · łączona 0,21 € 1. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 90,2 %
SWE-bench Verified — nie zmierzono
FrontierMath 55,8 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Na linii Pareto: żaden model nie jest jednocześnie lepszy i tańszy.
Zasoby do samodzielnego uruchomienia →
DeepSeek V4.1 Flash 🇨🇳 DeepSeek · Otwarte wagi: tak · Licencja: MIT
Zobacz wszystkie modele Wynik 155,0 16. miejsce z 37 pod względem wyniku · przedział ufności 148,8–157,6
Cena za milion tokenów · łączona 0,47 € 2. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond — nie zmierzono
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
peak-hour price, half price off-peak
Na linii Pareto: żaden model nie jest jednocześnie lepszy i tańszy.
Zasoby do samodzielnego uruchomienia →
DeepSeek V4 Pro 🇨🇳 DeepSeek · Otwarte wagi: tak · Licencja: MIT
Zobacz wszystkie modele Wynik 155,4 15. miejsce z 37 pod względem wyniku · przedział ufności 153,7–157,6
Cena za milion tokenów · łączona 1,76 € 6. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 91,7 %
SWE-bench Verified — nie zmierzono
FrontierMath 64,6 %
SimpleQA Verified 52,9 %
MATH Level 5 — nie zmierzono
peak-hour price, half price off-peak
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 2.
Zasoby do samodzielnego uruchomienia →
Qwen3.8 27B 🇨🇳 Alibaba · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 149,4 21. miejsce z 37 pod względem wyniku · przedział ufności 147,4–151,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond — nie zmierzono
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Qwen3.5 397B 🇨🇳 Alibaba · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 146,7 24. miejsce z 37 pod względem wyniku · przedział ufności 144,8–148,2
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 86,4 %
SWE-bench Verified — nie zmierzono
FrontierMath 31,2 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
MiniMax M3 🇨🇳 MiniMax · Otwarte wagi: tak · Licencja: MiniMax Community License
Zobacz wszystkie modele Wynik 147,0 23. miejsce z 37 pod względem wyniku · przedział ufności 142,7–149,8
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 90,9 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Gemma 4 31B 🇺🇸 Google · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 142,8 29. miejsce z 37 pod względem wyniku · przedział ufności 140,3–144,9
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 75,8 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified 10,4 %
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Mistral Medium 3.5 🇫🇷 Mistral AI · Otwarte wagi: tak · Licencja: Modified MIT
Zobacz wszystkie modele Wynik 141,4 32. miejsce z 37 pod względem wyniku · przedział ufności 138,4–143,7
Cena za milion tokenów · łączona 2,67 € 9. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond — nie zmierzono
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 8.
Zasoby do samodzielnego uruchomienia →
Mistral Small 3.2 🇫🇷 Mistral AI · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 131,7 37. miejsce z 37 pod względem wyniku · przedział ufności 126,6–133,9
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 49,1 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
gpt-oss-120b 🇺🇸 OpenAI · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 139,9 33. miejsce z 37 pod względem wyniku · przedział ufności 135,3–142,3
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 75,8 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
gpt-oss-20b 🇺🇸 OpenAI · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 137,8 35. miejsce z 37 pod względem wyniku · przedział ufności 133,0–139,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 60,8 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Llama 4 Maverick 🇺🇸 Meta · Otwarte wagi: tak · Licencja: Llama 4
Zobacz wszystkie modele Wynik 132,2 36. miejsce z 37 pod względem wyniku · przedział ufności 128,0–134,1
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 67,0 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 73,0 %
Zasoby do samodzielnego uruchomienia →
GPT-6 Astra 🇺🇸 OpenAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 166,5 2. miejsce z 37 pod względem wyniku · przedział ufności 163,1–171,1
Cena za milion tokenów · łączona 17,82 € 15. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 95,8 %
SWE-bench Verified — nie zmierzono
FrontierMath 93,7 %
SimpleQA Verified 75,6 %
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 1.
Claude Fable 5.1 🇺🇸 Anthropic · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 164,8 4. miejsce z 37 pod względem wyniku · przedział ufności 161,8–169,1
Cena za milion tokenów · łączona 17,82 € 15. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond — nie zmierzono
SWE-bench Verified — nie zmierzono
FrontierMath 90,2 %
SimpleQA Verified 70,8 %
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 2.
Gemini 3.7 Flash 🇺🇸 Google · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 157,4 8. miejsce z 37 pod względem wyniku · przedział ufności 155,4–160,1
Cena za milion tokenów · łączona 1,34 € 4. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 94,8 %
SWE-bench Verified — nie zmierzono
FrontierMath 71,6 %
SimpleQA Verified 69,2 %
MATH Level 5 — nie zmierzono
until 12/31/2026, then $1.50 / $7.50
Na linii Pareto: żaden model nie jest jednocześnie lepszy i tańszy.
Gemini 3.5 Flash-Lite 🇺🇸 Google · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 145,1 26. miejsce z 37 pod względem wyniku · przedział ufności 142,5–146,7
Cena za milion tokenów · łączona 0,76 € 3. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 83,3 %
SWE-bench Verified — nie zmierzono
FrontierMath 26,0 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 2.
Grok 4.6 🇺🇸 xAI · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 156,6 11. miejsce z 37 pod względem wyniku · przedział ufności 154,7–158,9
Cena za milion tokenów · łączona 2,67 € 10. miejsce z 16 pod względem ceny
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 94,0 %
SWE-bench Verified — nie zmierzono
FrontierMath 66,0 %
SimpleQA Verified 49,3 %
MATH Level 5 — nie zmierzono
Poza linią Pareto: wyprzedzany jednocześnie pod względem wyniku i ceny przez 2.
Qwen3.7 Flash 🇨🇳 Alibaba · Otwarte wagi: nie · Licencja: Własnościowa
Zobacz wszystkie modele Wynik 144,6 27. miejsce z 37 pod względem wyniku · przedział ufności 142,4–147,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 82,3 %
SWE-bench Verified — nie zmierzono
FrontierMath 19,3 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Kimi K3 🇨🇳 Moonshot AI · Otwarte wagi: tak · Licencja: Kimi K3 license
Zobacz wszystkie modele Wynik 157,6 7. miejsce z 37 pod względem wyniku · przedział ufności 154,9–160,4
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 93,1 %
SWE-bench Verified — nie zmierzono
FrontierMath 72,2 %
SimpleQA Verified 50,6 %
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Kimi K2.7 Code 🇨🇳 Moonshot AI · Otwarte wagi: tak · Licencja: —
Zobacz wszystkie modele Wynik 150,0 20. miejsce z 37 pod względem wyniku · przedział ufności 148,1–151,8
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 87,9 %
SWE-bench Verified — nie zmierzono
FrontierMath 54,0 %
SimpleQA Verified 36,5 %
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Inkling 🇺🇸 Thinking Machines · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 148,6 22. miejsce z 37 pod względem wyniku · przedział ufności 145,7–150,6
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 88,3 %
SWE-bench Verified — nie zmierzono
FrontierMath 33,3 %
SimpleQA Verified 40,3 %
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Inkling Small 🇺🇸 Thinking Machines · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 150,2 19. miejsce z 37 pod względem wyniku · przedział ufności 147,5–152,1
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 88,5 %
SWE-bench Verified — nie zmierzono
FrontierMath 46,3 %
SimpleQA Verified 19,1 %
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Nemotron 3 Ultra 🇺🇸 Nvidia · Otwarte wagi: tak · Licencja: OpenMDW-1.1
Zobacz wszystkie modele Wynik 146,2 25. miejsce z 37 pod względem wyniku · przedział ufności 143,9–148,1
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 85,4 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Qwen3.6 35B-A3B 🇨🇳 Alibaba · Otwarte wagi: tak · Licencja: —
Zobacz wszystkie modele Wynik 143,9 28. miejsce z 37 pod względem wyniku · przedział ufności 141,2–146,0
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 84,8 %
SWE-bench Verified — nie zmierzono
FrontierMath 20,4 %
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Gemma 4 26B A4B 🇺🇸 Google · Otwarte wagi: tak · Licencja: Apache 2.0
Zobacz wszystkie modele Wynik 141,8 31. miejsce z 37 pod względem wyniku · przedział ufności 138,4–143,4
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 73,2 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Qwen3.5 9B 🇨🇳 Alibaba · Otwarte wagi: tak · Licencja: —
Zobacz wszystkie modele Wynik 139,5 34. miejsce z 37 pod względem wyniku · przedział ufności 136,4–141,3
Cena za milion tokenów — Producent nie opublikował oficjalnej ceny: tego modelu nie ma na wykresie.
Benchmarki (najlepszy wynik zmierzony przez Epoch) GPQA Diamond 79,0 %
SWE-bench Verified — nie zmierzono
FrontierMath — nie zmierzono
SimpleQA Verified — nie zmierzono
MATH Level 5 — nie zmierzono
Zasoby do samodzielnego uruchomienia →
Model Producent Otwarte wagi Licencja Wynik Cena wejścia / wyjścia Cena łączona GPQA Diamond Claude Opus 5.5 Pareto 🇺🇸 Anthropic nie Własnościowa 167,3 3,56 € / 17,82 € 7,13 € 90,6 % GPT-6 Astra 🇺🇸 OpenAI nie Własnościowa 166,5 8,91 € / 44,54 € 17,82 € 95,8 % Claude Sonnet 5.5 Pareto 🇺🇸 Anthropic nie Własnościowa 165,2 1,78 € / 8,91 € 3,56 € 95,6 % Claude Fable 5.1 🇺🇸 Anthropic nie Własnościowa 164,8 8,91 € / 44,54 € 17,82 € — GPT-5.6 Sol 🇺🇸 OpenAI nie Własnościowa 161,8 3,56 € / 17,82 € 7,13 € 93,5 % GPT-5.6 Terra 🇺🇸 OpenAI nie Własnościowa 159,8 nieopublikowana — 93,3 % Kimi K3 🇨🇳 Moonshot AI tak Kimi K3 license 157,6 nieopublikowana — 93,1 % Gemini 3.7 Flash Pareto 🇺🇸 Google nie Własnościowa 157,4 0,67 € / 3,34 € 1,34 € 94,8 % Gemini 3.8 Flash 🇺🇸 Google nie Własnościowa 156,9 0,67 € / 3,34 € 1,34 € 95,4 % Muse Spark 1.3 🇺🇸 Meta nie Własnościowa 156,9 nieopublikowana — — Qwen3.8 Max 🇨🇳 Alibaba nie Własnościowa 156,6 nieopublikowana — 92,7 % Grok 4.6 🇺🇸 xAI nie Własnościowa 156,6 1,78 € / 5,35 € 2,67 € 94,0 % GPT-5.6 Luna 🇺🇸 OpenAI nie Własnościowa 156,4 nieopublikowana — 91,6 % GLM-5.3 🇨🇳 Z.ai tak MIT 155,8 1,25 € / 3,92 € 1,92 € 90,9 % DeepSeek V4 Pro 🇨🇳 DeepSeek tak MIT 155,4 1,18 € / 3,53 € 1,76 € 91,7 % DeepSeek V4.1 Flash Pareto 🇨🇳 DeepSeek tak MIT 155,0 0,27 € / 1,07 € 0,47 € — Grok 4.5 🇺🇸 xAI nie Własnościowa 154,0 1,78 € / 5,35 € 2,67 € 93,4 % GLM-5.3 Flash Pareto 🇨🇳 Z.ai tak MIT 151,9 0,13 € / 0,45 € 0,21 € 90,2 % Inkling Small 🇺🇸 Thinking Machines tak Apache 2.0 150,2 nieopublikowana — 88,5 % Kimi K2.7 Code 🇨🇳 Moonshot AI tak — 150,0 nieopublikowana — 87,9 % Qwen3.8 27B 🇨🇳 Alibaba tak Apache 2.0 149,4 nieopublikowana — — Inkling 🇺🇸 Thinking Machines tak Apache 2.0 148,6 nieopublikowana — 88,3 % MiniMax M3 🇨🇳 MiniMax tak MiniMax Community License 147,0 nieopublikowana — 90,9 % Qwen3.5 397B 🇨🇳 Alibaba tak Apache 2.0 146,7 nieopublikowana — 86,4 % Nemotron 3 Ultra 🇺🇸 Nvidia tak OpenMDW-1.1 146,2 nieopublikowana — 85,4 % Gemini 3.5 Flash-Lite 🇺🇸 Google nie Własnościowa 145,1 0,27 € / 2,23 € 0,76 € 83,3 % Qwen3.7 Flash 🇨🇳 Alibaba nie Własnościowa 144,6 nieopublikowana — 82,3 % Qwen3.6 35B-A3B 🇨🇳 Alibaba tak — 143,9 nieopublikowana — 84,8 % Gemma 4 31B 🇺🇸 Google tak Apache 2.0 142,8 nieopublikowana — 75,8 % Claude Haiku 4.5 🇺🇸 Anthropic nie Własnościowa 142,4 0,89 € / 4,45 € 1,78 € 71,2 % Gemma 4 26B A4B 🇺🇸 Google tak Apache 2.0 141,8 nieopublikowana — 73,2 % Mistral Medium 3.5 🇫🇷 Mistral AI tak Modified MIT 141,4 1,34 € / 6,68 € 2,67 € — gpt-oss-120b 🇺🇸 OpenAI tak Apache 2.0 139,9 nieopublikowana — 75,8 % Qwen3.5 9B 🇨🇳 Alibaba tak — 139,5 nieopublikowana — 79,0 % gpt-oss-20b 🇺🇸 OpenAI tak Apache 2.0 137,8 nieopublikowana — 60,8 % Llama 4 Maverick 🇺🇸 Meta tak Llama 4 132,2 nieopublikowana — 67,0 % Mistral Small 3.2 🇫🇷 Mistral AI tak Apache 2.0 131,7 nieopublikowana — 49,1 %
FAQ Co oznaczają „otwarte wagi”? Wagi to miliardy liczb, w których zapisane jest to, czego model się nauczył. Model z otwartymi wagami można pobrać i uruchomić na własnej maszynie; model zamknięty jest dostępny tylko przez API producenta. Otwarte wagi nie oznaczają open source: licencja może ograniczać użycie.
Jak mierzy się inteligencję modeli? Za pomocą indeksu możliwości Epoch AI (ECI), który łączy wyniki wielu benchmarków: rozumowanie naukowe (GPQA Diamond), programowanie (SWE-bench Verified), matematyka (FrontierMath), dokładność faktograficzna (SimpleQA Verified).
Skąd pochodzą ceny? Z oficjalnych stron z cennikami producentów, w dolarach za milion tokenów, przeliczonych na euro po kursie referencyjnym Europejskiego Banku Centralnego. Cena łączona uwzględnia 3/4 ceny wejścia i 1/4 ceny wyjścia.
Czym jest linia Pareto? Łączy modele, których żaden inny model nie przewyższa jednocześnie pod względem inteligencji i ceny: obecnie najlepsze kompromisy.
Czy ta informacja była przydatna?