Decidere Classifica dei modelli di IA: intelligenza, benchmark e prezzo Classifica dei modelli di IA: intelligenza, benchmark e prezzo Ogni punto è un modello: più è in alto, meglio è classificato; più è a sinistra, meno costa. Fai clic su un modello per vederlo da solo.
Tutti i modelli Pesi aperti Solo API
Zona più interessante 140 150 160 170 0,10 € 0,30 € 1,00 € 3,00 € 10,00 € 30,00 € Prezzo per milione di token (€, 3/4 input + 1/4 output, scala log) Indice di capacità di Epoch (ECI) Claude Opus 5.5 (Anthropic) · Punteggio 167,3 · 3,56 € / 17,82 € Claude Opus 5.5 Claude Sonnet 5.5 (Anthropic) · Punteggio 165,2 · 1,78 € / 8,91 € Claude Sonnet 5.5 Claude Haiku 4.5 (Anthropic) · Punteggio 142,4 · 0,89 € / 4,45 € Claude Haiku 4.5 GPT-5.6 Sol (OpenAI) · Punteggio 161,8 · 3,56 € / 17,82 € GPT-5.6 Sol Gemini 3.8 Flash (Google) · Punteggio 156,9 · 0,67 € / 3,34 € Gemini 3.8 Flash Grok 4.5 (xAI) · Punteggio 154,0 · 1,78 € / 5,35 € Grok 4.5 GLM-5.3 (Z.ai) · Punteggio 155,8 · 1,25 € / 3,92 € GLM-5.3 GLM-5.3 Flash (Z.ai) · Punteggio 151,9 · 0,13 € / 0,45 € GLM-5.3 Flash DeepSeek V4.1 Flash (DeepSeek) · Punteggio 155,0 · 0,27 € / 1,07 € DeepSeek V4.1 Flash DeepSeek V4 Pro (DeepSeek) · Punteggio 155,4 · 1,18 € / 3,53 € DeepSeek V4 Pro Mistral Medium 3.5 (Mistral AI) · Punteggio 141,4 · 1,34 € / 6,68 € Mistral Medium 3.5 GPT-6 Astra (OpenAI) · Punteggio 166,5 · 8,91 € / 44,54 € GPT-6 Astra Claude Fable 5.1 (Anthropic) · Punteggio 164,8 · 8,91 € / 44,54 € Claude Fable 5.1 Gemini 3.7 Flash (Google) · Punteggio 157,4 · 0,67 € / 3,34 € Gemini 3.7 Flash Gemini 3.5 Flash-Lite (Google) · Punteggio 145,1 · 0,27 € / 2,23 € Gemini 3.5 Flash-Lite Grok 4.6 (xAI) · Punteggio 156,6 · 1,78 € / 5,35 € Grok 4.6 Pesi aperti Solo API Linea di Pareto Claude Opus 5.5 🇺🇸 Anthropic · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 167,3 1º su 37 per punteggio · intervallo di confidenza 164,0–172,0
Prezzo per milione di token · misto 7,13 € 13º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 90,6 %
SWE-bench Verified — non misurato
FrontierMath 91,2 %
SimpleQA Verified 72,2 %
MATH Level 5 — non misurato
Sulla linea di Pareto: nessun modello è allo stesso tempo migliore e più economico.
Claude Sonnet 5.5 🇺🇸 Anthropic · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 165,2 3º su 37 per punteggio · intervallo di confidenza 161,8–169,4
Prezzo per milione di token · misto 3,56 € 12º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 95,6 %
SWE-bench Verified — non misurato
FrontierMath 88,8 %
SimpleQA Verified 46,5 %
MATH Level 5 — non misurato
Sulla linea di Pareto: nessun modello è allo stesso tempo migliore e più economico.
Claude Haiku 4.5 🇺🇸 Anthropic · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 142,4 30º su 37 per punteggio · intervallo di confidenza 139,5–144,3
Prezzo per milione di token · misto 1,78 € 7º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 71,2 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified 13,2 %
MATH Level 5 96,4 %
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 6.
GPT-5.6 Sol 🇺🇸 OpenAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 161,8 5º su 37 per punteggio · intervallo di confidenza 159,3–165,3
Prezzo per milione di token · misto 7,13 € 13º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 93,5 %
SWE-bench Verified — non misurato
FrontierMath 89,1 %
SimpleQA Verified 69,7 %
MATH Level 5 — non misurato
prezzo promozionale, almeno fino al 21/11/2026
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 1.
GPT-5.6 Terra 🇺🇸 OpenAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 159,8 6º su 37 per punteggio · intervallo di confidenza 157,1–162,8
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 93,3 %
SWE-bench Verified — non misurato
FrontierMath 86,0 %
SimpleQA Verified 43,2 %
MATH Level 5 — non misurato
GPT-5.6 Luna 🇺🇸 OpenAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 156,4 13º su 37 per punteggio · intervallo di confidenza 154,1–158,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 91,6 %
SWE-bench Verified — non misurato
FrontierMath 82,1 %
SimpleQA Verified 41,0 %
MATH Level 5 — non misurato
Gemini 3.8 Flash 🇺🇸 Google · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 156,9 9º su 37 per punteggio · intervallo di confidenza 154,6–160,4
Prezzo per milione di token · misto 1,34 € 4º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 95,4 %
SWE-bench Verified — non misurato
FrontierMath 68,4 %
SimpleQA Verified 69,7 %
MATH Level 5 — non misurato
fino al 31/12/2026, poi 1,50 $ / 7,50 $
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 0.
Muse Spark 1.3 🇺🇸 Meta · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 156,9 9º su 37 per punteggio · intervallo di confidenza 154,7–159,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond — non misurato
SWE-bench Verified — non misurato
FrontierMath 74,4 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Grok 4.5 🇺🇸 xAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 154,0 17º su 37 per punteggio · intervallo di confidenza 152,3–156,1
Prezzo per milione di token · misto 2,67 € 10º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 93,4 %
SWE-bench Verified — non misurato
FrontierMath 57,2 %
SimpleQA Verified 48,3 %
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 5.
Qwen3.8 Max 🇨🇳 Alibaba · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 156,6 11º su 37 per punteggio · intervallo di confidenza 154,5–158,8
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 92,7 %
SWE-bench Verified — non misurato
FrontierMath 74,7 %
SimpleQA Verified 45,8 %
MATH Level 5 — non misurato
GLM-5.3 🇨🇳 Z.ai · Pesi aperti: sì · Licenza: MIT
Vedi tutti i modelli Punteggio 155,8 14º su 37 per punteggio · intervallo di confidenza 153,7–158,3
Prezzo per milione di token · misto 1,92 € 8º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 90,9 %
SWE-bench Verified — non misurato
FrontierMath 68,8 %
SimpleQA Verified 41,0 %
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 2.
Risorse per eseguirlo in locale →
GLM-5.3 Flash 🇨🇳 Z.ai · Pesi aperti: sì · Licenza: MIT
Vedi tutti i modelli Punteggio 151,9 18º su 37 per punteggio · intervallo di confidenza 149,4–154,3
Prezzo per milione di token · misto 0,21 € 1º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 90,2 %
SWE-bench Verified — non misurato
FrontierMath 55,8 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Sulla linea di Pareto: nessun modello è allo stesso tempo migliore e più economico.
Risorse per eseguirlo in locale →
DeepSeek V4.1 Flash 🇨🇳 DeepSeek · Pesi aperti: sì · Licenza: MIT
Vedi tutti i modelli Punteggio 155,0 16º su 37 per punteggio · intervallo di confidenza 148,8–157,6
Prezzo per milione di token · misto 0,47 € 2º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond — non misurato
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
tariffa nelle ore di punta, metà prezzo nelle ore non di punta
Sulla linea di Pareto: nessun modello è allo stesso tempo migliore e più economico.
Risorse per eseguirlo in locale →
DeepSeek V4 Pro 🇨🇳 DeepSeek · Pesi aperti: sì · Licenza: MIT
Vedi tutti i modelli Punteggio 155,4 15º su 37 per punteggio · intervallo di confidenza 153,7–157,6
Prezzo per milione di token · misto 1,76 € 6º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 91,7 %
SWE-bench Verified — non misurato
FrontierMath 64,6 %
SimpleQA Verified 52,9 %
MATH Level 5 — non misurato
tariffa nelle ore di punta, metà prezzo nelle ore non di punta
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 2.
Risorse per eseguirlo in locale →
Qwen3.8 27B 🇨🇳 Alibaba · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 149,4 21º su 37 per punteggio · intervallo di confidenza 147,4–151,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond — non misurato
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Qwen3.5 397B 🇨🇳 Alibaba · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 146,7 24º su 37 per punteggio · intervallo di confidenza 144,8–148,2
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 86,4 %
SWE-bench Verified — non misurato
FrontierMath 31,2 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
MiniMax M3 🇨🇳 MiniMax · Pesi aperti: sì · Licenza: MiniMax Community License
Vedi tutti i modelli Punteggio 147,0 23º su 37 per punteggio · intervallo di confidenza 142,7–149,8
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 90,9 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Gemma 4 31B 🇺🇸 Google · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 142,8 29º su 37 per punteggio · intervallo di confidenza 140,3–144,9
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 75,8 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified 10,4 %
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Mistral Medium 3.5 🇫🇷 Mistral AI · Pesi aperti: sì · Licenza: Modified MIT
Vedi tutti i modelli Punteggio 141,4 32º su 37 per punteggio · intervallo di confidenza 138,4–143,7
Prezzo per milione di token · misto 2,67 € 9º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond — non misurato
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 8.
Risorse per eseguirlo in locale →
Mistral Small 3.2 🇫🇷 Mistral AI · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 131,7 37º su 37 per punteggio · intervallo di confidenza 126,6–133,9
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 49,1 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
gpt-oss-120b 🇺🇸 OpenAI · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 139,9 33º su 37 per punteggio · intervallo di confidenza 135,3–142,3
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 75,8 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
gpt-oss-20b 🇺🇸 OpenAI · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 137,8 35º su 37 per punteggio · intervallo di confidenza 133,0–139,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 60,8 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Llama 4 Maverick 🇺🇸 Meta · Pesi aperti: sì · Licenza: Llama 4
Vedi tutti i modelli Punteggio 132,2 36º su 37 per punteggio · intervallo di confidenza 128,0–134,1
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 67,0 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 73,0 %
Risorse per eseguirlo in locale →
GPT-6 Astra 🇺🇸 OpenAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 166,5 2º su 37 per punteggio · intervallo di confidenza 163,1–171,1
Prezzo per milione di token · misto 17,82 € 15º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 95,8 %
SWE-bench Verified — non misurato
FrontierMath 93,7 %
SimpleQA Verified 75,6 %
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 1.
Claude Fable 5.1 🇺🇸 Anthropic · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 164,8 4º su 37 per punteggio · intervallo di confidenza 161,8–169,1
Prezzo per milione di token · misto 17,82 € 15º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond — non misurato
SWE-bench Verified — non misurato
FrontierMath 90,2 %
SimpleQA Verified 70,8 %
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 2.
Gemini 3.7 Flash 🇺🇸 Google · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 157,4 8º su 37 per punteggio · intervallo di confidenza 155,4–160,1
Prezzo per milione di token · misto 1,34 € 4º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 94,8 %
SWE-bench Verified — non misurato
FrontierMath 71,6 %
SimpleQA Verified 69,2 %
MATH Level 5 — non misurato
fino al 31/12/2026, poi 1,50 $ / 7,50 $
Sulla linea di Pareto: nessun modello è allo stesso tempo migliore e più economico.
Gemini 3.5 Flash-Lite 🇺🇸 Google · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 145,1 26º su 37 per punteggio · intervallo di confidenza 142,5–146,7
Prezzo per milione di token · misto 0,76 € 3º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 83,3 %
SWE-bench Verified — non misurato
FrontierMath 26,0 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 2.
Grok 4.6 🇺🇸 xAI · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 156,6 11º su 37 per punteggio · intervallo di confidenza 154,7–158,9
Prezzo per milione di token · misto 2,67 € 10º su 16 per prezzo
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 94,0 %
SWE-bench Verified — non misurato
FrontierMath 66,0 %
SimpleQA Verified 49,3 %
MATH Level 5 — non misurato
Fuori dalla linea di Pareto: superato per punteggio e prezzo da 2.
Qwen3.7 Flash 🇨🇳 Alibaba · Pesi aperti: no · Licenza: Proprietaria
Vedi tutti i modelli Punteggio 144,6 27º su 37 per punteggio · intervallo di confidenza 142,4–147,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 82,3 %
SWE-bench Verified — non misurato
FrontierMath 19,3 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Kimi K3 🇨🇳 Moonshot AI · Pesi aperti: sì · Licenza: Kimi K3 license
Vedi tutti i modelli Punteggio 157,6 7º su 37 per punteggio · intervallo di confidenza 154,9–160,4
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 93,1 %
SWE-bench Verified — non misurato
FrontierMath 72,2 %
SimpleQA Verified 50,6 %
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Kimi K2.7 Code 🇨🇳 Moonshot AI · Pesi aperti: sì · Licenza: —
Vedi tutti i modelli Punteggio 150,0 20º su 37 per punteggio · intervallo di confidenza 148,1–151,8
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 87,9 %
SWE-bench Verified — non misurato
FrontierMath 54,0 %
SimpleQA Verified 36,5 %
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Inkling 🇺🇸 Thinking Machines · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 148,6 22º su 37 per punteggio · intervallo di confidenza 145,7–150,6
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 88,3 %
SWE-bench Verified — non misurato
FrontierMath 33,3 %
SimpleQA Verified 40,3 %
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Inkling Small 🇺🇸 Thinking Machines · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 150,2 19º su 37 per punteggio · intervallo di confidenza 147,5–152,1
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 88,5 %
SWE-bench Verified — non misurato
FrontierMath 46,3 %
SimpleQA Verified 19,1 %
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Nemotron 3 Ultra 🇺🇸 Nvidia · Pesi aperti: sì · Licenza: OpenMDW-1.1
Vedi tutti i modelli Punteggio 146,2 25º su 37 per punteggio · intervallo di confidenza 143,9–148,1
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 85,4 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Qwen3.6 35B-A3B 🇨🇳 Alibaba · Pesi aperti: sì · Licenza: —
Vedi tutti i modelli Punteggio 143,9 28º su 37 per punteggio · intervallo di confidenza 141,2–146,0
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 84,8 %
SWE-bench Verified — non misurato
FrontierMath 20,4 %
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Gemma 4 26B A4B 🇺🇸 Google · Pesi aperti: sì · Licenza: Apache 2.0
Vedi tutti i modelli Punteggio 141,8 31º su 37 per punteggio · intervallo di confidenza 138,4–143,4
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 73,2 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Qwen3.5 9B 🇨🇳 Alibaba · Pesi aperti: sì · Licenza: —
Vedi tutti i modelli Punteggio 139,5 34º su 37 per punteggio · intervallo di confidenza 136,4–141,3
Prezzo per milione di token — Nessun prezzo ufficiale pubblicato dallo sviluppatore: questo modello non compare nel grafico.
Benchmark (miglior risultato misurato da Epoch) GPQA Diamond 79,0 %
SWE-bench Verified — non misurato
FrontierMath — non misurato
SimpleQA Verified — non misurato
MATH Level 5 — non misurato
Risorse per eseguirlo in locale →
Modello Sviluppatore Pesi aperti Licenza Punteggio Prezzo input / output Prezzo misto GPQA Diamond Claude Opus 5.5 Pareto 🇺🇸 Anthropic no Proprietaria 167,3 3,56 € / 17,82 € 7,13 € 90,6 % GPT-6 Astra 🇺🇸 OpenAI no Proprietaria 166,5 8,91 € / 44,54 € 17,82 € 95,8 % Claude Sonnet 5.5 Pareto 🇺🇸 Anthropic no Proprietaria 165,2 1,78 € / 8,91 € 3,56 € 95,6 % Claude Fable 5.1 🇺🇸 Anthropic no Proprietaria 164,8 8,91 € / 44,54 € 17,82 € — GPT-5.6 Sol 🇺🇸 OpenAI no Proprietaria 161,8 3,56 € / 17,82 € 7,13 € 93,5 % GPT-5.6 Terra 🇺🇸 OpenAI no Proprietaria 159,8 non pubblicato — 93,3 % Kimi K3 🇨🇳 Moonshot AI sì Kimi K3 license 157,6 non pubblicato — 93,1 % Gemini 3.7 Flash Pareto 🇺🇸 Google no Proprietaria 157,4 0,67 € / 3,34 € 1,34 € 94,8 % Gemini 3.8 Flash 🇺🇸 Google no Proprietaria 156,9 0,67 € / 3,34 € 1,34 € 95,4 % Muse Spark 1.3 🇺🇸 Meta no Proprietaria 156,9 non pubblicato — — Qwen3.8 Max 🇨🇳 Alibaba no Proprietaria 156,6 non pubblicato — 92,7 % Grok 4.6 🇺🇸 xAI no Proprietaria 156,6 1,78 € / 5,35 € 2,67 € 94,0 % GPT-5.6 Luna 🇺🇸 OpenAI no Proprietaria 156,4 non pubblicato — 91,6 % GLM-5.3 🇨🇳 Z.ai sì MIT 155,8 1,25 € / 3,92 € 1,92 € 90,9 % DeepSeek V4 Pro 🇨🇳 DeepSeek sì MIT 155,4 1,18 € / 3,53 € 1,76 € 91,7 % DeepSeek V4.1 Flash Pareto 🇨🇳 DeepSeek sì MIT 155,0 0,27 € / 1,07 € 0,47 € — Grok 4.5 🇺🇸 xAI no Proprietaria 154,0 1,78 € / 5,35 € 2,67 € 93,4 % GLM-5.3 Flash Pareto 🇨🇳 Z.ai sì MIT 151,9 0,13 € / 0,45 € 0,21 € 90,2 % Inkling Small 🇺🇸 Thinking Machines sì Apache 2.0 150,2 non pubblicato — 88,5 % Kimi K2.7 Code 🇨🇳 Moonshot AI sì — 150,0 non pubblicato — 87,9 % Qwen3.8 27B 🇨🇳 Alibaba sì Apache 2.0 149,4 non pubblicato — — Inkling 🇺🇸 Thinking Machines sì Apache 2.0 148,6 non pubblicato — 88,3 % MiniMax M3 🇨🇳 MiniMax sì MiniMax Community License 147,0 non pubblicato — 90,9 % Qwen3.5 397B 🇨🇳 Alibaba sì Apache 2.0 146,7 non pubblicato — 86,4 % Nemotron 3 Ultra 🇺🇸 Nvidia sì OpenMDW-1.1 146,2 non pubblicato — 85,4 % Gemini 3.5 Flash-Lite 🇺🇸 Google no Proprietaria 145,1 0,27 € / 2,23 € 0,76 € 83,3 % Qwen3.7 Flash 🇨🇳 Alibaba no Proprietaria 144,6 non pubblicato — 82,3 % Qwen3.6 35B-A3B 🇨🇳 Alibaba sì — 143,9 non pubblicato — 84,8 % Gemma 4 31B 🇺🇸 Google sì Apache 2.0 142,8 non pubblicato — 75,8 % Claude Haiku 4.5 🇺🇸 Anthropic no Proprietaria 142,4 0,89 € / 4,45 € 1,78 € 71,2 % Gemma 4 26B A4B 🇺🇸 Google sì Apache 2.0 141,8 non pubblicato — 73,2 % Mistral Medium 3.5 🇫🇷 Mistral AI sì Modified MIT 141,4 1,34 € / 6,68 € 2,67 € — gpt-oss-120b 🇺🇸 OpenAI sì Apache 2.0 139,9 non pubblicato — 75,8 % Qwen3.5 9B 🇨🇳 Alibaba sì — 139,5 non pubblicato — 79,0 % gpt-oss-20b 🇺🇸 OpenAI sì Apache 2.0 137,8 non pubblicato — 60,8 % Llama 4 Maverick 🇺🇸 Meta sì Llama 4 132,2 non pubblicato — 67,0 % Mistral Small 3.2 🇫🇷 Mistral AI sì Apache 2.0 131,7 non pubblicato — 49,1 %
Domande frequenti Che cosa significa «pesi aperti»? I pesi sono i miliardi di numeri che contengono ciò che un modello ha imparato. Un modello a pesi aperti si può scaricare ed eseguire sul proprio computer; un modello chiuso è accessibile solo tramite l'API del suo sviluppatore. Pesi aperti non vuol dire open source: la licenza può limitarne l'uso.
Come si misura l'intelligenza dei modelli? Con l'indice di capacità di Epoch AI (ECI), che combina i risultati di molti benchmark: ragionamento scientifico (GPQA Diamond), codice (SWE-bench Verified), matematica (FrontierMath), accuratezza dei fatti (SimpleQA Verified).
Da dove vengono i prezzi? Dalle pagine ufficiali dei prezzi degli sviluppatori, in dollari per milione di token, convertiti in euro al tasso di riferimento della Banca centrale europea. Il prezzo misto conta 3/4 del prezzo di input e 1/4 di quello di output.
Che cos'è la linea di Pareto? Collega i modelli che nessun altro supera sia per intelligenza sia per prezzo: i migliori compromessi del momento.
Queste informazioni ti sono state utili?