LLM Leaderboard
LLM Leaderboard: o ranking dos modelos de IA
653 modelos de linguagem de 59 empresas — OpenAI, Anthropic, Google, DeepSeek, Alibaba, Mistral e outras — comparados por inteligência, programação, capacidade agêntica, velocidade, latência e preço por milhão de tokens. Os dados são do Artificial Analysis Intelligence Index e o ranking é atualizado toda semana.
Líder atual: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, com índice de inteligência 53,4.
Destaques desta atualização
Quem lidera em cada critério
Nenhum modelo vence em tudo. O mais inteligente raramente é o mais rápido, e o mais barato quase nunca está no topo — os seis destaques abaixo são recalculados a cada atualização do ranking.
Mais inteligente
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice 53,4.
- à frente de Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (53,2)
Melhor em programação
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice de código 81,6.
- Coding Index da Artificial Analysis
Melhor em tarefas agênticas
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice agêntico 57,9.
- uso de ferramenta e tarefa de várias etapas
Mais rápido entre os 50 mais inteligentes
Gemini 3.7 Flash (high), da Google — 334,7 tok/s.
- mediana de tokens de saída por segundo
Mais barato entre os 50 mais inteligentes
Qwen3.8-Flash-Next, da Alibaba — US$ 0,39 por milhão de tokens.
- índice de inteligência 39,8
Melhor custo-benefício
GLM 5.3 Flash, da Z AI — 101,33 pontos de inteligência por dólar.
- entre os modelos com pelo menos 75% do índice do líder
O ranking
Ranking de 653 modelos de IA
Ordenado por índice de inteligência. Clique no cabeçalho de uma coluna para reordenar, busque por modelo ou empresa, ou filtre por fabricante. A barra de cada célula mostra a posição do modelo naquela métrica entre todos os que têm o dado.
| # | Modelo | Lançamento | |||||||
|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 53,4 | 81,6 | 57,9 | 69,7 tok/s | 275,35 s | 282,52 s | US$ 40,00 | 01/09/2026 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 53,2 | 80,7 | 57,2 | 65,2 tok/s | 179,99 s | 187,67 s | US$ 40,00 | 01/09/2026 |
| 3 | GPT-6 Astra (max)OpenAI | 52,7 | 76,9 | 51,0 | 70,8 tok/s | 256,13 s | 263,20 s | US$ 40,00 | 03/09/2026 |
| 4 | GPT-6 Astra (xhigh)OpenAI | 52,4 | 75,9 | 50,2 | 62,8 tok/s | 126,92 s | 134,88 s | US$ 40,00 | 03/09/2026 |
| 5 | Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic | 51,2 | 79,1 | 53,1 | 57,5 tok/s | 22,53 s | 31,22 s | US$ 40,00 | 01/09/2026 |
| 6 | GPT-6 Astra (high)OpenAI | 50,9 | 77,1 | 48,2 | 63,7 tok/s | 33,31 s | 41,16 s | US$ 40,00 | 03/09/2026 |
| 7 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 50,8 | 78,0 | 56,5 | 60,7 tok/s | 54,00 s | 62,24 s | US$ 20,00 | 24/07/2026 |
| 8 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 49,7 | 77,0 | 55,6 | 56,5 tok/s | 22,87 s | 31,71 s | US$ 20,00 | 24/07/2026 |
| 9 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 49,6 | 76,5 | 50,7 | 67,9 tok/s | 120,83 s | 128,19 s | US$ 40,00 | 09/06/2026 |
| 10 | GPT-6 Astra (medium)OpenAI | 49,6 | 76,7 | 46,0 | 62,2 tok/s | 5,62 s | 13,67 s | US$ 40,00 | 03/09/2026 |
| 11 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic | 48,9 | 77,1 | 50,2 | 57,3 tok/s | 8,49 s | 17,22 s | US$ 40,00 | 01/09/2026 |
| 12 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 48,1 | 76,5 | 52,3 | 61,1 tok/s | 14,38 s | 22,56 s | US$ 20,00 | 24/07/2026 |
| 13 | Muse Spark 1.3 (max)Meta | 48,1 | 75,8 | 55,5 | 240,7 tok/s | 21,58 s | 31,97 s | US$ 3,50 | 02/09/2026 |
| 14 | GPT-5.6 Sol (max)OpenAI | 47,0 | 77,4 | 50,2 | 75,3 tok/s | 120,80 s | 127,44 s | US$ 16,00 | 09/07/2026 |
| 15 | Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic | 46,8 | 75,2 | 47,1 | 57,0 tok/s | 8,77 s | 17,55 s | US$ 40,00 | 01/09/2026 |
| 16 | GPT-6 Astra (low)OpenAI | 45,8 | 75,7 | 38,8 | 59,1 tok/s | 2,55 s | 11,01 s | US$ 40,00 | 03/09/2026 |
| 17 | Qwen3.8 Max (0902)Alibaba | 45,4 | 76,2 | 56,0 | 38,9 tok/s | 3,05 s | 67,40 s | US$ 5,00 | 02/09/2026 |
| 18 | Muse Spark 1.3 (xhigh)Meta | 45,1 | 76,5 | 51,5 | 292,8 tok/s | 21,99 s | 30,53 s | US$ 3,50 | 02/09/2026 |
| 19 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 44,8 | 74,3 | 46,2 | 58,6 tok/s | 4,32 s | 12,85 s | US$ 20,00 | 24/07/2026 |
| 20 | GLM-5.3 (max)Z AI | 44,8 | 74,8 | 53,1 | 71,8 tok/s | 2,90 s | 37,74 s | US$ 3,65 | 18/08/2026 |
| 21 | Grok 4.6 (high)SpaceXAI | 44,3 | 76,8 | 53,0 | 66,7 tok/s | 46,00 s | 53,50 s | US$ 5,00 | 12/08/2026 |
| 22 | Grok 4.6 (xhigh)SpaceXAI | 44,2 | 75,9 | 52,5 | 63,2 tok/s | 48,24 s | 56,15 s | US$ 5,00 | 12/08/2026 |
| 23 | GPT-5.6 Sol (xhigh)OpenAI | 44,0 | 78,3 | 47,4 | 74,1 tok/s | 37,79 s | 44,54 s | US$ 16,00 | 09/07/2026 |
| 24 | Step 5 PreviewStepFun | 43,7 | — | — | 99,8 tok/s | 2,96 s | 28,02 s | US$ 2,28 | 18/09/2026 |
| 25 | Kimi K3 (max)Kimi | 43,6 | 76,2 | 50,0 | 43,6 tok/s | 3,69 s | 61,04 s | US$ 12,00 | 16/07/2026 |
| 26 | Grok 4.6 (medium)SpaceXAI | 42,8 | 74,4 | 50,6 | 61,5 tok/s | 36,49 s | 44,63 s | US$ 5,00 | 12/08/2026 |
| 27 | GPT-5.6 Sol (high)OpenAI | 42,3 | 77,2 | 44,2 | 77,6 tok/s | 9,63 s | 16,07 s | US$ 16,00 | 09/07/2026 |
| 28 | GPT-5.6 Terra (max)OpenAI | 42,1 | 76,7 | 43,2 | 105,5 tok/s | 208,09 s | 212,83 s | US$ 9,50 | 09/07/2026 |
| 29 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic | 41,8 | 74,3 | 41,9 | 59,1 tok/s | 36,74 s | 45,20 s | US$ 20,00 | 28/05/2026 |
| 30 | GLM 5.3 FlashZ AI | 41,8 | 71,5 | 50,9 | 93,7 tok/s | 2,52 s | 29,21 s | US$ 0,41 | 26/08/2026 |
| 31 | Gemini 3.8 Flash (high)Google | 40,9 | 76,3 | 40,2 | 330,9 tok/s | 25,92 s | 27,43 s | US$ 3,00 | 02/09/2026 |
| 32 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic | 40,7 | 73,6 | 38,6 | 51,3 tok/s | 22,05 s | 31,79 s | US$ 20,00 | 16/04/2026 |
| 33 | Qwen3.8 MaxAlibaba | 40,2 | 71,8 | 49,1 | 39,5 tok/s | 2,80 s | 66,10 s | US$ 5,00 | 03/08/2026 |
| 34 | Qwen3.8 2.4T A95BAlibaba | 39,9 | 71,9 | 50,1 | 41,2 tok/s | 3,09 s | 63,76 s | US$ 5,00 | 12/08/2026 |
| 35 | Gemini 3.8 Flash (medium)Google | 39,8 | 74,1 | 39,7 | — | — | — | US$ 3,00 | 02/09/2026 |
| 36 | Qwen3.8-Flash-NextAlibaba | 39,8 | 73,1 | 53,6 | 63,0 tok/s | 2,71 s | 42,40 s | US$ 0,39 | 26/08/2026 |
| 37 | Gemini 3.7 Flash (medium)Google | 39,6 | 71,5 | — | 317,8 tok/s | 4,87 s | 6,44 s | US$ 3,00 | 13/08/2026 |
| 38 | Muse Spark 1.2 (xhigh)Meta | 39,6 | 72,2 | 43,2 | 224,7 tok/s | 16,10 s | 27,23 s | US$ 3,50 | 05/08/2026 |
| 39 | DeepSeek V4.1 Flash (Reasoning, Max Effort)DeepSeek | 39,5 | — | — | 238,8 tok/s | 0,93 s | 11,40 s | US$ 0,97 | 10/09/2026 |
| 40 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 39,4 | 66,9 | 36,0 | 62,1 tok/s | 2,94 s | 10,99 s | US$ 20,00 | 24/07/2026 |
| 41 | GPT-5.6 Sol (medium)OpenAI | 39,2 | 76,3 | 39,7 | 73,2 tok/s | 5,48 s | 12,30 s | US$ 16,00 | 09/07/2026 |
| 42 | Gemini 3.7 Flash (high)Google | 39,1 | 76,1 | 35,2 | 334,7 tok/s | 12,44 s | 13,94 s | US$ 3,00 | 13/08/2026 |
| 43 | GPT-5.4 (xhigh)OpenAI | 39,0 | 71,1 | — | 142,8 tok/s | 150,63 s | 154,14 s | US$ 11,88 | 05/03/2026 |
| 44 | Grok 4.5 (high)SpaceXAI | 38,8 | 72,4 | 41,2 | 63,3 tok/s | 7,24 s | 15,14 s | US$ 5,00 | 08/07/2026 |
| 45 | GPT-5.5 (xhigh)OpenAI | 38,4 | 74,9 | 36,4 | 115,0 tok/s | 65,25 s | 69,60 s | US$ 23,75 | 23/04/2026 |
| 46 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 38,2 | 71,5 | 43,6 | 81,2 tok/s | 134,06 s | 140,22 s | US$ 8,00 | 30/06/2026 |
| 47 | GPT-5.6 Terra (xhigh)OpenAI | 38,0 | 70,6 | 41,4 | 104,3 tok/s | 18,40 s | 23,20 s | US$ 9,50 | 09/07/2026 |
| 48 | GPT-5.6 Luna (max)OpenAI | 37,3 | 71,4 | 42,1 | 164,5 tok/s | 126,71 s | 129,75 s | US$ 0,95 | 09/07/2026 |
| 49 | GPT-5.5 (high)OpenAI | 37,0 | 71,6 | 34,3 | 107,3 tok/s | 17,43 s | 22,09 s | US$ 23,75 | 23/04/2026 |
| 50 | Gemini 3.7 Flash (low)Google | 36,9 | 71,0 | — | 320,4 tok/s | 0,73 s | 2,29 s | US$ 3,00 | 13/08/2026 |
| 51 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 36,0 | 68,8 | 41,3 | 108,2 tok/s | 1,65 s | 24,75 s | US$ 3,30 | 13/08/2026 |
| 52 | Agnes 3.0 FlashSapiens AI | 35,5 | — | — | — | — | — | US$ 0,12 | 11/09/2026 |
| 53 | Agnes 2.5 Pro BetaSapiens AI | 35,2 | 62,3 | — | — | — | — | US$ 0,25 | 26/08/2026 |
| 54 | Grok 4.6 (low)SpaceXAI | 35,1 | 66,3 | 41,2 | 58,2 tok/s | 8,52 s | 17,11 s | US$ 5,00 | 12/08/2026 |
| 55 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 34,8 | 65,0 | 47,5 | 240,1 tok/s | 1,18 s | 11,59 s | US$ 1,10 | 21/08/2026 |
| 56 | GPT-5.6 Luna (xhigh)OpenAI | 34,6 | 68,6 | 38,7 | 164,7 tok/s | 33,79 s | 36,82 s | US$ 0,95 | 09/07/2026 |
| 57 | Kimi K3 (low)Kimi | 34,5 | 72,0 | — | 42,5 tok/s | 4,82 s | 63,66 s | US$ 12,00 | 16/07/2026 |
| 58 | Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 34,4 | — | — | 73,9 tok/s | 41,84 s | 48,60 s | US$ 8,00 | 30/06/2026 |
| 59 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 34,3 | 69,1 | 41,0 | 243,7 tok/s | 0,98 s | 11,24 s | US$ 1,10 | 31/07/2026 |
| 60 | GPT-5.6 Terra (high)OpenAI | 34,2 | 67,1 | 36,7 | 90,6 tok/s | 3,15 s | 8,67 s | US$ 9,50 | 09/07/2026 |
| 61 | Gemini 3.6 Flash (high)Google | 34,0 | 69,2 | 29,0 | 222,6 tok/s | 39,77 s | 42,01 s | US$ 3,00 | 21/07/2026 |
| 62 | GPT-5.5 (medium)OpenAI | 33,8 | 71,5 | 29,5 | 102,5 tok/s | 6,50 s | 11,38 s | US$ 23,75 | 23/04/2026 |
| 63 | GLM-5.2 (max)Z AI | 33,7 | 68,8 | 38,4 | 74,0 tok/s | 5,18 s | 38,98 s | US$ 3,65 | 16/06/2026 |
| 64 | Muse Spark 1.1 (xhigh)Meta | 33,7 | 71,3 | 25,8 | — | — | — | US$ 3,50 | 09/07/2026 |
| 65 | Qwen3.8 27B (xhigh)Alibaba | 33,7 | 68,1 | 45,8 | 46,8 tok/s | 3,94 s | 57,34 s | US$ 2,38 | 14/08/2026 |
| 66 | Gemini 3.5 Flash (medium)Google | 33,6 | — | — | 252,9 tok/s | 26,95 s | 28,93 s | US$ 7,13 | 19/05/2026 |
| 67 | Motif 3Motif Technologies | 33,6 | 63,5 | — | — | — | — | — | 12/08/2026 |
| 68 | Gemini 3.8 Flash (low)Google | 33,5 | 73,5 | 32,6 | — | — | — | US$ 3,00 | 02/09/2026 |
| 69 | GPT-5.6 Sol (low)OpenAI | 33,5 | 69,7 | 31,6 | 72,1 tok/s | 3,16 s | 10,09 s | US$ 16,00 | 09/07/2026 |
| 70 | Gemini 3.5 Flash (high)Google | 32,6 | 70,1 | 26,0 | 238,4 tok/s | 33,65 s | 35,75 s | US$ 7,13 | 19/05/2026 |
| 71 | GPT-5.3 Codex (xhigh)OpenAI | 32,5 | — | — | 179,4 tok/s | 78,34 s | 81,13 s | US$ 10,94 | 05/02/2026 |
| 72 | Motif 3 (Beta)Motif Technologies | 32,3 | 62,0 | — | — | — | — | — | 14/07/2026 |
| 73 | GPT-5.6 Luna (high)OpenAI | 32,1 | 63,3 | 34,6 | 157,4 tok/s | 9,56 s | 12,74 s | US$ 0,95 | 09/07/2026 |
| 74 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 31,9 | — | — | 43,2 tok/s | 23,47 s | 35,06 s | US$ 20,00 | 05/02/2026 |
| 75 | Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic | 31,7 | — | — | 71,7 tok/s | 11,94 s | 18,91 s | US$ 8,00 | 30/06/2026 |
| 76 | Muse SparkMeta | 31,3 | 58,6 | — | — | — | — | — | 08/04/2026 |
| 77 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 30,9 | — | — | 44,9 tok/s | 1,03 s | 12,18 s | US$ 20,00 | 16/04/2026 |
| 78 | GPT-5.5 (low)OpenAI | 30,7 | 60,9 | — | 97,3 tok/s | 1,54 s | 6,68 s | US$ 23,75 | 23/04/2026 |
| 79 | K2 Horizon 375B A23BInstitute of Foundation Models | 30,5 | 61,5 | 40,0 | — | — | — | — | 03/09/2026 |
| 80 | Apodex 1.1Apodex | 30,4 | 60,8 | — | — | — | — | US$ 2,33 | 30/08/2026 |
| 81 | DeepSeek V4 Pro 0424 (Reasoning, Max Effort)DeepSeek | 30,4 | 59,4 | 26,3 | 107,0 tok/s | 1,63 s | 47,21 s | US$ 0,76 | 24/04/2026 |
| 82 | GPT-5.2 (xhigh)OpenAI | 30,4 | — | — | 100,6 tok/s | 170,83 s | 175,80 s | US$ 10,94 | 11/12/2025 |
| 83 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 30,1 | 63,0 | 31,8 | 53,9 tok/s | 125,76 s | 135,04 s | US$ 12,00 | 17/02/2026 |
| 84 | DeepSeek V4 Pro 0424 (Reasoning, High Effort)DeepSeek | 30,1 | 58,7 | — | 99,8 tok/s | 1,63 s | 26,61 s | US$ 0,76 | 24/04/2026 |
| 85 | GPT-5.6 Terra (medium)OpenAI | 30,1 | 64,7 | 30,4 | 96,4 tok/s | 2,03 s | 7,22 s | US$ 9,50 | 09/07/2026 |
| 86 | Gemini 3.1 Pro PreviewGoogle | 29,7 | 68,8 | 8,2 | 124,4 tok/s | 63,62 s | 67,64 s | US$ 9,50 | 19/02/2026 |
| 87 | Qwen3.7 MaxAlibaba | 29,5 | 66,0 | 22,5 | 200,3 tok/s | 2,34 s | 16,86 s | US$ 6,25 | 19/05/2026 |
| 88 | MiniMax-M3MiniMax | 29,2 | 58,6 | 29,5 | 227,3 tok/s | 0,90 s | 11,90 s | US$ 0,97 | 01/06/2026 |
| 89 | Claude Opus 4.5 (Reasoning)Anthropic | 29,1 | — | — | 50,7 tok/s | 16,60 s | 26,47 s | US$ 20,00 | 24/11/2025 |
| 90 | MiMo-V2-ProXiaomi | 28,6 | — | — | — | — | — | — | 18/03/2026 |
| 91 | GPT-5.2 Codex (xhigh)OpenAI | 28,5 | — | — | — | — | — | US$ 10,94 | 11/12/2025 |
| 92 | Qwen3.6 Max PreviewAlibaba | 28,4 | — | — | 69,9 tok/s | 3,28 s | 39,05 s | US$ 6,18 | 20/04/2026 |
| 93 | GPT-5.6 Sol (Non-reasoning)OpenAI | 28,3 | 65,1 | 28,1 | 64,7 tok/s | 1,16 s | 8,89 s | US$ 16,00 | 09/07/2026 |
| 94 | Nex-N2-Pro (based on Qwen3.5-397B-A17B)Nex AGI | 28,2 | 59,1 | 23,7 | — | — | — | — | 02/06/2026 |
| 95 | Solar Pro 4Upstage | 28,2 | 52,7 | — | 66,6 tok/s | 2,03 s | 39,56 s | US$ 0,97 | 06/08/2026 |
| 96 | Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic | 28,1 | — | — | 70,5 tok/s | 2,70 s | 9,79 s | US$ 8,00 | 30/06/2026 |
| 97 | Gemini 3 Pro Preview (high)Google | 28,0 | — | — | — | — | — | US$ 9,50 | 18/11/2025 |
| 98 | GLM-5 (Reasoning)Z AI | 27,9 | — | — | 76,3 tok/s | 1,50 s | 48,73 s | US$ 2,65 | 11/02/2026 |
| 99 | Inkling SmallThinking Machines | 27,8 | 52,9 | — | 188,4 tok/s | 2,02 s | 15,29 s | US$ 0,97 | 30/07/2026 |
| 100 | GPT-5.4 (low)OpenAI | 27,6 | — | — | 111,2 tok/s | 1,83 s | 6,32 s | US$ 11,88 | 05/03/2026 |
Nenhum modelo com essa combinação de busca e empresa.
Preço combinado estimado com 1 token de entrada para cada 3 de saída, em dólares por milhão de tokens. Latência é a mediana de tempo até o primeiro token; em modelos de raciocínio, inclui o tempo pensando antes de responder. Dados por Artificial Analysis.
Por fabricante
O melhor modelo de cada empresa
O modelo com maior índice de inteligência de cada uma das 12 empresas com mais modelos no ranking.
| Empresa | Melhor modelo | Inteligência | Preço/1M | Modelos no ranking |
|---|---|---|---|---|
| OpenAI | GPT-6 Astra (max) | 52,7 | US$ 40,00 | 91 |
| Alibaba | Qwen3.8 Max (0902) | 45,4 | US$ 5,00 | 89 |
| Gemini 3.8 Flash (high) | 40,9 | US$ 3,00 | 65 | |
| Anthropic | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 53,4 | US$ 40,00 | 48 |
| DeepSeek | DeepSeek V4.1 Flash (Reasoning, Max Effort) | 39,5 | US$ 0,97 | 35 |
| Mistral | Mistral Medium 3.5 | 14,2 | US$ 6,00 | 32 |
| SpaceXAI | Grok 4.6 (high) | 44,3 | US$ 5,00 | 26 |
| Meta | Muse Spark 1.3 (max) | 48,1 | US$ 3,50 | 22 |
| Z AI | GLM-5.3 (max) | 44,8 | US$ 3,65 | 22 |
| NVIDIA | Nemotron 3 Ultra 550B A55B (Reasoning) | 22,9 | US$ 1,95 | 19 |
| Amazon | Nova 2.0 Pro Preview (medium) | 14,2 | US$ 7,81 | 14 |
| IBM | Granite 4.2 30B | 14,8 | US$ 0,53 | 13 |
Metodologia
Como ler cada coluna
Todas as medições são do Artificial Analysis, que roda as mesmas avaliações em todos os modelos em vez de repetir o número divulgado por cada fabricante.
| Coluna | O que mede |
|---|---|
| Inteligência | Artificial Analysis Intelligence Index v4.3: nota composta de avaliações de raciocínio, conhecimento, matemática e código. É a coluna que ordena o ranking. |
| Coding | Coding Index: desempenho em geração e edição de código. Só existe para os modelos em que a avaliação foi rodada. |
| Agentic | Agentic Index: capacidade de usar ferramentas e completar tarefas de várias etapas — o critério que mais importa para agentes em produção. |
| Velocidade | Mediana de tokens de saída por segundo, medida na API do fornecedor. |
| Latência | Mediana de segundos até o primeiro token. Em modelos que raciocinam antes de responder, inclui esse tempo de raciocínio. |
| E2E | Resposta completa, de ponta a ponta: mediana de segundos da requisição até o fim da resposta — o tempo que o usuário de fato espera. |
| Preço/1M | Preço por milhão de tokens: estimativa combinada em dólares, supondo 1 token de entrada para cada 3 de saída. O custo real depende do perfil de uso de cada aplicação. |
Do ranking à decisão
O ranking não escolhe o modelo da sua empresa
O topo da tabela diz qual modelo é mais capaz em avaliação padronizada. A decisão de adoção depende de quatro perguntas que nenhum benchmark responde.
Qual qualidade é suficiente?
Classificar ticket, resumir reunião e redigir contrato pedem níveis diferentes de modelo. Pagar pelo líder do ranking em tarefa que o 40º resolve é o erro de custo mais comum em IA corporativa.
Quanto a operação aguenta por token?
O preço por milhão parece pequeno até multiplicar por volume. A conta certa é custo por caso de uso por mês — e ela só existe quando o consumo passa por um ponto único de medição, como um AI Gateway.
Onde o dado pode ser processado?
Dado pessoal enviado a um modelo é tratamento sob a LGPD, com contrato de operador e transferência internacional a avaliar. O modelo mais inteligente pode ser o que o jurídico não aprova. Ver LGPD em fluxos de IA.
Dá para trocar de modelo sem reescrever?
O líder muda a cada poucas semanas — este ranking é a prova. Arquitetura presa a um fornecedor transforma cada lançamento em projeto. Compare as opções no comparativo de 124 AI Gateways.
Perguntas frequentes
LLM Leaderboard, em resposta direta
Qual é o melhor modelo de IA hoje?
No ranking atualizado em 21 de setembro de 2026, o Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, lidera o Artificial Analysis Intelligence Index v4.3 com 53,4 pontos. Em seguida vêm Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (53,2) e GPT-6 Astra (max) (52,7). O índice mede capacidade geral; o melhor modelo para uma empresa depende também de custo por token, latência e de onde o dado pode ser processado.
Qual é o melhor LLM para programação?
Pelo Coding Index da Artificial Analysis, o Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, tem a maior pontuação em código: 81,6. O índice combina avaliações de geração e edição de código; para uso em assistente de programação, vale olhar também a latência, porque modelos de raciocínio longo podem demorar dezenas de segundos para começar a responder.
Qual é o LLM mais barato com boa qualidade?
Entre os 50 modelos com maior índice de inteligência, o mais barato é o Qwen3.8-Flash-Next, da Alibaba: US$ 0,39 por milhão de tokens, com índice 39,8. Na relação entre inteligência e preço, o destaque é o GLM 5.3 Flash, com 101,33 pontos por dólar entre os modelos com pelo menos 75% do índice do líder. O preço é uma estimativa combinada que supõe 1 token de entrada para cada 3 de saída.
Qual é o modelo de IA mais rápido?
Entre os 50 modelos mais inteligentes, o Gemini 3.7 Flash (high), da Google, é o mais rápido, com mediana de 334,7 tok/s de saída. Velocidade de geração e latência são coisas diferentes: um modelo pode gerar rápido e ainda assim demorar para emitir o primeiro token, se raciocina antes de responder.
De onde vêm os dados e com que frequência o ranking é atualizado?
Os dados são do Artificial Analysis, que testa os modelos de forma independente e publica o Intelligence Index, os índices de código e agêntico e as medições de velocidade, latência e preço. O ranking é o mesmo publicado pelo Automations Cookbook, atualizado toda semana; ao abrir a página, a tabela ainda busca a versão mais recente disponível. Esta atualização cobre 653 modelos de 59 empresas.
Como escolher um LLM para uso corporativo?
Comece pelo caso de uso, não pelo topo do ranking. Defina qual qualidade é suficiente, quanto a operação pode pagar por milhão de tokens e qual latência o usuário tolera. Depois vêm as perguntas que o benchmark não responde: onde o dado é processado, o que o contrato do fornecedor diz sobre retenção e treino, e se a arquitetura permite trocar de modelo sem reescrever a aplicação — que é o papel de um AI Gateway.
Fonte e atualização
De onde vêm estes números
As medições são do Artificial Analysis, que avalia os modelos de forma independente e publica os índices e as medições de desempenho e preço. Esta página espelha o LLM Leaderboard do Automations Cookbook, em inglês, atualizado por rotina semanal.
Duas camadas de atualização. A versão publicada foi gerada em 21 de setembro de 2026. Ao abrir a página, a tabela busca a versão mais recente disponível e se atualiza sozinha; se a fonte estiver fora do ar, fica a versão publicada.
Os dados em JSON estão em /llm-leaderboard/modelos.json, com os mesmos campos da tabela.
Próximo passo
Escolher o modelo é a parte fácil
O difícil é saber quais modelos a empresa já usa, quanto custam e que dado passa por eles. O diagnóstico de maturidade responde em dez perguntas e três minutos, sem cadastro.