LLM Leaderboard

LLM Leaderboard: o ranking dos modelos de IA

653 modelos de linguagem de 59 empresas — OpenAI, Anthropic, Google, DeepSeek, Alibaba, Mistral e outras — comparados por inteligência, programação, capacidade agêntica, velocidade, latência e preço por milhão de tokens. Os dados são do Artificial Analysis Intelligence Index e o ranking é atualizado toda semana.

Atualizado em

Líder atual: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, com índice de inteligência 53,4.

Artificial Analysis Intelligence Index v4.3 · dados por Artificial Analysis · espelho do LLM Leaderboard do Automations Cookbook

Destaques desta atualização

Quem lidera em cada critério

Nenhum modelo vence em tudo. O mais inteligente raramente é o mais rápido, e o mais barato quase nunca está no topo — os seis destaques abaixo são recalculados a cada atualização do ranking.

01

Mais inteligente

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice 53,4.

  • à frente de Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (53,2)
02

Melhor em programação

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice de código 81,6.

  • Coding Index da Artificial Analysis
03

Melhor em tarefas agênticas

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic — índice agêntico 57,9.

  • uso de ferramenta e tarefa de várias etapas
04

Mais rápido entre os 50 mais inteligentes

Gemini 3.7 Flash (high), da Google — 334,7 tok/s.

  • mediana de tokens de saída por segundo
05

Mais barato entre os 50 mais inteligentes

Qwen3.8-Flash-Next, da Alibaba — US$ 0,39 por milhão de tokens.

  • índice de inteligência 39,8
06

Melhor custo-benefício

GLM 5.3 Flash, da Z AI — 101,33 pontos de inteligência por dólar.

  • entre os modelos com pelo menos 75% do índice do líder

O ranking

Ranking de 653 modelos de IA

Ordenado por índice de inteligência. Clique no cabeçalho de uma coluna para reordenar, busque por modelo ou empresa, ou filtre por fabricante. A barra de cada célula mostra a posição do modelo naquela métrica entre todos os que têm o dado.

Ranking de modelos de IA por índice de inteligência, código, capacidade agêntica, velocidade, latência, tempo de resposta e preço, atualizado em 21 de setembro de 2026.
# Modelo Lançamento
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53,481,657,969,7 tok/s275,35 s282,52 sUS$ 40,0001/09/2026
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53,280,757,265,2 tok/s179,99 s187,67 sUS$ 40,0001/09/2026
3GPT-6 Astra (max)OpenAI52,776,951,070,8 tok/s256,13 s263,20 sUS$ 40,0003/09/2026
4GPT-6 Astra (xhigh)OpenAI52,475,950,262,8 tok/s126,92 s134,88 sUS$ 40,0003/09/2026
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51,279,153,157,5 tok/s22,53 s31,22 sUS$ 40,0001/09/2026
6GPT-6 Astra (high)OpenAI50,977,148,263,7 tok/s33,31 s41,16 sUS$ 40,0003/09/2026
7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50,878,056,560,7 tok/s54,00 s62,24 sUS$ 20,0024/07/2026
8Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49,777,055,656,5 tok/s22,87 s31,71 sUS$ 20,0024/07/2026
9Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49,676,550,767,9 tok/s120,83 s128,19 sUS$ 40,0009/06/2026
10GPT-6 Astra (medium)OpenAI49,676,746,062,2 tok/s5,62 s13,67 sUS$ 40,0003/09/2026
11Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic48,977,150,257,3 tok/s8,49 s17,22 sUS$ 40,0001/09/2026
12Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48,176,552,361,1 tok/s14,38 s22,56 sUS$ 20,0024/07/2026
13Muse Spark 1.3 (max)Meta48,175,855,5240,7 tok/s21,58 s31,97 sUS$ 3,5002/09/2026
14GPT-5.6 Sol (max)OpenAI47,077,450,275,3 tok/s120,80 s127,44 sUS$ 16,0009/07/2026
15Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic46,875,247,157,0 tok/s8,77 s17,55 sUS$ 40,0001/09/2026
16GPT-6 Astra (low)OpenAI45,875,738,859,1 tok/s2,55 s11,01 sUS$ 40,0003/09/2026
17Qwen3.8 Max (0902)Alibaba45,476,256,038,9 tok/s3,05 s67,40 sUS$ 5,0002/09/2026
18Muse Spark 1.3 (xhigh)Meta45,176,551,5292,8 tok/s21,99 s30,53 sUS$ 3,5002/09/2026
19Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic44,874,346,258,6 tok/s4,32 s12,85 sUS$ 20,0024/07/2026
20GLM-5.3 (max)Z AI44,874,853,171,8 tok/s2,90 s37,74 sUS$ 3,6518/08/2026
21Grok 4.6 (high)SpaceXAI44,376,853,066,7 tok/s46,00 s53,50 sUS$ 5,0012/08/2026
22Grok 4.6 (xhigh)SpaceXAI44,275,952,563,2 tok/s48,24 s56,15 sUS$ 5,0012/08/2026
23GPT-5.6 Sol (xhigh)OpenAI44,078,347,474,1 tok/s37,79 s44,54 sUS$ 16,0009/07/2026
24Step 5 PreviewStepFun43,7——99,8 tok/s2,96 s28,02 sUS$ 2,2818/09/2026
25Kimi K3 (max)Kimi43,676,250,043,6 tok/s3,69 s61,04 sUS$ 12,0016/07/2026
26Grok 4.6 (medium)SpaceXAI42,874,450,661,5 tok/s36,49 s44,63 sUS$ 5,0012/08/2026
27GPT-5.6 Sol (high)OpenAI42,377,244,277,6 tok/s9,63 s16,07 sUS$ 16,0009/07/2026
28GPT-5.6 Terra (max)OpenAI42,176,743,2105,5 tok/s208,09 s212,83 sUS$ 9,5009/07/2026
29Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic41,874,341,959,1 tok/s36,74 s45,20 sUS$ 20,0028/05/2026
30GLM 5.3 FlashZ AI41,871,550,993,7 tok/s2,52 s29,21 sUS$ 0,4126/08/2026
31Gemini 3.8 Flash (high)Google40,976,340,2330,9 tok/s25,92 s27,43 sUS$ 3,0002/09/2026
32Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic40,773,638,651,3 tok/s22,05 s31,79 sUS$ 20,0016/04/2026
33Qwen3.8 MaxAlibaba40,271,849,139,5 tok/s2,80 s66,10 sUS$ 5,0003/08/2026
34Qwen3.8 2.4T A95BAlibaba39,971,950,141,2 tok/s3,09 s63,76 sUS$ 5,0012/08/2026
35Gemini 3.8 Flash (medium)Google39,874,139,7———US$ 3,0002/09/2026
36Qwen3.8-Flash-NextAlibaba39,873,153,663,0 tok/s2,71 s42,40 sUS$ 0,3926/08/2026
37Gemini 3.7 Flash (medium)Google39,671,5—317,8 tok/s4,87 s6,44 sUS$ 3,0013/08/2026
38Muse Spark 1.2 (xhigh)Meta39,672,243,2224,7 tok/s16,10 s27,23 sUS$ 3,5005/08/2026
39DeepSeek V4.1 Flash (Reasoning, Max Effort)DeepSeek39,5——238,8 tok/s0,93 s11,40 sUS$ 0,9710/09/2026
40Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic39,466,936,062,1 tok/s2,94 s10,99 sUS$ 20,0024/07/2026
41GPT-5.6 Sol (medium)OpenAI39,276,339,773,2 tok/s5,48 s12,30 sUS$ 16,0009/07/2026
42Gemini 3.7 Flash (high)Google39,176,135,2334,7 tok/s12,44 s13,94 sUS$ 3,0013/08/2026
43GPT-5.4 (xhigh)OpenAI39,071,1—142,8 tok/s150,63 s154,14 sUS$ 11,8805/03/2026
44Grok 4.5 (high)SpaceXAI38,872,441,263,3 tok/s7,24 s15,14 sUS$ 5,0008/07/2026
45GPT-5.5 (xhigh)OpenAI38,474,936,4115,0 tok/s65,25 s69,60 sUS$ 23,7523/04/2026
46Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic38,271,543,681,2 tok/s134,06 s140,22 sUS$ 8,0030/06/2026
47GPT-5.6 Terra (xhigh)OpenAI38,070,641,4104,3 tok/s18,40 s23,20 sUS$ 9,5009/07/2026
48GPT-5.6 Luna (max)OpenAI37,371,442,1164,5 tok/s126,71 s129,75 sUS$ 0,9509/07/2026
49GPT-5.5 (high)OpenAI37,071,634,3107,3 tok/s17,43 s22,09 sUS$ 23,7523/04/2026
50Gemini 3.7 Flash (low)Google36,971,0—320,4 tok/s0,73 s2,29 sUS$ 3,0013/08/2026
51DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek36,068,841,3108,2 tok/s1,65 s24,75 sUS$ 3,3013/08/2026
52Agnes 3.0 FlashSapiens AI35,5—————US$ 0,1211/09/2026
53Agnes 2.5 Pro BetaSapiens AI35,262,3————US$ 0,2526/08/2026
54Grok 4.6 (low)SpaceXAI35,166,341,258,2 tok/s8,52 s17,11 sUS$ 5,0012/08/2026
55DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek34,865,047,5240,1 tok/s1,18 s11,59 sUS$ 1,1021/08/2026
56GPT-5.6 Luna (xhigh)OpenAI34,668,638,7164,7 tok/s33,79 s36,82 sUS$ 0,9509/07/2026
57Kimi K3 (low)Kimi34,572,0—42,5 tok/s4,82 s63,66 sUS$ 12,0016/07/2026
58Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic34,4——73,9 tok/s41,84 s48,60 sUS$ 8,0030/06/2026
59DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek34,369,141,0243,7 tok/s0,98 s11,24 sUS$ 1,1031/07/2026
60GPT-5.6 Terra (high)OpenAI34,267,136,790,6 tok/s3,15 s8,67 sUS$ 9,5009/07/2026
61Gemini 3.6 Flash (high)Google34,069,229,0222,6 tok/s39,77 s42,01 sUS$ 3,0021/07/2026
62GPT-5.5 (medium)OpenAI33,871,529,5102,5 tok/s6,50 s11,38 sUS$ 23,7523/04/2026
63GLM-5.2 (max)Z AI33,768,838,474,0 tok/s5,18 s38,98 sUS$ 3,6516/06/2026
64Muse Spark 1.1 (xhigh)Meta33,771,325,8———US$ 3,5009/07/2026
65Qwen3.8 27B (xhigh)Alibaba33,768,145,846,8 tok/s3,94 s57,34 sUS$ 2,3814/08/2026
66Gemini 3.5 Flash (medium)Google33,6——252,9 tok/s26,95 s28,93 sUS$ 7,1319/05/2026
67Motif 3Motif Technologies33,663,5—————12/08/2026
68Gemini 3.8 Flash (low)Google33,573,532,6———US$ 3,0002/09/2026
69GPT-5.6 Sol (low)OpenAI33,569,731,672,1 tok/s3,16 s10,09 sUS$ 16,0009/07/2026
70Gemini 3.5 Flash (high)Google32,670,126,0238,4 tok/s33,65 s35,75 sUS$ 7,1319/05/2026
71GPT-5.3 Codex (xhigh)OpenAI32,5——179,4 tok/s78,34 s81,13 sUS$ 10,9405/02/2026
72Motif 3 (Beta)Motif Technologies32,362,0—————14/07/2026
73GPT-5.6 Luna (high)OpenAI32,163,334,6157,4 tok/s9,56 s12,74 sUS$ 0,9509/07/2026
74Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic31,9——43,2 tok/s23,47 s35,06 sUS$ 20,0005/02/2026
75Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic31,7——71,7 tok/s11,94 s18,91 sUS$ 8,0030/06/2026
76Muse SparkMeta31,358,6—————08/04/2026
77Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic30,9——44,9 tok/s1,03 s12,18 sUS$ 20,0016/04/2026
78GPT-5.5 (low)OpenAI30,760,9—97,3 tok/s1,54 s6,68 sUS$ 23,7523/04/2026
79K2 Horizon 375B A23BInstitute of Foundation Models30,561,540,0————03/09/2026
80Apodex 1.1Apodex30,460,8————US$ 2,3330/08/2026
81DeepSeek V4 Pro 0424 (Reasoning, Max Effort)DeepSeek30,459,426,3107,0 tok/s1,63 s47,21 sUS$ 0,7624/04/2026
82GPT-5.2 (xhigh)OpenAI30,4——100,6 tok/s170,83 s175,80 sUS$ 10,9411/12/2025
83Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic30,163,031,853,9 tok/s125,76 s135,04 sUS$ 12,0017/02/2026
84DeepSeek V4 Pro 0424 (Reasoning, High Effort)DeepSeek30,158,7—99,8 tok/s1,63 s26,61 sUS$ 0,7624/04/2026
85GPT-5.6 Terra (medium)OpenAI30,164,730,496,4 tok/s2,03 s7,22 sUS$ 9,5009/07/2026
86Gemini 3.1 Pro PreviewGoogle29,768,88,2124,4 tok/s63,62 s67,64 sUS$ 9,5019/02/2026
87Qwen3.7 MaxAlibaba29,566,022,5200,3 tok/s2,34 s16,86 sUS$ 6,2519/05/2026
88MiniMax-M3MiniMax29,258,629,5227,3 tok/s0,90 s11,90 sUS$ 0,9701/06/2026
89Claude Opus 4.5 (Reasoning)Anthropic29,1——50,7 tok/s16,60 s26,47 sUS$ 20,0024/11/2025
90MiMo-V2-ProXiaomi28,6——————18/03/2026
91GPT-5.2 Codex (xhigh)OpenAI28,5—————US$ 10,9411/12/2025
92Qwen3.6 Max PreviewAlibaba28,4——69,9 tok/s3,28 s39,05 sUS$ 6,1820/04/2026
93GPT-5.6 Sol (Non-reasoning)OpenAI28,365,128,164,7 tok/s1,16 s8,89 sUS$ 16,0009/07/2026
94Nex-N2-Pro (based on Qwen3.5-397B-A17B)Nex AGI28,259,123,7————02/06/2026
95Solar Pro 4Upstage28,252,7—66,6 tok/s2,03 s39,56 sUS$ 0,9706/08/2026
96Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic28,1——70,5 tok/s2,70 s9,79 sUS$ 8,0030/06/2026
97Gemini 3 Pro Preview (high)Google28,0—————US$ 9,5018/11/2025
98GLM-5 (Reasoning)Z AI27,9——76,3 tok/s1,50 s48,73 sUS$ 2,6511/02/2026
99Inkling SmallThinking Machines27,852,9—188,4 tok/s2,02 s15,29 sUS$ 0,9730/07/2026
100GPT-5.4 (low)OpenAI27,6——111,2 tok/s1,83 s6,32 sUS$ 11,8805/03/2026

Preço combinado estimado com 1 token de entrada para cada 3 de saída, em dólares por milhão de tokens. Latência é a mediana de tempo até o primeiro token; em modelos de raciocínio, inclui o tempo pensando antes de responder. Dados por Artificial Analysis.

Por fabricante

O melhor modelo de cada empresa

O modelo com maior índice de inteligência de cada uma das 12 empresas com mais modelos no ranking.

EmpresaMelhor modeloInteligênciaPreço/1MModelos no ranking
OpenAIGPT-6 Astra (max)52,7US$ 40,0091
AlibabaQwen3.8 Max (0902)45,4US$ 5,0089
GoogleGemini 3.8 Flash (high)40,9US$ 3,0065
AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53,4US$ 40,0048
DeepSeekDeepSeek V4.1 Flash (Reasoning, Max Effort)39,5US$ 0,9735
MistralMistral Medium 3.514,2US$ 6,0032
SpaceXAIGrok 4.6 (high)44,3US$ 5,0026
MetaMuse Spark 1.3 (max)48,1US$ 3,5022
Z AIGLM-5.3 (max)44,8US$ 3,6522
NVIDIANemotron 3 Ultra 550B A55B (Reasoning)22,9US$ 1,9519
AmazonNova 2.0 Pro Preview (medium)14,2US$ 7,8114
IBMGranite 4.2 30B14,8US$ 0,5313

Metodologia

Como ler cada coluna

Todas as medições são do Artificial Analysis, que roda as mesmas avaliações em todos os modelos em vez de repetir o número divulgado por cada fabricante.

ColunaO que mede
InteligênciaArtificial Analysis Intelligence Index v4.3: nota composta de avaliações de raciocínio, conhecimento, matemática e código. É a coluna que ordena o ranking.
CodingCoding Index: desempenho em geração e edição de código. Só existe para os modelos em que a avaliação foi rodada.
AgenticAgentic Index: capacidade de usar ferramentas e completar tarefas de várias etapas — o critério que mais importa para agentes em produção.
VelocidadeMediana de tokens de saída por segundo, medida na API do fornecedor.
LatênciaMediana de segundos até o primeiro token. Em modelos que raciocinam antes de responder, inclui esse tempo de raciocínio.
E2EResposta completa, de ponta a ponta: mediana de segundos da requisição até o fim da resposta — o tempo que o usuário de fato espera.
Preço/1MPreço por milhão de tokens: estimativa combinada em dólares, supondo 1 token de entrada para cada 3 de saída. O custo real depende do perfil de uso de cada aplicação.

Do ranking à decisão

O ranking não escolhe o modelo da sua empresa

O topo da tabela diz qual modelo é mais capaz em avaliação padronizada. A decisão de adoção depende de quatro perguntas que nenhum benchmark responde.

01

Qual qualidade é suficiente?

Classificar ticket, resumir reunião e redigir contrato pedem níveis diferentes de modelo. Pagar pelo líder do ranking em tarefa que o 40º resolve é o erro de custo mais comum em IA corporativa.

02

Quanto a operação aguenta por token?

O preço por milhão parece pequeno até multiplicar por volume. A conta certa é custo por caso de uso por mês — e ela só existe quando o consumo passa por um ponto único de medição, como um AI Gateway.

03

Onde o dado pode ser processado?

Dado pessoal enviado a um modelo é tratamento sob a LGPD, com contrato de operador e transferência internacional a avaliar. O modelo mais inteligente pode ser o que o jurídico não aprova. Ver LGPD em fluxos de IA.

04

Dá para trocar de modelo sem reescrever?

O líder muda a cada poucas semanas — este ranking é a prova. Arquitetura presa a um fornecedor transforma cada lançamento em projeto. Compare as opções no comparativo de 124 AI Gateways.

Perguntas frequentes

LLM Leaderboard, em resposta direta

Qual é o melhor modelo de IA hoje?

No ranking atualizado em 21 de setembro de 2026, o Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, lidera o Artificial Analysis Intelligence Index v4.3 com 53,4 pontos. Em seguida vêm Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (53,2) e GPT-6 Astra (max) (52,7). O índice mede capacidade geral; o melhor modelo para uma empresa depende também de custo por token, latência e de onde o dado pode ser processado.

Qual é o melhor LLM para programação?

Pelo Coding Index da Artificial Analysis, o Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), da Anthropic, tem a maior pontuação em código: 81,6. O índice combina avaliações de geração e edição de código; para uso em assistente de programação, vale olhar também a latência, porque modelos de raciocínio longo podem demorar dezenas de segundos para começar a responder.

Qual é o LLM mais barato com boa qualidade?

Entre os 50 modelos com maior índice de inteligência, o mais barato é o Qwen3.8-Flash-Next, da Alibaba: US$ 0,39 por milhão de tokens, com índice 39,8. Na relação entre inteligência e preço, o destaque é o GLM 5.3 Flash, com 101,33 pontos por dólar entre os modelos com pelo menos 75% do índice do líder. O preço é uma estimativa combinada que supõe 1 token de entrada para cada 3 de saída.

Qual é o modelo de IA mais rápido?

Entre os 50 modelos mais inteligentes, o Gemini 3.7 Flash (high), da Google, é o mais rápido, com mediana de 334,7 tok/s de saída. Velocidade de geração e latência são coisas diferentes: um modelo pode gerar rápido e ainda assim demorar para emitir o primeiro token, se raciocina antes de responder.

De onde vêm os dados e com que frequência o ranking é atualizado?

Os dados são do Artificial Analysis, que testa os modelos de forma independente e publica o Intelligence Index, os índices de código e agêntico e as medições de velocidade, latência e preço. O ranking é o mesmo publicado pelo Automations Cookbook, atualizado toda semana; ao abrir a página, a tabela ainda busca a versão mais recente disponível. Esta atualização cobre 653 modelos de 59 empresas.

Como escolher um LLM para uso corporativo?

Comece pelo caso de uso, não pelo topo do ranking. Defina qual qualidade é suficiente, quanto a operação pode pagar por milhão de tokens e qual latência o usuário tolera. Depois vêm as perguntas que o benchmark não responde: onde o dado é processado, o que o contrato do fornecedor diz sobre retenção e treino, e se a arquitetura permite trocar de modelo sem reescrever a aplicação — que é o papel de um AI Gateway.

Fonte e atualização

De onde vêm estes números

As medições são do Artificial Analysis, que avalia os modelos de forma independente e publica os índices e as medições de desempenho e preço. Esta página espelha o LLM Leaderboard do Automations Cookbook, em inglês, atualizado por rotina semanal.

Duas camadas de atualização. A versão publicada foi gerada em 21 de setembro de 2026. Ao abrir a página, a tabela busca a versão mais recente disponível e se atualiza sozinha; se a fonte estiver fora do ar, fica a versão publicada.

Os dados em JSON estão em /llm-leaderboard/modelos.json, com os mesmos campos da tabela.

Próximo passo

Escolher o modelo é a parte fácil

O difícil é saber quais modelos a empresa já usa, quanto custam e que dado passa por eles. O diagnóstico de maturidade responde em dez perguntas e três minutos, sem cadastro.