Aviso antes dos números: a última medição registrada aqui é de 13 de julho, não da semana passada. O acompanhamento ficou 7 semanas parado. Os deltas abaixo comparam com esse último snapshot disponível, não com "a semana anterior". Onde o intervalo é maior, a leitura do delta também exige mais cautela.

Mesmo com o hiato, a mudança central é clara: a Anthropic lançou o Claude Opus 5, e ele já lidera o Artificial Analysis Intelligence Index, inclusive à frente do próprio Claude Fable 5, que era o nº 1 em julho. No LMArena, porém, quem continua no topo do voto humano é o Fable 5, e o Opus 5 estreia bem mais abaixo. O mesmo padrão de divergência entre os dois rankings que já tínhamos visto em agosto continua valendo.

Quem lidera o Artificial Analysis Intelligence Index

# Modelo Índice Preço (US$/1M, blended)
1 Claude Opus 5 (max) 63 3,85
2 Claude Opus 5 (xhigh) 63 3,85
3 Claude Fable 5 (com fallback) 62 7,70
4 Claude Opus 5 (high) 61 3,85
5 GPT-5.6 Sol (max) 61 3,08
6 Grok 4.6 (high) 61 1,35
7 Kimi K3 (max) 60 2,31
8 GLM-5.3 (max) 60 0,90

O ranking tem 177 modelos avaliados (versão v4.1.1 do índice). Comparado com 13/07, número contra número:

O Opus 5 simplesmente não existia no ranking em julho: estreou e foi direto para 1º e 2º lugar (max e xhigh, 63 pontos cada). O Fable 5, que liderava com 60 pontos, subiu 2 pontos (para 62) mas caiu do 1º para o 3º lugar, ultrapassado pelo próprio irmão da Anthropic. Ninguém perdeu pontuação, a família Opus é que subiu mais rápido.

O GPT-5.6 Sol (max) também melhorou (59 → 61, +2 pontos) mas caiu do 2º para uma 5ª posição empatada, e ficou mais barato: o preço blended caiu de US$ 4,35 para US$ 3,08 (-29%). O Grok 4.6 (high) substituiu o Grok 4.5 no ranking com um salto de 54 para 61 pontos (+7), a maior progressão nominal da lista, e a SpaceXAI diz que essa geração lidera em custo-eficiência.

A novidade mais estrutural é embaixo: Kimi K3 (max) e GLM-5.3 (max) entraram no top 8 com 60 pontos cada. Em julho nenhum modelo de peso aberto aparecia entre os dez primeiros. Os dois empatam em pontuação, mas o GLM-5.3 custa um terço do Kimi K3 (US$ 0,90 contra US$ 2,31 por 1M, blended), o mais barato de toda a lista.

Opus 4.8 (56 pontos em julho) e Sonnet 5 (53) saíram do quadro visível do topo: não porque pioraram, mas porque a fila em cima deles ficou mais longa.

Quem lidera o LMArena

# Modelo Elo
1 claude-fable-5 1507
2 claude-opus-4-6-high 1505
3 claude-opus-4-7-high 1502
4 muse-spark-1.2 (xHigh) 1498
5 claude-opus-4-6 1497
6 claude-opus-4-7 1494
7 claude-opus-5-high 1492
8 muse-spark-1.1 1490
9 gemini-3.7-flash-high 1490
10 kimi-k3-max 1489

Leaderboard de texto geral, atualizado em 27/08, com 7.922.078 votos em 395 modelos: contra 7.274.904 votos e 374 modelos em 10/07 (+647 mil votos, +8,9%, em 7 semanas).

O Fable 5 manteve o 1º lugar nas duas medições, com Elo subindo de 1505 para 1507, variação pequena o bastante para estar dentro da margem de erro (±5). O dado que chama atenção é o Opus 5: apesar de liderar disparado o Intelligence Index, sua estreia no Arena foi em 7º lugar (1492, variante high), atrás de quatro modelos Claude mais antigos. É o mesmo padrão que já tínhamos visto quando o Opus 5 foi lançado: ele ganha em tarefas estruturadas e agênticas, mas ainda não converteu isso em preferência subjetiva dos usuários que votam no Arena.

A Meta trocou de geração: o muse-spark-1.1, que estava em 6º em julho, foi substituído no topo por uma versão nova (muse-spark-1.2, xHigh), que entrou direto em 4º com 1498. O muse-spark-1.1 original ainda segue no top 10, agora em 8º. O Google saiu do top 10 (gemini-3-pro e gemini-3.1-pro-preview ocupavam 9º e 10º em julho) e voltou com um modelo diferente, gemini-3.7-flash-high, em 9º. E o Kimi K3 (max) também aparece no Arena, em 10º, o mesmo modelo que está no top 8 do Intelligence Index.

Como ler esses números

Os dois rankings continuam medindo coisas diferentes. O Intelligence Index é uma média de nove avaliações técnicas: código, agentes, raciocínio científico, capacidade geral. O LMArena é voto humano cego, par a par. Um modelo pode arrasar no primeiro e ficar no meio do segundo, que é exatamente o que está acontecendo com o Opus 5 agora.

Para quem decide stack: se a tarefa é agente rodando horas, código complexo ou raciocínio em múltiplos passos, o Intelligence Index é a referência mais relevante, e aí o Opus 5 lidera. Se o produto é conversa, atendimento ou algo onde o "tom" da resposta importa tanto quanto a precisão, o Arena pesa mais, e aí o Fable 5 segue na frente. E em qualquer um dos dois casos, GLM-5.3 e Kimi K3 mostram que dá para ficar perto do topo técnico gastando uma fração do preço dos líderes.