Aviso antes dos números: a última medição registrada aqui é de 13 de julho, não da semana passada. O acompanhamento ficou 7 semanas parado. Os deltas abaixo comparam com esse último snapshot disponível, não com "a semana anterior". Onde o intervalo é maior, a leitura do delta também exige mais cautela.
Mesmo com o hiato, a mudança central é clara: a Anthropic lançou o Claude Opus 5, e ele já lidera o Artificial Analysis Intelligence Index, inclusive à frente do próprio Claude Fable 5, que era o nº 1 em julho. No LMArena, porém, quem continua no topo do voto humano é o Fable 5, e o Opus 5 estreia bem mais abaixo. O mesmo padrão de divergência entre os dois rankings que já tínhamos visto em agosto continua valendo.
Quem lidera o Artificial Analysis Intelligence Index
| # | Modelo | Índice | Preço (US$/1M, blended) |
|---|---|---|---|
| 1 | Claude Opus 5 (max) | 63 | 3,85 |
| 2 | Claude Opus 5 (xhigh) | 63 | 3,85 |
| 3 | Claude Fable 5 (com fallback) | 62 | 7,70 |
| 4 | Claude Opus 5 (high) | 61 | 3,85 |
| 5 | GPT-5.6 Sol (max) | 61 | 3,08 |
| 6 | Grok 4.6 (high) | 61 | 1,35 |
| 7 | Kimi K3 (max) | 60 | 2,31 |
| 8 | GLM-5.3 (max) | 60 | 0,90 |
O ranking tem 177 modelos avaliados (versão v4.1.1 do índice). Comparado com 13/07, número contra número:
O Opus 5 simplesmente não existia no ranking em julho: estreou e foi direto para 1º e 2º lugar (max e xhigh, 63 pontos cada). O Fable 5, que liderava com 60 pontos, subiu 2 pontos (para 62) mas caiu do 1º para o 3º lugar, ultrapassado pelo próprio irmão da Anthropic. Ninguém perdeu pontuação, a família Opus é que subiu mais rápido.
O GPT-5.6 Sol (max) também melhorou (59 → 61, +2 pontos) mas caiu do 2º para uma 5ª posição empatada, e ficou mais barato: o preço blended caiu de US$ 4,35 para US$ 3,08 (-29%). O Grok 4.6 (high) substituiu o Grok 4.5 no ranking com um salto de 54 para 61 pontos (+7), a maior progressão nominal da lista, e a SpaceXAI diz que essa geração lidera em custo-eficiência.
A novidade mais estrutural é embaixo: Kimi K3 (max) e GLM-5.3 (max) entraram no top 8 com 60 pontos cada. Em julho nenhum modelo de peso aberto aparecia entre os dez primeiros. Os dois empatam em pontuação, mas o GLM-5.3 custa um terço do Kimi K3 (US$ 0,90 contra US$ 2,31 por 1M, blended), o mais barato de toda a lista.
Opus 4.8 (56 pontos em julho) e Sonnet 5 (53) saíram do quadro visível do topo: não porque pioraram, mas porque a fila em cima deles ficou mais longa.
Quem lidera o LMArena
| # | Modelo | Elo |
|---|---|---|
| 1 | claude-fable-5 | 1507 |
| 2 | claude-opus-4-6-high | 1505 |
| 3 | claude-opus-4-7-high | 1502 |
| 4 | muse-spark-1.2 (xHigh) | 1498 |
| 5 | claude-opus-4-6 | 1497 |
| 6 | claude-opus-4-7 | 1494 |
| 7 | claude-opus-5-high | 1492 |
| 8 | muse-spark-1.1 | 1490 |
| 9 | gemini-3.7-flash-high | 1490 |
| 10 | kimi-k3-max | 1489 |
Leaderboard de texto geral, atualizado em 27/08, com 7.922.078 votos em 395 modelos: contra 7.274.904 votos e 374 modelos em 10/07 (+647 mil votos, +8,9%, em 7 semanas).
O Fable 5 manteve o 1º lugar nas duas medições, com Elo subindo de 1505 para 1507, variação pequena o bastante para estar dentro da margem de erro (±5). O dado que chama atenção é o Opus 5: apesar de liderar disparado o Intelligence Index, sua estreia no Arena foi em 7º lugar (1492, variante high), atrás de quatro modelos Claude mais antigos. É o mesmo padrão que já tínhamos visto quando o Opus 5 foi lançado: ele ganha em tarefas estruturadas e agênticas, mas ainda não converteu isso em preferência subjetiva dos usuários que votam no Arena.
A Meta trocou de geração: o muse-spark-1.1, que estava em 6º em julho, foi substituído no topo por uma versão nova (muse-spark-1.2, xHigh), que entrou direto em 4º com 1498. O muse-spark-1.1 original ainda segue no top 10, agora em 8º. O Google saiu do top 10 (gemini-3-pro e gemini-3.1-pro-preview ocupavam 9º e 10º em julho) e voltou com um modelo diferente, gemini-3.7-flash-high, em 9º. E o Kimi K3 (max) também aparece no Arena, em 10º, o mesmo modelo que está no top 8 do Intelligence Index.
Como ler esses números
Os dois rankings continuam medindo coisas diferentes. O Intelligence Index é uma média de nove avaliações técnicas: código, agentes, raciocínio científico, capacidade geral. O LMArena é voto humano cego, par a par. Um modelo pode arrasar no primeiro e ficar no meio do segundo, que é exatamente o que está acontecendo com o Opus 5 agora.
Para quem decide stack: se a tarefa é agente rodando horas, código complexo ou raciocínio em múltiplos passos, o Intelligence Index é a referência mais relevante, e aí o Opus 5 lidera. Se o produto é conversa, atendimento ou algo onde o "tom" da resposta importa tanto quanto a precisão, o Arena pesa mais, e aí o Fable 5 segue na frente. E em qualquer um dos dois casos, GLM-5.3 e Kimi K3 mostram que dá para ficar perto do topo técnico gastando uma fração do preço dos líderes.