Duas Medições, Dois Vencedores

Claude Opus 5 (Adaptive Reasoning, Max Effort) atualmente tem o maior score de Intelligence Index da Artificial Analysis, com 61 pontos. No outro lado, Fable 5 é agora #1 no leaderboard de texto do Arena em 1508.6 na data de corte de 1º de agosto.

Se parecem contraditórios, é porque medem coisas diferentes.

O que Mudou Desde 13 de Julho

Anthropic lançou Claude Opus 5 em 24 de julho de 2026, seu quarto modelo em menos de dois meses após Mythos 5, Fable 5 e Sonnet 5. Este lançamento derrotou a posição anterior onde Claude Fable 5 liderava o Intelligence Index.

Artificial Analysis Intelligence Index v4.1:

  • Claude Opus 5 agora lidera com 61, seguido por Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) com 60, e Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) com 60
  • Fable 5 fica em segundo lugar (60 / 52.8 no Agentic Index) e GPT-5.6 Sol em terceiro (59 / 54.0)

LMArena (agora Arena.ai):

  • Fable 5 é #1 no leaderboard de texto a 1508.6, #1 em Humanity's Last Exam com 53.3% e #1 em AA-Omniscience com 40 — três casas diferentes concordando
  • GPT-5.6 Sol senta-se em #14 no leaderboard de texto do Arena com 1482.8

Como Ler Esses Números (e Por Que Divergem)

Artificial Analysis Intelligence Index v4.1 combina performance em nove avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Esta métrica composta fornece um único score para rastrear progresso em inteligência geral artificial através de matemática, ciência, código e raciocínio.

Ele mede capacidade objetiva: pode o modelo resolver esse problema específico?

LMArena (Arena.ai) rankings são baseados em votos de usuários crowdsourced (ratings Elo de testes cegos A/B). Votos coletados de "Battles in Direct" agora contam para leaderboards. Desde março de 2026, 10% de sessões de chat direto no Arena são convertidas em batalhas entre dois modelos aleatoriamente amostrados. Começando agora, votos coletados dessa forma serão inclusos nos leaderboards.

Ele mede preferência humana: qual modelo os usuários preferem para respostas reais?

Por Que Opus 5 Lidera Benchmarks mas Fable 5 Lidera Votes

Claude Opus 5 mantém o lane de entregas profissionais no GDPval-AA v2, onde o board reajustado agora lê 1858 contra Fable 5's 1746. A Opus 5 foi projetada para tarefas agentic longas — código complexo, simulações, reasoning multi-step.

Fable 5 domina em conversação natural. Fable 5 é #1 em Humanity's Last Exam com 53.3% e #1 em AA-Omniscience com 40 — este último medindo "com que frequência um modelo está simplesmente errado". Usuários a votam em primeiro porque fornece respostas equilibradas, honestas e bem explicadas.

É a diferença entre "melhor em problemas malucos de pesquisa" vs "melhor em ajudar uma pessoa real".

A Lição para Escolher Seu Modelo

Nenhum ranking é completo. Use Intelligence Index se você está construindo agentes de IA, automação ou tarefas que precisam de reasoning à prova de balas. Use Arena votes se você quer um modelo que as pessoas achem agradável de usar.

Opus 5 é o modelo de produção. Fable 5 é o modelo que as pessoas elegem quando têm tempo para julgar.

Ambos os dados saem de avaliações conduzidas independentemente pela Artificial Analysis em hardware padronizado, então confie em ambos — apenas não compare diretamente.