Duas Medições, Dois Vencedores
Claude Opus 5 (Adaptive Reasoning, Max Effort) atualmente tem o maior score de Intelligence Index da Artificial Analysis, com 61 pontos. No outro lado, Fable 5 é agora #1 no leaderboard de texto do Arena em 1508.6 na data de corte de 1º de agosto.
Se parecem contraditórios, é porque medem coisas diferentes.
O que Mudou Desde 13 de Julho
Anthropic lançou Claude Opus 5 em 24 de julho de 2026, seu quarto modelo em menos de dois meses após Mythos 5, Fable 5 e Sonnet 5. Este lançamento derrotou a posição anterior onde Claude Fable 5 liderava o Intelligence Index.
Artificial Analysis Intelligence Index v4.1:
- Claude Opus 5 agora lidera com 61, seguido por Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) com 60, e Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) com 60
- Fable 5 fica em segundo lugar (60 / 52.8 no Agentic Index) e GPT-5.6 Sol em terceiro (59 / 54.0)
LMArena (agora Arena.ai):
- Fable 5 é #1 no leaderboard de texto a 1508.6, #1 em Humanity's Last Exam com 53.3% e #1 em AA-Omniscience com 40 — três casas diferentes concordando
- GPT-5.6 Sol senta-se em #14 no leaderboard de texto do Arena com 1482.8
Como Ler Esses Números (e Por Que Divergem)
Artificial Analysis Intelligence Index v4.1 combina performance em nove avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Esta métrica composta fornece um único score para rastrear progresso em inteligência geral artificial através de matemática, ciência, código e raciocínio.
Ele mede capacidade objetiva: pode o modelo resolver esse problema específico?
LMArena (Arena.ai) rankings são baseados em votos de usuários crowdsourced (ratings Elo de testes cegos A/B). Votos coletados de "Battles in Direct" agora contam para leaderboards. Desde março de 2026, 10% de sessões de chat direto no Arena são convertidas em batalhas entre dois modelos aleatoriamente amostrados. Começando agora, votos coletados dessa forma serão inclusos nos leaderboards.
Ele mede preferência humana: qual modelo os usuários preferem para respostas reais?
Por Que Opus 5 Lidera Benchmarks mas Fable 5 Lidera Votes
Claude Opus 5 mantém o lane de entregas profissionais no GDPval-AA v2, onde o board reajustado agora lê 1858 contra Fable 5's 1746. A Opus 5 foi projetada para tarefas agentic longas — código complexo, simulações, reasoning multi-step.
Fable 5 domina em conversação natural. Fable 5 é #1 em Humanity's Last Exam com 53.3% e #1 em AA-Omniscience com 40 — este último medindo "com que frequência um modelo está simplesmente errado". Usuários a votam em primeiro porque fornece respostas equilibradas, honestas e bem explicadas.
É a diferença entre "melhor em problemas malucos de pesquisa" vs "melhor em ajudar uma pessoa real".
A Lição para Escolher Seu Modelo
Nenhum ranking é completo. Use Intelligence Index se você está construindo agentes de IA, automação ou tarefas que precisam de reasoning à prova de balas. Use Arena votes se você quer um modelo que as pessoas achem agradável de usar.
Opus 5 é o modelo de produção. Fable 5 é o modelo que as pessoas elegem quando têm tempo para julgar.
Ambos os dados saem de avaliações conduzidas independentemente pela Artificial Analysis em hardware padronizado, então confie em ambos — apenas não compare diretamente.