Esta semana a Anthropic (empresa que desenvolve o Claude) fechou um ciclo que começou há quinze dias. Em 22 de setembro saiu o Opus 5.5. Em 28 de setembro, o Sonnet 5.5. Em 7 de outubro, dois dias atrás, o Haiku 5.5. Os três anúncios saem direto do site oficial da empresa, sem intermediário, e têm uma coisa em comum que foge do padrão do setor: nos três casos o modelo novo custa menos que o antigo, e mede melhor em benchmark ao mesmo tempo. Normalmente é um ou outro.
As três datas, lado a lado
| Modelo | Data | Preço de entrada por milhão de tokens | Preço do antigo |
|---|---|---|---|
| Opus 5.5 | 22/09/2026 | US$ 4 entrada, US$ 20 saída | US$ 5 / US$ 25 (Opus 5) |
| Sonnet 5.5 | 28/09/2026 | US$ 2 entrada, US$ 10 saída (igual ao Sonnet 5) | US$ 2 / US$ 10 (Sonnet 5) |
| Haiku 5.5 | 07/10/2026 | US$ 0,10 entrada, US$ 0,50 saída (até 100 mil tokens) | US$ 1 / US$ 5 (Haiku 4.5) |
Todos os números vêm direto das três páginas de anúncio da Anthropic, que são a fonte primária de preço e benchmark de cada modelo.
Opus 5.5: o mais caro ficou 40 por cento mais barato
O Opus é o modelo mais potente da família, o que a Anthropic recomenda para o trabalho mais difícil. Mesmo assim o preço caiu de US$ 5/US$ 25 por milhão de tokens para US$ 4/US$ 20, e a leitura de cache (reaproveitar contexto já processado, o que pesa bastante em tarefa longa de código) caiu 60 por cento, de US$ 0,50 para US$ 0,20. No benchmark Terminal-Bench 4.0 (teste que mede se o modelo resolve sozinho uma tarefa real de linha de comando, sem ajuda humana no meio), o Opus 5.5 marcou 66,4 por cento contra 52,3 do Opus 5, e também passou do GPT-6 Astra da OpenAI (57,9 por cento) e do próprio Fable 5.1, outro modelo da Anthropic (55,8 por cento), segundo a tabela de comparação que a própria empresa publicou no anúncio.
Sonnet 5.5: mesmo preço, salto de desempenho, e um corte que chegou só essa semana
O Sonnet 5.5 manteve o preço do Sonnet 5 (US$ 2 de entrada, US$ 10 de saída), mas a Anthropic diz que ele usa menos tokens para a mesma tarefa, o que na prática custa até 30 por cento menos por tarefa concluída. No Terminal-Bench 4.0 o salto foi o maior dos três: de 10,3 por cento no Sonnet 5 para 70,6 no Sonnet 5.5, quase sete vezes mais.
O detalhe que só aconteceu esta semana, junto com o lançamento do Haiku: a Anthropic cortou pela metade o preço de leitura de cache do Sonnet 5.5, de US$ 0,20 para US$ 0,10 por milhão de tokens, o que corta cerca de 20 por cento do custo da maioria das tarefas de agente, segundo a própria página de anúncio do Haiku 5.5. Quem já estava rodando Sonnet 5.5 em produção viu a conta cair sem precisar trocar de modelo.
Haiku 5.5: o corte de preço mais agressivo dos três
O Haiku é o modelo pequeno, feito para tarefa de alto volume, e foi onde a queda de preço mais chamou atenção: até 100 mil tokens de prompt, a entrada caiu de US$ 1 para US$ 0,10 por milhão, 90 por cento a menos, e a saída caiu de US$ 5 para US$ 0,50. Acima de 100 mil tokens o corte é menor, mas ainda assim pela metade do preço do Haiku 4.5.
No OSWorld 2.1 (benchmark que testa se o modelo opera um computador sozinho, clicando, digitando e navegando como uma pessoa faria), o Haiku 5.5 marcou 72,4 por cento contra 15,7 do Haiku 4.5, quase cinco vezes mais. No Terminal-Bench 4.0 saiu de 0,0 por cento para 39,2. É também o primeiro Haiku com nível de esforço ajustável, uma régua que deixa escolher entre resposta mais rápida e barata ou mais caprichada, tarefa por tarefa.
A própria Anthropic cita três clientes com resultado medido: a Asana relatou queda de mais de 30 por cento na latência, a HubSpot chegou a 92,8 por cento de acerto numa avaliação interna de CRM, e a Box registrou 11 pontos a mais que o Haiku 4.5 rodando em cerca de metade do tempo.
Por que essa inversão de preço e desempenho importa pra quem constrói automação
Quem monta agente de IA para atendimento, triagem ou automação de WhatsApp (o trabalho que a Mutagex faz todo dia) sente na conta mensal cada centavo por milhão de tokens, porque o volume de mensagem processada é alto e constante. Historicamente modelo novo e melhor custava mais caro, e a escolha era trocar desempenho por custo. Esta leva inverte essa conta: o Haiku 5.5 custa um décimo do Haiku 4.5 e ainda assim resolve mais tarefa de computador sozinho. Isso baixa o piso de custo de operar um agente de atendimento rodando o ano inteiro, sem abrir mão de qualidade.
O nível de esforço ajustável, que chegou primeiro no Opus 5.5 e agora também está no Haiku, é a peça mais prática disso tudo: dá pra configurar o agente para gastar menos processamento numa pergunta simples (tipo "qual o horário de funcionamento") e mais numa complicada (tipo entender o que o cliente quer de verdade), sem trocar de modelo no meio do fluxo.
A ressalva que fica
Todo número de benchmark citado aqui (Terminal-Bench, OSWorld, GDPval-AA) está na própria página de anúncio da Anthropic, não em auditoria independente publicada. É a empresa medindo o próprio produto contra o produto anterior e contra concorrente. Isso não torna o número mentira, mas também não é a mesma coisa que um teste de terceiro sem interesse no resultado. Quem decide trocar de modelo numa automação em produção faz a própria medição, com o próprio volume de mensagem e o próprio caso de uso, antes de confiar na tabela do anúncio como garantia do resultado.