No dia 28 de setembro, a Anthropic (empresa que desenvolve o Claude) lançou o Claude Sonnet 5.5. O anúncio oficial e as release notes da Claude Platform confirmam a data e o identificador do modelo na API, claude-sonnet-5-5, já disponível na Claude API, na Amazon Bedrock, no Google Cloud e no Microsoft Foundry. Até aqui, notícia comum de lançamento de modelo. O que vale a pena entender é o que exatamente melhorou, porque a resposta muda a conta de quem cobra por automação de negócio, não por hora de trabalho.

O que a Anthropic divulgou

Segundo o anúncio oficial, o Sonnet 5.5 marca 70,6% no Terminal-Bench 4.0, uma avaliação de agente que mede se o modelo completa tarefas reais de linha de comando dentro de um ambiente isolado, com teste automático decidindo aprovação ou reprovação ao final. A Anthropic compara com o resultado do modelo anterior, o Sonnet 5, que marcou 10,3% no mesmo teste. Um salto desse tamanho, medido pela própria empresa que fabrica o modelo, pede desconfiança saudável até a comunidade independente validar em cima da mesma metodologia, mas o número já é o suficiente pra explicar por que a Anthropic classifica o lançamento como o Sonnet mais capaz pra tarefa longa, com múltiplos passos.

O número que interessa de verdade

O preço por token não mudou: US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de saída, idêntico ao Sonnet 5, confirmado na tabela de preços da Claude Platform. A Anthropic afirma que o Sonnet 5.5 "gera respostas 30% ou mais rápido que o Sonnet 5" e que "custa até 30% menos por tarefa que seu antecessor", porque precisa de menos tokens e menos passos pra terminar o mesmo trabalho.

Essa é a distinção que costuma passar batido. Preço por token igual não quer dizer custo igual. Se um agente que hoje gasta 12 idas e vindas de ferramenta pra preencher uma planilha passa a resolver em 8, o preço unitário do token não mudou nada, e o custo da execução caiu de verdade. É o mesmo motorista, o mesmo posto de gasolina, só que o carro anda mais longe com o mesmo tanque.

Por que isso muda a conta de quem cobra por automação

Automação de negócio de verdade não roda uma vez, roda toda hora, o dia inteiro, de novo e de novo: uma mensagem de WhatsApp que chega, uma planilha que precisa de dado novo, uma cobrança que precisa sair. A conta de quem entrega isso não é "quanto custa 1 milhão de tokens", é "quanto custa cada execução, multiplicado pelo volume do cliente".

A própria documentação de preços da Claude Platform traz um exemplo nesse formato: processar 10 mil tickets de suporte, cerca de 3.700 tokens por conversa, usando o Claude Haiku 4.5 (o modelo mais barato da família, não o Sonnet 5.5), sai por aproximadamente US$ 37 no total. Não é o mesmo modelo do lançamento desta semana, mas o exemplo mostra o formato de conta que decide se uma automação é viável em escala: custo por execução vezes volume, não o preço de tabela por token.

É exatamente essa conta que aperta o funil de quem constrói automação pra negócio pequeno. O piso de projeto da Mutagex é de R$ 5.000, e o que sobra de margem depois disso depende de quanto cada execução custa de verdade, não do quanto o benchmark do modelo subiu. Um modelo que faz a mesma tarefa em menos passos baixa o custo variável de cada automação em produção, isso é dinheiro que fica com quem construiu o sistema, mês após mês, não só no dia da venda.

A ressalva que vale escrever

Os números de velocidade e custo são "até 30%", não garantidos, e vêm de teste feito pela própria Anthropic, que tem interesse comercial direto no resultado. O modelo tem dois dias de mercado nesta publicação: ainda não existe medição independente de terceiro pra confirmar o ganho fora do laboratório da empresa que o fabrica. Antes de trocar um agente de produção pra Sonnet 5.5 achando que a conta vai cair 30% sozinha, o certo é medir a tarefa real do cliente, contando token e passo de ferramenta, antes e depois. Número sem medição própria vira lenda, e este é um erro que já custou caro antes.