Tela com código em destaque representando sessões longas de desenvolvimento
IA Generativa

Anthropic: Claude Opus 5.5 corta custos de código em 40%

Novo modelo da Anthropic reduz preços por token, barateia leituras de cache e acelera saídas. Entenda o que muda nos seus fluxos de codificação e como capturar a economia no dia a dia.

Danilo Gato

Danilo Gato

Autor

25 de setembro de 2026
11 min de leitura

Introdução

Anthropic lançou o Claude Opus 5.5 com preços otimizados por cache e foco em sessões de codificação que usam mais contexto, com a promessa de reduzir custos em cerca de 40% em cargas típicas. A palavra‑chave aqui é Claude Opus 5.5, porque a queda não é só uma tabela mais barata, é uma mudança na dinâmica de como o modelo lê, reutiliza e conclui tarefas em menos turnos. (claude.com)

A data importa, o anúncio saiu em 24 de setembro de 2026, e foi acompanhado por uma análise com exemplos numéricos, que mostram por que o ganho aparece mais forte em sessões longas e com muitos reenvios de contexto via cache. Opus 5.5 custa menos por token, lê mais do cache por muito menos e, com frequência, precisa de menos iterações para terminar o mesmo trabalho. (claude.com)

Este guia entra direto no que muda nos preços, no comportamento do cache e nos hábitos práticos que destravam a economia. Também traz orientações de configuração do TTL de cache, além de um resumo dos dados que a Anthropic vem observando no uso do Claude Code em março a setembro de 2026.

O que muda no preço, linha por linha

Os novos valores de lista do Opus 5.5 na API são claros. Entrada a 4 dólares por milhão de tokens, saída a 20 dólares por milhão e leitura de cache a 0,20 dólar por milhão. Na prática, é uma queda de 20% em entrada e saída em relação ao Opus 5, com corte de 60% no preço da leitura de cache, de 0,50 para 0,20. O write de cache desce para 5 dólares por milhão. Esses números aparecem tanto na página de preços quanto nos posts técnicos. (claude.com)

Por que isso move o ponteiro mais do que parece. Em agentes e em sessões de código, a maior parte do custo de entrada vem de releituras da mesma conversa, que são justamente cobradas como cache read. Se sua sessão tem 90% de acerto de cache, cair de 0,50 para 0,20 por milhão derruba a maior linha do seu “recibo” de uso. O próprio breakdown ilustrativo da Anthropic mostra uma sessão que fica 31% mais barata só pela troca de modelo com os mesmos tokens, e que pode passar dos 40% quando o 5.5 reduz turnos e acerta mais cedo. (claude.com)

Além disso, o Opus 5.5 roda mais rápido. A Anthropic indica mais de 30% de ganho de velocidade de saída em relação ao Opus 5, o que não muda a conta diretamente, mas reduz espera em execuções longas. (claude.com)

Sessões de código 2026, mais contexto e menos interrupções

O time do Claude Code analisou uso agregado de março a setembro de 2026 e encontrou um padrão. As sessões estão mais longas, cada prompt “trabalha” 3,3 vezes mais, com mais de 40% de chamadas por prompt, 68% menos interrupções e um crescimento de 2,6 vezes na quantidade de contexto por requisição. O rácio entrada para saída saltou de 189:1 para 324:1. O recado é simples, Claude lê muito mais tokens, e é aí que cache inteligente paga a conta. (claude.com)

Para esses cenários, o Opus 5.5 vem afinado em três frentes, preço, comportamento do modelo e melhorias no harness do Claude Code que evitam “quebrar” o cache por detalhes como renovar login, mudar esforço ou carregar ferramentas no meio da conversa. Até subagentes passam a herdar o cache do pai ao serem criados por fork, reduzindo recomputações caras. (claude.com)

Cache na prática, como extrair a economia

O cache é um prefixo da sua conversa que fica disponível para releitura a um custo muito menor do que reler tudo como entrada “fresca”. Dois controles importam, o acerto de cache por turno e o tempo de vida do cache, o TTL. Por padrão, a API oferece duas opções, 5 minutos e 1 hora. O TTL de 1 hora mantém o cache aquecido por pausas maiores, porém cobra writes a uma tarifa mais alta. No Claude Code, você pode pedir o TTL de 1 hora até mesmo quando está em API key, definindo promptCacheTtl=1h ou a variável de ambiente correspondente. (code.claude.com)

Existe também uma regra de buckets. O “main conversation” ganha 1 hora por padrão quando você está em assinatura dentro do uso incluso, e 5 minutos quando está fora disso ou em API key. Itens fora da conversa principal, como subagentes e workflows, usam 5 minutos por padrão, a menos que você configure explicitamente. Essa distinção explica por que alguns turnos ainda mostram miss de cache mesmo com a conversa principal estável. (code.claude.com)

Checklist rápido para proteger leituras do cache no Opus 5.5, escolhido no início da sessão, não troque de modelo no meio. Faça compaction antes de se ausentar, não depois. Evite alterações que toquem o prefixo, por exemplo mexer em system prompt ou redefinir ferramentas a cada turno. E, para sessões longas, force TTL de 1 hora no bucket principal se estiver em API key. (claude.com)

O que muda no custo por tarefa, além da tarifa por token

Preço por token não conta a história inteira. Tarefas custam o que for preciso para terminar, e isso depende de quantos turnos cada modelo exige. Cada turno reenvia todo o histórico, então um modelo que precisa de menos turnos para chegar ao mesmo resultado consome menos entrada, ainda que o preço por token fosse idêntico. No comparativo que a Anthropic publicou, há cenários de escopo fechado em que o ganho é só o corte de 20% em entrada e saída. Em tarefas abertas, com risco de falsa partida, a diferença cresce porque o 5.5 evita gastar turnos na direção errada. (claude.com)

A peça “What a task costs on Opus 5.5” também traz números didáticos. Em uma tarefa que começa com 20 mil tokens de contexto e cresce para 120 mil, 40 turnos custam cerca de 2,8 milhões de tokens de entrada, enquanto 25 turnos caem para 1,75 milhão. Mantido um acerto de cache de 90%, o custo de entrada cai de 1,62 dólar para 1,02 dólar nesse exemplo simplificado. É essa matemática que faz cache e redução de turnos baterem mais do que uma simples mudança de tabela. (claude.com)

Tabela de preços, recados para migração e modo rápido

Na página de preços, além de Opus 5.5 a 4, 20 e 0,20 por milhão, dá para checar os demais modelos e a relação com o cache. Sonnet 5, Haiku 4.5 e Fable 5.1 têm estruturas diferentes. Fable 5.1, por exemplo, usa 0,25 por milhão para leitura de cache, 1,25 vezes a taxa do 5.5. Também há anotações sobre modo rápido no próprio Opus 5.5, que pode entregar até 2,5 vezes mais velocidade a 2 vezes o preço padrão, útil quando o latência manda. E existe a opção de inferência somente nos Estados Unidos com multiplicador de 1,1 em entrada e saída. (claude.com)

Ilustração do artigo

Para quem usa Claude via API HTTP, os parâmetros de cache aparecem no campo cache_control com TTL de 1 hora como opção, então equipes podem alinhar o comportamento do cache no código, e não só na CLI do Claude Code. Isso ajuda quando a conversa não acontece no terminal, mas sim em uma automação própria ou em um gateway. (platform.claude.com)

Dados do anúncio, por que o 5.5 é adequado a sessões com mais contexto

O post de lançamento traz três pilares do ganho em sessões longas. Primeiro, o cache ficou mais barato. Segundo, o harness do Claude Code passou a evitar miss de cache em situações corriqueiras, e permite alterar nível de esforço sem resetar o cache nos modelos mais novos, como Opus 5.5 e Fable 5.1. Terceiro, o próprio Opus 5.5 tende a fechar a tarefa com menos turnos do que o Opus 5, o que se traduziu em menos tool calls e custo quase pela metade em testes de parceiros como a Zeta Labs. Além disso, geração de saída 30% mais rápida encurta filas em execuções extensas. (claude.com)

Há também uma comparação com concorrentes. A Anthropic afirma que, na data da publicação, um token de cache lido no Opus 5.5 custa um quinto do que custa em modelos concorrentes, mantendo desempenho superior. O ponto não é só pagar menos pelo token, é pagar menos exatamente na linha que mais pesa quando o fluxo é de agentes. (claude.com)

Exemplos numéricos, como simular sua própria conta

Um jeito simples de estimar o efeito no seu cenário é separar quatro componentes, turnos, taxa de acerto de cache, distribuição entre entrada fresca e leitura de cache e tokens de saída. Com os preços do 5.5, uma sessão com 2,8 milhões de tokens de entrada, 90% de acerto de cache e 60 mil de saída fica aproximadamente com 1,62 dólar em entrada e 1,20 dólar em saída, além da fração de 0,20 por milhão para as releituras do cache. Se cair para 25 turnos, a mesma tarefa aproxima 1,02 dólar de entrada, com o mesmo 1,20 de saída. O quadro de exemplos e o “recibo” interativo no post técnico ajudam a ajustar esses sliders para a sua realidade. (claude.com)

Duas regras práticas que sempre se confirmam. O turno mais barato é o turno que você não precisa. E a linha de cache move mais o custo total do que qualquer outro ajuste, desde que você mantenha o prefixo estável e o TTL adequado para o seu padrão de pausas. (claude.com)

Como configurar TTL e monitorar acertos, passo a passo

Para sessões em API key ou em provedores de nuvem, defina promptCacheTtl=1h para dar 1 hora ao bucket da conversa principal. O restante fica em 5 minutos até você ajustar subagentPromptCacheTtl. Caso sua assinatura ultrapasse o uso incluso e passe a usar “usage credits”, o Claude Code volta a pedir 5 minutos por padrão no bucket principal, então vale travar manualmente para 1 hora quando seu padrão inclui pausas longas. (code.claude.com)

Na API HTTP, o cache_control aceita TTLs ephemerais, inclusive 1 hora, e o relatório de uso expõe cache_read_input_tokens e cache_creation_input_tokens. Um alto rácio de leitura para criação indica cache saudável. No terminal do Claude Code, o comando /usage mostra o hit ratio, misses e se o cache está quente, além de apontar a provável causa do último miss. (platform.claude.com)

Benchmarks e cobertura independente

Publicações setoriais e laboratórios de custo de LLMs repercutiram os números do 5.5, citando a queda de 20% em entrada e saída, 60% em leitura de cache e a economia efetiva de tarefas próxima de 40% quando o modelo reduz turnos. Há também comparativos de preço com o Fable 5.1, cujo cache read fica em 0,25 por milhão, 1,25 vez a taxa do Opus 5.5. Essas leituras confirmam a direção do anúncio, ainda que recomendem medir no seu próprio tráfego. (venturebeat.com)

Em outras palavras, a economia prometida não é só “tabela nova”, é “tarefa fechada mais cedo” com menos iteração. E isso depende do quanto você consegue manter o cache aquecido, evitar alterações de prefixo e guiar o modelo para validar hipóteses com testes e builds automáticos antes de expandir o escopo. (claude.com)

Boas práticas para times que usam agentes

  • Escolher modelo logo no começo da sessão, evite alternância. (claude.com)
  • Compactar a conversa antes de pausas longas, manter prefixo estável. (claude.com)
  • Forcar TTL de 1 hora na conversa principal quando o padrão inclui pausas, especialmente em API key. (code.claude.com)
  • Medir custo por tarefa, não por token, e monitorar turnos e acerto de cache. (claude.com)
  • Automatizar checagens, testes e builds para cortar voltas desnecessárias. (claude.com)

Conclusão

Opus 5.5 não muda só a etiqueta de preço, muda o equilíbrio entre leitura de contexto e iterações. O corte de 20% em entrada e saída e de 60% em cache read ataca exatamente onde o custo de agentes e sessões longas pesa. Quando o fluxo é projetado para manter cache estável e cortar turnos, a economia real de tarefa tende a se aproximar dos 40% relatados nos posts de lançamento.

Para capturar tudo isso, vale um pequeno investimento de engenharia, ajustar TTLs, revisar hábitos que quebram cache e checar custos por tarefa no seu repositório, com seus testes e ferramentas. O resultado, sessões que usam mais contexto, pagam muito menos pelas releituras e avançam mais rápido do início ao fim. (claude.com)

Leia também

Inteligência Artificial

SpaceXAI lança Grok 4.7, código veloz por US$2/M, metade

Grok 4.7 é o novo modelo da SpaceXAI para codificação, agentes e conhecimento. Chega a US$2 por milhão de tokens de entrada e US$6 por milhão de saída, com opção Fast em infraestrutura acelerada. Veja desempenho, custos reais por tarefa, casos de uso e como integrar na pilha atual.

8 min de leitura
IA Generativa

Qwen-Image-2.1 Alibaba une geração, edição e transparência

Qwen-Image-2.1 consolida geração, edição e transparência nativa em um único modelo open source. Com 7B de parâmetros no componente visual, suporte a até 10 imagens de referência e arquitetura otimizada, ele promete acelerar design, e-commerce e criação de conteúdo. Entenda o que muda na prática, os impactos da licença e como começar.

9 min de leitura
IA Generativa

OpenAI lança GPT-6 Sol e Luna com 50% mais baratos

OpenAI apresentou os modelos GPT-6 Sol e GPT-6 Luna com cortes de 50% no preço em relação aos equivalentes GPT-5.6. Além da redução de custos, há melhorias em factualidade, coding e uso de computador, além de caching otimizado que reduz leituras não-cacheadas segundo a GitHub. Veja impactos práticos, preços e quando adotar cada modelo.

9 min de leitura
IA Generativa

Anthropic lança Claude Opus 5.5, 40% mais barato, líder

Claude Opus 5.5 marca um avanço prático no agentic coding. A Anthropic afirma reduzir custos em 40 a 50 por cento em tarefas de codificação com agentes, entregar respostas mais rápidas e ampliar recursos para trabalhos longos. Veja como isso afeta orçamentos, pipelines e arquitetura de apps.

9 min de leitura

Tags

Claude CodeLLMPrompt Caching