Claude Haiku 5.5 chega mais barato: o detalhe que muda a conta dos seus agentes
Claude Haiku 5.5 reduz o preço para agentes de IA, mas cobra mais acima de 100 mil tokens. Entenda os custos reais e os novos créditos de API.
A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026, com a proposta de baratear tarefas rápidas e repetitivas feitas por agentes de IA. A empresa anuncia uma economia média de aproximadamente 75% em relação ao Haiku 4.5. Mas a tabela tem duas faixas, e a mais barata termina quando a entrada passa de 100 mil tokens.
Este artigo é uma leitura do anúncio e da documentação oficial, com foco na conta de quem usa IA dentro de uma empresa. Os valores abaixo são da API, o serviço usado para conectar o modelo a aplicativos e automações. São diferentes da mensalidade do aplicativo Claude.
Quanto custa o Claude Haiku 5.5?
O Haiku 5.5 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída quando a entrada da requisição tem até 100 mil tokens. Acima disso, os valores sobem para US$ 0,50 e US$ 2,50, respectivamente, conforme a documentação do modelo.
Tokens são os pedaços de texto usados para medir o consumo do modelo. Entrada é o material que você envia, como instruções, conversa e documentos. Saída é o conteúdo que a IA produz.
| Modelo e faixa de entrada | Entrada por milhão de tokens | Saída por milhão de tokens |
|---|---|---|
| Haiku 4.5 | US$ 1,00 | US$ 5,00 |
| Haiku 5.5, até 100 mil tokens | US$ 0,10 | US$ 0,50 |
| Haiku 5.5, acima de 100 mil tokens | US$ 0,50 | US$ 2,50 |
Fonte: tabela oficial de preços da Anthropic. Valores em dólares, sem considerar outros serviços, impostos ou conversão para reais.
A redução da tarifa é de 90% na faixa curta e de 50% na faixa longa, comparando os mesmos números de tokens. O desconto existe nos dois casos. O tamanho do pedido determina qual deles entra na conta.
Por que a economia anunciada é de 75%, e não de 90%?
Os 75% são uma estimativa média de custo por trabalho apresentada pela Anthropic. Já os 90% comparam a tarifa por token dos pedidos curtos. A nota do anúncio diz que a estimativa também considera mudanças no consumo de tokens e que cerca de 90% das requisições ao Haiku anterior ficavam na faixa de até 100 mil.
Há uma mudança de medição: o guia de migração informa que o mesmo texto gera aproximadamente 30% mais tokens no Haiku 5.5 do que no 4.5. O aumento exato depende do conteúdo. Reaproveitar a contagem antiga pode subestimar o tamanho da entrada e o custo.
Um exemplo hipotético ajuda. Se um documento consumia 80 mil tokens e o aumento fosse exatamente 30%, passaria a consumir 104 mil. O material ultrapassaria a fronteira da tarifa curta, mesmo sem receber uma linha nova.
Esse cálculo ilustra a regra. Não é uma medição nossa de um documento real, nem uma previsão de quanto sua automação vai economizar.
O que acontece quando a entrada passa de 100 mil tokens?
A requisição passa a usar a tabela mais cara do Haiku 5.5, inclusive para a saída. A página de preços diferencia pedidos pela extensão da entrada. A tarifa superior se aplica à requisição inteira, não apenas ao trecho que excedeu a fronteira.
Vamos comparar dois pedidos fictícios, sem cache e com uma saída de 2 mil tokens:
| Entrada | Custo da entrada | Custo da saída | Total aproximado |
|---|---|---|---|
| 100 mil tokens | US$ 0,010000 | US$ 0,001000 | US$ 0,011000 |
| 100.001 tokens | US$ 0,0500005 | US$ 0,005000 | US$ 0,0550005 |
Os totais são cálculos deste artigo usando as tarifas oficiais. Não incluem ferramentas cobradas à parte, armazenamento nem outros componentes da aplicação.
Nesse exemplo, acrescentar um token à entrada faz o pedido custar aproximadamente cinco vezes mais. Isso acontece porque ele muda de faixa, e não pelo custo isolado daquele token.
Em 10 mil pedidos iguais por mês, os totais seriam cerca de US$ 110 e US$ 550. O exemplo mostra por que vale medir o material enviado em cada chamada, especialmente quando um agente acumula conversas e resultados de pesquisas.
Que tipo de tarefa combina com o modelo novo?
O Haiku 5.5 foi descrito para tarefas de alto volume e baixa demora, como classificação, extração de dados e encaminhamento de pedidos. Segundo a ficha oficial, ele recebe texto e imagens, produz texto, aceita contexto de até 1 milhão de tokens e tem saída máxima padrão de 128 mil tokens.
Contexto é a quantidade de material que o modelo consegue receber numa interação. Ter espaço para 1 milhão de tokens não significa pagar a tarifa curta ao usar todo esse espaço: a fronteira de preço continua em 100 mil.
Um exemplo de classificação seria ler uma mensagem de atendimento e dizer se ela trata de cobrança, entrega ou troca. Um exemplo de extração seria devolver os campos de um pedido, como produto, quantidade e endereço. São exemplos ilustrativos do tipo de trabalho, não testes feitos pelo ibe.IA.
Já uma tarefa que exige investigar vários sistemas e decidir mudanças dependentes umas das outras pode exigir outra capacidade. No anúncio, a Anthropic mantém Sonnet 5.5 e Opus 5.5 como opções melhores para trabalho complexo de criação com agentes.
Os benchmarks mostram que ele substitui os modelos maiores?
Os resultados divulgados mostram ganhos sobre o Haiku 4.5, mas também diferenças relevantes em relação ao Sonnet 5.5. No Terminal-Bench 4.0, teste de tarefas com agentes no terminal, o anúncio informa 39,2% para o Haiku 5.5 e 70,6% para o Sonnet 5.5.
São resultados publicados pelo fornecedor, nas condições de avaliação dele. Não representam uma taxa garantida de sucesso no atendimento da sua empresa ou no aplicativo que você está criando.
Uma consequência prática é comparar custo por tarefa aceita, incluindo as tentativas que precisam ser refeitas. Se um modelo barato devolve uma classificação incorreta e outro precisa corrigir, a economia do primeiro pedido não descreve o trabalho inteiro.
Num teste da sua operação, dá para separar exemplos conhecidos: mensagens simples, mensagens ambíguas e casos que dependem de documentos. O resultado observado em cada grupo ajuda a decidir quais tarefas podem usar o modelo menor. Essa é uma proposta de avaliação, não uma conclusão de benchmark.
O que mudou no preço do Sonnet 5.5?
A leitura de cache do Sonnet 5.5 caiu de US$ 0,20 para US$ 0,10 por milhão de tokens. A Anthropic anunciou a mudança junto com o Haiku e estima uma redução de aproximadamente 20% no custo de boa parte do trabalho com agentes, dependendo da proporção de conteúdo reutilizado.
Cache permite reaproveitar partes da entrada já processadas, como um conjunto de instruções ou documentos repetidos. A documentação de preços separa a cobrança de gravar esse conteúdo da cobrança de lê-lo depois.
Por exemplo, ler 20 milhões de tokens do cache do Sonnet custava US$ 4 pela tarifa antiga e passa a custar US$ 2. Essa conta cobre somente as leituras. Ela não reduz pela metade o valor dos tokens novos nem da resposta.
Quem recebe os novos créditos de API?
Os planos Max e Team passam a incluir créditos mensais para a Claude Platform, com liberação gradual ao longo de alguns dias. O Help Center detalha os valores e exige vincular uma organização do Console à assinatura.
| Plano | Crédito mensal |
|---|---|
| Max 5x | US$ 100 |
| Max 20x | US$ 200 |
| Team Standard | US$ 20 por assento |
| Team Premium | US$ 100 por assento |
No Team, os valores são somados num saldo compartilhado com teto de US$ 500 por mês. Uma equipe com três assentos Standard e dois Premium recebe US$ 260, exemplo apresentado pelo próprio suporte.
Free, Pro e Enterprise não são elegíveis. Novos assinantes precisam completar sete dias num plano elegível. Os créditos não utilizados expiram ao fim do ciclo e não aumentam os limites de uso interativo do Claude, Claude Code ou Cowork.
Eles cobrem o consumo elegível na Claude Platform, como a API e o Agent SDK. Não pagam sessões interativas do Claude Code nem o uso em plataformas parceiras como Bedrock. O suporte também diferencia execuções próprias com chave de API de sessões autenticadas pela assinatura. Essa distinção evita confundir saldo para uma aplicação com limite para conversar no aplicativo.
Trocar o Haiku 4.5 pelo 5.5 exige ajustes?
Sim. O guia de migração pede mais do que mudar o identificador do modelo. Além de recontar tokens, integrações precisam revisar parâmetros de geração, configuração de raciocínio e a forma de ler a resposta.
O modelo usa raciocínio adaptativo por padrão, com esforço ajustável.
Uma integração que trata o primeiro bloco retornado como resposta final pode precisar selecionar os blocos pelo tipo. Também há alterações em parâmetros como temperature, top_p e top_k.
Para quem usa uma ferramenta pronta, esses ajustes dependem de como o fornecedor integrou o novo modelo. Para uma aplicação própria, comparar respostas e custos antes de mudar a operação inteira ajuda a encontrar incompatibilidades que a tabela de preços não mostra.
Como essa notícia entra na conta de uma empresa?
O lançamento abre uma opção mais barata para trabalho delimitado e repetido, mas o tamanho das entradas e a qualidade das respostas continuam determinando a conta. A diferença entre US$ 110 e US$ 550 no exemplo deste artigo nasce de uma fronteira de cobrança. Já o custo das correções depende da tarefa que a empresa coloca nas mãos do agente.
Minha leitura é que o ganho está em conhecer bem a tarefa antes de escolher o modelo. Triagem de mensagens, extração de campos e investigação de um problema complexo podem receber o mesmo nome de “automação”, mas exigem avaliações diferentes.
A Formação em IA para Negócios do ibe.IA ensina a aplicar IA em marketing, atendimento, vendas e análise dentro da empresa.
Conheça a Formação em IA para Negócios.
Para acompanhar outras leituras dos anúncios e do que muda no trabalho, o ibe.IA também está no Instagram: @ibe.ia.
Fonte
- Anthropic: Claude Haiku 5.5, anúncio de 7 de outubro de 2026.
- Claude Platform: Especificações e disponibilidade do Haiku 5.5.
- Claude Platform: Preços de modelos, cache e contexto longo.
- Claude Platform: Guia de migração do Haiku 4.5 para o 5.5.
- Claude Help Center: Créditos mensais de API para Max e Team.
Materiais Gratuitos
Crie um SaaS que paga suas contas
Aula gratuita: aprenda a criar aplicativos web e mobile com Vibe Coding e IA, sem saber programar. Nossos alunos publicam o primeiro app em menos de 7 dias.
Assistir Aula Gratuita →Fature R$12k/mês como Gestor de IA
Aula gratuita: descubra a profissão do Gestor de IA. Aprenda a criar agentes e automações com n8n e fature R$12 mil/mês trabalhando de casa, sem programar.
Assistir Aula Gratuita →3 formações em 1
Tudo que você precisa para dominar IA
Vibe Coding + Agentes IA + IA para Negócios em um único pacote.
Formação em Vibe Coding
Aprenda a criar Apps, SaaS e plataformas completas com Vibe Coding e IA.
-
Claude Code
-
Cursor
-
Antigravity
-
Lovable
-
Supabase
Formação em Agentes IA e Automações
Domine Agentes IA e Automações para atender clientes no WhatsApp, otimizar processos e eliminar trabalho repetitivo.
-
n8n
-
SquadOS
Formação em IA para Negócios
Implemente IA em todos os departamentos da empresa: conteúdo, marketing, imagens, vídeos, gestão e análise de dados.
-
Claude Cowork
-
Claude Code
-
ChatGPT
-
Magnific
-
Heygen


