O Claude Haiku 5.5 custa $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, um décimo do preço de $1 e $5 do Haiku 4.5. Isso se aplica a prompts de até 100.000 tokens. Acima dessa linha, toda a solicitação é cobrada a $0,50 e $2,50, que é metade do preço do Haiku 4.5, em vez de um décimo.
A Anthropic coloca a economia típica em cerca de 75%, não 90%, e a diferença vem de três fatores que este post analisa: onde seus prompts se situam em relação à linha de 100K, quantos tokens de pensamento as configurações padrão geram, e um novo tokenizador que conta o mesmo texto como cerca de 30% mais tokens. Dois exemplos práticos abaixo mostram como uma conta real se apresenta.
A tabela de preços
Preços por milhão de tokens, do post de lançamento do Haiku 5.5 e da página de preços da Anthropic:
| Tipo de token | Haiku 5.5, curto | Haiku 5.5, longo | Haiku 4.5 | Soneto 5.5 |
|---|---|---|---|---|
| Entrada | $0,10 | $0,50 | $1,00 | $2,00 |
| Saída | $0,50 | $2,50 | $5,00 | $10,00 |
| Leitura de cache | $0,01 | $0,05 | $0,10 | $0,10 |
| Escrita de cache, 5 min | $0,125 | $0,625 | $1,25 | $2,50 |
| Escrita de cache, 1 hora | $0,20 | $1,00 | $2,00 | $4,00 |
"Curto" significa um prompt de 100.000 tokens ou menos; "longo" significa mais de 100.000. A API Batch reduz em 50% as taxas de entrada e saída. O preço de leitura de cache do Soneto 5.5 foi reduzido de $0,20 para $0,10 no mesmo dia.
A página do Haiku 5.5 no AIHubMix lista os mesmos dois níveis, com pesquisa na web a $0,01 por solicitação.
Regras de cobrança que são fáceis de perder
A solicitação inteira muda de nível, não apenas o excesso. A Anthropic precifica o Haiku 5.5 com duas tabelas de preços escolhidas pelo comprimento do prompt. Um prompt de 100.000 tokens paga $0,0100 por sua entrada; um prompt de 100.001 tokens paga $0,0500, e sua saída também custa cinco vezes mais. O Haiku 5.5 é a exceção aqui: os outros modelos de contexto de 1M atuais da Anthropic cobram a janela inteira em suas taxas padrão.
A linha chega mais cedo do que seus antigos painéis sugerem. O Haiku 5.5 usa um tokenizador mais novo, e o mesmo texto produz cerca de 30% mais tokens do que no Haiku 4.5. Dividir 100.000 por 1,3 coloca a linha perto de 77.000 tokens, como o Haiku 4.5 os contava. Um prompt de 78.000 tokens no seu antigo painel se torna aproximadamente 101.000 tokens no Haiku 5.5, e paga a taxa longa. Essa aritmética vem do número de 30% no guia de migração da Anthropic; o aumento exato depende do conteúdo, então recalcule prompts reais no novo modelo.
Pensar está ativado por padrão, e é cobrado como saída. O Haiku 4.5 só pensava quando solicitado. O Haiku 5.5 executa pensamento adaptativo com esforço médio a menos que você mude, então um caminho que costumava retornar 200 tokens de saída agora pode retornar vários centenas a mais.
Prompts curtos agora podem ser armazenados em cache. O prompt mínimo armazenável em cache cai de 4.096 tokens no Haiku 4.5 para 512 no Haiku 5.5, de acordo com o guia de migração da Anthropic. Um prompt de sistema de 3.000 tokens que nunca poderia ser armazenado em cache no Haiku 4.5 pode ser armazenado agora, e uma leitura de cache custa um décimo da taxa de entrada.
A camada de prioridade não está disponível. Se você tiver um compromisso de Camada de Prioridade no Haiku 4.5, ele não é transferido para o Haiku 5.5. Planeje a capacidade separadamente.
Tokens em cache e a linha de 100K: assuma que eles contam. A Anthropic lista um preço de leitura de cache separado para cada nível, o que sugere que todo o prompt, armazenado em cache ou não, decide o nível. A Anthropic não deixou isso claro, então a suposição segura é que um prefixo em cache de 95K mais uma pergunta de 6K é um prompt longo.
Exemplo prático 1: um classificador de tickets de suporte
Suposições, nas contagens de tokens do Haiku 4.5: um prompt de sistema de 3.000 tokens com definições de ferramentas, um ticket de 1.000 tokens, uma resposta de 200 tokens, e 1 milhão de solicitações por mês. O Haiku 4.5 opera com o pensamento desligado.
No Haiku 5.5, o mesmo texto se torna 3.900 + 1.300 tokens de entrada e uma resposta de 260 tokens. Supõe-se que o pensamento adicione 300 tokens com esforço baixo e 800 com esforço médio. Esses números de pensamento são suposições; meça os seus.
| Configuração | Por solicitação | Por mês |
|---|---|---|
| Haiku 4.5 | $0,00500 | $5.000 |
| Haiku 5.5, baixo, sem cache | $0,00080 | $800 |
| Haiku 5.5, baixo, prefixo em cache | $0,00045 | $453 |
| Haiku 5.5, médio, prefixo em cache | $0,00070 | $703 |
| Soneto 5.5, médio, prefixo em cache | $0,01359 | $13.674 |
As linhas mensais em cache incluem cerca de $4 de escritas de cache para o Haiku 5.5 e cerca de $84 para o Soneto 5.5, assumindo uma escrita de 5 minutos a cada cinco minutos. O Soneto 5.5 usa as mesmas suposições de tokens que o Haiku em nível médio.
Como a linha de baixo em cache se soma: 3.900 tokens em cache a $0,01 por milhão ($0,000039), mais 1.300 tokens de entrada frescos a $0,10 ($0,00013), mais 560 tokens de saída a $0,50 ($0,00028), totalizando $0,000449 por solicitação.
O padrão: o cache e o esforço juntos movem a conta de 16% do custo antigo (sem cache, baixo) para 9% (em cache, baixo). Manter o esforço no padrão em vez de baixo adiciona cerca de $250 por mês a esse volume. Nenhuma escolha importa muito em termos absolutos em comparação com os $5.000 do Haiku 4.5, que é por isso que o caso do classificador é onde o título de 90% é real.
Exemplo prático 2: uma revisão de contrato que ultrapassa a linha
Suposições, nas contagens de tokens do Haiku 4.5: um contrato mais instruções de 70.000 tokens, uma resposta de 1.500 tokens, sem cache. No Haiku 5.5, isso se torna 91.000 tokens de entrada, uma resposta de 1.950 tokens, e um suposto 2.000 tokens de pensamento a médio, totalizando 3.950 tokens de saída.
Agora faça o contrato 14% mais longo: 80.000 tokens no Haiku 4.5, 104.000 no Haiku 5.5.
| Tamanho do contrato (contagem do Haiku 4.5) | Haiku 4.5 | Haiku 5.5 | Mudança |
|---|---|---|---|
| 70.000 tokens | $0,0775 | $0,0111 | 86% mais baixo |
| 80.000 tokens | $0,0875 | $0,0619 | 29% mais baixo |
A segunda linha: 104.000 tokens de entrada a $0,50 por milhão ($0,052) mais 3.950 tokens de saída a $2,50 ($0,0099). Quatorze por cento mais texto custa 5,6 vezes mais no Haiku 5.5.
A solução é ficar abaixo da linha. Dividir o contrato mais longo em duas chamadas de cerca de 53.000 tokens cada (metade do contrato mais as instruções em cada uma) custa cerca de $0,015 no total na taxa curta, menos de um quarto da chamada longa única. Se uma divisão funciona depende da tarefa; a revisão cláusula por cláusula se divide facilmente, uma pergunta que precisa do documento inteiro de uma vez não.
Como se compara em custo por tarefa
Contra o Soneto 5.5, o Haiku 5.5 custa cerca de um vigésimo do preço por token em prompts curtos. Mas o preço por token não é o mesmo que o preço por tarefa finalizada. Em codificação complexa e agente, o Soneto 5.5 pontua 70,6% no Terminal-Bench 4.0 em comparação com 39,2% do Haiku 5.5, nos resultados relatados pela Anthropic, e uma solicitação mais barata que falha e é reprocessada, ou que é refeita por um modelo maior, não é mais barata. O próprio conselho da Anthropic é comparar com o Soneto 5.5 antes de executar o Haiku em xhigh ou max. O Soneto 5.5 também ficou mais barato no mesmo dia: suas leituras de cache foram reduzidas pela metade, o que a Anthropic diz que corta cerca de 20% da maioria dos trabalhos agentes.
Contra o GPT-6 Luna, os preços de lista para prompts curtos são idênticos, incluindo leituras de cache. A diferença é a regra de prompts longos. A taxa de longo contexto do Luna começa acima de 272.000 tokens de entrada e é $0,20 / $0,75, enquanto a do Haiku 5.5 começa acima de 100.000 e é $0,50 / $2,50. Para uma carga de trabalho entre 100K e 272K tokens, o Luna é muito mais barato no preço de lista. Os dois modelos usam tokenizadores diferentes, então compare contas reais, não contagens de tokens.
Os números sobre o limite de 100K e o efeito do tokenizador também foram analisados por Roo's Newsletter, cuja aritmética corresponde aos exemplos acima.
Passos que reduzem a conta
- Conte tokens no novo modelo e alerte antes de 100K. Registre o tamanho total do prompt para cada solicitação e alerte em torno de 90.000 tokens, para que prompts que aumentam sejam cortados ou divididos antes de mudarem de nível.
- Armazene em cache o prefixo estável. Prompt de sistema e definições de ferramentas primeiro, conteúdo variável por último. Com um mínimo de 512 tokens, a maioria dos prompts de sistema de produção agora se qualifica. O guia de cache de prompts do Claude da AIHubMix mostra o formato da solicitação.
- Defina o esforço explicitamente. Use
baixopara rotas simples de alto volume. O padrãomédiocusta mais em cada solicitação, independentemente de a rota precisar ou não. - Defina max_tokens para pensamento mais resposta. Muito pequeno e você paga por pensamento que termina sem resposta.
- Agrupe o que pode esperar. A API Batch reduz pela metade as taxas de entrada e saída.
- Roteie para cima em vez de tentar para baixo. Se um tipo de tarefa falha frequentemente no Haiku, envie-o primeiro para o Soneto 5.5 em vez de pagar por tentativas do Haiku mais um fallback.
Um padrão de registro para os passos 1 e 2 através do endpoint nativo do Claude da AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
SYSTEM_PROMPT = "Você triage tickets de suporte..." # prefixo estável, armazenável em cache
def classify(ticket: str) -> str:
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"},
system=[{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": ticket}],
)
u = r.usage
prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
+ (u.cache_creation_input_tokens or 0))
if prompt_tokens > 90_000:
print(f"aviso: prompt com {prompt_tokens} tokens, perto da linha de preço de 100K")
return next(b.text for b in r.content if b.type == "text")
Se cache_read_input_tokens permanecer em zero em chamadas repetidas, algo no prefixo está mudando entre as solicitações, como um timestamp no prompt do sistema.
FAQ
Quanto custa o Claude Haiku 5.5?
Para prompts de até 100.000 tokens, $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída. Para prompts mais longos, $0,50 e $2,50, aplicados a toda a solicitação. Leituras de cache custam um décimo da taxa de entrada, e a API Batch reduz pela metade os preços de entrada e saída.
O Haiku 5.5 é realmente 90% mais barato que o Haiku 4.5?
Por token, em prompts curtos, sim. Por tarefa, menos: o novo tokenizador conta cerca de 30% mais tokens para o mesmo texto, o pensamento está ativado por padrão, e prompts longos recebem apenas um corte de 50%. A Anthropic estima uma economia típica de cerca de 75%. Um classificador de prompts curtos com cache pode economizar cerca de 90%.
O que acontece se meu prompt estiver um pouco acima de 100.000 tokens?
Toda a solicitação passa para a tabela de preços mais alta, tanto a entrada quanto a saída. No exemplo do contrato acima, 14% mais texto fez a solicitação 5,6 vezes mais cara.
Tokens em cache contam para o limite de 100K?
A Anthropic não declarou isso explicitamente. Seus preços listam preços de leitura de cache separados para cada nível, então a suposição segura é que todo o prompt, armazenado em cache ou não, decide o nível.
Tokens de pensamento custam extra?
Eles são cobrados como tokens de saída na taxa normal de saída. Como o pensamento está ativado por padrão com esforço médio, eles podem adicionar consideravelmente a uma rota que costumava produzir respostas curtas. Reduzir o esforço os diminui.
O Haiku 5.5 é mais barato que o GPT-6 Luna?
Em prompts de até 100K tokens, os preços de lista são os mesmos. Entre 100K e 272K tokens, o Luna mantém sua taxa base enquanto o Haiku 5.5 passa para a mais alta, então o Luna é mais barato lá no preço de lista. Os tokenizadores diferem, então compare contas reais.
Posso usar a Camada de Prioridade com o Haiku 5.5?
Não. A Camada de Prioridade não é suportada no Haiku 5.5, então compromissos no Haiku 4.5 não são transferidos.
Continue lendo: a série Claude Haiku 5.5
- Um preço baixo por token só vale a pena se o modelo puder realizar a tarefa. Para ver como o Haiku 5.5 se compara ao Haiku 4.5, GPT-6 Luna e Soneto 5.5, leia Claude Haiku 5.5 vs Haiku 4.5: O que Dez Centavos Agora Compra
- Tokens de pensamento foram a maior suposição nos exemplos acima. Para contagens de tokens medidas em cada nível de esforço, leia Claude Haiku 5.5 Níveis de Esforço: Médio é o Padrão, Baixo é Muitas Vezes Suficiente
- A mudança de tokenizador e o novo mínimo de cache também aparecem como trabalho de migração. Para os erros e mudanças silenciosas a serem esperadas ao mudar do Haiku 4.5, leia Migrando do Claude Haiku 4.5 para 5.5: Cinco Erros 400 e as Mudanças Silenciosas
Fontes
- Preços (Documentos da Plataforma Claude)
- Introduzindo o Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 no AIHubMix
- Claude Haiku 5.5 Está Disponível a $0,10 por Milhão de Tokens. Leia a Regra de 100K Antes de Migrar (Roo's Newsletter)
- Preços da API GPT-6 Luna (OpenRouter)



