Preços do Claude Haiku 5.5: A Linha de 100K por trás do Corte de 90%

AIHubMix8 min de leitura
Preços do Claude Haiku 5.5: A Linha de 100K por trás do Corte de 90%

O Claude Haiku 5.5 custa $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, um décimo do preço de $1 e $5 do Haiku 4.5. Isso se aplica a prompts de até 100.000 tokens. Acima dessa linha, toda a solicitação é cobrada a $0,50 e $2,50, que é metade do preço do Haiku 4.5, em vez de um décimo.

A Anthropic coloca a economia típica em cerca de 75%, não 90%, e a diferença vem de três fatores que este post analisa: onde seus prompts se situam em relação à linha de 100K, quantos tokens de pensamento as configurações padrão geram, e um novo tokenizador que conta o mesmo texto como cerca de 30% mais tokens. Dois exemplos práticos abaixo mostram como uma conta real se apresenta.

A tabela de preços

Preços por milhão de tokens, do post de lançamento do Haiku 5.5 e da página de preços da Anthropic:

Tipo de token Haiku 5.5, curto Haiku 5.5, longo Haiku 4.5 Soneto 5.5
Entrada $0,10 $0,50 $1,00 $2,00
Saída $0,50 $2,50 $5,00 $10,00
Leitura de cache $0,01 $0,05 $0,10 $0,10
Escrita de cache, 5 min $0,125 $0,625 $1,25 $2,50
Escrita de cache, 1 hora $0,20 $1,00 $2,00 $4,00

"Curto" significa um prompt de 100.000 tokens ou menos; "longo" significa mais de 100.000. A API Batch reduz em 50% as taxas de entrada e saída. O preço de leitura de cache do Soneto 5.5 foi reduzido de $0,20 para $0,10 no mesmo dia.

A página do Haiku 5.5 no AIHubMix lista os mesmos dois níveis, com pesquisa na web a $0,01 por solicitação.

Regras de cobrança que são fáceis de perder

A solicitação inteira muda de nível, não apenas o excesso. A Anthropic precifica o Haiku 5.5 com duas tabelas de preços escolhidas pelo comprimento do prompt. Um prompt de 100.000 tokens paga $0,0100 por sua entrada; um prompt de 100.001 tokens paga $0,0500, e sua saída também custa cinco vezes mais. O Haiku 5.5 é a exceção aqui: os outros modelos de contexto de 1M atuais da Anthropic cobram a janela inteira em suas taxas padrão.

A linha chega mais cedo do que seus antigos painéis sugerem. O Haiku 5.5 usa um tokenizador mais novo, e o mesmo texto produz cerca de 30% mais tokens do que no Haiku 4.5. Dividir 100.000 por 1,3 coloca a linha perto de 77.000 tokens, como o Haiku 4.5 os contava. Um prompt de 78.000 tokens no seu antigo painel se torna aproximadamente 101.000 tokens no Haiku 5.5, e paga a taxa longa. Essa aritmética vem do número de 30% no guia de migração da Anthropic; o aumento exato depende do conteúdo, então recalcule prompts reais no novo modelo.

Pensar está ativado por padrão, e é cobrado como saída. O Haiku 4.5 só pensava quando solicitado. O Haiku 5.5 executa pensamento adaptativo com esforço médio a menos que você mude, então um caminho que costumava retornar 200 tokens de saída agora pode retornar vários centenas a mais.

Prompts curtos agora podem ser armazenados em cache. O prompt mínimo armazenável em cache cai de 4.096 tokens no Haiku 4.5 para 512 no Haiku 5.5, de acordo com o guia de migração da Anthropic. Um prompt de sistema de 3.000 tokens que nunca poderia ser armazenado em cache no Haiku 4.5 pode ser armazenado agora, e uma leitura de cache custa um décimo da taxa de entrada.

A camada de prioridade não está disponível. Se você tiver um compromisso de Camada de Prioridade no Haiku 4.5, ele não é transferido para o Haiku 5.5. Planeje a capacidade separadamente.

Tokens em cache e a linha de 100K: assuma que eles contam. A Anthropic lista um preço de leitura de cache separado para cada nível, o que sugere que todo o prompt, armazenado em cache ou não, decide o nível. A Anthropic não deixou isso claro, então a suposição segura é que um prefixo em cache de 95K mais uma pergunta de 6K é um prompt longo.

Exemplo prático 1: um classificador de tickets de suporte

Suposições, nas contagens de tokens do Haiku 4.5: um prompt de sistema de 3.000 tokens com definições de ferramentas, um ticket de 1.000 tokens, uma resposta de 200 tokens, e 1 milhão de solicitações por mês. O Haiku 4.5 opera com o pensamento desligado.

No Haiku 5.5, o mesmo texto se torna 3.900 + 1.300 tokens de entrada e uma resposta de 260 tokens. Supõe-se que o pensamento adicione 300 tokens com esforço baixo e 800 com esforço médio. Esses números de pensamento são suposições; meça os seus.

Configuração Por solicitação Por mês
Haiku 4.5 $0,00500 $5.000
Haiku 5.5, baixo, sem cache $0,00080 $800
Haiku 5.5, baixo, prefixo em cache $0,00045 $453
Haiku 5.5, médio, prefixo em cache $0,00070 $703
Soneto 5.5, médio, prefixo em cache $0,01359 $13.674

As linhas mensais em cache incluem cerca de $4 de escritas de cache para o Haiku 5.5 e cerca de $84 para o Soneto 5.5, assumindo uma escrita de 5 minutos a cada cinco minutos. O Soneto 5.5 usa as mesmas suposições de tokens que o Haiku em nível médio.

Como a linha de baixo em cache se soma: 3.900 tokens em cache a $0,01 por milhão ($0,000039), mais 1.300 tokens de entrada frescos a $0,10 ($0,00013), mais 560 tokens de saída a $0,50 ($0,00028), totalizando $0,000449 por solicitação.

O padrão: o cache e o esforço juntos movem a conta de 16% do custo antigo (sem cache, baixo) para 9% (em cache, baixo). Manter o esforço no padrão em vez de baixo adiciona cerca de $250 por mês a esse volume. Nenhuma escolha importa muito em termos absolutos em comparação com os $5.000 do Haiku 4.5, que é por isso que o caso do classificador é onde o título de 90% é real.

Exemplo prático 2: uma revisão de contrato que ultrapassa a linha

Suposições, nas contagens de tokens do Haiku 4.5: um contrato mais instruções de 70.000 tokens, uma resposta de 1.500 tokens, sem cache. No Haiku 5.5, isso se torna 91.000 tokens de entrada, uma resposta de 1.950 tokens, e um suposto 2.000 tokens de pensamento a médio, totalizando 3.950 tokens de saída.

Agora faça o contrato 14% mais longo: 80.000 tokens no Haiku 4.5, 104.000 no Haiku 5.5.

Tamanho do contrato (contagem do Haiku 4.5) Haiku 4.5 Haiku 5.5 Mudança
70.000 tokens $0,0775 $0,0111 86% mais baixo
80.000 tokens $0,0875 $0,0619 29% mais baixo

A segunda linha: 104.000 tokens de entrada a $0,50 por milhão ($0,052) mais 3.950 tokens de saída a $2,50 ($0,0099). Quatorze por cento mais texto custa 5,6 vezes mais no Haiku 5.5.

A solução é ficar abaixo da linha. Dividir o contrato mais longo em duas chamadas de cerca de 53.000 tokens cada (metade do contrato mais as instruções em cada uma) custa cerca de $0,015 no total na taxa curta, menos de um quarto da chamada longa única. Se uma divisão funciona depende da tarefa; a revisão cláusula por cláusula se divide facilmente, uma pergunta que precisa do documento inteiro de uma vez não.

Como se compara em custo por tarefa

Contra o Soneto 5.5, o Haiku 5.5 custa cerca de um vigésimo do preço por token em prompts curtos. Mas o preço por token não é o mesmo que o preço por tarefa finalizada. Em codificação complexa e agente, o Soneto 5.5 pontua 70,6% no Terminal-Bench 4.0 em comparação com 39,2% do Haiku 5.5, nos resultados relatados pela Anthropic, e uma solicitação mais barata que falha e é reprocessada, ou que é refeita por um modelo maior, não é mais barata. O próprio conselho da Anthropic é comparar com o Soneto 5.5 antes de executar o Haiku em xhigh ou max. O Soneto 5.5 também ficou mais barato no mesmo dia: suas leituras de cache foram reduzidas pela metade, o que a Anthropic diz que corta cerca de 20% da maioria dos trabalhos agentes.

Contra o GPT-6 Luna, os preços de lista para prompts curtos são idênticos, incluindo leituras de cache. A diferença é a regra de prompts longos. A taxa de longo contexto do Luna começa acima de 272.000 tokens de entrada e é $0,20 / $0,75, enquanto a do Haiku 5.5 começa acima de 100.000 e é $0,50 / $2,50. Para uma carga de trabalho entre 100K e 272K tokens, o Luna é muito mais barato no preço de lista. Os dois modelos usam tokenizadores diferentes, então compare contas reais, não contagens de tokens.

Os números sobre o limite de 100K e o efeito do tokenizador também foram analisados por Roo's Newsletter, cuja aritmética corresponde aos exemplos acima.

Passos que reduzem a conta

  1. Conte tokens no novo modelo e alerte antes de 100K. Registre o tamanho total do prompt para cada solicitação e alerte em torno de 90.000 tokens, para que prompts que aumentam sejam cortados ou divididos antes de mudarem de nível.
  2. Armazene em cache o prefixo estável. Prompt de sistema e definições de ferramentas primeiro, conteúdo variável por último. Com um mínimo de 512 tokens, a maioria dos prompts de sistema de produção agora se qualifica. O guia de cache de prompts do Claude da AIHubMix mostra o formato da solicitação.
  3. Defina o esforço explicitamente. Use baixo para rotas simples de alto volume. O padrão médio custa mais em cada solicitação, independentemente de a rota precisar ou não.
  4. Defina max_tokens para pensamento mais resposta. Muito pequeno e você paga por pensamento que termina sem resposta.
  5. Agrupe o que pode esperar. A API Batch reduz pela metade as taxas de entrada e saída.
  6. Roteie para cima em vez de tentar para baixo. Se um tipo de tarefa falha frequentemente no Haiku, envie-o primeiro para o Soneto 5.5 em vez de pagar por tentativas do Haiku mais um fallback.

Um padrão de registro para os passos 1 e 2 através do endpoint nativo do Claude da AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Você triage tickets de suporte..."  # prefixo estável, armazenável em cache

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"aviso: prompt com {prompt_tokens} tokens, perto da linha de preço de 100K")
    return next(b.text for b in r.content if b.type == "text")

Se cache_read_input_tokens permanecer em zero em chamadas repetidas, algo no prefixo está mudando entre as solicitações, como um timestamp no prompt do sistema.

FAQ

Quanto custa o Claude Haiku 5.5?
Para prompts de até 100.000 tokens, $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída. Para prompts mais longos, $0,50 e $2,50, aplicados a toda a solicitação. Leituras de cache custam um décimo da taxa de entrada, e a API Batch reduz pela metade os preços de entrada e saída.

O Haiku 5.5 é realmente 90% mais barato que o Haiku 4.5?
Por token, em prompts curtos, sim. Por tarefa, menos: o novo tokenizador conta cerca de 30% mais tokens para o mesmo texto, o pensamento está ativado por padrão, e prompts longos recebem apenas um corte de 50%. A Anthropic estima uma economia típica de cerca de 75%. Um classificador de prompts curtos com cache pode economizar cerca de 90%.

O que acontece se meu prompt estiver um pouco acima de 100.000 tokens?
Toda a solicitação passa para a tabela de preços mais alta, tanto a entrada quanto a saída. No exemplo do contrato acima, 14% mais texto fez a solicitação 5,6 vezes mais cara.

Tokens em cache contam para o limite de 100K?
A Anthropic não declarou isso explicitamente. Seus preços listam preços de leitura de cache separados para cada nível, então a suposição segura é que todo o prompt, armazenado em cache ou não, decide o nível.

Tokens de pensamento custam extra?
Eles são cobrados como tokens de saída na taxa normal de saída. Como o pensamento está ativado por padrão com esforço médio, eles podem adicionar consideravelmente a uma rota que costumava produzir respostas curtas. Reduzir o esforço os diminui.

O Haiku 5.5 é mais barato que o GPT-6 Luna?
Em prompts de até 100K tokens, os preços de lista são os mesmos. Entre 100K e 272K tokens, o Luna mantém sua taxa base enquanto o Haiku 5.5 passa para a mais alta, então o Luna é mais barato lá no preço de lista. Os tokenizadores diferem, então compare contas reais.

Posso usar a Camada de Prioridade com o Haiku 5.5?
Não. A Camada de Prioridade não é suportada no Haiku 5.5, então compromissos no Haiku 4.5 não são transferidos.

Continue lendo: a série Claude Haiku 5.5

Fontes