Claude Haiku 5.5 vs Haiku 4.5: O que dez centavos compram agora

AIHubMix8 min de leitura
Claude Haiku 5.5 vs Haiku 4.5: O que dez centavos compram agora

Claude Haiku 4.5 obteve 0,0% no Terminal-Bench 4.0. Claude Haiku 5.5 obteve 39,2%, e custa um décimo do preço por token: $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, contra $1 e $5 para Haiku 4.5.

Essa é a atualização em uma linha. O pequeno modelo Claude passou de "bom para classificação, não para agentes" para um subagente utilizável, e seu preço agora se iguala ao do GPT-6 Luna da OpenAI ao centavo. A Anthropic lançou-o em 7 de outubro de 2026 como Claude Haiku 5.5, ID do modelo claude-haiku-5-5, e já está listado no AIHubMix.

O preço vem com condições, assim como as pontuações de benchmark. Este post cobre o que mudou, quão perto Haiku 5.5 chega do Sonnet 5.5, onde é a escolha errada e quem deve mudar agora.

O que mudou e o que não mudou

Haiku 4.5 Haiku 5.5
Preço de entrada / saída $1 / $5 $0,10 / $0,50
Janela de contexto 200K 1M
Saída máxima 64K 128K
Pensamento Orçamento manual, desligado por padrão Adaptativo, ligado por padrão
Níveis de esforço Nenhum Cinco, padrão médio
Tokens para o mesmo texto Base Cerca de 30% a mais
Ferramenta de uso do navegador Não Sim

Os preços do Haiku 5.5 se aplicam a prompts de até 100K tokens; prompts mais longos pagam $0,50 / $2,50. Os preços são por milhão de tokens.

O que permanece o mesmo: a descrição do trabalho. A Anthropic ainda direciona o Haiku para trabalhos de alto volume e sensíveis a custos (resumos, compactação, consultas a banco de dados, classificação) e para funções de subagente sob um modelo maior. A Anthropic afirma que os prompts existentes do Haiku 4.5 devem funcionar bem sem alterações. O código de solicitação existente é uma questão diferente: cinco padrões de solicitação que funcionavam no Haiku 4.5 agora retornam um erro 400, conforme listado no guia de migração da Anthropic e o post de migração nesta série detalha.

Duas mudanças alteram como o modelo se comporta por padrão. O pensamento agora está ativado, a menos que você o desative, então uma solicitação que nunca mencionou o pensamento pode retornar com blocos de thinking primeiro e gastar tokens de saída neles. E o Haiku 5.5 é o primeiro Haiku com uma configuração de esforço, que agora é o principal controle entre custo e qualidade.

Como ele se compara ao Haiku 4.5, Luna e Sonnet 5.5

Os números abaixo vêm dos materiais de lançamento da Anthropic e do cartão do sistema do Haiku 5.5, conforme compilado por Kingy.ai. Eles são reportados pelo fornecedor (a Anthropic realizou algumas das comparações com o GPT, como o OSWorld), e ninguém reproduziu a tabela completa de forma independente ainda.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (offline) 72,4% 15,7% 48,9% 83,9%
O Último Exame da Humanidade 45,9% 10,2% n/a 56,9%
Terminal-Bench 4.0 39,2% 0,0% 16,4% 70,6%
FrontierCode 1.1 Principal 46,4% n/a 42,4% 52,1%
Cartografia 46,4% 6,4% 29,1% 61,6%

O Último Exame da Humanidade e a Cartografia estão sem ferramentas. A pontuação do FrontierCode do Sonnet 5.5 está em esforço xalto.

Três leituras são mais importantes do que qualquer linha única:

  • Contra o Haiku 4.5, é uma classe diferente de modelo. As classificações de trabalho de conhecimento dobram aproximadamente, e as linhas de agente vão de quase zero a utilizáveis. O Haiku 4.5 não conseguiu concluir uma tarefa do Terminal-Bench; o Haiku 5.5 conclui cerca de duas em cinco.
  • Contra o GPT-6 Luna, ele lidera em todas as linhas compartilhadas pelo mesmo preço de lista. As maiores diferenças estão no uso de computador (72,4% vs 48,9%) e Terminal-Bench (39,2% vs 16,4%).
  • Contra o Sonnet 5.5, a diferença depende da tarefa. No FrontierCode, o Haiku está dentro de seis pontos. No Terminal-Bench, o Sonnet pontua 70,6% contra 39,2% do Haiku. A própria Anthropic afirma que o Sonnet 5.5 e o Opus 5.5 continuam sendo a melhor escolha para codificação complexa de agentes.

Leia as letras miúdas antes de citar esses números

As pontuações principais foram executadas com esforço máximo, a configuração mais cara. O padrão é médio, e as execuções de esforço médio do cartão do sistema apresentam resultados mais baixos: 1277 no GDPval-AA em vez de 1620, e 1372 no AA-Briefcase em vez de 1578. Se você implantar no padrão, compare com esses números, não com a tabela de lançamento.

O número do OSWorld também precisa de uma segunda análise. Os 72,4% são crédito parcial, médio sobre pontos de verificação. A proporção de tarefas em que o Haiku 5.5 completou todos os pontos de verificação é 37,1% (Luna: 17,1%). Para um agente de navegador que deve concluir todo o trabalho, 37,1% é o número a ser considerado.

O que os primeiros clientes relataram

O post de lançamento da Anthropic cita vários clientes que testaram o modelo antes do lançamento. Estes são selecionados pelo fornecedor, mas apontam para as mesmas cargas de trabalho:

  • AlphaSense realiza cerca de 8 milhões de chamadas "Perguntar no Documento" por semana. Em 400 consultas de teste, o Haiku 5.5 obteve 0,84 contra 0,76 do Haiku 4.5.
  • Box viu um ganho de 11 pontos em relação ao Haiku 4.5 com cerca de metade da latência.
  • Asana mediu uma latência mais de 30% menor por tarefa e até 2,5x mais rápida na inferência por turno de agente, em comparação com seu modelo atual.
  • HubSpot obteve 92,8% em sua suíte de CRM, a melhor pontuação que já viu nessa suíte.
  • Cognition usa o Haiku 5.5 como um "assistente" sob o Opus 5.5 no Devin Fusion e relata que a dupla mantém uma pontuação de FrontierCode de 66,2 a um custo e latência mais baixos.

O padrão: trabalho curto e repetido sobre documentos, e função de subagente sob um modelo maior.

Onde o Haiku 5.5 é a escolha errada

  • Codificação complexa de agentes. O Terminal-Bench é onde o Sonnet 5.5 se destaca. Se uma tarefa precisar de muitos passos, requisitos ambíguos ou uma longa cadeia de edições, comece com o Sonnet 5.5 ou o Opus 5.5.
  • Prompts acima de 100K tokens. A janela de 1M é real, mas o preço não é fixo ao longo dela. Após 100K tokens, toda a solicitação passa a $0,50 / $2,50, e como o novo tokenizador conta cerca de 30% mais tokens, essa linha fica próxima de 77K tokens, como o Haiku 4.5 os contava. O post de preços nesta série detalha os números.
  • Trabalho que precisa de xalto ou máximo para passar. A saída fica longa e cara nas configurações mais altas. A própria orientação da Anthropic é comparar com o Sonnet 5.5 antes de decidir por lá.
  • Equipes no Tier de Prioridade. O Haiku 5.5 não o suporta, então um compromisso de Tier de Prioridade do Haiku 4.5 não é transferido.
  • Testes de segurança. As salvaguardas cibernéticas do Haiku 5.5 são mais rigorosas do que as do Haiku 4.5 e bloqueiam testes de penetração. Espere razões de parada de refusal nesse tipo de trabalho, sem fallback do lado do servidor para outro modelo.

Experimente através do AIHubMix

A configuração de esforço do Haiku 5.5 está na output_config da API Messages, então o endpoint nativo do Claude no AIHubMix é o caminho mais direto. Instale um SDK atual da Anthropic (pip install -U anthropic) e aponte para o AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # deixe espaço para pensar, não apenas para a resposta
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Classifique este ticket como cobrança, bug ou outro: "
                   "'Fui cobrado duas vezes por outubro.'",
    }],
)

# Os blocos de pensamento podem vir primeiro, então escolha o bloco de texto por tipo.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

Uma coisa a verificar na sua primeira execução: leia response.usage.output_tokens em low e novamente em high no mesmo prompt: se os números não mudarem, a configuração de esforço não está alcançando o modelo. O Haiku 5.5 funciona com a janela de contexto completa de 1M no AIHubMix, então prompts longos funcionam como estão; apenas mantenha em mente a linha de preço de 100K.

Quem deve mudar, quem deve esperar

Mude agora se você realiza classificação, extração, roteamento, resumos ou Q&A de documentos com prompts bem abaixo de 100K tokens. Você obtém um modelo muito mais forte a uma fração do preço por token. Planeje uma hora para as mudanças no código de solicitação e, em seguida, teste o esforço low contra medium em suas próprias avaliações.

Mude agora se você usa um modelo grande para trabalho de subagente para o qual está superqualificado: puxar um número de um arquivo, verificar um arquivo, resumir um resultado de ferramenta. Este é o papel que a Anthropic e seus clientes de lançamento enfatizam.

Espere uma sprint se sua integração usa uso de computador com a ferramenta computer_20250124, preenchimento automático ou temperature=0. Cada um desses retorna um 400 no Haiku 5.5, e corrigi-los é trabalho de código, não uma troca de string de modelo.

Fique onde você está se sua carga de trabalho é de prompt longo (regularmente acima de cerca de 77K tokens do Haiku 4.5), depende do Tier de Prioridade ou é codificação complexa de agentes. Para o último grupo, a comparação útil é o Haiku 5.5 contra o Sonnet 5.5 em custo por tarefa concluída, não o Haiku 5.5 contra o Haiku 4.5.

Quando você estiver pronto para comparar, a lista de modelos do AIHubMix coloca o Haiku 5.5, Sonnet 5.5 e Opus 5.5 atrás de uma chave de API, para que a mesma avaliação possa ser executada contra os três.

FAQ

O Claude Haiku 5.5 é melhor que o Haiku 4.5 em tudo?
Em todos os benchmarks na tabela de lançamento da Anthropic, sim, muitas vezes por uma ampla margem. As exceções são práticas, em vez de qualidade: o Tier de Prioridade não é suportado, prompts acima de 100K tokens custam mais por token do que a taxa de prompt curto, e vários padrões de solicitação antigos agora retornam erros.

O Haiku 5.5 é realmente 90% mais barato?
O preço por token é 90% mais baixo para prompts de até 100K tokens e 50% mais baixo acima disso. Pesando pela mistura de solicitações (cerca de 90% das solicitações do Haiku 4.5 estavam abaixo de 100K tokens) e o novo tokenizador, que conta cerca de 30% mais tokens para o mesmo texto, a Anthropic estima uma economia média de cerca de 75%. O pensamento ativado por padrão adiciona tokens de saída a isso, então sua conta real também depende da configuração de esforço.

Como o Haiku 5.5 se compara ao GPT-6 Luna?
Ambos têm preço de $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída. Nos resultados reportados pela Anthropic, o Haiku 5.5 pontua mais alto em todos os benchmarks onde ambos aparecem, mais claramente no uso de computador e no Terminal-Bench. O Luna mantém seu preço base até um comprimento de prompt mais longo, então cargas de trabalho de prompt longo devem ser precificadas separadamente.

O Haiku 5.5 pode substituir o Sonnet 5.5 para codificação?
Para mudanças estreitas e bem definidas e tarefas de subagente, pode valer a pena testar. Para codificação complexa de agentes em múltiplos passos, o Sonnet 5.5 pontua muito mais alto no Terminal-Bench 4.0 (70,6% vs 39,2%), e a Anthropic recomenda o Sonnet ou o Opus para esse trabalho.

As pontuações de benchmark estão na configuração padrão?
Não. As pontuações principais foram executadas com esforço máximo. O padrão é médio, onde o cartão do sistema reporta resultados mais baixos, por exemplo, 1277 em vez de 1620 no GDPval-AA.

A janela de contexto de 1M significa que posso enviar prompts de 1M tokens de forma barata?
Você pode enviá-los, mas qualquer coisa acima de 100K tokens é cobrada a $0,50 de entrada e $2,50 de saída por milhão de tokens para toda a solicitação. O AIHubMix também suporta a janela completa de 1M.

O que eu preciso mudar no meu código para fazer a troca?
No mínimo: o ID do modelo, qualquer orçamento manual de pensamento, qualquer configuração de temperatura ou top_p, qualquer preenchimento automático de assistente e código que lê o primeiro bloco de conteúdo como a resposta. O post de migração nesta série tem a lista completa.

Continue lendo: a série Claude Haiku 5.5

Fontes