Claude Haiku 4.5 obteve 0,0% no Terminal-Bench 4.0. Claude Haiku 5.5 obteve 39,2%, e custa um décimo do preço por token: $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, contra $1 e $5 para Haiku 4.5.
Essa é a atualização em uma linha. O pequeno modelo Claude passou de "bom para classificação, não para agentes" para um subagente utilizável, e seu preço agora se iguala ao do GPT-6 Luna da OpenAI ao centavo. A Anthropic lançou-o em 7 de outubro de 2026 como Claude Haiku 5.5, ID do modelo claude-haiku-5-5, e já está listado no AIHubMix.
O preço vem com condições, assim como as pontuações de benchmark. Este post cobre o que mudou, quão perto Haiku 5.5 chega do Sonnet 5.5, onde é a escolha errada e quem deve mudar agora.
O que mudou e o que não mudou
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Preço de entrada / saída | $1 / $5 | $0,10 / $0,50 |
| Janela de contexto | 200K | 1M |
| Saída máxima | 64K | 128K |
| Pensamento | Orçamento manual, desligado por padrão | Adaptativo, ligado por padrão |
| Níveis de esforço | Nenhum | Cinco, padrão médio |
| Tokens para o mesmo texto | Base | Cerca de 30% a mais |
| Ferramenta de uso do navegador | Não | Sim |
Os preços do Haiku 5.5 se aplicam a prompts de até 100K tokens; prompts mais longos pagam $0,50 / $2,50. Os preços são por milhão de tokens.
O que permanece o mesmo: a descrição do trabalho. A Anthropic ainda direciona o Haiku para trabalhos de alto volume e sensíveis a custos (resumos, compactação, consultas a banco de dados, classificação) e para funções de subagente sob um modelo maior. A Anthropic afirma que os prompts existentes do Haiku 4.5 devem funcionar bem sem alterações. O código de solicitação existente é uma questão diferente: cinco padrões de solicitação que funcionavam no Haiku 4.5 agora retornam um erro 400, conforme listado no guia de migração da Anthropic e o post de migração nesta série detalha.
Duas mudanças alteram como o modelo se comporta por padrão. O pensamento agora está ativado, a menos que você o desative, então uma solicitação que nunca mencionou o pensamento pode retornar com blocos de thinking primeiro e gastar tokens de saída neles. E o Haiku 5.5 é o primeiro Haiku com uma configuração de esforço, que agora é o principal controle entre custo e qualidade.
Como ele se compara ao Haiku 4.5, Luna e Sonnet 5.5
Os números abaixo vêm dos materiais de lançamento da Anthropic e do cartão do sistema do Haiku 5.5, conforme compilado por Kingy.ai. Eles são reportados pelo fornecedor (a Anthropic realizou algumas das comparações com o GPT, como o OSWorld), e ninguém reproduziu a tabela completa de forma independente ainda.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72,4% | 15,7% | 48,9% | 83,9% |
| O Último Exame da Humanidade | 45,9% | 10,2% | n/a | 56,9% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 Principal | 46,4% | n/a | 42,4% | 52,1% |
| Cartografia | 46,4% | 6,4% | 29,1% | 61,6% |
O Último Exame da Humanidade e a Cartografia estão sem ferramentas. A pontuação do FrontierCode do Sonnet 5.5 está em esforço xalto.
Três leituras são mais importantes do que qualquer linha única:
- Contra o Haiku 4.5, é uma classe diferente de modelo. As classificações de trabalho de conhecimento dobram aproximadamente, e as linhas de agente vão de quase zero a utilizáveis. O Haiku 4.5 não conseguiu concluir uma tarefa do Terminal-Bench; o Haiku 5.5 conclui cerca de duas em cinco.
- Contra o GPT-6 Luna, ele lidera em todas as linhas compartilhadas pelo mesmo preço de lista. As maiores diferenças estão no uso de computador (72,4% vs 48,9%) e Terminal-Bench (39,2% vs 16,4%).
- Contra o Sonnet 5.5, a diferença depende da tarefa. No FrontierCode, o Haiku está dentro de seis pontos. No Terminal-Bench, o Sonnet pontua 70,6% contra 39,2% do Haiku. A própria Anthropic afirma que o Sonnet 5.5 e o Opus 5.5 continuam sendo a melhor escolha para codificação complexa de agentes.
Leia as letras miúdas antes de citar esses números
As pontuações principais foram executadas com esforço máximo, a configuração mais cara. O padrão é médio, e as execuções de esforço médio do cartão do sistema apresentam resultados mais baixos: 1277 no GDPval-AA em vez de 1620, e 1372 no AA-Briefcase em vez de 1578. Se você implantar no padrão, compare com esses números, não com a tabela de lançamento.
O número do OSWorld também precisa de uma segunda análise. Os 72,4% são crédito parcial, médio sobre pontos de verificação. A proporção de tarefas em que o Haiku 5.5 completou todos os pontos de verificação é 37,1% (Luna: 17,1%). Para um agente de navegador que deve concluir todo o trabalho, 37,1% é o número a ser considerado.
O que os primeiros clientes relataram
O post de lançamento da Anthropic cita vários clientes que testaram o modelo antes do lançamento. Estes são selecionados pelo fornecedor, mas apontam para as mesmas cargas de trabalho:
- AlphaSense realiza cerca de 8 milhões de chamadas "Perguntar no Documento" por semana. Em 400 consultas de teste, o Haiku 5.5 obteve 0,84 contra 0,76 do Haiku 4.5.
- Box viu um ganho de 11 pontos em relação ao Haiku 4.5 com cerca de metade da latência.
- Asana mediu uma latência mais de 30% menor por tarefa e até 2,5x mais rápida na inferência por turno de agente, em comparação com seu modelo atual.
- HubSpot obteve 92,8% em sua suíte de CRM, a melhor pontuação que já viu nessa suíte.
- Cognition usa o Haiku 5.5 como um "assistente" sob o Opus 5.5 no Devin Fusion e relata que a dupla mantém uma pontuação de FrontierCode de 66,2 a um custo e latência mais baixos.
O padrão: trabalho curto e repetido sobre documentos, e função de subagente sob um modelo maior.
Onde o Haiku 5.5 é a escolha errada
- Codificação complexa de agentes. O Terminal-Bench é onde o Sonnet 5.5 se destaca. Se uma tarefa precisar de muitos passos, requisitos ambíguos ou uma longa cadeia de edições, comece com o Sonnet 5.5 ou o Opus 5.5.
- Prompts acima de 100K tokens. A janela de 1M é real, mas o preço não é fixo ao longo dela. Após 100K tokens, toda a solicitação passa a $0,50 / $2,50, e como o novo tokenizador conta cerca de 30% mais tokens, essa linha fica próxima de 77K tokens, como o Haiku 4.5 os contava. O post de preços nesta série detalha os números.
- Trabalho que precisa de xalto ou máximo para passar. A saída fica longa e cara nas configurações mais altas. A própria orientação da Anthropic é comparar com o Sonnet 5.5 antes de decidir por lá.
- Equipes no Tier de Prioridade. O Haiku 5.5 não o suporta, então um compromisso de Tier de Prioridade do Haiku 4.5 não é transferido.
- Testes de segurança. As salvaguardas cibernéticas do Haiku 5.5 são mais rigorosas do que as do Haiku 4.5 e bloqueiam testes de penetração. Espere razões de parada de
refusalnesse tipo de trabalho, sem fallback do lado do servidor para outro modelo.
Experimente através do AIHubMix
A configuração de esforço do Haiku 5.5 está na output_config da API Messages, então o endpoint nativo do Claude no AIHubMix é o caminho mais direto. Instale um SDK atual da Anthropic (pip install -U anthropic) e aponte para o AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # deixe espaço para pensar, não apenas para a resposta
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Classifique este ticket como cobrança, bug ou outro: "
"'Fui cobrado duas vezes por outubro.'",
}],
)
# Os blocos de pensamento podem vir primeiro, então escolha o bloco de texto por tipo.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Uma coisa a verificar na sua primeira execução: leia response.usage.output_tokens em low e novamente em high no mesmo prompt: se os números não mudarem, a configuração de esforço não está alcançando o modelo. O Haiku 5.5 funciona com a janela de contexto completa de 1M no AIHubMix, então prompts longos funcionam como estão; apenas mantenha em mente a linha de preço de 100K.
Quem deve mudar, quem deve esperar
Mude agora se você realiza classificação, extração, roteamento, resumos ou Q&A de documentos com prompts bem abaixo de 100K tokens. Você obtém um modelo muito mais forte a uma fração do preço por token. Planeje uma hora para as mudanças no código de solicitação e, em seguida, teste o esforço low contra medium em suas próprias avaliações.
Mude agora se você usa um modelo grande para trabalho de subagente para o qual está superqualificado: puxar um número de um arquivo, verificar um arquivo, resumir um resultado de ferramenta. Este é o papel que a Anthropic e seus clientes de lançamento enfatizam.
Espere uma sprint se sua integração usa uso de computador com a ferramenta computer_20250124, preenchimento automático ou temperature=0. Cada um desses retorna um 400 no Haiku 5.5, e corrigi-los é trabalho de código, não uma troca de string de modelo.
Fique onde você está se sua carga de trabalho é de prompt longo (regularmente acima de cerca de 77K tokens do Haiku 4.5), depende do Tier de Prioridade ou é codificação complexa de agentes. Para o último grupo, a comparação útil é o Haiku 5.5 contra o Sonnet 5.5 em custo por tarefa concluída, não o Haiku 5.5 contra o Haiku 4.5.
Quando você estiver pronto para comparar, a lista de modelos do AIHubMix coloca o Haiku 5.5, Sonnet 5.5 e Opus 5.5 atrás de uma chave de API, para que a mesma avaliação possa ser executada contra os três.
FAQ
O Claude Haiku 5.5 é melhor que o Haiku 4.5 em tudo?
Em todos os benchmarks na tabela de lançamento da Anthropic, sim, muitas vezes por uma ampla margem. As exceções são práticas, em vez de qualidade: o Tier de Prioridade não é suportado, prompts acima de 100K tokens custam mais por token do que a taxa de prompt curto, e vários padrões de solicitação antigos agora retornam erros.
O Haiku 5.5 é realmente 90% mais barato?
O preço por token é 90% mais baixo para prompts de até 100K tokens e 50% mais baixo acima disso. Pesando pela mistura de solicitações (cerca de 90% das solicitações do Haiku 4.5 estavam abaixo de 100K tokens) e o novo tokenizador, que conta cerca de 30% mais tokens para o mesmo texto, a Anthropic estima uma economia média de cerca de 75%. O pensamento ativado por padrão adiciona tokens de saída a isso, então sua conta real também depende da configuração de esforço.
Como o Haiku 5.5 se compara ao GPT-6 Luna?
Ambos têm preço de $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída. Nos resultados reportados pela Anthropic, o Haiku 5.5 pontua mais alto em todos os benchmarks onde ambos aparecem, mais claramente no uso de computador e no Terminal-Bench. O Luna mantém seu preço base até um comprimento de prompt mais longo, então cargas de trabalho de prompt longo devem ser precificadas separadamente.
O Haiku 5.5 pode substituir o Sonnet 5.5 para codificação?
Para mudanças estreitas e bem definidas e tarefas de subagente, pode valer a pena testar. Para codificação complexa de agentes em múltiplos passos, o Sonnet 5.5 pontua muito mais alto no Terminal-Bench 4.0 (70,6% vs 39,2%), e a Anthropic recomenda o Sonnet ou o Opus para esse trabalho.
As pontuações de benchmark estão na configuração padrão?
Não. As pontuações principais foram executadas com esforço máximo. O padrão é médio, onde o cartão do sistema reporta resultados mais baixos, por exemplo, 1277 em vez de 1620 no GDPval-AA.
A janela de contexto de 1M significa que posso enviar prompts de 1M tokens de forma barata?
Você pode enviá-los, mas qualquer coisa acima de 100K tokens é cobrada a $0,50 de entrada e $2,50 de saída por milhão de tokens para toda a solicitação. O AIHubMix também suporta a janela completa de 1M.
O que eu preciso mudar no meu código para fazer a troca?
No mínimo: o ID do modelo, qualquer orçamento manual de pensamento, qualquer configuração de temperatura ou top_p, qualquer preenchimento automático de assistente e código que lê o primeiro bloco de conteúdo como a resposta. O post de migração nesta série tem a lista completa.
Continue lendo: a série Claude Haiku 5.5
- As pontuações principais foram executadas com esforço máximo, mas você provavelmente implantará em médio ou baixo. Para ver o que cada nível custa em tokens e o que você perde ao reduzir, leia Níveis de Esforço do Claude Haiku 5.5: Médio é o Padrão, Baixo é Muitas Vezes Suficiente
- O número de um décimo do preço só se aplica abaixo de uma linha de comprimento de prompt que o novo tokenizador move. Para exemplos de custo trabalhado e as regras de faturamento que são fáceis de perder, leia Preços do Claude Haiku 5.5: A Linha de 100K por trás do Corte de 90%
- Mudar é mais do que uma troca de string de modelo: cinco padrões de solicitação antigos agora falham. Para cada erro, sua causa e sua correção, leia Migrando de Claude Haiku 4.5 para 5.5: Cinco Erros 400 e as Mudanças Silenciosas
Fontes
- Introduzindo Claude Haiku 5.5 (Anthropic)
- Guia de migração do Claude Haiku 5.5 (Documentos da Plataforma Claude)
- Claude Haiku 5.5 no AIHubMix
- Claude Haiku 5.5: Benchmarks, Especificações, Sol & Luna Comparados (Kingy.ai)
- Análise de Inteligência, Desempenho & Preço do Claude Haiku 5.5 (Análise Artificial)



