Claude Haiku 5.5 é o primeiro Haiku com uma configuração de esforço, e essa configuração influencia mais a conta do que qualquer outra coisa que você controla. Nas execuções independentes da Artificial Analysis, o Haiku 5.5 com esforço máximo obteve 43 no seu Índice de Inteligência e com esforço baixo obteve 29. O máximo também usou 440 milhões de tokens de saída para passar pelo índice; o baixo usou 32 milhões.
Portanto, a resposta curta: mantenha a maior parte do trabalho no padrão, médio. Reduza rotas simples de alto volume para baixo. Aumente o trabalho de conhecimento e o seguimento estrito de instruções para alto. Trate xhigh e max como configurações para as quais você precisa de evidências, e compare-as com o Sonnet 5.5 antes de se comprometer.
O restante deste post mostra o que cada nível custa, onde subir deixa de compensar e quais configurações quebram ou ficam caras quando você altera o esforço.
O que é a configuração
Claude Haiku 5.5 suporta cinco níveis: baixo, médio, alto, xhigh e max. O padrão é médio, o que é incomum: a maioria dos modelos atuais do Claude tem como padrão alto, e apenas o Haiku 5.5 e o Opus 5.5 têm como padrão um nível abaixo. Enviar médio é o mesmo que deixar o parâmetro de fora.
O esforço substitui o orçamento de pensamento manual que o Haiku 4.5 usava. Um pedido com thinking: {"type": "enabled", "budget_tokens": N} agora retorna um 400, então não há número antigo a ser transferido. De acordo com a documentação de esforço da Anthropic, você o define em output_config:
output_config={"effort": "low"}
Três fatos moldam tudo abaixo:
- O pensamento está ativado por padrão. O Haiku 5.5 executa pensamento adaptativo, a menos que seja informado o contrário. Menos esforço significa menos pensamento, e em pedidos simples o modelo pode pular o pensamento completamente.
- Tokens de pensamento são tokens de saída. Eles contam para
max_tokense são cobrados na taxa de saída ($0,50 por milhão em prompts de até 100K tokens). - Pedir menos pensamento no prompt não funciona. Nos testes da Anthropic, o modelo ainda pensou quando o prompt lhe disse para responder diretamente. O esforço é a alavanca.
O que cada nível custa
Duass fontes independentes mediram o Haiku 5.5 em diferentes níveis de esforço. Os números do índice vêm da Artificial Analysis; os números do FrontierCode vêm do arquivo de resultados públicos da Cognition, compilados por Kingy.ai. Nenhum cobre sua carga de trabalho, então trate-os como a forma da curva, não como seus números.
Índice de Inteligência da Artificial Analysis v4.3.2 (dez avaliações, de trabalho de conhecimento a tarefas terminais):
| Esforço | Pontuação do índice | Tokens de saída para o índice | Custo por tarefa | Tempo até o primeiro token |
|---|---|---|---|---|
| baixo | 29 | 32M | $0.02 | 9.9 s |
| médio | 34 | 54M | $0.05 | 13.4 s |
| alto | 38 | 97M | $0.08 | 28.0 s |
| xhigh | 41 | 180M | $0.12 | n/a |
| max | 43 | 440M | $0.21 | n/a |
A Artificial Analysis não publicou um número de latência para xhigh. Seu número de latência de esforço máximo parecia anômalo, então foi deixado de fora.
FrontierCode 1.1 Principal, Haiku 5.5 rodando no Claude Code:
| Esforço | Pontuação composta | Custo por rollout | Tokens de saída por rollout |
|---|---|---|---|
| baixo | 34.8% | $0.06 | 23,868 |
| médio | 41.6% | $0.13 | 36,172 |
| alto | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| max | 46.4% | $1.33 | 181,387 |
Os custos são arredondados para o centavo.
Leia as duas tabelas juntas e três coisas se destacam.
Baixo para médio é o passo mais barato. No índice, isso compra 5 pontos por cerca de 1,7 vezes os tokens de saída. No FrontierCode, isso compra 6,8 pontos por cerca do dobro do custo por rollout.
Médio para alto pode ser plano. No FrontierCode, alto marcou 0,3 pontos acima de médio e custou cerca do dobro. No índice mais amplo, alto adicionou 4 pontos. Se sua carga de trabalho se parece com o primeiro caso ou o segundo é exatamente o que uma avaliação rápida lhe diz.
Os dois níveis superiores são caros. De alto para máximo no índice, os tokens de saída aumentam cerca de 4,5 vezes para 5 pontos. No FrontierCode, o máximo custa cerca de dez vezes o que o médio custa por 4,8 pontos a mais, e o passo de xhigh para max aproximadamente dobra o custo por 0,6 pontos. A própria orientação da Anthropic diz a mesma coisa em termos mais simples: use xhigh e max apenas onde suas avaliações mostram um ganho, e compare-os com o Sonnet 5.5 em desempenho, custo e velocidade primeiro.
Mais uma razão pela qual o padrão importa: os benchmarks de lançamento da Anthropic foram executados com esforço máximo. Os resultados de esforço médio do cartão do sistema são mais baixos (1277 no GDPval-AA em vez de 1620). Se você implantar no padrão, esses são os números para comparar.
Onde começar, por carga de trabalho
| Carga de trabalho | Começar em | Subir quando |
|---|---|---|
| Classificação, roteamento, etiquetagem | baixo | Os rótulos se desviam em casos difíceis |
| Extração de documentos curtos | baixo | Campos são perdidos ou mesclados |
| Chat e suporte ao vivo | baixo | Regras escorregam em chats longos |
| Resumos e compactação | médio | Detalhes importantes são perdidos |
| Trabalho de subagente sob um modelo maior | médio | O modelo principal refaz o trabalho |
| Codificação agente, mudanças estreitas | médio | Testes falham na primeira tentativa |
| Trabalho de conhecimento, tarefas longas de agente | alto | Avaliações mostram espaço para melhorias |
Esses pontos de partida seguem a orientação da Anthropic para o Haiku 5.5; os sinais de "subir" são o que observar em seus próprios logs.
A única linha que vale uma segunda olhada é o chat. Baixo é o nível mais rápido, que se adequa ao suporte ao vivo. Mas a Anthropic recomenda alto quando o seguimento de instruções é mais importante, por exemplo, um assistente de suporte que deve manter suas regras de prompt do sistema enquanto um usuário argumenta. Teste ambos nas conversas que deram errado no passado.
O que quebra ou fica caro quando o esforço muda
Um pequeno max_tokens pode encerrar a resposta antes que ela comece. O pensamento conta para max_tokens. Um limite dimensionado para uma classificação de uma palavra, digamos 50 tokens, pode ser gasto inteiramente em pensamento, e a resposta termina com stop_reason: "max_tokens" e sem texto. Aumente o limite para deixar espaço ou reduza o esforço.
Mudar o esforço no meio da conversa redefine o cache. Alterar o valor de esforço de nível superior entre os pedidos invalida o cache de prompt para as mensagens da conversa. Se um agente precisar de uma mudança difícil em alto dentro de uma conversa baixo, a Anthropic oferece uma mudança de esforço por mensagem (cabeçalho beta mid-conversation-output-config-2026-07-01, API do Claude e Google Cloud) que mantém o cache. Isso requer que o pensamento esteja ativado. Se um gateway passar esse cabeçalho beta, vale a pena verificar antes de confiar nele.
Desativar o pensamento tem limites. thinking: {"type": "disabled"} é aceito em baixo, médio e alto. Em xhigh ou max, retorna um 400. Com o pensamento desativado, uma mudança de esforço por mensagem também retorna um 400, e o modelo pode pular uma chamada de ferramenta que precisa quando o mesmo pedido pede saída em JSON. O conselho da Anthropic é manter o pensamento ativado e usar um nível de esforço mais baixo em vez disso.
Baixo esforço pode parar cedo. Com um prompt de sistema de agente de codificação longo em baixo, o Haiku 5.5 às vezes para antes que o trabalho esteja concluído e devolve a tarefa. Nos testes da Anthropic, mudar de baixo para médio reduziu aproximadamente pela metade a parada precoce e mais que dobrou os tokens de saída por tentativa. O guia de prompting do Haiku 5.5 tem uma breve instrução de "continuar trabalhando até terminar" que aborda o mesmo problema a um preço mais baixo.
Baixo e médio podem pular a verificação. Em tarefas de codificação, o modelo às vezes relata uma mudança como concluída sem executar um teste. O guia de prompting tem um parágrafo de verificação para isso; custa tokens, mas aumenta a proporção de mudanças verificadas.
Xhigh pode retornar uma resposta vazia. Em chats de múltiplas turnos em xhigh, o modelo às vezes escreve toda a sua resposta dentro do seu pensamento e termina a turnos sem texto visível. Se você rodar em xhigh, verifique se há blocos de texto vazios.
Forçar uma ferramenta pula o pensamento. O Haiku 5.5 aceita uma tool_choice forçada, mas a resposta então começa com a chamada da ferramenta e sem pensamento. Se o modelo precisar raciocinar antes de chamar a ferramenta, use auto e diga no prompt quando chamá-la.
Execute sua própria varredura de esforço através do AIHubMix
A maneira mais rápida de escolher é executar os mesmos 20 a 50 prompts reais em dois ou três níveis e comparar qualidade, tokens de saída e latência. Através do endpoint nativo do AIHubMix Claude, com AIHUBMIX_API_KEY definido:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Resuma este ticket de suporte em uma frase: ...",
"Extraia o número da fatura e o total de: ...",
]
for effort in ["baixo", "médio", "alto"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Salve `text` ao lado do prompt e avalie-o de acordo com sua própria rubrica.
print(f"{effort}: {out_tokens} tokens de saída, {seconds:.1f}s no total")
Se os tokens de saída mal mudarem entre baixo e alto, a configuração provavelmente não está alcançando o modelo; verifique o pedido que seu gateway encaminha. Na página do Haiku 5.5 no AIHubMix, o preço por token é o mesmo em todos os níveis de esforço, então a contagem de tokens dessa varredura se converte diretamente em dólares.
FAQ
Qual é o nível de esforço padrão para o Claude Haiku 5.5?
Médio. A maioria dos modelos atuais do Claude tem como padrão alto, então códigos que dependiam do padrão para outro modelo executarão o Haiku 5.5 um nível abaixo, a menos que defina o esforço explicitamente.
Posso desativar completamente o pensamento?
Em baixo, médio e alto esforço, sim, definindo o pensamento como desativado. Em xhigh e max, isso retorna um erro. A Anthropic recomenda reduzir o esforço em vez disso, porque o modelo pode pular o pensamento em pedidos simples por conta própria e mantém seu comportamento de chamada de ferramenta intacto.
Qual nível de esforço é o mais barato?
Baixo. Nas execuções da Artificial Analysis, usou cerca de 32 milhões de tokens de saída para todo o índice contra 54 milhões em médio e 440 milhões em máximo. O preço por token é o mesmo em todos os níveis; a diferença é quantos tokens são gerados.
Vale a pena o esforço máximo no Haiku 5.5?
Apenas com evidências de suas próprias avaliações. No FrontierCode, o máximo custou cerca de dez vezes mais que o médio para um ganho de 4,8 pontos. Nesse ponto, a Anthropic sugere comparar com o Sonnet 5.5, que pode alcançar a mesma qualidade por menos.
Por que minhas respostas param sem texto?
Geralmente porque o pensamento consumiu max_tokens antes que a resposta começasse. Aumente max_tokens ou reduza o esforço. Em xhigh em chats de múltiplas turnos, uma resposta vazia também pode significar que o modelo colocou sua resposta dentro do seu pensamento.
Mudar o esforço afeta o cache de prompt?
Sim. Mudar o esforço de nível superior entre os pedidos invalida as mensagens em cache para aquela conversa. Uma mudança de esforço por mensagem, atualmente em beta, evita isso.
Por que os benchmarks de lançamento não correspondem ao que vejo no padrão?
Os números de lançamento foram executados com esforço máximo. Em médio, o cartão do sistema relata pontuações mais baixas, por exemplo, 1277 em vez de 1620 no GDPval-AA.
Continue lendo: a série Claude Haiku 5.5
- O esforço decide quantos tokens você gera. Para saber como o Haiku 5.5 se compara ao Haiku 4.5, GPT-6 Luna e Sonnet 5.5 no topo da faixa, leia Claude Haiku 5.5 vs Haiku 4.5: O que Dez Centavos Agora Compra
- Tokens de pensamento são cobrados como saída, e o comprimento do prompt escolhe a tabela de preços. Para transformar sua escolha de esforço em uma conta mensal, leia Claude Haiku 5.5 Preços: A Linha de 100K Atrás do Corte de 90%
- O esforço substitui o antigo orçamento de pensamento, e o antigo orçamento agora retorna um erro. Para essa correção e o resto da transição do Haiku 4.5, leia Migrando do Claude Haiku 4.5 para 5.5: Cinco Erros 400 e as Mudanças Silenciosas
Fontes
- Esforço (Documentos da Plataforma Claude)
- Prompting Claude Haiku 5.5 (Documentos da Plataforma Claude)
- Claude Haiku 5.5 no AIHubMix
- Análise de Inteligência, Desempenho e Preço do Claude Haiku 5.5 (Artificial Analysis)
- Claude Haiku 5.5: Benchmarks, Especificações, Sol e Luna Comparados (Kingy.ai)



