Claude Haiku 5.5 è il primo Haiku con un'impostazione di sforzo, e l'impostazione influisce più di qualsiasi altra cosa tu controlli. Negli esperimenti indipendenti di Artificial Analysis, Haiku 5.5 a sforzo massimo ha ottenuto 43 nel suo Indice di Intelligenza e a sforzo basso ha ottenuto 29. Max ha anche utilizzato 440 milioni di token di output per completare l'indice; basso ha utilizzato 32 milioni.
Quindi, la risposta breve: lascia la maggior parte del lavoro al predefinito, medio. Riduci i percorsi semplici ad alto volume a basso. Aumenta il lavoro di conoscenza e il rispetto rigoroso delle istruzioni a alto. Considera xhigh e max come impostazioni per cui hai bisogno di prove, e confrontale con Sonnet 5.5 prima di impegnarti.
Il resto di questo post mostra cosa costa ciascun livello, dove il passaggio a livelli superiori smette di ripagare e quali impostazioni si rompono o diventano costose quando cambi lo sforzo.
Cosa è l'impostazione
Claude Haiku 5.5 supporta cinque livelli: basso, medio, alto, xhigh e max. Il predefinito è medio, il che è insolito: la maggior parte dei modelli Claude attuali ha come predefinito alto, e solo Haiku 5.5 e Opus 5.5 hanno un predefinito un livello più basso. Inviare medio è come lasciare fuori il parametro.
Lo sforzo sostituisce il budget di pensiero manuale che Haiku 4.5 utilizzava. Una richiesta con thinking: {"type": "enabled", "budget_tokens": N} ora restituisce un 400, quindi non c'è un vecchio numero da trasferire. Secondo la documentazione sugli sforzi di Anthropic, lo imposti in output_config:
output_config={"effort": "low"}
Tre fatti inquadrano tutto ciò che segue:
- Il pensiero è attivo per impostazione predefinita. Haiku 5.5 esegue un pensiero adattivo a meno che non venga detto diversamente. Uno sforzo inferiore significa meno pensiero, e su richieste semplici il modello può saltare completamente il pensiero.
- I token di pensiero sono token di output. Contano verso
max_tokense vengono addebitati al tasso di output ($0.50 per milione su richieste fino a 100K token). - Chiedere meno pensiero nel prompt non funziona. Nei test di Anthropic, il modello ha comunque pensato quando il prompt gli ha detto di rispondere direttamente. Lo sforzo è la leva.
Cosa costa ciascun livello
Due fonti indipendenti hanno misurato Haiku 5.5 attraverso i livelli di sforzo. I dati dell'indice provengono da Artificial Analysis; i dati di FrontierCode provengono dal file di risultati pubblici di Cognition, compilato da Kingy.ai. Nessuno copre il tuo carico di lavoro, quindi trattali come la forma della curva, non come i tuoi numeri.
Indice di Intelligenza Artificial Analysis v4.3.2 (dieci valutazioni, dal lavoro di conoscenza ai compiti terminali):
| Sforzo | Punteggio indice | Token di output per l'indice | Costo per compito | Tempo per il primo token |
|---|---|---|---|---|
| basso | 29 | 32M | $0.02 | 9.9 s |
| medio | 34 | 54M | $0.05 | 13.4 s |
| alto | 38 | 97M | $0.08 | 28.0 s |
| max | 43 | 440M | $0.21 | n/a |
Artificial Analysis non ha pubblicato un'esecuzione xhigh. La sua cifra di latenza a sforzo massimo sembrava anomala, quindi è stata omessa.
FrontierCode 1.1 Main, Haiku 5.5 in esecuzione in Claude Code:
| Sforzo | Punteggio composito | Costo per rollout | Token di output per rollout |
|---|---|---|---|
| basso | 34.8% | $0.06 | 23,868 |
| medio | 41.6% | $0.13 | 36,172 |
| alto | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| max | 46.4% | $1.33 | 181,387 |
I costi sono arrotondati al centesimo.
Leggi le due tabelle insieme e tre cose spiccano.
Passare da basso a medio è il passo più economico. Sull'indice, acquista 5 punti per circa 1.7 volte i token di output. Su FrontierCode, acquista 6.8 punti per circa il doppio del costo per rollout.
Da medio ad alto può essere piatto. Su FrontierCode, alto ha ottenuto 0.3 punti in più rispetto a medio e ha costato circa il doppio. Sull'indice più ampio, alto ha aggiunto 4 punti. Se il tuo carico di lavoro assomiglia al primo caso o al secondo è esattamente ciò che una valutazione rapida ti dice.
I due livelli superiori sono costosi. Dal livello alto al massimo sull'indice, i token di output aumentano di circa 4.5 volte per 5 punti. Su FrontierCode, il massimo costa circa dieci volte quanto costa il medio per 4.8 punti in più, e il passaggio da xhigh a max raddoppia grossomodo il costo per 0.6 punti. Le stesse indicazioni di Anthropic dicono la stessa cosa in termini più semplici: usa xhigh e max solo dove le tue valutazioni mostrano un guadagno, e confrontale prima con Sonnet 5.5 su prestazioni, costo e velocità.
Un ulteriore motivo per cui il predefinito è importante: i benchmark di lancio di Anthropic sono stati eseguiti a sforzo massimo. I risultati a sforzo medio della scheda di sistema sono più bassi (1277 su GDPval-AA invece di 1620). Se distribuisci al predefinito, questi sono i numeri da confrontare.
Dove iniziare, in base al carico di lavoro
| Carico di lavoro | Inizia a | Passa a quando |
|---|---|---|
| Classificazione, instradamento, etichettatura | basso | Le etichette si spostano nei casi difficili |
| Estrazione da documenti brevi | basso | I campi vengono persi o fusi |
| Chat e supporto dal vivo | basso | Le regole sfuggono in chat lunghe |
| Riepiloghi e compattazione | medio | Dettagli chiave vengono persi |
| Lavoro di subagente sotto un modello più grande | medio | Il modello principale rifà il lavoro |
| Codifica agentica, modifiche ridotte | medio | I test falliscono al primo tentativo |
| Lavoro di conoscenza, compiti lunghi per agenti | alto | Le valutazioni mostrano margine di miglioramento |
Questi punti di partenza seguono le indicazioni di Anthropic per Haiku 5.5; i segnali "passa a" sono ciò a cui prestare attenzione nei tuoi log.
L'unica riga che merita un secondo sguardo è la chat. Basso è il livello più veloce, che si adatta al supporto dal vivo. Ma Anthropic raccomanda alto quando il rispetto delle istruzioni è più importante, ad esempio un assistente di supporto che deve mantenere le regole del suo prompt di sistema mentre un utente discute. Testa entrambi sui dialoghi che sono andati male in passato.
Cosa si rompe o diventa costoso quando cambia lo sforzo
Un piccolo max_tokens può terminare la risposta prima che inizi. Il pensiero conta verso max_tokens. Un limite dimensionato per una classificazione di una parola, diciamo 50 token, può essere speso interamente per il pensiero, e la risposta termina con stop_reason: "max_tokens" e nessun testo. Aumenta il limite per lasciare spazio, o riduci lo sforzo.
Cambiare lo sforzo a metà conversazione resetta la cache. Cambiare il valore di sforzo di alto livello tra le richieste invalida la cache del prompt per i messaggi della conversazione. Se un agente ha bisogno di un turno difficile a alto all'interno di una conversazione bassa, Anthropic offre un cambiamento di sforzo per messaggio (beta header mid-conversation-output-config-2026-07-01, Claude API e Google Cloud) che mantiene la cache. Richiede che il pensiero sia attivo. Se un gateway passa quel beta header è opportuno verificarlo prima di fare affidamento su di esso.
Disattivare il pensiero ha dei limiti. thinking: {"type": "disabled"} è accettato a basso, medio e alto. A xhigh o max restituisce un 400. Con il pensiero disattivato, un cambiamento di sforzo per messaggio restituisce anch'esso un 400, e il modello potrebbe saltare una chiamata a uno strumento di cui ha bisogno quando la stessa richiesta chiede un output JSON. Il consiglio di Anthropic è di mantenere il pensiero attivo e utilizzare invece un livello di sforzo inferiore.
Un basso sforzo può fermarsi presto. Con un lungo prompt di sistema per agenti di codifica a basso, Haiku 5.5 a volte si ferma prima che il lavoro sia completato e restituisce il compito. Nei test di Anthropic, passare da basso a medio ha ridotto grossomodo la fermata anticipata della metà e ha più che raddoppiato i token di output per tentativo. La guida al prompting di Haiku 5.5 ha una breve istruzione "continua a lavorare fino a completare" che affronta lo stesso problema a un prezzo inferiore.
Basso e medio possono saltare la verifica. Su compiti di codifica, il modello a volte riporta un cambiamento come completato senza eseguire un test. La guida al prompting ha un paragrafo di verifica per questo; costa token ma aumenta la quota di cambiamenti controllati.
Xhigh può restituire una risposta vuota. In chat a più turni a xhigh, il modello a volte scrive l'intera risposta all'interno del suo pensiero e termina il turno senza testo visibile. Se esegui a xhigh, controlla i blocchi di testo vuoti.
Forzare uno strumento salta il pensiero. Haiku 5.5 accetta un tool_choice forzato, ma la risposta inizia quindi con la chiamata allo strumento e senza pensiero. Se il modello ha bisogno di ragionare prima di chiamare lo strumento, usa auto e indica nel prompt quando chiamarlo.
Esegui la tua scansione di sforzo attraverso AIHubMix
Il modo più veloce per scegliere è eseguire gli stessi 20-50 prompt reali a due o tre livelli e confrontare qualità, token di output e latenza. Attraverso l'endpoint nativo di AIHubMix Claude, con AIHUBMIX_API_KEY impostato:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Riepiloga questo ticket di supporto in una frase: ...",
"Estrai il numero della fattura e il totale da: ...",
]
for effort in ["basso", "medio", "alto"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Salva `text` accanto al prompt e valutalo secondo il tuo rubric.
print(f"{effort}: {out_tokens} token di output, {seconds:.1f}s totali")
Se i token di output cambiano poco tra basso e alto, l'impostazione probabilmente non sta raggiungendo il modello; controlla la richiesta che il tuo gateway inoltra. Sulla pagina di Haiku 5.5 su AIHubMix, il prezzo per token è lo stesso a ogni livello di sforzo, quindi il conteggio dei token di questa scansione si traduce direttamente in dollari.
FAQ
Qual è il livello di sforzo predefinito per Claude Haiku 5.5?
Medio. La maggior parte dei modelli Claude attuali ha come predefinito il livello alto, quindi il codice che si basava sul predefinito per un altro modello eseguirà Haiku 5.5 un livello più basso a meno che non imposti esplicitamente lo sforzo.
Posso disattivare completamente il pensiero?
A basso, medio e alto sforzo, sì, impostando il pensiero su disabilitato. A xhigh e max questo restituisce un errore. Anthropic raccomanda di ridurre lo sforzo invece, perché il modello può saltare il pensiero su richieste semplici da solo e mantiene intatta la sua modalità di chiamata agli strumenti.
Quale livello di sforzo è il più economico?
Basso. Negli esperimenti di Artificial Analysis ha utilizzato circa 32 milioni di token di output per l'intero indice contro 54 milioni a medio e 440 milioni a massimo. Il prezzo per token è lo stesso a ogni livello; la differenza è quanti token vengono generati.
Vale la pena lo sforzo massimo su Haiku 5.5?
Solo con prove dalle tue valutazioni. Su FrontierCode, il massimo costava circa dieci volte quanto il medio per un guadagno di 4.8 punti. A quel punto Anthropic suggerisce di confrontare con Sonnet 5.5, che potrebbe raggiungere la stessa qualità per meno.
Perché le mie risposte si fermano senza testo?
Di solito perché il pensiero ha esaurito max_tokens prima che la risposta iniziasse. Aumenta max_tokens o riduci lo sforzo. A xhigh in chat a più turni, una risposta vuota può anche significare che il modello ha messo la sua risposta all'interno del suo pensiero.
Cambiare lo sforzo influisce sulla cache del prompt?
Sì. Cambiare lo sforzo di alto livello tra le richieste invalida i messaggi memorizzati nella cache per quella conversazione. Un cambiamento di sforzo per messaggio, attualmente in beta, evita ciò.
Perché i benchmark di lancio non corrispondono a ciò che vedo al predefinito?
Le cifre di lancio sono state eseguite a sforzo massimo. A medio, la scheda di sistema riporta punteggi più bassi, ad esempio 1277 invece di 1620 su GDPval-AA.
Continua a leggere: la serie Claude Haiku 5.5
- Lo sforzo decide quanti token generi. Per come Haiku 5.5 si confronta con Haiku 4.5, GPT-6 Luna e Sonnet 5.5 al vertice della gamma, leggi Claude Haiku 5.5 vs Haiku 4.5: Cosa Comprano Ora Dieci Cent
- I token di pensiero vengono addebitati come output, e la lunghezza del prompt determina il tasso. Per trasformare la tua scelta di sforzo in una bolletta mensile, leggi Claude Haiku 5.5 Prezzi: La Linea da 100K Dietro il Taglio del 90%
- Lo sforzo sostituisce il vecchio budget di pensiero, e il vecchio budget ora restituisce un errore. Per quella correzione e il resto del passaggio da Haiku 4.5, leggi Migrazione da Claude Haiku 4.5 a 5.5: Cinque Errori 400 e i Cambiamenti Silenziosi
Fonti
- Sforzo (Documentazione della piattaforma Claude)
- Prompting Claude Haiku 5.5 (Documentazione della piattaforma Claude)
- Claude Haiku 5.5 su AIHubMix
- Analisi di Intelligenza, Prestazioni e Prezzo di Claude Haiku 5.5 (Analisi Artificiale)
- Claude Haiku 5.5: Benchmark, Specifiche, Sol e Luna a Confronto (Kingy.ai)



