Claude Haiku 5.5 costa $0.10 per milione di token in input e $0.50 per milione di token in output, un decimo rispetto ai $1 e $5 di Haiku 4.5. Questo vale per i prompt fino a 100.000 token. Oltre quella linea, l'intera richiesta viene fatturata a $0.50 e $2.50, che è la metà del prezzo di Haiku 4.5 piuttosto che un decimo.
Anthropic stima il risparmio tipico intorno al 75%, non al 90%, e la differenza deriva da tre fattori che questo post analizza: dove si collocano i tuoi prompt rispetto alla linea dei 100K, quanti token di pensiero generano le impostazioni predefinite e un nuovo tokenizer che conta lo stesso testo come circa il 30% in più di token. Due esempi pratici qui sotto mostrano come si presenta una bolletta reale.
Il listino prezzi
Prezzi per milione di token, dal post di lancio di Haiku 5.5 di Anthropic e dalla pagina dei prezzi:
| Tipo di token | Haiku 5.5, breve | Haiku 5.5, lungo | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| Input | $0.10 | $0.50 | $1.00 | $2.00 |
| Output | $0.50 | $2.50 | $5.00 | $10.00 |
| Lettura cache | $0.01 | $0.05 | $0.10 | $0.10 |
| Scrittura cache, 5 min | $0.125 | $0.625 | $1.25 | $2.50 |
| Scrittura cache, 1 ora | $0.20 | $1.00 | $2.00 | $4.00 |
"Breve" significa un prompt di 100.000 token o meno; "lungo" significa oltre 100.000. L'API Batch applica uno sconto del 50% su input e output. Il prezzo di lettura della cache di Sonnet 5.5 è stato ridotto da $0.20 a $0.10 lo stesso giorno.
La pagina di Haiku 5.5 su AIHubMix elenca gli stessi due livelli, con la ricerca web a $0.01 per richiesta.
Regole di fatturazione facili da perdere
Intera richiesta cambia livello, non solo l'eccesso. Anthropic prezza Haiku 5.5 con due listini scelti in base alla lunghezza del prompt. Un prompt di 100.000 token paga $0.0100 per il suo input; un prompt di 100.001 token paga $0.0500, e il suo output costa cinque volte di più. Haiku 5.5 è l'eccezione qui: gli altri modelli attuali di contesto 1M di Anthropic fatturano l'intera finestra alle loro tariffe standard.
La linea arriva prima di quanto suggeriscano i tuoi vecchi dashboard. Haiku 5.5 utilizza un tokenizer più recente, e lo stesso testo produce circa il 30% in più di token rispetto a Haiku 4.5. Dividendo 100.000 per 1.3 si colloca la linea vicino a 77.000 token come li contava Haiku 4.5. Un prompt di 78.000 token sul tuo vecchio dashboard diventa circa 101.000 token su Haiku 5.5, e paga la tariffa lunga. Questa aritmetica deriva dal dato del 30% nella guida alla migrazione di Anthropic; l'aumento esatto dipende dal contenuto, quindi ricontare i prompt reali sul nuovo modello.
Il pensiero è attivo per impostazione predefinita e viene fatturato come output. Haiku 4.5 pensava solo quando richiesto. Haiku 5.5 esegue un pensiero adattivo a medium sforzo a meno che tu non lo cambi, quindi un percorso che prima restituiva 200 token di output ora può restituire diversi centinaia in più.
I prompt brevi possono ora essere memorizzati nella cache. Il prompt minimo memorizzabile nella cache scende da 4.096 token su Haiku 4.5 a 512 su Haiku 5.5, secondo la guida alla migrazione di Anthropic. Un prompt di sistema di 3.000 token che non poteva mai essere memorizzato nella cache su Haiku 4.5 può ora essere memorizzato, e una lettura della cache costa un decimo della tariffa di input.
Il livello Prioritario non è disponibile. Se hai un impegno di Livello Prioritario su Haiku 4.5, non si trasferisce a Haiku 5.5. Pianifica la capacità separatamente.
I token memorizzati nella cache e la linea dei 100K: si presume che vengano conteggiati. Anthropic elenca un prezzo di lettura della cache separato per ciascun livello, il che suggerisce che l'intero prompt, memorizzato nella cache o meno, decide il livello. Anthropic non ha specificato questo, quindi l'assunzione sicura è che un prefisso memorizzato nella cache di 95K più una domanda di 6K sia un prompt lungo.
Esempio pratico 1: un classificatore di ticket di supporto
Assunzioni, nei conteggi di token di Haiku 4.5: un prompt di sistema di 3.000 token con definizioni di strumenti, un ticket di 1.000 token, una risposta di 200 token e 1 milione di richieste al mese. Haiku 4.5 funziona con il pensiero disattivato.
Su Haiku 5.5 lo stesso testo diventa 3.900 + 1.300 token in input e una risposta di 260 token. Si presume che il pensiero aggiunga 300 token a low sforzo e 800 a medium. Queste cifre di pensiero sono assunzioni; misura le tue.
| Impostazione | Per richiesta | Al mese |
|---|---|---|
| Haiku 4.5 | $0.00500 | $5,000 |
| Haiku 5.5, basso, senza cache | $0.00080 | $800 |
| Haiku 5.5, basso, prefisso memorizzato nella cache | $0.00045 | $453 |
| Haiku 5.5, medio, prefisso memorizzato nella cache | $0.00070 | $703 |
| Sonnet 5.5, medio, prefisso memorizzato nella cache | $0.01359 | $13,674 |
Le righe mensili memorizzate nella cache includono circa $4 di scritture cache per Haiku 5.5 e circa $84 per Sonnet 5.5, assumendo una scrittura di 5 minuti ogni cinque minuti. Sonnet 5.5 utilizza le stesse assunzioni sui token di Haiku a livello medio.
Come si somma la riga memorizzata nella cache low: 3.900 token memorizzati nella cache a $0.01 per milione ($0.000039), più 1.300 token di input freschi a $0.10 ($0.00013), più 560 token di output a $0.50 ($0.00028), per un totale di $0.000449 per richiesta.
Il modello: caching e sforzo insieme spostano la bolletta dal 16% del costo precedente (senza cache, basso) al 9% (memorizzato, basso). Lasciare lo sforzo al valore predefinito invece di low aggiunge circa $250 al mese a questo volume. Nessuna delle due scelte conta molto in termini assoluti rispetto ai $5.000 di Haiku 4.5, motivo per cui il caso del classificatore è dove il titolo del 90% è reale.
Esempio pratico 2: una revisione di contratto che supera la linea
Assunzioni, nei conteggi di token di Haiku 4.5: un contratto più istruzioni di 70.000 token, una risposta di 1.500 token, senza caching. Su Haiku 5.5 questo diventa 91.000 token in input, una risposta di 1.950 token e un presunto 2.000 token di pensiero a medium, quindi 3.950 token di output.
Ora rendi il contratto più lungo del 14%: 80.000 token su Haiku 4.5, 104.000 su Haiku 5.5.
| Dimensione del contratto (conteggio Haiku 4.5) | Haiku 4.5 | Haiku 5.5 | Cambiamento |
|---|---|---|---|
| 70.000 token | $0.0775 | $0.0111 | 86% in meno |
| 80.000 token | $0.0875 | $0.0619 | 29% in meno |
La seconda riga: 104.000 token in input a $0.50 per milione ($0.052) più 3.950 token di output a $2.50 ($0.0099). Quattordici percento di testo in più costa 5.6 volte di più su Haiku 5.5.
La soluzione è rimanere sotto la linea. Suddividere il contratto più lungo in due chiamate di circa 53.000 token ciascuna (metà del contratto più le istruzioni in ciascuna) costa circa $0.015 in totale alla tariffa breve, meno di un quarto della singola chiamata lunga. Se una suddivisione funziona dipende dal compito; la revisione clausola per clausola si divide facilmente, una domanda che richiede l'intero documento contemporaneamente no.
Come si confronta in termini di costo per compito
Rispetto a Sonnet 5.5, Haiku 5.5 è circa un ventesimo del prezzo per token sui prompt brevi. Ma il prezzo per token non è il prezzo per compito finito. Su codifica complessa e agentica, Sonnet 5.5 ottiene il 70.6% su Terminal-Bench 4.0 rispetto al 39.2% di Haiku 5.5, nei risultati riportati da Anthropic, e una richiesta più economica che fallisce e viene ripetuta, o viene rifatta da un modello più grande, non è più economica. Il consiglio di Anthropic è di confrontare con Sonnet 5.5 prima di eseguire Haiku a xhigh o max. Sonnet 5.5 è diventato anche più economico lo stesso giorno: le sue letture della cache sono state dimezzate, il che, secondo Anthropic, riduce circa il 20% della maggior parte del lavoro agentico.
Rispetto a GPT-6 Luna, i prezzi di listino per i prompt brevi sono identici, incluse le letture della cache. La differenza è nella regola dei prompt lunghi. La tariffa di contesto lungo di Luna inizia sopra i 272.000 token in input ed è $0.20 / $0.75, mentre quella di Haiku 5.5 inizia sopra i 100.000 ed è $0.50 / $2.50. Per un carico di lavoro tra 100K e 272K token, Luna è molto più economica a prezzo di listino. I due modelli utilizzano tokenizer diversi, quindi confronta le bollette misurate, non i conteggi dei token.
I dati sulla soglia dei 100K e l'effetto del tokenizer sono stati anche analizzati da Roo's Newsletter, la cui aritmetica corrisponde agli esempi sopra.
Passi per ridurre la bolletta
- Conta i token sul nuovo modello e avvisa prima dei 100K. Registra la dimensione totale del prompt per ogni richiesta e avvisa intorno ai 90.000 token, in modo che i prompt che tendono a salire vengano ridotti o suddivisi prima di cambiare livello.
- Memorizza nella cache il prefisso stabile. Prima il prompt di sistema e le definizioni degli strumenti, poi il contenuto variabile. Con un minimo di 512 token, la maggior parte dei prompt di sistema di produzione ora è idonea. La guida alla memorizzazione nella cache dei prompt di Claude di AIHubMix mostra il formato della richiesta.
- Imposta esplicitamente lo sforzo. Usa
lowper percorsi semplici e ad alto volume. Il valore predefinitomediumcosta di più su ogni richiesta, che il percorso ne abbia bisogno o meno. - Dimensiona max_tokens per il pensiero più la risposta. Troppo piccolo e paghi per pensieri che terminano senza risposta.
- Batch ciò che può aspettare. L'API Batch dimezza le tariffe di input e output.
- Invia in alto invece di riprovare in basso. Se un tipo di compito fallisce spesso su Haiku, invialo prima a Sonnet 5.5 piuttosto che pagare per i tentativi di Haiku più un fallback.
Un modello di registrazione per i passi 1 e 2 attraverso il endpoint nativo di Claude di AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
SYSTEM_PROMPT = "Tu triage i ticket di supporto..." # prefisso stabile, memorizzabile nella cache
def classify(ticket: str) -> str:
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"},
system=[{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": ticket}],
)
u = r.usage
prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
+ (u.cache_creation_input_tokens or 0))
if prompt_tokens > 90_000:
print(f"avviso: prompt a {prompt_tokens} token, vicino alla linea di prezzo dei 100K")
return next(b.text for b in r.content if b.type == "text")
Se cache_read_input_tokens rimane a zero in chiamate ripetute, qualcosa nel prefisso sta cambiando tra le richieste, come un timestamp nel prompt di sistema.
FAQ
Quanto costa Claude Haiku 5.5?
Per i prompt fino a 100.000 token, $0.10 per milione di token in input e $0.50 per milione di token in output. Per prompt più lunghi, $0.50 e $2.50, applicati all'intera richiesta. Le letture della cache costano un decimo della tariffa di input, e l'API Batch dimezza i prezzi di input e output.
È vero che Haiku 5.5 è davvero il 90% più economico di Haiku 4.5?
Per token, sui prompt brevi, sì. Per compito, meno: il nuovo tokenizer conta circa il 30% in più di token per lo stesso testo, il pensiero è attivo per impostazione predefinita e i prompt lunghi ricevono solo un taglio del 50%. Anthropic stima un risparmio tipico di circa il 75%. Un classificatore per prompt brevi con caching può risparmiare circa il 90%.
Cosa succede se il mio prompt supera i 100.000 token?
L'intera richiesta passa al listino prezzi più alto, sia per input che per output. Nell'esempio del contratto sopra, il 14% di testo in più ha reso la richiesta 5.6 volte più costosa.
I token memorizzati nella cache contano verso la soglia dei 100K?
Anthropic non ha dichiarato questo esplicitamente. I suoi prezzi elencano tariffe di lettura della cache separate per ciascun livello, quindi l'assunzione sicura è che l'intero prompt, memorizzato nella cache o meno, decide il livello.
I token di pensiero costano extra?
Vengono fatturati come token di output alla tariffa normale di output. Poiché il pensiero è attivo per impostazione predefinita a sforzo medio, possono aggiungere notevolmente a un percorso che prima produceva risposte brevi. Ridurre lo sforzo li riduce.
È Haiku 5.5 più economico di GPT-6 Luna?
Per i prompt fino a 100K token i prezzi di listino sono gli stessi. Tra 100K e 272K token, Luna rimane alla sua tariffa base mentre Haiku 5.5 passa a quella più alta, quindi Luna è più economica lì a prezzo di listino. I tokenizer differiscono, quindi confronta le bollette reali.
Posso usare il Livello Prioritario con Haiku 5.5?
No. Il Livello Prioritario non è supportato su Haiku 5.5, quindi gli impegni su Haiku 4.5 non si trasferiscono.
Continua a leggere: la serie Claude Haiku 5.5
- Un prezzo per token basso si ripaga solo se il modello può svolgere il compito. Per vedere come Haiku 5.5 si confronta con Haiku 4.5, GPT-6 Luna e Sonnet 5.5, leggi Claude Haiku 5.5 vs Haiku 4.5: Cosa Comprano Ora Dieci Cent
- I token di pensiero erano la maggiore assunzione negli esempi sopra. Per conteggi di token misurati a ciascun livello di sforzo, leggi Claude Haiku 5.5 Livelli di Sforzo: Il Medio È il Predefinito, Il Basso È Spesso Sufficiente
- Il cambiamento del tokenizer e il nuovo minimo di caching si presentano anche come lavoro di migrazione. Per gli errori e i cambiamenti silenziosi da aspettarsi quando si passa da Haiku 4.5, leggi Migrazione da Claude Haiku 4.5 a 5.5: Cinque Errori 400 e i Cambiamenti Silenziosi
Fonti
- Prezzi (Documenti della Piattaforma Claude)
- Introduzione a Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 su AIHubMix
- Claude Haiku 5.5 È Disponibile a $0.10 per Milione di Token. Leggi la Regola dei 100K Prima di Migrare (Roo's Newsletter)
- Prezzi API di GPT-6 Luna (OpenRouter)



