Claude Haiku 4.5 ha ottenuto lo 0,0% su Terminal-Bench 4.0. Claude Haiku 5.5 ottiene il 39,2% e costa un decimo per token: $0,10 per milione di token di input e $0,50 per milione di token di output, contro $1 e $5 per Haiku 4.5.
Questa è l'aggiornamento in una riga. Il piccolo modello Claude è passato da "buono per la classificazione, non per gli agenti" a un subagente utilizzabile, e il suo prezzo ora è allineato a quello di GPT-6 Luna di OpenAI. Anthropic lo ha rilasciato il 7 ottobre 2026 come Claude Haiku 5.5, ID modello claude-haiku-5-5, ed è già elencato su AIHubMix.
Il prezzo viene con condizioni, e anche i punteggi di benchmark. Questo post copre cosa è cambiato, quanto si avvicina Haiku 5.5 a Sonnet 5.5, dove è la scelta sbagliata e chi dovrebbe passare ora.
Cosa è cambiato e cosa non è cambiato
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Prezzo input / output | $1 / $5 | $0,10 / $0,50 |
| Finestra di contesto | 200K | 1M |
| Output massimo | 64K | 128K |
| Pensiero | Budget manuale, disattivato per impostazione predefinita | Adattivo, attivato per impostazione predefinita |
| Livelli di impegno | Nessuno | Cinque, medio per impostazione predefinita |
| Token per lo stesso testo | Baseline | Circa il 30% in più |
| Strumento di utilizzo del browser | No | Sì |
I prezzi di Haiku 5.5 si applicano a richieste fino a 100K token; richieste più lunghe pagano $0,50 / $2,50. I prezzi sono per milione di token.
Cosa rimane invariato: la descrizione del lavoro. Anthropic continua a proporre Haiku per lavori ad alto volume e sensibili ai costi (sintesi, compattazione, query di database, classificazione) e per compiti di subagente sotto un modello più grande. Anthropic afferma che le richieste esistenti di Haiku 4.5 dovrebbero funzionare bene senza modifiche. Il codice di richiesta esistente è un'altra questione: cinque schemi di richiesta che funzionavano su Haiku 4.5 ora restituiscono un errore 400, come elencato nella guida alla migrazione di Anthropic e il post di migrazione in questa serie spiega.
Due cambiamenti alterano il comportamento del modello per impostazione predefinita. Il pensiero è ora attivato a meno che non venga disattivato, quindi una richiesta che non ha mai menzionato il pensiero può tornare con blocchi di thinking per primi e spendere token di output su di essi. E Haiku 5.5 è il primo Haiku con un impostazione di impegno, che ora è il principale dial tra costo e qualità.
Come si confronta con Haiku 4.5, Luna e Sonnet 5.5
I dati qui sotto provengono dai materiali di lancio di Anthropic e dalla scheda di sistema di Haiku 5.5, come compilato da Kingy.ai. Sono riportati dal fornitore, Anthropic ha eseguito i modelli GPT da solo e nessuno ha ancora riprodotto l'intera tabella in modo indipendente.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72,4% | 15,7% | 48,9% | 83,9% |
| L'Ultimo Esame dell'Umanità | 45,9% | 10,2% | n/a | 56,9% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 Main | 46,4% | n/a | 42,4% | 52,1% |
| Chartography | 46,4% | 6,4% | 29,1% | 61,6% |
L'Ultimo Esame dell'Umanità e Chartography sono senza strumenti. Il punteggio FrontierCode di Sonnet 5.5 è a sforzo xhigh.
Tre letture contano più di qualsiasi singola riga:
- Rispetto a Haiku 4.5, è una classe di modello diversa. Le valutazioni del lavoro conoscitivo raddoppiano circa, e le righe agentiche passano da quasi zero a utilizzabili. Haiku 4.5 non poteva completare un compito di Terminal-Bench; Haiku 5.5 completa circa due compiti su cinque.
- Rispetto a GPT-6 Luna, guida in ogni riga condivisa allo stesso prezzo di listino. I divari più ampi sono sull'uso del computer (72,4% contro 48,9%) e Terminal-Bench (39,2% contro 16,4%).
- Rispetto a Sonnet 5.5, il divario dipende dal compito. Su FrontierCode, Haiku è entro sei punti. Su Terminal-Bench, Sonnet ottiene il 70,6% rispetto al 39,2% di Haiku. Anthropic stesso afferma che Sonnet 5.5 e Opus 5.5 rimangono la scelta migliore per la codifica complessa agentica.
Leggi le note prima di citare questi numeri
I punteggi principali sono stati eseguiti al massimo sforzo, l'impostazione più costosa. L'impostazione predefinita è media, e i risultati delle esecuzioni a sforzo medio della scheda di sistema sono più bassi: 1277 su GDPval-AA invece di 1620, e 1372 su AA-Briefcase invece di 1578. Se distribuisci con l'impostazione predefinita, confronta con quei numeri, non con la tabella di lancio.
Il dato di OSWorld ha bisogno di un secondo sguardo. Il 72,4% è un credito parziale, mediato su checkpoint. La percentuale di compiti in cui Haiku 5.5 ha completato ogni checkpoint è del 37,1% (Luna: 17,1%). Per un agente browser che deve completare l'intero lavoro, il 37,1% è il numero su cui pianificare.
Cosa hanno riportato i primi clienti
Il post di lancio di Anthropic cita diversi clienti che hanno testato il modello prima del rilascio. Questi sono selezionati dal fornitore, ma puntano agli stessi carichi di lavoro:
- AlphaSense esegue circa 8 milioni di chiamate "Chiedi nel Documento" a settimana. Su 400 query di test, Haiku 5.5 ha ottenuto 0,84 contro 0,76 di Haiku 4.5.
- Box ha visto un guadagno di 11 punti rispetto a Haiku 4.5 con circa la metà della latenza.
- Asana ha misurato una latenza per compito inferiore del 30% e fino a 2,5 volte più veloce nell'inferenza per turno dell'agente, rispetto al suo modello attuale.
- HubSpot ha ottenuto il 92,8% sulla sua suite CRM, il punteggio migliore che avesse mai visto da un modello piccolo.
- Cognition utilizza Haiku 5.5 come "spalla" sotto Opus 5.5 in Devin Fusion e riporta che la coppia ha un punteggio FrontierCode di 66,2 a un costo e latenza inferiori.
Il modello: lavoro breve e ripetuto su documenti, e compiti di subagente sotto un modello più grande.
Dove Haiku 5.5 è la scelta sbagliata
- Codifica agentica complessa. Terminal-Bench è dove Sonnet 5.5 si distacca di più. Se un compito richiede molti passaggi, requisiti ambigui o una lunga catena di modifiche, inizia con Sonnet 5.5 o Opus 5.5.
- Richieste oltre 100K token. La finestra di 1M è reale, ma il prezzo non è uniforme su di essa. Oltre 100K token, l'intera richiesta passa a $0,50 / $2,50, e poiché il nuovo tokenizer conta circa il 30% in più di token, quella linea si trova vicino a 77K token come li contava Haiku 4.5. Il post sui prezzi in questa serie analizza i numeri.
- Lavoro che richiede xhigh o max per passare. L'output diventa lungo e costoso alle impostazioni più alte. La guida di Anthropic stessa è di confrontare con Sonnet 5.5 prima di stabilirsi lì.
- Team su Priority Tier. Haiku 5.5 non lo supporta, quindi un impegno di Priority Tier di Haiku 4.5 non si trasferisce.
- Test di sicurezza. Le salvaguardie informatiche di Haiku 5.5 sono più severe di quelle di Haiku 4.5 e bloccano i test di penetrazione. Aspettati motivi di stop
refusalsu quel tipo di lavoro, senza un fallback server-side su un altro modello.
Provalo tramite AIHubMix
L'impostazione di impegno di Haiku 5.5 vive nell'API dei Messaggi output_config, quindi il endpoint nativo di Claude su AIHubMix è la via più diretta. Installa un SDK Anthropic attuale (pip install -U anthropic) e puntalo su AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # lascia spazio per il pensiero, non solo per la risposta
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Classifica questo ticket come fatturazione, bug o altro: "
"'Sono stato addebitato due volte per ottobre.'",
}],
)
# I blocchi di pensiero possono venire per primi, quindi scegli il blocco di testo per tipo.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Due cose da controllare al tuo primo avvio. Leggi response.usage.output_tokens a low e di nuovo a high sullo stesso prompt: se i numeri non si muovono, l'impostazione di impegno non sta raggiungendo il modello. E nota che la pagina del modello di AIHubMix attualmente elenca una lunghezza di contesto di 200K per questo modello, sotto l'1M di Anthropic, quindi conferma il limite prima di inviare richieste molto lunghe.
Chi dovrebbe passare, chi dovrebbe aspettare
Passa ora se esegui classificazione, estrazione, instradamento, sintesi o Q&A documentale con richieste ben sotto i 100K token. Ottieni un modello molto più potente a una frazione del prezzo per token. Pianifica un'ora per le modifiche al codice di richiesta, poi testa l'impegno low contro medium nelle tue valutazioni.
Passa ora se utilizzi un modello grande per lavori di subagente per cui è sovraqualificato: estrarre una cifra da un file, controllare un file, riassumere un risultato di uno strumento. Questo è il ruolo che Anthropic e i suoi clienti di lancio enfatizzano.
Aspetta un ciclo se la tua integrazione utilizza l'uso del computer con lo strumento computer_20250124, prefill, o temperature=0. Ognuno di questi restituisce un 400 su Haiku 5.5, e risolverli richiede lavoro di codice, non un semplice cambio di stringa del modello.
Rimani dove sei se il tuo carico di lavoro è a lungo prompt (regolarmente oltre circa 77K token di Haiku 4.5), dipende da Priority Tier, o è codifica agentica complessa. Per l'ultimo gruppo, il confronto utile è Haiku 5.5 contro Sonnet 5.5 sul costo per compito completato, non Haiku 5.5 contro Haiku 4.5.
Quando sei pronto a confrontare, l'elenco dei modelli di AIHubMix mette Haiku 5.5, Sonnet 5.5 e Opus 5.5 dietro una chiave API, quindi la stessa valutazione può essere eseguita su tutti e tre.
FAQ
Claude Haiku 5.5 è migliore di Haiku 4.5 in tutto?
In ogni benchmark nella tabella di lancio di Anthropic, sì, spesso di un ampio margine. Le eccezioni sono pratiche piuttosto che qualitative: Priority Tier non è supportato, le richieste oltre 100K token costano di più per token rispetto alla tariffa per richieste brevi, e diversi vecchi schemi di richiesta ora restituiscono errori.
Haiku 5.5 è davvero il 90% più economico?
Il prezzo per token è il 90% più basso per richieste fino a 100K token e il 50% più basso oltre. Poiché il nuovo tokenizer conta circa il 30% in più di token per lo stesso testo, e il pensiero ora produce token di output, Anthropic stima il risparmio tipico intorno al 75%.
Come si confronta Haiku 5.5 con GPT-6 Luna?
Entrambi hanno un prezzo di $0,10 per milione di token di input e $0,50 per milione di token di output. Nei risultati riportati da Anthropic, Haiku 5.5 ottiene punteggi più alti in ogni benchmark in cui entrambi compaiono, in particolare sull'uso del computer e Terminal-Bench. Luna mantiene il suo prezzo base fino a una lunghezza di prompt più lunga, quindi i carichi di lavoro a lungo prompt dovrebbero essere valutati separatamente.
Può Haiku 5.5 sostituire Sonnet 5.5 per la codifica?
Per cambiamenti ristretti e ben definiti e compiti di subagente, può valere la pena testarlo. Per la codifica agentica complessa a più passaggi, Sonnet 5.5 ottiene punteggi molto più alti su Terminal-Bench 4.0 (70,6% contro 39,2%), e Anthropic raccomanda Sonnet o Opus per quel lavoro.
I punteggi di benchmark sono all'impostazione predefinita?
No. I punteggi principali sono stati eseguiti al massimo sforzo. L'impostazione predefinita è media, dove la scheda di sistema riporta risultati più bassi, ad esempio 1277 invece di 1620 su GDPval-AA.
La finestra di contesto di 1M significa che posso inviare richieste di 1M token a basso costo?
Puoi inviarle, ma qualsiasi cosa oltre 100K token viene fatturata a $0,50 input e $2,50 output per milione di token per l'intera richiesta. Controlla anche il limite di contesto elencato dal tuo gateway.
Cosa devo cambiare nel mio codice per passare?
Al minimo: l'ID del modello, qualsiasi budget di pensiero manuale, qualsiasi impostazione di temperatura o top_p, qualsiasi prefill dell'assistente e codice che legge il primo blocco di contenuto come risposta. Il post di migrazione in questa serie ha l'elenco completo.
Continua a leggere: la serie Claude Haiku 5.5
- I punteggi principali sono stati eseguiti al massimo sforzo, ma probabilmente distribuirai a impostazione media o bassa. Per vedere cosa costa ciascun livello in token e cosa perdi passando a un livello inferiore, leggi Claude Haiku 5.5 Livelli di Impegno: Il Medio è il Predefinito, il Basso è Spesso Sufficiente
- La cifra di un decimo del prezzo vale solo sotto una linea di lunghezza del prompt che il nuovo tokenizer sposta. Per esempi di costo lavorato e le regole di fatturazione che sono facili da perdere, leggi Claude Haiku 5.5 Prezzi: La Linea di 100K Dietro il Taglio del 90%
- Cambiare è più di un semplice cambio di stringa del modello: cinque vecchi schemi di richiesta ora falliscono. Per ogni errore, la sua causa e la sua soluzione, leggi Migrazione da Claude Haiku 4.5 a 5.5: Cinque Errori 400 e i Cambiamenti Silenziosi
Fonti
- Introduzione a Claude Haiku 5.5 (Anthropic)
- Guida alla migrazione di Claude Haiku 5.5 (Documentazione della piattaforma Claude)
- Claude Haiku 5.5 su AIHubMix
- Claude Haiku 5.5: Benchmark, Specifiche, Sol & Luna a Confronto (Kingy.ai)
- Analisi di Intelligenza, Prestazioni & Prezzo di Claude Haiku 5.5 (Analisi Artificiale)



