Claude Haiku 4.5 scoorde 0,0% op Terminal-Bench 4.0. Claude Haiku 5.5 scoort 39,2%, en het kost een tiende per token: $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens, tegenover $1 en $5 voor Haiku 4.5.
Dat is de upgrade in één regel. Het kleine Claude-model ging van "prima voor classificatie, niet voor agenten" naar een bruikbare subagent, en de prijs komt nu overeen met die van OpenAI's GPT-6 Luna tot op de cent. Anthropic heeft het op 7 oktober 2026 uitgebracht als Claude Haiku 5.5, model-ID claude-haiku-5-5, en het is al vermeld op AIHubMix.
De prijs komt met voorwaarden, en dat geldt ook voor de benchmark scores. Deze post behandelt wat er veranderd is, hoe dicht Haiku 5.5 bij Sonnet 5.5 komt, waar het de verkeerde keuze is, en wie nu zou moeten overstappen.
Wat is veranderd en wat niet
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Invoer / uitvoer prijs | $1 / $5 | $0,10 / $0,50 |
| Contextvenster | 200K | 1M |
| Max uitvoer | 64K | 128K |
| Denken | Handmatig budget, standaard uit | Adaptief, standaard aan |
| Inspanningsniveaus | Geen | Vijf, standaard medium |
| Tokens voor dezelfde tekst | Basislijn | Ongeveer 30% meer |
| Browser gebruik tool | Nee | Ja |
Haiku 5.5 prijzen zijn van toepassing op prompts tot 100K tokens; langere prompts betalen $0,50 / $2,50. Prijzen zijn per miljoen tokens.
Wat hetzelfde blijft: de functiebeschrijving. Anthropic blijft Haiku aanbieden voor werk met een hoog volume en kostenbewustzijn (samenvattingen, compressie, databasequery's, classificatie) en voor subagenttaken onder een groter model. Anthropic zegt dat bestaande Haiku 4.5 prompts goed zouden moeten werken zonder wijzigingen. Bestaande aanvraagcode is een ander verhaal: vijf aanvraagpatronen die werkten op Haiku 4.5 geven nu een 400-fout, zoals vermeld in Anthropic's migratiehandleiding en de migratiepost in deze serie loopt hier doorheen.
Twee veranderingen beïnvloeden hoe het model zich standaard gedraagt. Denken is nu aan tenzij je het uitschakelt, dus een aanvraag die nooit over denken sprak, kan terugkomen met thinking blokken eerst en tokens uitgeven voor hen. En Haiku 5.5 is de eerste Haiku met een inspanning instelling, die nu de belangrijkste schakel is tussen kosten en kwaliteit.
Hoe het scoort tegen Haiku 4.5, Luna en Sonnet 5.5
Cijfers hieronder komen uit de lancering materialen van Anthropic en de Haiku 5.5 systeemkaart, zoals samengesteld door Kingy.ai. Ze zijn door de leverancier gerapporteerd, Anthropic heeft de GPT-modellen zelf uitgevoerd, en niemand heeft de volledige tabel tot nu toe onafhankelijk gereproduceerd.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72,4% | 15,7% | 48,9% | 83,9% |
| Humanity's Last Exam | 45,9% | 10,2% | n.v.t. | 56,9% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 Hoofd | 46,4% | n.v.t. | 42,4% | 52,1% |
| Chartography | 46,4% | 6,4% | 29,1% | 61,6% |
Humanity's Last Exam en Chartography zijn zonder tools. Sonnet 5.5's FrontierCode score is bij xhigh inspanning.
Drie cijfers zijn belangrijker dan welke enkele rij dan ook:
- In vergelijking met Haiku 4.5 is het een ander type model. De beoordelingen voor kenniswerk verdubbelen ongeveer, en de agentische rijen gaan van bijna nul naar bruikbaar. Haiku 4.5 kon een Terminal-Bench taak niet voltooien; Haiku 5.5 voltooit ongeveer twee op de vijf.
- In vergelijking met GPT-6 Luna leidt het op elke gedeelde rij tegen dezelfde lijstprijs. De grootste verschillen zijn bij computergebruik (72,4% vs 48,9%) en Terminal-Bench (39,2% vs 16,4%).
- In vergelijking met Sonnet 5.5 hangt de kloof af van de taak. Bij FrontierCode ligt Haiku binnen zes punten. Bij Terminal-Bench scoort Sonnet 70,6% tegen Haiku's 39,2%. Anthropic zelf zegt dat Sonnet 5.5 en Opus 5.5 de betere keuze blijven voor complexe agentische codering.
Lees de kleine lettertjes voordat je deze cijfers citeert
De hoofdscores zijn uitgevoerd op maximale inspanning, de duurste instelling. De standaard is medium, en de medium-inspanningsruns van de systeemkaart komen lager uit: 1277 op GDPval-AA in plaats van 1620, en 1372 op AA-Briefcase in plaats van 1578. Als je op de standaard inzet, vergelijk dan met die cijfers, niet de lanceringstabel.
De OSWorld-cijfers hebben ook een tweede blik nodig. De 72,4% is gedeeltelijke krediet, gemiddeld over checkpoints. Het aandeel taken waarbij Haiku 5.5 elke checkpoint voltooide is 37,1% (Luna: 17,1%). Voor een browseragent die de hele klus moet klaren, is 37,1% het getal om rekening mee te houden.
Wat vroege klanten rapporteerden
Anthropic's lancering post citeert verschillende klanten die het model voor de release hebben getest. Dit zijn door de leverancier geselecteerde klanten, maar ze wijzen op dezelfde werkbelasting:
- AlphaSense voert ongeveer 8 miljoen "Vraag in Document" oproepen per week uit. Bij 400 testvragen scoorde Haiku 5.5 0,84 tegen Haiku 4.5's 0,76.
- Box zag een winst van 11 punten ten opzichte van Haiku 4.5 bij ongeveer de helft van de latentie.
- Asana meet meer dan 30% lagere latentie per taak en tot 2,5x snellere inferentie per agentbeurt, vergeleken met het huidige model.
- HubSpot behaalde 92,8% op zijn CRM-suite, de beste score die het had gezien van een klein model.
- Cognition gebruikt Haiku 5.5 als een "sidekick" onder Opus 5.5 in Devin Fusion en meldt dat het paar een FrontierCode score van 66,2 behoudt tegen lagere kosten en latentie.
Het patroon: kort, herhaald werk over documenten, en subagenttaken onder een groter model.
Waar Haiku 5.5 de verkeerde keuze is
- Complex agentische codering. Terminal-Bench is waar Sonnet 5.5 het verst voorop loopt. Als een taak veel stappen, vage vereisten of een lange keten van bewerkingen vereist, begin dan met Sonnet 5.5 of Opus 5.5.
- Prompts boven de 100K tokens. Het 1M venster is echt, maar de prijs is niet gelijkmatig over het venster. Boven de 100K tokens verschuift de hele aanvraag naar $0,50 / $2,50, en omdat de nieuwe tokenizer ongeveer 30% meer tokens telt, ligt die lijn dicht bij 77K tokens zoals Haiku 4.5 ze telde. De prijspost in deze serie werkt de cijfers door.
- Werk dat xhigh of max nodig heeft om te slagen. Uitvoer wordt lang en duur bij de hoogste instellingen. Anthropic's eigen richtlijn is om te vergelijken met Sonnet 5.5 voordat je daar besluit.
- Teams op Priority Tier. Haiku 5.5 ondersteunt het niet, dus een Haiku 4.5 Priority Tier verbintenis gaat niet over.
- Beveiligingstests. Haiku 5.5's cyberbeveiligingen zijn strenger dan die van Haiku 4.5 en blokkeren penetratietests. Verwacht
refusalstopredenen voor dat soort werk, zonder server-side terugval naar een ander model.
Probeer het via AIHubMix
Haiku 5.5's inspanning instelling bevindt zich in de Messages API's output_config, dus de Claude native endpoint op AIHubMix is de meest directe route. Installeer een actuele Anthropic SDK (pip install -U anthropic) en wijs deze aan AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # laat ruimte voor denken, niet alleen voor het antwoord
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Classificeer dit ticket als facturering, bug of ander: "
"'Ik ben twee keer in rekening gebracht voor oktober.'",
}],
)
# Denkblokken kunnen eerst komen, dus kies het tekstblok op type.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Twee dingen om te controleren bij je eerste run. Lees response.usage.output_tokens bij low en opnieuw bij high op dezelfde prompt: als de cijfers niet veranderen, bereikt de inspanning instelling het model niet. En let op dat de modelpagina van AIHubMix momenteel een contextlengte van 200K voor dit model vermeldt, onder Anthropic's 1M, dus bevestig de limiet voordat je zeer lange prompts verzendt.
Wie zou moeten overstappen, wie zou moeten wachten
Stap nu over als je classificatie, extractie, routering, samenvattingen of document Q&A uitvoert met prompts ruim onder de 100K tokens. Je krijgt een veel sterker model voor een fractie van de tokenprijs. Plan een uur voor de wijzigingen in de aanvraagcode, en test vervolgens inspanning low tegen medium op je eigen evaluaties.
Stap nu over als je een groot model gebruikt voor subagenttaken waarvoor het overgekwalificeerd is: een figuur uit een archief halen, een bestand controleren, een toolresultaat samenvatten. Dit is de rol die Anthropic en zijn lancering klanten benadrukken.
Wacht een sprint als je integratie computergebruik met de computer_20250124 tool, prefill of temperature=0 gebruikt. Elk van deze geeft een 400 terug op Haiku 5.5, en het oplossen ervan is codewerk, geen model-stringwisseling.
Blijf waar je bent als je werkbelasting lange prompts vereist (regelmatig boven ongeveer 77K Haiku 4.5 tokens), afhankelijk is van Priority Tier, of complexe agentische codering is. Voor de laatste groep is de nuttige vergelijking Haiku 5.5 tegen Sonnet 5.5 op kosten per voltooide taak, niet Haiku 5.5 tegen Haiku 4.5.
Wanneer je klaar bent om te vergelijken, plaatst de AIHubMix model lijst Haiku 5.5, Sonnet 5.5 en Opus 5.5 achter één API-sleutel, zodat dezelfde evaluatie tegen alle drie kan worden uitgevoerd.
FAQ
Is Claude Haiku 5.5 beter dan Haiku 4.5 in alles?
Op elke benchmark in de lanceringstabel van Anthropic, ja, vaak met een grote marge. De uitzonderingen zijn praktisch in plaats van kwaliteit: Priority Tier wordt niet ondersteund, prompts boven de 100K tokens kosten meer per token dan het kort-prompt tarief, en verschillende oude aanvraagpatronen geven nu fouten terug.
Is Haiku 5.5 echt 90% goedkoper?
De prijs per token is 90% lager voor prompts tot 100K tokens en 50% lager daarboven. Omdat de nieuwe tokenizer ongeveer 30% meer tokens telt voor dezelfde tekst, en denken nu uitvoertokens produceert, schat Anthropic de typische besparing op ongeveer 75%.
Hoe verhoudt Haiku 5.5 zich tot GPT-6 Luna?
Beide hebben een prijs van $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens. In de door Anthropic gerapporteerde resultaten scoort Haiku 5.5 hoger op elke benchmark waar beide verschijnen, het duidelijkst bij computergebruik en Terminal-Bench. Luna houdt zijn basisprijs tot een langere promptlengte, dus lange-prompt werkbelastingen moeten apart geprijsd worden.
Kan Haiku 5.5 Sonnet 5.5 vervangen voor codering?
Voor smalle, goed afgebakende wijzigingen en subagenttaken kan het de moeite waard zijn om te testen. Voor complexe multi-stap agentische codering scoort Sonnet 5.5 veel hoger op Terminal-Bench 4.0 (70,6% vs 39,2%), en Anthropic raadt Sonnet of Opus aan voor dat werk.
Zijn de benchmark scores op de standaardinstelling?
Nee. De hoofdscores zijn uitgevoerd op maximale inspanning. De standaard is medium, waar de systeemkaart lagere resultaten rapporteert, bijvoorbeeld 1277 in plaats van 1620 op GDPval-AA.
Betekent het 1M contextvenster dat ik 1M-token prompts goedkoop kan verzenden?
Je kunt ze verzenden, maar alles boven de 100K tokens wordt gefactureerd tegen $0,50 invoer en $2,50 uitvoer per miljoen tokens voor de hele aanvraag. Controleer ook de vermelde contextlimiet van je gateway.
Wat moet ik veranderen in mijn code om over te stappen?
Minimaal: de model-ID, elk handmatig denkbudget, elke temperatuur of top_p instelling, elke assistent prefill, en code die het eerste inhoudsblok als antwoord leest. De migratiepost in deze serie heeft de volledige lijst.
Blijf lezen: de Claude Haiku 5.5 serie
- De hoofdscores zijn uitgevoerd op maximale inspanning, maar je zult waarschijnlijk op medium of laag inzetten. Om te zien wat elk niveau kost in tokens en wat je verliest door naar beneden te stappen, lees Claude Haiku 5.5 Inspanningsniveaus: Medium Is de Standaard, Laag Is Vaak Voldoende
- Het cijfer van een tiende van de prijs geldt alleen onder een prompt-lengte lijn die de nieuwe tokenizer verplaatst. Voor voorbeelden van werkelijke kosten en de factureringsregels die gemakkelijk te missen zijn, lees Claude Haiku 5.5 Prijzen: De 100K Lijn Achter de 90% Korting
- Overstappen is meer dan een model-string wijziging: vijf oude aanvraagpatronen falen nu. Voor elke fout, de oorzaak en de oplossing, lees Migreren van Claude Haiku 4.5 naar 5.5: Vijf 400 Fouten en de Stille Veranderingen
Bronnen
- Introductie van Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 migratiehandleiding (Claude Platform Docs)
- Claude Haiku 5.5 op AIHubMix
- Claude Haiku 5.5: Benchmarks, Specificaties, Sol & Luna Vergelijkt (Kingy.ai)
- Claude Haiku 5.5 Intelligentie, Prestaties & Prijsanalyse (Artificial Analysis)



