Claude Haiku 5.5 kost $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens, een tiende van Haiku 4.5's $1 en $5. Dit geldt voor prompts tot 100.000 tokens. Boven die grens wordt het hele verzoek gefactureerd tegen $0,50 en $2,50, wat de helft is van de prijs van Haiku 4.5 in plaats van een tiende.
Anthropic schat de typische besparing op ongeveer 75%, niet 90%, en het verschil komt voort uit drie zaken waar deze post op ingaat: waar je prompts zich bevinden ten opzichte van de 100K-grens, hoeveel denktokens de standaardinstellingen genereren, en een nieuwe tokenizer die dezelfde tekst telt als ongeveer 30% meer tokens. Twee uitgewerkte voorbeelden hieronder laten zien hoe een echte rekening eruitziet.
De tarievenkaart
Prijzen per miljoen tokens, uit Anthropic's Haiku 5.5 lancering post en prijs pagina:
| Token type | Haiku 5.5, kort | Haiku 5.5, lang | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| Invoer | $0,10 | $0,50 | $1,00 | $2,00 |
| Uitvoer | $0,50 | $2,50 | $5,00 | $10,00 |
| Cache lezen | $0,01 | $0,05 | $0,10 | $0,10 |
| Cache schrijven, 5 min | $0,125 | $0,625 | $1,25 | $2,50 |
| Cache schrijven, 1 uur | $0,20 | $1,00 | $2,00 | $4,00 |
"Kort" betekent een prompt van 100.000 tokens of minder; "lang" betekent meer dan 100.000. De Batch API geeft 50% korting op invoer en uitvoer. De prijs voor cache lezen van Sonnet 5.5 werd op dezelfde dag verlaagd van $0,20 naar $0,10.
De Haiku 5.5 pagina op AIHubMix vermeldt dezelfde twee niveaus, met webzoekopdrachten voor $0,01 per verzoek.
Factureringsregels die gemakkelijk te missen zijn
Het hele verzoek verandert van niveau, niet alleen het overschot. Anthropic prijst Haiku 5.5 met twee tarievenkaarten, afhankelijk van de lengte van de prompt. Een prompt van 100.000 tokens betaalt $0,0100 voor zijn invoer; een prompt van 100.001 tokens betaalt $0,0500, en de uitvoer kost ook vijf keer zoveel. Haiku 5.5 is hier de uitzondering: de andere huidige 1M-contextmodellen van Anthropic factureren het volledige venster tegen hun standaardtarieven.
De grens komt eerder dan je oude dashboards suggereren. Haiku 5.5 gebruikt een nieuwere tokenizer, en dezelfde tekst produceert ongeveer 30% meer tokens dan op Haiku 4.5. 100.000 delen door 1,3 plaatst de grens nabij 77.000 tokens zoals Haiku 4.5 ze telde. Een prompt van 78.000 tokens op je oude dashboard wordt ongeveer 101.000 tokens op Haiku 5.5, en betaalt de lange prijs. Die rekensom komt van het 30%-cijfer in Anthropic's migratiehandleiding; de exacte toename hangt af van de inhoud, dus tel echte prompts opnieuw op het nieuwe model.
Denken is standaard ingeschakeld, en het wordt gefactureerd als uitvoer. Haiku 4.5 dacht alleen wanneer daarom werd gevraagd. Haiku 5.5 voert adaptief denken uit met medium inspanning, tenzij je het verandert, zodat een route die vroeger 200 uitvoertokens terugbracht, nu enkele honderden meer kan terugbrengen.
Korte prompts kunnen nu worden gecached. De minimale cachebare prompt daalt van 4.096 tokens op Haiku 4.5 naar 512 op Haiku 5.5, volgens Anthropic's migratiehandleiding. Een systeemprompt van 3.000 tokens die nooit kon worden gecached op Haiku 4.5 kan nu worden gecached, en een cache lezen kost een tiende van het invoertarief.
Priority Tier is niet beschikbaar. Als je een Priority Tier verplichting hebt op Haiku 4.5, wordt deze niet overgedragen naar Haiku 5.5. Plan capaciteit afzonderlijk.
Gecachede tokens en de 100K-grens: neem aan dat ze meetellen. Anthropic vermeldt een aparte prijs voor cache lezen voor elk niveau, wat suggereert dat de hele prompt, gecached of niet, het niveau bepaalt. Anthropic heeft dit niet expliciet vermeld, dus de veilige aanname is dat een 95K gecached prefix plus een 6K vraag een lange prompt is.
Uitgewerkt voorbeeld 1: een supportticket-classificator
Aannames, in Haiku 4.5 token tellingen: een systeemprompt van 3.000 tokens met tooldefinities, een ticket van 1.000 tokens, een antwoord van 200 tokens, en 1 miljoen verzoeken per maand. Haiku 4.5 draait met denken uit.
Op Haiku 5.5 wordt dezelfde tekst 3.900 + 1.300 invoertokens en een antwoord van 260 tokens. Denken wordt verondersteld 300 tokens toe te voegen bij laag inspanning en 800 bij medium. Die denkfiguren zijn aannames; meet de jouwe.
| Instelling | Per verzoek | Per maand |
|---|---|---|
| Haiku 4.5 | $0,00500 | $5.000 |
| Haiku 5.5, laag, geen cache | $0,00080 | $800 |
| Haiku 5.5, laag, gecached prefix | $0,00045 | $453 |
| Haiku 5.5, medium, gecached prefix | $0,00070 | $703 |
| Sonnet 5.5, medium, gecached prefix | $0,01359 | $13.674 |
Maandelijkse gecachede rijen omvatten ongeveer $4 aan cache schrijven voor Haiku 5.5 en ongeveer $84 voor Sonnet 5.5, uitgaande van één 5-minuten schrijven elke vijf minuten. Sonnet 5.5 gebruikt dezelfde token aannames als Haiku op medium.
Hoe de gecachede laag rij optelt: 3.900 gecachede tokens tegen $0,01 per miljoen ($0,000039), plus 1.300 verse invoertokens tegen $0,10 ($0,00013), plus 560 uitvoertokens tegen $0,50 ($0,00028), voor $0,000449 per verzoek.
Het patroon: caching en inspanning samen verplaatsen de rekening van 16% van de oude kosten (geen cache, laag) naar 9% (gecached, laag). Het laten van inspanning op de standaard in plaats van laag voegt ongeveer $250 per maand toe bij dit volume. Geen van beide keuzes doet er veel toe in absolute termen naast Haiku 4.5's $5.000, wat de reden is dat de classificatorzaak is waar de 90% kop echt is.
Uitgewerkt voorbeeld 2: een contractbeoordeling die de grens overschrijdt
Aannames, in Haiku 4.5 token tellingen: een contract plus instructies van 70.000 tokens, een antwoord van 1.500 tokens, geen caching. Op Haiku 5.5 wordt dat 91.000 invoertokens, een antwoord van 1.950 tokens, en een veronderstelde 2.000 denktokens bij medium, dus 3.950 uitvoertokens.
Maak nu het contract 14% langer: 80.000 tokens op Haiku 4.5, 104.000 op Haiku 5.5.
| Contractgrootte (Haiku 4.5 telling) | Haiku 4.5 | Haiku 5.5 | Verandering |
|---|---|---|---|
| 70.000 tokens | $0,0775 | $0,0111 | 86% lager |
| 80.000 tokens | $0,0875 | $0,0619 | 29% lager |
De tweede rij: 104.000 invoertokens tegen $0,50 per miljoen ($0,052) plus 3.950 uitvoertokens tegen $2,50 ($0,0099). Veertien procent meer tekst kost 5,6 keer zoveel op Haiku 5.5.
De oplossing is om onder de grens te blijven. Het splitsen van het langere contract in twee oproepen van ongeveer 53.000 tokens elk (de helft van het contract plus de instructies in elk) kost ongeveer $0,015 in totaal tegen het korte tarief, minder dan een kwart van de enkele lange oproep. Of een splitsing werkt, hangt af van de taak; clausule-voor-clausule beoordeling splitst schoon, een vraag die het hele document in één keer nodig heeft, doet dat niet.
Hoe het zich verhoudt qua kosten per taak
Ten opzichte van Sonnet 5.5 is Haiku 5.5 ongeveer een twintigste van de prijs per token op korte prompts. Maar de prijs per token is niet de prijs per voltooide taak. Bij complexe agentische codering scoort Sonnet 5.5 70,6% op Terminal-Bench 4.0 tegenover Haiku 5.5's 39,2%, in de door Anthropic gerapporteerde resultaten, en een goedkopere aanvraag die faalt en opnieuw wordt geprobeerd, of opnieuw wordt gedaan door een groter model, is niet goedkoper. Anthropic's eigen advies is om te vergelijken met Sonnet 5.5 voordat je Haiku op xhigh of max draait. Sonnet 5.5 werd op dezelfde dag ook goedkoper: de prijzen voor cache lezen werden gehalveerd, wat volgens Anthropic ongeveer 20% van de meeste agentische werkzaamheden afsnijdt.
Ten opzichte van GPT-6 Luna zijn de prijzen voor korte prompts identiek, inclusief cache lezen. Het verschil is de regel voor lange prompts. Luna's lange-context tarief begint boven 272.000 invoertokens en is $0,20 / $0,75, terwijl Haiku 5.5 begint boven 100.000 en $0,50 / $2,50 is. Voor een werklast tussen 100K en 272K tokens is Luna veel goedkoper op lijstprijs. De twee modellen gebruiken verschillende tokenizers, dus vergelijk gemeten rekeningen, niet token tellingen.
Cijfers over de 100K-drempel en het effect van de tokenizer zijn ook door Roo's Nieuwsbrief doorgerekend, wiens rekensom overeenkomt met de bovenstaande voorbeelden.
Stappen die de rekening verlagen
- Tel tokens op het nieuwe model en waarschuw voor 100K. Log de volledige promptgrootte voor elk verzoek en waarschuw bij ongeveer 90.000 tokens, zodat prompts die omhoog drijven worden ingekort of gesplitst voordat ze van niveau veranderen.
- Cache de stabiele prefix. Systeemprompt en tooldefinities eerst, variabele inhoud laatst. Met een minimum van 512 tokens kwalificeren de meeste productie systeemprompts nu. AIHubMix's Claude prompt caching gids toont het aanvraagformaat.
- Stel inspanning expliciet in. Gebruik
laagvoor hoogvolume, eenvoudige routes. De standaardmediumkost meer bij elk verzoek, of de route het nu nodig heeft of niet. - Stel max_tokens in voor denken plus antwoord. Te klein en je betaalt voor denken dat eindigt zonder antwoord.
- Batch wat kan wachten. De Batch API halveert invoer- en uitvoertarieven.
- Stuur omhoog in plaats van omlaag opnieuw te proberen. Als een taaktype vaak faalt op Haiku, stuur het dan eerst naar Sonnet 5.5 in plaats van te betalen voor Haiku-pogingen plus een fallback.
Een logpatroon voor stappen 1 en 2 via AIHubMix's Claude native endpoint:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
SYSTEM_PROMPT = "Je triageert supporttickets..." # stabiele, cachebare prefix
def classify(ticket: str) -> str:
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"},
system=[{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": ticket}],
)
u = r.usage
prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
+ (u.cache_creation_input_tokens or 0))
if prompt_tokens > 90_000:
print(f"waarschuwing: prompt op {prompt_tokens} tokens, nabij de 100K prijsgrens")
return next(b.text for b in r.content if b.type == "text")
Als cache_read_input_tokens op nul blijft staan bij herhaalde oproepen, verandert er iets in de prefix tussen verzoeken, zoals een tijdstempel in de systeemprompt.
FAQ
Hoeveel kost Claude Haiku 5.5?
Voor prompts tot 100.000 tokens, $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens. Voor langere prompts, $0,50 en $2,50, toegepast op het hele verzoek. Cache lezen kost een tiende van het invoertarief, en de Batch API halveert invoer- en uitvoerprijzen.
Is Haiku 5.5 echt 90% goedkoper dan Haiku 4.5?
Per token, op korte prompts, ja. Per taak, minder: de nieuwe tokenizer telt ongeveer 30% meer tokens voor dezelfde tekst, denken is standaard ingeschakeld, en lange prompts krijgen slechts een korting van 50%. Anthropic schat een typische besparing van ongeveer 75%. Een korte prompt-classificator met caching kan ongeveer 90% besparen.
Wat gebeurt er als mijn prompt net boven de 100.000 tokens is?
Het hele verzoek gaat naar de hogere tarievenkaart, invoer en uitvoer gelijk. In het contractvoorbeeld hierboven maakte 14% meer tekst het verzoek 5,6 keer duurder.
Tellen gecachede tokens mee voor de 100K-drempel?
Anthropic heeft dit niet expliciet vermeld. De prijsstelling vermeldt aparte prijzen voor cache lezen voor elk niveau, dus de veilige aanname is dat de hele prompt, gecached of niet, het niveau bepaalt.
Kosten denktokens extra?
Ze worden gefactureerd als uitvoertokens tegen het normale uitvoertarief. Omdat denken standaard is ingeschakeld bij gemiddelde inspanning, kunnen ze merkbaar bijdragen aan een route die vroeger korte antwoorden produceerde. Het verlagen van de inspanning vermindert ze.
Is Haiku 5.5 goedkoper dan GPT-6 Luna?
Voor prompts tot 100K tokens zijn de lijstprijzen hetzelfde. Tussen 100K en 272K tokens blijft Luna op zijn basistarief terwijl Haiku 5.5 naar zijn hogere gaat, dus Luna is daar goedkoper op lijstprijs. Tokenizers verschillen, dus vergelijk echte rekeningen.
Kan ik Priority Tier gebruiken met Haiku 5.5?
Nee. Priority Tier wordt niet ondersteund op Haiku 5.5, dus verplichtingen op Haiku 4.5 worden niet overgedragen.
Blijf lezen: de Claude Haiku 5.5 serie
- Een lage prijs per token betaalt zich alleen terug als het model de taak kan uitvoeren. Om te zien hoe Haiku 5.5 scoort ten opzichte van Haiku 4.5, GPT-6 Luna, en Sonnet 5.5, lees Claude Haiku 5.5 vs Haiku 4.5: Wat Tien Cents Nu Koopt
- Denktokens waren de grootste aanname in de bovenstaande voorbeelden. Voor gemeten token tellingen op elk inspanningsniveau, lees Claude Haiku 5.5 Inspanningsniveaus: Medium Is de Standaard, Laag Is Vaak Voldoende
- De tokenizer verandering en de nieuwe caching minimum komen ook naar voren als migratiewerk. Voor de fouten en stille veranderingen om te verwachten bij de overstap van Haiku 4.5, lees Migreren van Claude Haiku 4.5 naar 5.5: Vijf 400 Fouten en de Stille Veranderingen
Bronnen
- Prijzen (Claude Platform Docs)
- Introductie van Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 op AIHubMix
- Claude Haiku 5.5 Is Uit voor $0,10 per Miljoen Tokens. Lees de 100K Regel Voordat Je Migreert (Roo's Nieuwsbrief)
- GPT-6 Luna API prijzen (OpenRouter)



