Claude Haiku 5.5 Inspanningsniveaus: Medium Is de Standaard, Laag Is Vaak Voldoende

AIHubMix7 min leestijd
Claude Haiku 5.5 Inspanningsniveaus: Medium Is de Standaard, Laag Is Vaak Voldoende

Claude Haiku 5.5 is de eerste Haiku met een inspanningsinstelling, en deze instelling beïnvloedt de rekening meer dan alles wat je controleert. In de onafhankelijke runs van Artificial Analysis scoorde Haiku 5.5 met maximale inspanning 43 op de Intelligentie-index en met lage inspanning 29. Max gebruikte ook 440 miljoen outputtokens om door de index te komen; laag gebruikte 32 miljoen.

Dus het korte antwoord: laat het meeste werk op de standaardinstelling, medium. Verlaag hoge-volume, eenvoudige routes naar low. Verhoog kenniswerk en strikte instructievolging naar high. Behandel xhigh en max als instellingen waarvoor je bewijs nodig hebt, en vergelijk ze met Sonnet 5.5 voordat je je verbindt.

De rest van deze post laat zien wat elk niveau kost, waar het omhooggaan niet meer loont, en welke instellingen breken of duur worden wanneer je de inspanning verandert.

Wat de instelling is

Claude Haiku 5.5 ondersteunt vijf niveaus: low, medium, high, xhigh, en max. De standaard is medium, wat ongebruikelijk is: de meeste huidige Claude-modellen hebben als standaard high, en alleen Haiku 5.5 en Opus 5.5 hebben als standaard één niveau lager. Het verzenden van medium is hetzelfde als het weglaten van de parameter.

Inspanning vervangt het handmatige denkbudget dat Haiku 4.5 gebruikte. Een verzoek met thinking: {"type": "enabled", "budget_tokens": N} retourneert nu een 400, dus er is geen oud nummer om over te dragen. Volgens de inspanningdocumentatie van Anthropic stel je het in met output_config:

output_config={"effort": "low"}

Drie feiten kaderen alles hieronder:

  • Denken is standaard ingeschakeld. Haiku 5.5 voert adaptief denken uit tenzij anders aangegeven. Lagere inspanning betekent minder denken, en bij eenvoudige verzoeken kan het model het denken volledig overslaan.
  • Denktokens zijn outputtokens. Ze tellen mee voor max_tokens en worden berekend tegen het outputtarief ($0.50 per miljoen op prompts tot 100K tokens).
  • Vragen om minder denken in de prompt werkt niet. In de tests van Anthropic dacht het model nog steeds na toen de prompt het vroeg om direct te antwoorden. Inspanning is de hefboom.

Wat elk niveau kost

Twee onafhankelijke bronnen hebben Haiku 5.5 gemeten over inspanningsniveaus. Indexcijfers komen van Artificial Analysis; de FrontierCode-cijfers komen uit het openbare resultaatbestand van Cognition, zoals samengesteld door Kingy.ai. Geen van beide dekt jouw werklast, dus beschouw ze als de vorm van de curve, niet als jouw cijfers.

Artificial Analysis Intelligentie-index v4.3.2 (tien evaluaties, van kenniswerk tot terminaltaken):

Inspanning Indexscore Outputtokens voor de index Kosten per taak Tijd tot de eerste token
laag 29 32M $0.02 9.9 s
medium 34 54M $0.05 13.4 s
hoog 38 97M $0.08 28.0 s
max 43 440M $0.21 n/a

Artificial Analysis heeft geen xhigh-run gepubliceerd. De latentiefiguur bij maximale inspanning leek anomalisch, dus deze is weggelaten.

FrontierCode 1.1 Hoofd, Haiku 5.5 draait in Claude Code:

Inspanning Samengestelde score Kosten per rollout Outputtokens per rollout
laag 34.8% $0.06 23,868
medium 41.6% $0.13 36,172
hoog 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
max 46.4% $1.33 181,387

Kosten zijn afgerond op de cent.

Lees de twee tabellen samen en drie dingen springen eruit.

Van laag naar medium is de goedkoopste stap omhoog. Op de index koopt het 5 punten voor ongeveer 1.7 keer de outputtokens. Op FrontierCode koopt het 6.8 punten voor ongeveer twee keer de kosten per rollout.

Van medium naar hoog kan vlak zijn. Op FrontierCode scoorde hoog 0.3 punten boven medium en kostte ongeveer twee keer zoveel. Op de bredere index voegde hoog echter 4 punten toe. Of jouw werklast eruitziet als het eerste geval of het tweede, dat is precies wat een snelle evaluatie je vertelt.

De bovenste twee niveaus zijn duur. Van hoog naar max op de index stijgen de outputtokens ongeveer 4.5 keer voor 5 punten. Op FrontierCode kost max ongeveer tien keer zoveel als medium voor 4.8 meer punten, en de stap van xhigh naar max verdubbelt de kosten ongeveer voor 0.6 punten. De eigen richtlijnen van Anthropic zeggen hetzelfde in eenvoudigere termen: gebruik xhigh en max alleen waar jouw evaluaties een winst laten zien, en vergelijk ze eerst met Sonnet 5.5 op prestaties, kosten en snelheid.

Een reden waarom de standaardinstelling belangrijk is: de lancering benchmarks van Anthropic zijn uitgevoerd met maximale inspanning. De resultaten van de systeemkaart bij gemiddelde inspanning zijn lager (1277 op GDPval-AA in plaats van 1620). Als je op de standaardinstelling inzet, zijn dat de cijfers om mee te vergelijken.

Waar te beginnen, per werklast

Werklast Begin bij Verhoog wanneer
Classificatie, routering, tagging laag Labels verschuiven bij moeilijke gevallen
Extractie uit korte documenten laag Velden worden gemist of samengevoegd
Chat en live ondersteuning laag Regels slippen in lange chats
Samenvattingen en compactie medium Belangrijke details vallen weg
Subagentwerk onder een groter model medium Het leidende model doet het werk opnieuw
Agentic codering, nauwe wijzigingen medium Tests falen bij de eerste poging
Kenniswerk, lange agenttaken hoog Evaluaties tonen ruimte aan

Deze startpunten volgen de richtlijnen van Anthropic voor Haiku 5.5; de "verhoog" signalen zijn wat je moet in de gaten houden in je eigen logs.

De ene rij die een tweede blik waard is, is chat. Laag is het snelste niveau, wat geschikt is voor live ondersteuning. Maar Anthropic raadt high aan wanneer het volgen van instructies het belangrijkst is, bijvoorbeeld een ondersteuningsassistent die zijn systeempromptregels moet handhaven terwijl een gebruiker argumenteert. Test beide op de gesprekken die in het verleden verkeerd zijn gegaan.

Wat breekt of duur wordt wanneer de inspanning verandert

Een klein aantal max_tokens kan de reactie beëindigen voordat deze begint. Denken telt mee voor max_tokens. Een limiet die is ingesteld voor een classificatie van één woord, zeg 50 tokens, kan volledig worden besteed aan denken, en de reactie eindigt met stop_reason: "max_tokens" en geen tekst. Verhoog de limiet om ruimte te laten, of verlaag de inspanning.

De inspanning halverwege het gesprek veranderen reset de cache. Het veranderen van de bovenste inspanningswaarde tussen verzoeken maakt de promptcache ongeldig voor de berichten van het gesprek. Als een agent één moeilijke draai bij high nodig heeft binnen een low gesprek, biedt Anthropic een per-bericht inspanningsverandering (beta-header mid-conversation-output-config-2026-07-01, Claude API en Google Cloud) die de cache behoudt. Het vereist dat denken aan is. Of een gateway die beta-header doorgeeft, is het de moeite waard om te controleren voordat je erop vertrouwt.

Denken uitschakelen heeft beperkingen. thinking: {"type": "disabled"} wordt geaccepteerd bij low, medium, en high. Bij xhigh of max retourneert het een 400. Met denken uit, retourneert een per-bericht inspanningsverandering ook een 400, en het model kan een toolaanroep overslaan die het nodig heeft wanneer hetzelfde verzoek om JSON-output vraagt. Het advies van Anthropic is om denken aan te houden en in plaats daarvan een lager inspanningsniveau te gebruiken.

Laag kan vroeg stoppen. Met een lange coderingsagent-systeemprompt op low stopt Haiku 5.5 soms voordat het werk is gedaan en geeft de taak terug. In de tests van Anthropic halveerde het verplaatsen van low naar medium ongeveer het vroeg stoppen en meer dan verdubbelde de outputtokens per poging. De Haiku 5.5 prompting-gids heeft een korte instructie "blijf werken totdat het klaar is" die hetzelfde probleem aanpakt tegen een lagere prijs.

Laag en medium kunnen verificatie overslaan. Bij coderingstaken rapporteert het model soms een wijziging als voltooid zonder een test uit te voeren. De prompting-gids heeft een verificatieparagraaf hiervoor; het kost tokens maar verhoogt het aandeel gecontroleerde wijzigingen.

Xhigh kan een lege reactie retourneren. In multi-turn chats bij xhigh schrijft het model soms zijn hele antwoord binnen zijn denken en eindigt de beurt zonder zichtbare tekst. Als je op xhigh draait, controleer dan op lege tekstblokken.

Een tool forceren slaat denken over. Haiku 5.5 accepteert een geforceerde tool_choice, maar de reactie begint dan met de toolaanroep en zonder denken. Als het model moet redeneren voordat het de tool aanroept, gebruik dan auto en geef in de prompt aan wanneer het deze moet aanroepen.

Voer je eigen inspanningsronde uit via AIHubMix

De snelste manier om te kiezen is om dezelfde 20 tot 50 echte prompts op twee of drie niveaus uit te voeren en kwaliteit, outputtokens en latentie te vergelijken. Via de AIHubMix Claude native endpoint, met AIHUBMIX_API_KEY ingesteld:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Samenvat deze ondersteuningsaanvraag in één zin: ...",
    "Extracteer het factuurnummer en totaal van: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Bewaar `text` naast de prompt en beoordeel het tegen je eigen rubric.
    print(f"{effort}: {out_tokens} outputtokens, {seconds:.1f}s totaal")

Als outputtokens nauwelijks veranderen tussen low en high, bereikt de instelling waarschijnlijk het model niet; controleer het verzoek dat jouw gateway doorstuurt. Op de Haiku 5.5-pagina op AIHubMix is de prijs per token hetzelfde op elk inspanningsniveau, dus het aantal tokens van deze ronde converteert rechtstreeks naar dollars.

FAQ

Wat is het standaard inspanningsniveau voor Claude Haiku 5.5?
Medium. De meeste huidige Claude-modellen hebben als standaard hoog, dus code die op de standaard vertrouwde voor een ander model zal Haiku 5.5 één niveau lager uitvoeren, tenzij het de inspanning expliciet instelt.

Kan ik denken helemaal uitschakelen?
Bij lage, gemiddelde en hoge inspanning, ja, door denken op uit te zetten. Bij xhigh en max retourneert dat een fout. Anthropic raadt aan om de inspanning in plaats daarvan te verlagen, omdat het model zelf kan overslaan denken bij eenvoudige verzoeken en zijn tool-aanroepgedrag intact houdt.

Welk inspanningsniveau is het goedkoopst?
Laag. In de runs van Artificial Analysis gebruikte het ongeveer 32 miljoen outputtokens voor de hele index tegen 54 miljoen bij medium en 440 miljoen bij max. De prijs per token is hetzelfde op elk niveau; het verschil is hoeveel tokens worden gegenereerd.

Is maximale inspanning het waard op Haiku 5.5?
Alleen met bewijs uit je eigen evaluaties. Op FrontierCode kostte max ongeveer tien keer zoveel als medium voor een winst van 4.8 punten. Op dat punt stelt Anthropic voor om te vergelijken met Sonnet 5.5, dat mogelijk dezelfde kwaliteit voor minder bereikt.

Waarom stoppen mijn reacties zonder tekst?
Meestal omdat denken max_tokens heeft opgebruikt voordat het antwoord begon. Verhoog max_tokens of verlaag de inspanning. Bij xhigh in multi-turn chats kan een lege reactie ook betekenen dat het model zijn antwoord binnen zijn denken heeft geplaatst.

Beïnvloedt het veranderen van inspanning de promptcache?
Ja. Het veranderen van de bovenste inspanning tussen verzoeken maakt de gecachede berichten voor dat gesprek ongeldig. Een per-bericht inspanningsverandering, momenteel in beta, voorkomt dat.

Waarom komen de lancering benchmarks niet overeen met wat ik zie bij de standaard?
De lanceringscijfers zijn uitgevoerd met maximale inspanning. Bij medium rapporteert de systeemkaart lagere scores, bijvoorbeeld 1277 in plaats van 1620 op GDPval-AA.

Blijf lezen: de Claude Haiku 5.5-serie

Bronnen