Claude Haiku 5.5 ist das erste Haiku mit einer Aufwandseinstellung, und diese Einstellung beeinflusst die Rechnung mehr als alles andere, was Sie steuern. In den unabhängigen Tests von Artificial Analysis erzielte Haiku 5.5 bei maximalem Aufwand 43 auf dem Intelligenzindex und bei niedrigem Aufwand 29. Maximal wurden auch 440 Millionen Ausgabetokens verwendet, um durch den Index zu gelangen; niedrig verwendete 32 Millionen.
Die kurze Antwort: Lassen Sie die meisten Arbeiten auf dem Standardwert, medium. Reduzieren Sie hochvolumige, einfache Routen auf low. Erhöhen Sie Wissensarbeit und strikte Befehlsbefolgung auf high. Behandeln Sie xhigh und max als Einstellungen, für die Sie Beweise benötigen, und vergleichen Sie sie mit Sonnet 5.5, bevor Sie sich festlegen.
Der Rest dieses Beitrags zeigt, was jede Ebene kostet, wo das Hochsteigen nicht mehr rentabel ist und welche Einstellungen brechen oder teuer werden, wenn Sie den Aufwand ändern.
Was die Einstellung ist
Claude Haiku 5.5 unterstützt fünf Ebenen: low, medium, high, xhigh und max. Der Standardwert ist medium, was ungewöhnlich ist: Die meisten aktuellen Claude-Modelle haben als Standard high, und nur Haiku 5.5 und Opus 5.5 haben einen Standardwert, der eine Ebene niedriger ist. Das Senden von medium ist dasselbe wie das Weglassen des Parameters.
Der Aufwand ersetzt das manuelle Denkbudget, das Haiku 4.5 verwendet hat. Eine Anfrage mit thinking: {"type": "enabled", "budget_tokens": N} gibt jetzt eine 400 zurück, sodass es keine alte Zahl gibt, die übertragen werden kann. Laut der Aufwandsdokumentation von Anthropic stellen Sie es in output_config ein:
output_config={"effort": "low"}
Drei Fakten rahmen alles Folgendes ein:
- Denken ist standardmäßig aktiviert. Haiku 5.5 führt adaptives Denken aus, es sei denn, es wird anders angegeben. Niedriger Aufwand bedeutet weniger Denken, und bei einfachen Anfragen kann das Modell das Denken ganz überspringen.
- Denkenstokens sind Ausgabetokens. Sie zählen zu
max_tokensund werden zum Ausgabepreis berechnet (0,50 $ pro Million bei Eingaben von bis zu 100K Tokens). - Weniger Denken in der Eingabeaufforderung zu verlangen, funktioniert nicht. In den Tests von Anthropic dachte das Modell immer noch, als die Eingabeaufforderung ihm sagte, direkt zu antworten. Der Aufwand ist der Hebel.
Was jede Ebene kostet
Zwei unabhängige Quellen haben Haiku 5.5 über die Aufwandsebenen hinweg gemessen. Die Indexzahlen stammen von Artificial Analysis; die FrontierCode-Zahlen stammen aus der öffentlichen Ergebnisdatei von Cognition, wie sie von Kingy.ai zusammengestellt wurde. Keine von beiden deckt Ihre Arbeitslast ab, also behandeln Sie sie als die Form der Kurve, nicht als Ihre Zahlen.
Artificial Analysis Intelligence Index v4.3.2 (zehn Bewertungen, von Wissensarbeit bis zu terminalen Aufgaben):
| Aufwand | Indexpunktzahl | Ausgabetokens für den Index | Kosten pro Aufgabe | Zeit bis zum ersten Token |
|---|---|---|---|---|
| low | 29 | 32M | 0,02 $ | 9,9 s |
| medium | 34 | 54M | 0,05 $ | 13,4 s |
| high | 38 | 97M | 0,08 $ | 28,0 s |
| max | 43 | 440M | 0,21 $ | n/a |
Artificial Analysis hat keinen xhigh-Lauf veröffentlicht. Die Latenzwerte bei maximalem Aufwand schienen anormal zu sein, daher wurden sie weggelassen.
FrontierCode 1.1 Haupt, Haiku 5.5 läuft in Claude Code:
| Aufwand | Zusammengesetzte Punktzahl | Kosten pro Rollout | Ausgabetokens pro Rollout |
|---|---|---|---|
| low | 34,8% | 0,06 $ | 23.868 |
| medium | 41,6% | 0,13 $ | 36.172 |
| high | 41,9% | 0,26 $ | 55.149 |
| xhigh | 45,8% | 0,63 $ | 100.847 |
| max | 46,4% | 1,33 $ | 181.387 |
Die Kosten sind auf den Cent gerundet.
Lesen Sie die beiden Tabellen zusammen und drei Dinge fallen auf.
Von low zu medium ist der günstigste Schritt nach oben. Im Index kauft es 5 Punkte für etwa 1,7 Mal die Ausgabetokens. Bei FrontierCode kauft es 6,8 Punkte für etwa doppelt so viel Kosten pro Rollout.
Von medium zu high kann flach sein. Bei FrontierCode erzielte high 0,3 Punkte mehr als medium und kostete etwa doppelt so viel. Im breiteren Index fügte high 4 Punkte hinzu. Ob Ihre Arbeitslast wie der erste oder der zweite Fall aussieht, sagt genau das eine schnelle Bewertung.
Die beiden höchsten Ebenen sind teuer. Von high zu max im Index steigen die Ausgabetokens um etwa das 4,5-fache für 5 Punkte. Bei FrontierCode kostet max etwa zehnmal so viel wie medium für 4,8 mehr Punkte, und der Schritt von xhigh zu max verdoppelt die Kosten grob für 0,6 Punkte. Die eigene Anleitung von Anthropic sagt dasselbe in einfacheren Worten: Verwenden Sie xhigh und max nur dort, wo Ihre Bewertungen einen Gewinn zeigen, und vergleichen Sie sie zuerst mit Sonnet 5.5 hinsichtlich Leistung, Kosten und Geschwindigkeit.
Ein weiterer Grund, warum der Standardwert wichtig ist: Die Startbenchmarks von Anthropic wurden bei maximalem Aufwand durchgeführt. Die Ergebnisse des Medium-Aufwands der Systemkarte sind niedriger (1277 auf GDPval-AA anstelle von 1620). Wenn Sie mit dem Standardwert arbeiten, sind dies die Zahlen, mit denen Sie vergleichen sollten.
Wo man anfangen sollte, je nach Arbeitslast
| Arbeitslast | Beginnen bei | Hochsteigen, wenn |
|---|---|---|
| Klassifizierung, Routing, Tagging | low | Labels driften bei schwierigen Fällen |
| Extraktion aus kurzen Dokumenten | low | Felder werden übersehen oder zusammengeführt |
| Chat und Live-Support | low | Regeln rutschen in langen Chats |
| Zusammenfassungen und Verdichtungen | medium | Wichtige Details fallen weg |
| Subagentenarbeit unter einem größeren Modell | medium | Das Hauptmodell macht die Arbeit erneut |
| Agentisches Codieren, enge Änderungen | medium | Tests scheitern beim ersten Versuch |
| Wissensarbeit, lange Agentenaufgaben | high | Bewertungen zeigen Spielraum |
Diese Ausgangspunkte folgen der Anleitung von Anthropic für Haiku 5.5; die "hochsteigen"-Signale sind das, worauf Sie in Ihren eigenen Protokollen achten sollten.
Die eine Zeile, die einen zweiten Blick wert ist, ist der Chat. Low ist die schnellste Ebene, was für den Live-Support geeignet ist. Aber Anthropic empfiehlt high, wenn das Befolgen von Anweisungen am wichtigsten ist, zum Beispiel bei einem Support-Assistenten, der seine Systemaufforderungsregeln einhalten muss, während ein Benutzer argumentiert. Testen Sie beide bei den Gesprächen, die in der Vergangenheit schiefgelaufen sind.
Was bricht oder wird teuer, wenn sich der Aufwand ändert
Ein kleines max_tokens kann die Antwort beenden, bevor sie beginnt. Denken zählt zu max_tokens. Eine Obergrenze, die für eine Ein-Wort-Klassifizierung ausgelegt ist, sagen wir 50 Tokens, kann vollständig für das Denken aufgebraucht werden, und die Antwort endet mit stop_reason: "max_tokens" und ohne Text. Erhöhen Sie die Obergrenze, um Platz zu lassen, oder senken Sie den Aufwand.
Ändern des Aufwands mitten im Gespräch setzt den Cache zurück. Das Ändern des obersten Aufwandwerts zwischen Anfragen macht den Eingabeaufforderungs-Cache für die Nachrichten des Gesprächs ungültig. Wenn ein Agent innerhalb eines low Gesprächs eine schwierige Wendung bei high benötigt, bietet Anthropic eine Änderung des Aufwands pro Nachricht (Beta-Header mid-conversation-output-config-2026-07-01, Claude API und Google Cloud) an, die den Cache beibehält. Es erfordert, dass das Denken aktiviert ist. Ob ein Gateway diesen Beta-Header durchlässt, ist es wert, zu überprüfen, bevor Sie sich darauf verlassen.
Das Deaktivieren des Denkens hat Grenzen. thinking: {"type": "disabled"} wird bei low, medium und high akzeptiert. Bei xhigh oder max gibt es einen 400 zurück. Wenn das Denken deaktiviert ist, gibt eine Änderung des Aufwands pro Nachricht ebenfalls einen 400 zurück, und das Modell kann einen Toolaufruf überspringen, den es benötigt, wenn dieselbe Anfrage JSON-Ausgaben anfordert. Anthropic empfiehlt, das Denken aktiviert zu lassen und stattdessen eine niedrigere Aufwandsebene zu verwenden.
Niedriger Aufwand kann frühzeitig stoppen. Mit einer langen Systemaufforderung für den Codierungsagenten bei low stoppt Haiku 5.5 manchmal, bevor die Arbeit erledigt ist, und gibt die Aufgabe zurück. In den Tests von Anthropic halbierte sich das frühe Stoppen grob, als von low auf medium gewechselt wurde, und die Ausgabetokens pro Versuch verdoppelten sich mehr als. Der Haiku 5.5 Eingabeaufforderungsleitfaden enthält eine kurze Anweisung "weiterarbeiten, bis es fertig ist", die dasselbe Problem zu einem niedrigeren Preis anspricht.
Niedrig und medium können die Überprüfung überspringen. Bei Codierungsaufgaben meldet das Modell manchmal eine Änderung als abgeschlossen, ohne einen Test durchzuführen. Der Eingabeaufforderungsleitfaden hat einen Überprüfungsabschnitt dafür; es kostet Tokens, erhöht jedoch den Anteil der überprüften Änderungen.
Xhigh kann eine leere Antwort zurückgeben. In Mehrfachgesprächen bei xhigh schreibt das Modell manchmal seine gesamte Antwort in sein Denken und beendet die Runde ohne sichtbaren Text. Wenn Sie bei xhigh arbeiten, überprüfen Sie auf leere Textblöcke.
Das Erzwingen eines Tools überspringt das Denken. Haiku 5.5 akzeptiert eine erzwungene tool_choice, aber die Antwort beginnt dann mit dem Toolaufruf und ohne Denken. Wenn das Modell vor dem Aufruf des Tools argumentieren muss, verwenden Sie auto und geben Sie in der Eingabeaufforderung an, wann es aufgerufen werden soll.
Führen Sie Ihren eigenen Aufwand durch AIHubMix durch
Der schnellste Weg zur Auswahl besteht darin, dieselben 20 bis 50 echten Eingabeaufforderungen auf zwei oder drei Ebenen auszuführen und Qualität, Ausgabetokens und Latenz zu vergleichen. Über den AIHubMix Claude Native Endpoint, mit AIHUBMIX_API_KEY gesetzt:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Fassen Sie dieses Support-Ticket in einem Satz zusammen: ...",
"Extrahieren Sie die Rechnungsnummer und den Gesamtbetrag aus: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Speichern Sie `text` neben der Eingabeaufforderung und bewerten Sie es anhand Ihres eigenen Rubriks.
print(f"{effort}: {out_tokens} Ausgabetokens, {seconds:.1f}s insgesamt")
Wenn die Ausgabetokens zwischen low und high kaum variieren, erreicht die Einstellung wahrscheinlich nicht das Modell; überprüfen Sie die Anfrage, die Ihr Gateway weiterleitet. Auf der Haiku 5.5-Seite auf AIHubMix ist der Preis pro Token auf jeder Aufwandsebene gleich, sodass die Tokenanzahl aus diesem Sweep direkt in Dollar umgerechnet wird.
FAQ
Was ist die Standardaufwandsebene für Claude Haiku 5.5?
Mittel. Die meisten aktuellen Claude-Modelle haben als Standardwert hoch, sodass Code, der sich auf den Standard eines anderen Modells stützte, Haiku 5.5 eine Ebene niedriger ausführt, es sei denn, er setzt den Aufwand ausdrücklich.
Kann ich das Denken vollständig deaktivieren?
Bei niedrigem, mittlerem und hohem Aufwand, ja, indem Sie das Denken auf deaktiviert setzen. Bei xhigh und max gibt es einen Fehler zurück. Anthropic empfiehlt stattdessen, den Aufwand zu senken, da das Modell bei einfachen Anfragen selbst das Denken überspringen kann und sein Verhalten beim Aufrufen von Tools intakt bleibt.
Welche Aufwandsebene ist am günstigsten?
Niedrig. In den Tests von Artificial Analysis verwendete es etwa 32 Millionen Ausgabetokens für den gesamten Index im Vergleich zu 54 Millionen bei medium und 440 Millionen bei max. Der Preis pro Token ist auf jeder Ebene gleich; der Unterschied liegt darin, wie viele Tokens generiert werden.
Ist maximaler Aufwand bei Haiku 5.5 lohnenswert?
Nur mit Beweisen aus Ihren eigenen Bewertungen. Bei FrontierCode kostete max etwa zehnmal so viel wie medium für einen Gewinn von 4,8 Punkten. An diesem Punkt schlägt Anthropic vor, mit Sonnet 5.5 zu vergleichen, das möglicherweise die gleiche Qualität zu einem niedrigeren Preis erreicht.
Warum enden meine Antworten ohne Text?
In der Regel, weil das Denken max_tokens aufgebraucht hat, bevor die Antwort begann. Erhöhen Sie max_tokens oder senken Sie den Aufwand. Bei xhigh in Mehrfachgesprächen kann eine leere Antwort auch bedeuten, dass das Modell seine Antwort in sein Denken gelegt hat.
Beeinflusst das Ändern des Aufwands den Eingabeaufforderungs-Cache?
Ja. Das Ändern des obersten Aufwands zwischen Anfragen macht die zwischengespeicherten Nachrichten für dieses Gespräch ungültig. Eine Änderung des Aufwands pro Nachricht, die sich derzeit in der Beta-Phase befindet, vermeidet dies.
Warum stimmen die Startbenchmarks nicht mit dem überein, was ich beim Standardwert sehe?
Die Startzahlen wurden bei maximalem Aufwand durchgeführt. Bei medium berichtet die Systemkarte niedrigere Werte, zum Beispiel 1277 anstelle von 1620 auf GDPval-AA.
Weiterlesen: die Claude Haiku 5.5-Serie
- Der Aufwand entscheidet, wie viele Tokens Sie generieren. Wie Haiku 5.5 im Vergleich zu Haiku 4.5, GPT-6 Luna und Sonnet 5.5 am oberen Ende des Spektrums abschneidet, lesen Sie Claude Haiku 5.5 vs Haiku 4.5: Was zehn Cent jetzt kaufen
- Denkenstokens werden als Ausgabe berechnet, und die Länge der Eingabeaufforderung bestimmt die Preisliste. Um Ihre Aufwandwahl in eine monatliche Rechnung umzuwandeln, lesen Sie Claude Haiku 5.5 Preisgestaltung: Die 100K-Linie hinter dem 90%-Schnitt
- Der Aufwand ersetzt das alte Denkbudget, und das alte Budget gibt jetzt einen Fehler zurück. Für diese Lösung und den Rest des Wechsels von Haiku 4.5 lesen Sie Migration von Claude Haiku 4.5 zu 5.5: Fünf 400-Fehler und die leisen Änderungen
Quellen
- Aufwand (Claude Platform-Dokumentation)
- Eingabeaufforderung von Claude Haiku 5.5 (Claude Platform-Dokumentation)
- Claude Haiku 5.5 auf AIHubMix
- Claude Haiku 5.5 Intelligenz-, Leistungs- & Preisanalyse (Artificial Analysis)
- Claude Haiku 5.5: Benchmarks, Spezifikationen, Sol & Luna verglichen (Kingy.ai)



