Claude Haiku 5.5 Aufwandsebenen: Mittel ist der Standard, Niedrig ist oft ausreichend

AIHubMix7 Min. Lesezeit
Claude Haiku 5.5 Aufwandsebenen: Mittel ist der Standard, Niedrig ist oft ausreichend

Claude Haiku 5.5 ist das erste Haiku mit einer Aufwandseinstellung, und diese Einstellung beeinflusst die Rechnung mehr als alles andere, was Sie steuern. In den unabhängigen Tests von Artificial Analysis erzielte Haiku 5.5 bei maximalem Aufwand 43 auf dem Intelligenzindex und bei niedrigem Aufwand 29. Maximal wurden auch 440 Millionen Ausgabetokens verwendet, um durch den Index zu gelangen; niedrig verwendete 32 Millionen.

Die kurze Antwort: Lassen Sie die meisten Arbeiten auf dem Standardwert, medium. Reduzieren Sie hochvolumige, einfache Routen auf low. Erhöhen Sie Wissensarbeit und strikte Befehlsbefolgung auf high. Behandeln Sie xhigh und max als Einstellungen, für die Sie Beweise benötigen, und vergleichen Sie sie mit Sonnet 5.5, bevor Sie sich festlegen.

Der Rest dieses Beitrags zeigt, was jede Ebene kostet, wo das Hochsteigen nicht mehr rentabel ist und welche Einstellungen brechen oder teuer werden, wenn Sie den Aufwand ändern.

Was die Einstellung ist

Claude Haiku 5.5 unterstützt fünf Ebenen: low, medium, high, xhigh und max. Der Standardwert ist medium, was ungewöhnlich ist: Die meisten aktuellen Claude-Modelle haben als Standard high, und nur Haiku 5.5 und Opus 5.5 haben einen Standardwert, der eine Ebene niedriger ist. Das Senden von medium ist dasselbe wie das Weglassen des Parameters.

Der Aufwand ersetzt das manuelle Denkbudget, das Haiku 4.5 verwendet hat. Eine Anfrage mit thinking: {"type": "enabled", "budget_tokens": N} gibt jetzt eine 400 zurück, sodass es keine alte Zahl gibt, die übertragen werden kann. Laut der Aufwandsdokumentation von Anthropic stellen Sie es in output_config ein:

output_config={"effort": "low"}

Drei Fakten rahmen alles Folgendes ein:

  • Denken ist standardmäßig aktiviert. Haiku 5.5 führt adaptives Denken aus, es sei denn, es wird anders angegeben. Niedriger Aufwand bedeutet weniger Denken, und bei einfachen Anfragen kann das Modell das Denken ganz überspringen.
  • Denkenstokens sind Ausgabetokens. Sie zählen zu max_tokens und werden zum Ausgabepreis berechnet (0,50 $ pro Million bei Eingaben von bis zu 100K Tokens).
  • Weniger Denken in der Eingabeaufforderung zu verlangen, funktioniert nicht. In den Tests von Anthropic dachte das Modell immer noch, als die Eingabeaufforderung ihm sagte, direkt zu antworten. Der Aufwand ist der Hebel.

Was jede Ebene kostet

Zwei unabhängige Quellen haben Haiku 5.5 über die Aufwandsebenen hinweg gemessen. Die Indexzahlen stammen von Artificial Analysis; die FrontierCode-Zahlen stammen aus der öffentlichen Ergebnisdatei von Cognition, wie sie von Kingy.ai zusammengestellt wurde. Keine von beiden deckt Ihre Arbeitslast ab, also behandeln Sie sie als die Form der Kurve, nicht als Ihre Zahlen.

Artificial Analysis Intelligence Index v4.3.2 (zehn Bewertungen, von Wissensarbeit bis zu terminalen Aufgaben):

Aufwand Indexpunktzahl Ausgabetokens für den Index Kosten pro Aufgabe Zeit bis zum ersten Token
low 29 32M 0,02 $ 9,9 s
medium 34 54M 0,05 $ 13,4 s
high 38 97M 0,08 $ 28,0 s
max 43 440M 0,21 $ n/a

Artificial Analysis hat keinen xhigh-Lauf veröffentlicht. Die Latenzwerte bei maximalem Aufwand schienen anormal zu sein, daher wurden sie weggelassen.

FrontierCode 1.1 Haupt, Haiku 5.5 läuft in Claude Code:

Aufwand Zusammengesetzte Punktzahl Kosten pro Rollout Ausgabetokens pro Rollout
low 34,8% 0,06 $ 23.868
medium 41,6% 0,13 $ 36.172
high 41,9% 0,26 $ 55.149
xhigh 45,8% 0,63 $ 100.847
max 46,4% 1,33 $ 181.387

Die Kosten sind auf den Cent gerundet.

Lesen Sie die beiden Tabellen zusammen und drei Dinge fallen auf.

Von low zu medium ist der günstigste Schritt nach oben. Im Index kauft es 5 Punkte für etwa 1,7 Mal die Ausgabetokens. Bei FrontierCode kauft es 6,8 Punkte für etwa doppelt so viel Kosten pro Rollout.

Von medium zu high kann flach sein. Bei FrontierCode erzielte high 0,3 Punkte mehr als medium und kostete etwa doppelt so viel. Im breiteren Index fügte high 4 Punkte hinzu. Ob Ihre Arbeitslast wie der erste oder der zweite Fall aussieht, sagt genau das eine schnelle Bewertung.

Die beiden höchsten Ebenen sind teuer. Von high zu max im Index steigen die Ausgabetokens um etwa das 4,5-fache für 5 Punkte. Bei FrontierCode kostet max etwa zehnmal so viel wie medium für 4,8 mehr Punkte, und der Schritt von xhigh zu max verdoppelt die Kosten grob für 0,6 Punkte. Die eigene Anleitung von Anthropic sagt dasselbe in einfacheren Worten: Verwenden Sie xhigh und max nur dort, wo Ihre Bewertungen einen Gewinn zeigen, und vergleichen Sie sie zuerst mit Sonnet 5.5 hinsichtlich Leistung, Kosten und Geschwindigkeit.

Ein weiterer Grund, warum der Standardwert wichtig ist: Die Startbenchmarks von Anthropic wurden bei maximalem Aufwand durchgeführt. Die Ergebnisse des Medium-Aufwands der Systemkarte sind niedriger (1277 auf GDPval-AA anstelle von 1620). Wenn Sie mit dem Standardwert arbeiten, sind dies die Zahlen, mit denen Sie vergleichen sollten.

Wo man anfangen sollte, je nach Arbeitslast

Arbeitslast Beginnen bei Hochsteigen, wenn
Klassifizierung, Routing, Tagging low Labels driften bei schwierigen Fällen
Extraktion aus kurzen Dokumenten low Felder werden übersehen oder zusammengeführt
Chat und Live-Support low Regeln rutschen in langen Chats
Zusammenfassungen und Verdichtungen medium Wichtige Details fallen weg
Subagentenarbeit unter einem größeren Modell medium Das Hauptmodell macht die Arbeit erneut
Agentisches Codieren, enge Änderungen medium Tests scheitern beim ersten Versuch
Wissensarbeit, lange Agentenaufgaben high Bewertungen zeigen Spielraum

Diese Ausgangspunkte folgen der Anleitung von Anthropic für Haiku 5.5; die "hochsteigen"-Signale sind das, worauf Sie in Ihren eigenen Protokollen achten sollten.

Die eine Zeile, die einen zweiten Blick wert ist, ist der Chat. Low ist die schnellste Ebene, was für den Live-Support geeignet ist. Aber Anthropic empfiehlt high, wenn das Befolgen von Anweisungen am wichtigsten ist, zum Beispiel bei einem Support-Assistenten, der seine Systemaufforderungsregeln einhalten muss, während ein Benutzer argumentiert. Testen Sie beide bei den Gesprächen, die in der Vergangenheit schiefgelaufen sind.

Was bricht oder wird teuer, wenn sich der Aufwand ändert

Ein kleines max_tokens kann die Antwort beenden, bevor sie beginnt. Denken zählt zu max_tokens. Eine Obergrenze, die für eine Ein-Wort-Klassifizierung ausgelegt ist, sagen wir 50 Tokens, kann vollständig für das Denken aufgebraucht werden, und die Antwort endet mit stop_reason: "max_tokens" und ohne Text. Erhöhen Sie die Obergrenze, um Platz zu lassen, oder senken Sie den Aufwand.

Ändern des Aufwands mitten im Gespräch setzt den Cache zurück. Das Ändern des obersten Aufwandwerts zwischen Anfragen macht den Eingabeaufforderungs-Cache für die Nachrichten des Gesprächs ungültig. Wenn ein Agent innerhalb eines low Gesprächs eine schwierige Wendung bei high benötigt, bietet Anthropic eine Änderung des Aufwands pro Nachricht (Beta-Header mid-conversation-output-config-2026-07-01, Claude API und Google Cloud) an, die den Cache beibehält. Es erfordert, dass das Denken aktiviert ist. Ob ein Gateway diesen Beta-Header durchlässt, ist es wert, zu überprüfen, bevor Sie sich darauf verlassen.

Das Deaktivieren des Denkens hat Grenzen. thinking: {"type": "disabled"} wird bei low, medium und high akzeptiert. Bei xhigh oder max gibt es einen 400 zurück. Wenn das Denken deaktiviert ist, gibt eine Änderung des Aufwands pro Nachricht ebenfalls einen 400 zurück, und das Modell kann einen Toolaufruf überspringen, den es benötigt, wenn dieselbe Anfrage JSON-Ausgaben anfordert. Anthropic empfiehlt, das Denken aktiviert zu lassen und stattdessen eine niedrigere Aufwandsebene zu verwenden.

Niedriger Aufwand kann frühzeitig stoppen. Mit einer langen Systemaufforderung für den Codierungsagenten bei low stoppt Haiku 5.5 manchmal, bevor die Arbeit erledigt ist, und gibt die Aufgabe zurück. In den Tests von Anthropic halbierte sich das frühe Stoppen grob, als von low auf medium gewechselt wurde, und die Ausgabetokens pro Versuch verdoppelten sich mehr als. Der Haiku 5.5 Eingabeaufforderungsleitfaden enthält eine kurze Anweisung "weiterarbeiten, bis es fertig ist", die dasselbe Problem zu einem niedrigeren Preis anspricht.

Niedrig und medium können die Überprüfung überspringen. Bei Codierungsaufgaben meldet das Modell manchmal eine Änderung als abgeschlossen, ohne einen Test durchzuführen. Der Eingabeaufforderungsleitfaden hat einen Überprüfungsabschnitt dafür; es kostet Tokens, erhöht jedoch den Anteil der überprüften Änderungen.

Xhigh kann eine leere Antwort zurückgeben. In Mehrfachgesprächen bei xhigh schreibt das Modell manchmal seine gesamte Antwort in sein Denken und beendet die Runde ohne sichtbaren Text. Wenn Sie bei xhigh arbeiten, überprüfen Sie auf leere Textblöcke.

Das Erzwingen eines Tools überspringt das Denken. Haiku 5.5 akzeptiert eine erzwungene tool_choice, aber die Antwort beginnt dann mit dem Toolaufruf und ohne Denken. Wenn das Modell vor dem Aufruf des Tools argumentieren muss, verwenden Sie auto und geben Sie in der Eingabeaufforderung an, wann es aufgerufen werden soll.

Führen Sie Ihren eigenen Aufwand durch AIHubMix durch

Der schnellste Weg zur Auswahl besteht darin, dieselben 20 bis 50 echten Eingabeaufforderungen auf zwei oder drei Ebenen auszuführen und Qualität, Ausgabetokens und Latenz zu vergleichen. Über den AIHubMix Claude Native Endpoint, mit AIHUBMIX_API_KEY gesetzt:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Fassen Sie dieses Support-Ticket in einem Satz zusammen: ...",
    "Extrahieren Sie die Rechnungsnummer und den Gesamtbetrag aus: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Speichern Sie `text` neben der Eingabeaufforderung und bewerten Sie es anhand Ihres eigenen Rubriks.
    print(f"{effort}: {out_tokens} Ausgabetokens, {seconds:.1f}s insgesamt")

Wenn die Ausgabetokens zwischen low und high kaum variieren, erreicht die Einstellung wahrscheinlich nicht das Modell; überprüfen Sie die Anfrage, die Ihr Gateway weiterleitet. Auf der Haiku 5.5-Seite auf AIHubMix ist der Preis pro Token auf jeder Aufwandsebene gleich, sodass die Tokenanzahl aus diesem Sweep direkt in Dollar umgerechnet wird.

FAQ

Was ist die Standardaufwandsebene für Claude Haiku 5.5?
Mittel. Die meisten aktuellen Claude-Modelle haben als Standardwert hoch, sodass Code, der sich auf den Standard eines anderen Modells stützte, Haiku 5.5 eine Ebene niedriger ausführt, es sei denn, er setzt den Aufwand ausdrücklich.

Kann ich das Denken vollständig deaktivieren?
Bei niedrigem, mittlerem und hohem Aufwand, ja, indem Sie das Denken auf deaktiviert setzen. Bei xhigh und max gibt es einen Fehler zurück. Anthropic empfiehlt stattdessen, den Aufwand zu senken, da das Modell bei einfachen Anfragen selbst das Denken überspringen kann und sein Verhalten beim Aufrufen von Tools intakt bleibt.

Welche Aufwandsebene ist am günstigsten?
Niedrig. In den Tests von Artificial Analysis verwendete es etwa 32 Millionen Ausgabetokens für den gesamten Index im Vergleich zu 54 Millionen bei medium und 440 Millionen bei max. Der Preis pro Token ist auf jeder Ebene gleich; der Unterschied liegt darin, wie viele Tokens generiert werden.

Ist maximaler Aufwand bei Haiku 5.5 lohnenswert?
Nur mit Beweisen aus Ihren eigenen Bewertungen. Bei FrontierCode kostete max etwa zehnmal so viel wie medium für einen Gewinn von 4,8 Punkten. An diesem Punkt schlägt Anthropic vor, mit Sonnet 5.5 zu vergleichen, das möglicherweise die gleiche Qualität zu einem niedrigeren Preis erreicht.

Warum enden meine Antworten ohne Text?
In der Regel, weil das Denken max_tokens aufgebraucht hat, bevor die Antwort begann. Erhöhen Sie max_tokens oder senken Sie den Aufwand. Bei xhigh in Mehrfachgesprächen kann eine leere Antwort auch bedeuten, dass das Modell seine Antwort in sein Denken gelegt hat.

Beeinflusst das Ändern des Aufwands den Eingabeaufforderungs-Cache?
Ja. Das Ändern des obersten Aufwands zwischen Anfragen macht die zwischengespeicherten Nachrichten für dieses Gespräch ungültig. Eine Änderung des Aufwands pro Nachricht, die sich derzeit in der Beta-Phase befindet, vermeidet dies.

Warum stimmen die Startbenchmarks nicht mit dem überein, was ich beim Standardwert sehe?
Die Startzahlen wurden bei maximalem Aufwand durchgeführt. Bei medium berichtet die Systemkarte niedrigere Werte, zum Beispiel 1277 anstelle von 1620 auf GDPval-AA.

Weiterlesen: die Claude Haiku 5.5-Serie

Quellen