Claude Haiku 4.5 erzielte 0,0 % im Terminal-Bench 4.0. Claude Haiku 5.5 erzielt 39,2 % und kostet nur ein Zehntel pro Token: 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens, im Vergleich zu 1 $ und 5 $ für Haiku 4.5.
Das ist das Upgrade in einem Satz. Das kleine Claude-Modell hat sich von "gut für Klassifizierung, nicht für Agenten" zu einem nutzbaren Subagenten entwickelt, und sein Preis entspricht jetzt dem von OpenAI's GPT-6 Luna bis auf den Cent. Anthropic hat es am 7. Oktober 2026 als Claude Haiku 5.5 veröffentlicht, Modell-ID claude-haiku-5-5, und es ist bereits auf AIHubMix gelistet.
Der Preis gilt unter bestimmten Bedingungen, und das gilt auch für die Benchmark-Ergebnisse. Dieser Beitrag behandelt, was sich geändert hat, wie nah Haiku 5.5 an Sonnet 5.5 herankommt, wo es die falsche Wahl ist und wer jetzt wechseln sollte.
Was sich geändert hat und was nicht
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Eingabe-/Ausgabepreis | 1 $ / 5 $ | 0,10 $ / 0,50 $ |
| Kontextfenster | 200K | 1M |
| Maximale Ausgabe | 64K | 128K |
| Denken | Manuelles Budget, standardmäßig deaktiviert | Adaptiv, standardmäßig aktiviert |
| Aufwandsstufen | Keine | Fünf, standardmäßig mittel |
| Tokens für denselben Text | Basislinie | Etwa 30 % mehr |
| Browser-Nutzungswerkzeug | Nein | Ja |
Die Preise für Haiku 5.5 gelten für Eingaben bis zu 100K Tokens; längere Eingaben kosten 0,50 $ / 2,50 $. Die Preise gelten pro Million Tokens.
Was gleich bleibt: die Stellenbeschreibung. Anthropic bewirbt Haiku weiterhin für Arbeiten mit hohem Volumen und Kostenbewusstsein (Zusammenfassungen, Verdichtung, Datenbankabfragen, Klassifizierung) und für Subagentenaufgaben unter einem größeren Modell. Anthropic sagt, dass bestehende Haiku 4.5-Eingaben gut ohne Änderungen funktionieren sollten. Bestehender Anfragecode ist eine andere Angelegenheit: fünf Anfrage-Muster, die auf Haiku 4.5 funktionierten, geben jetzt einen 400-Fehler zurück, wie in Anthropics Migrationsleitfaden aufgeführt und der Migrationsbeitrag in dieser Serie erläutert.
Zwei Änderungen beeinflussen, wie das Modell standardmäßig funktioniert. Denken ist jetzt aktiviert, es sei denn, Sie schalten es herunter, sodass eine Anfrage, die nie das Denken erwähnte, mit thinking Blöcken zurückkommen kann und Ausgabetokens dafür verwendet. Und Haiku 5.5 ist das erste Haiku mit einer Aufwandeinstellung, die jetzt das Hauptsteuerungselement zwischen Kosten und Qualität ist.
Wie es im Vergleich zu Haiku 4.5, Luna und Sonnet 5.5 abschneidet
Die folgenden Zahlen stammen aus Anthropics Veröffentlichungsmaterialien und der Haiku 5.5-Systemkarte, wie von Kingy.ai zusammengestellt. Sie sind vom Anbieter gemeldet, Anthropic hat die GPT-Modelle selbst getestet, und bisher hat niemand die vollständige Tabelle unabhängig reproduziert.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity's Last Exam | 45,9 % | 10,2 % | n/a | 56,9 % |
| Terminal-Bench 4.0 | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| FrontierCode 1.1 Main | 46,4 % | n/a | 42,4 % | 52,1 % |
| Chartography | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Humanity's Last Exam und Chartography sind ohne Werkzeuge. Sonnet 5.5's FrontierCode-Wertung liegt bei hohem Aufwand.
Drei Werte sind wichtiger als jede einzelne Zeile:
- Im Vergleich zu Haiku 4.5 ist es eine andere Modellklasse. Die Bewertungen für Wissensarbeit verdoppeln sich ungefähr, und die agentischen Zeilen gehen von nahezu null zu nutzbar. Haiku 4.5 konnte eine Terminal-Bench-Aufgabe nicht abschließen; Haiku 5.5 schließt etwa zwei von fünf ab.
- Im Vergleich zu GPT-6 Luna führt es in jeder gemeinsamen Zeile zum gleichen Listenpreis. Die größten Unterschiede liegen in der Computernutzung (72,4 % vs. 48,9 %) und im Terminal-Bench (39,2 % vs. 16,4 %).
- Im Vergleich zu Sonnet 5.5 hängt die Lücke von der Aufgabe ab. Bei FrontierCode liegt Haiku innerhalb von sechs Punkten. Bei Terminal-Bench erzielt Sonnet 70,6 % gegenüber Haikus 39,2 %. Anthropic selbst sagt, dass Sonnet 5.5 und Opus 5.5 die bessere Wahl für komplexe agentische Codierung bleiben.
Lesen Sie das Kleingedruckte, bevor Sie diese Zahlen zitieren
Die Hauptwerte wurden mit maximalem Aufwand ermittelt, der teuersten Einstellung. Der Standard ist mittel, und die eigenen Mittelaufwandsläufe der Systemkarte liegen niedriger: 1277 auf GDPval-AA statt 1620 und 1372 auf AA-Briefcase statt 1578. Wenn Sie mit dem Standard arbeiten, vergleichen Sie mit diesen Zahlen, nicht mit der Starttabelle.
Die OSWorld-Zahl benötigt ebenfalls einen zweiten Blick. Die 72,4 % sind Teilgutschriften, die über die Prüfungen gemittelt werden. Der Anteil der Aufgaben, bei denen Haiku 5.5 jeden Punkt abgeschlossen hat, beträgt 37,1 % (Luna: 17,1 %). Für einen Browser-Agenten, der die gesamte Aufgabe abschließen muss, ist 37,1 % die Zahl, um die man planen sollte.
Was frühe Kunden berichteten
Anthropics Veröffentlichungsbeitrag zitiert mehrere Kunden, die das Modell vor der Veröffentlichung getestet haben. Diese sind vom Anbieter ausgewählt, aber sie weisen auf dieselben Arbeitslasten hin:
- AlphaSense führt etwa 8 Millionen "Fragen im Dokument" pro Woche aus. Bei 400 Testanfragen erzielte Haiku 5.5 0,84 gegenüber 0,76 von Haiku 4.5.
- Box verzeichnete einen Gewinn von 11 Punkten gegenüber Haiku 4.5 bei etwa der Hälfte der Latenz.
- Asana maß über 30 % niedrigere Latenz pro Aufgabe und bis zu 2,5-fach schnellere Inferenz pro Agentenrunde im Vergleich zu ihrem aktuellen Modell.
- HubSpot erzielte 92,8 % in seiner CRM-Suite, die beste Punktzahl, die es von einem kleinen Modell gesehen hat.
- Cognition verwendet Haiku 5.5 als "Sidekick" unter Opus 5.5 in Devin Fusion und berichtet, dass das Paar eine FrontierCode-Wertung von 66,2 bei niedrigeren Kosten und Latenz hält.
Das Muster: kurze, wiederholte Arbeiten über Dokumente und Subagentenaufgaben unter einem größeren Modell.
Wo Haiku 5.5 die falsche Wahl ist
- Komplexe agentische Codierung. Terminal-Bench ist der Bereich, in dem Sonnet 5.5 am weitesten voraus ist. Wenn eine Aufgabe viele Schritte, mehrdeutige Anforderungen oder eine lange Kette von Bearbeitungen benötigt, beginnen Sie mit Sonnet 5.5 oder Opus 5.5.
- Prompts über 100K Tokens. Das 1M-Fenster ist real, aber der Preis ist nicht gleichmäßig verteilt. Über 100K Tokens bewegt sich die gesamte Anfrage auf 0,50 $ / 2,50 $, und da der neue Tokenizer etwa 30 % mehr Tokens zählt, liegt diese Grenze bei etwa 77K Tokens, wie Haiku 4.5 sie zählte. Der Preisbeitrag in dieser Serie arbeitet die Zahlen durch.
- Arbeiten, die xhigh oder max benötigen, um zu bestehen. Die Ausgabe wird bei den höchsten Einstellungen lang und teuer. Anthropics eigene Anleitung empfiehlt, sich vor der endgültigen Entscheidung mit Sonnet 5.5 zu vergleichen.
- Teams in der Priority Tier. Haiku 5.5 unterstützt dies nicht, sodass ein Haiku 4.5 Priority Tier-Engagement nicht übertragen wird.
- Sicherheitstests. Haiku 5.5's Cyber-Schutzmaßnahmen sind strenger als die von Haiku 4.5 und blockieren Penetrationstests. Erwarten Sie
refusalStop-Gründe bei dieser Art von Arbeit, ohne serverseitige Rückfallmöglichkeit auf ein anderes Modell.
Probieren Sie es über AIHubMix aus
Die Aufwandeinstellung von Haiku 5.5 befindet sich in der Messages API's output_config, sodass der Claude Native-Endpunkt auf AIHubMix der direkteste Weg ist. Installieren Sie ein aktuelles Anthropic SDK (pip install -U anthropic) und richten Sie es auf AIHubMix aus:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # Platz für Denken lassen, nicht nur für die Antwort
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Klassifizieren Sie dieses Ticket als Abrechnung, Fehler oder anderes: "
"'Ich wurde für Oktober zweimal belastet.'",
}],
)
# Denkblöcke können zuerst kommen, also wählen Sie den Textblock nach Typ aus.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Zwei Dinge, die Sie bei Ihrem ersten Lauf überprüfen sollten. Lesen Sie response.usage.output_tokens bei low und erneut bei high mit demselben Prompt: Wenn sich die Zahlen nicht ändern, erreicht die Aufwandeinstellung das Modell nicht. Und beachten Sie, dass die Modellseite von AIHubMix derzeit eine Kontextlänge von 200K für dieses Modell angibt, unter Anthropics 1M, also bestätigen Sie das Limit, bevor Sie sehr lange Prompts senden.
Wer wechseln sollte, wer warten sollte
Jetzt wechseln, wenn Sie Klassifizierung, Extraktion, Routing, Zusammenfassungen oder Dokumenten-Q&A mit Prompts unter 100K Tokens durchführen. Sie erhalten ein viel stärkeres Modell zu einem Bruchteil des Tokenpreises. Planen Sie eine Stunde für die Änderungen am Anfragecode ein und testen Sie dann den Aufwand low im Vergleich zu medium bei Ihren eigenen Bewertungen.
Jetzt wechseln, wenn Sie ein großes Modell für Subagentenarbeiten verwenden, für die es überqualifiziert ist: eine Zahl aus einer Akte ziehen, eine Datei überprüfen, ein Toolergebnis zusammenfassen. Dies ist die Rolle, die Anthropic und seine Startkunden betonen.
Warten Sie einen Sprint, wenn Ihre Integration die Computernutzung mit dem computer_20250124 Werkzeug, Vorbefüllung oder temperature=0 verwendet. Jedes dieser Elemente gibt einen 400-Fehler bei Haiku 5.5 zurück, und deren Behebung ist Codearbeit, kein Austausch von Modell-Strings.
Bleiben Sie, wo Sie sind, wenn Ihre Arbeitslast lang ist (regelmäßig über etwa 77K Haiku 4.5 Tokens), von der Priority Tier abhängt oder komplexe agentische Codierung erfordert. Für die letzte Gruppe ist der nützliche Vergleich Haiku 5.5 gegen Sonnet 5.5 hinsichtlich der Kosten pro abgeschlossener Aufgabe, nicht Haiku 5.5 gegen Haiku 4.5.
Wenn Sie bereit sind zu vergleichen, listet die AIHubMix-Modellliste Haiku 5.5, Sonnet 5.5 und Opus 5.5 hinter einem API-Schlüssel auf, sodass dieselbe Bewertung gegen alle drei durchgeführt werden kann.
FAQ
Ist Claude Haiku 5.5 in allem besser als Haiku 4.5?
In jedem Benchmark in Anthropics Veröffentlichungstabelle, ja, oft mit großem Abstand. Die Ausnahmen sind praktisch und nicht qualitativ: Priority Tier wird nicht unterstützt, Prompts über 100K Tokens kosten pro Token mehr als der Kurzprompt-Tarif, und mehrere alte Anfrage-Muster geben jetzt Fehler zurück.
Ist Haiku 5.5 wirklich 90 % günstiger?
Der Preis pro Token ist für Prompts bis zu 100K Tokens um 90 % niedriger und um 50 % niedriger darüber hinaus. Da der neue Tokenizer etwa 30 % mehr Tokens für denselben Text zählt und das Denken jetzt Ausgabetokens produziert, schätzt Anthropic die typischen Einsparungen auf etwa 75 %.
Wie schneidet Haiku 5.5 im Vergleich zu GPT-6 Luna ab?
Beide listen zu 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens. In den von Anthropic berichteten Ergebnissen schneidet Haiku 5.5 in jedem Benchmark, in dem beide erscheinen, besser ab, am deutlichsten bei der Computernutzung und im Terminal-Bench. Luna hält seinen Basispreis bis zu einer längeren Promptlänge, sodass Arbeitslasten mit langen Prompts separat bepreist werden sollten.
Kann Haiku 5.5 Sonnet 5.5 beim Codieren ersetzen?
Für enge, gut definierte Änderungen und Subagentenaufgaben kann es sich lohnen, es zu testen. Für komplexe mehrstufige agentische Codierung erzielt Sonnet 5.5 bei Terminal-Bench 4.0 (70,6 % vs. 39,2 %) deutlich höhere Werte, und Anthropic empfiehlt Sonnet oder Opus für diese Arbeit.
Sind die Benchmark-Werte bei der Standardeinstellung?
Nein. Die Hauptwerte wurden mit maximalem Aufwand ermittelt. Der Standard ist mittel, bei dem die Systemkarte niedrigere Ergebnisse meldet, zum Beispiel 1277 statt 1620 auf GDPval-AA.
Bedeutet das 1M-Kontextfenster, dass ich 1M-Token-Prompts günstig senden kann?
Sie können sie senden, aber alles über 100K Tokens wird mit 0,50 $ Eingabe und 2,50 $ Ausgabe pro Million Tokens für die gesamte Anfrage abgerechnet. Überprüfen Sie auch das angegebene Kontextlimit Ihres Gateways.
Was muss ich in meinem Code ändern, um zu wechseln?
Mindestens: die Modell-ID, jedes manuelle Denkbudget, jede Temperatur- oder top_p-Einstellung, jede Vorbefüllung des Assistenten und Code, der den ersten Inhaltsblock als Antwort liest. Der Migrationsbeitrag in dieser Serie enthält die vollständige Liste.
Weiterlesen: die Claude Haiku 5.5-Serie
- Die Hauptwerte wurden mit maximalem Aufwand ermittelt, aber Sie werden wahrscheinlich mit mittel oder niedrig bereitstellen. Um zu sehen, was jede Stufe in Tokens kostet und was Sie verlieren, wenn Sie herunterstufen, lesen Sie Claude Haiku 5.5 Aufwandsstufen: Mittel ist der Standard, Niedrig ist oft genug
- Die Zehn-Prozent-Preisschätzung gilt nur unterhalb einer Prompt-Längenlinie, die der neue Tokenizer verschiebt. Für Beispiele zu den Kosten und den Abrechnungsregeln, die leicht übersehen werden können, lesen Sie Claude Haiku 5.5 Preisgestaltung: Die 100K-Linie hinter dem 90%-Schnitt
- Der Wechsel ist mehr als nur ein Austausch des Modell-Strings: fünf alte Anfrage-Muster schlagen jetzt fehl. Für jeden Fehler, seine Ursache und seine Behebung lesen Sie Migration von Claude Haiku 4.5 zu 5.5: Fünf 400-Fehler und die stillen Änderungen
Quellen
- Einführung von Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 Migrationsleitfaden (Claude Platform Docs)
- Claude Haiku 5.5 auf AIHubMix
- Claude Haiku 5.5: Benchmarks, Spezifikationen, Sol & Luna im Vergleich (Kingy.ai)
- Claude Haiku 5.5 Intelligenz, Leistung & Preis Analyse (Artificial Analysis)



