Claude Haiku 5.5 vs Haiku 4.5: Was zehn Cent jetzt kaufen

AIHubMix8 Min. Lesezeit
Claude Haiku 5.5 vs Haiku 4.5: Was zehn Cent jetzt kaufen

Claude Haiku 4.5 erzielte 0,0 % im Terminal-Bench 4.0. Claude Haiku 5.5 erzielt 39,2 % und kostet nur ein Zehntel pro Token: 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens, im Vergleich zu 1 $ und 5 $ für Haiku 4.5.

Das ist das Upgrade in einem Satz. Das kleine Claude-Modell hat sich von "gut für Klassifizierung, nicht für Agenten" zu einem nutzbaren Subagenten entwickelt, und sein Preis entspricht jetzt dem von OpenAI's GPT-6 Luna bis auf den Cent. Anthropic hat es am 7. Oktober 2026 als Claude Haiku 5.5 veröffentlicht, Modell-ID claude-haiku-5-5, und es ist bereits auf AIHubMix gelistet.

Der Preis gilt unter bestimmten Bedingungen, und das gilt auch für die Benchmark-Ergebnisse. Dieser Beitrag behandelt, was sich geändert hat, wie nah Haiku 5.5 an Sonnet 5.5 herankommt, wo es die falsche Wahl ist und wer jetzt wechseln sollte.

Was sich geändert hat und was nicht

Haiku 4.5 Haiku 5.5
Eingabe-/Ausgabepreis 1 $ / 5 $ 0,10 $ / 0,50 $
Kontextfenster 200K 1M
Maximale Ausgabe 64K 128K
Denken Manuelles Budget, standardmäßig deaktiviert Adaptiv, standardmäßig aktiviert
Aufwandsstufen Keine Fünf, standardmäßig mittel
Tokens für denselben Text Basislinie Etwa 30 % mehr
Browser-Nutzungswerkzeug Nein Ja

Die Preise für Haiku 5.5 gelten für Eingaben bis zu 100K Tokens; längere Eingaben kosten 0,50 $ / 2,50 $. Die Preise gelten pro Million Tokens.

Was gleich bleibt: die Stellenbeschreibung. Anthropic bewirbt Haiku weiterhin für Arbeiten mit hohem Volumen und Kostenbewusstsein (Zusammenfassungen, Verdichtung, Datenbankabfragen, Klassifizierung) und für Subagentenaufgaben unter einem größeren Modell. Anthropic sagt, dass bestehende Haiku 4.5-Eingaben gut ohne Änderungen funktionieren sollten. Bestehender Anfragecode ist eine andere Angelegenheit: fünf Anfrage-Muster, die auf Haiku 4.5 funktionierten, geben jetzt einen 400-Fehler zurück, wie in Anthropics Migrationsleitfaden aufgeführt und der Migrationsbeitrag in dieser Serie erläutert.

Zwei Änderungen beeinflussen, wie das Modell standardmäßig funktioniert. Denken ist jetzt aktiviert, es sei denn, Sie schalten es herunter, sodass eine Anfrage, die nie das Denken erwähnte, mit thinking Blöcken zurückkommen kann und Ausgabetokens dafür verwendet. Und Haiku 5.5 ist das erste Haiku mit einer Aufwandeinstellung, die jetzt das Hauptsteuerungselement zwischen Kosten und Qualität ist.

Wie es im Vergleich zu Haiku 4.5, Luna und Sonnet 5.5 abschneidet

Die folgenden Zahlen stammen aus Anthropics Veröffentlichungsmaterialien und der Haiku 5.5-Systemkarte, wie von Kingy.ai zusammengestellt. Sie sind vom Anbieter gemeldet, Anthropic hat die GPT-Modelle selbst getestet, und bisher hat niemand die vollständige Tabelle unabhängig reproduziert.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (offline) 72,4 % 15,7 % 48,9 % 83,9 %
Humanity's Last Exam 45,9 % 10,2 % n/a 56,9 %
Terminal-Bench 4.0 39,2 % 0,0 % 16,4 % 70,6 %
FrontierCode 1.1 Main 46,4 % n/a 42,4 % 52,1 %
Chartography 46,4 % 6,4 % 29,1 % 61,6 %

Humanity's Last Exam und Chartography sind ohne Werkzeuge. Sonnet 5.5's FrontierCode-Wertung liegt bei hohem Aufwand.

Drei Werte sind wichtiger als jede einzelne Zeile:

  • Im Vergleich zu Haiku 4.5 ist es eine andere Modellklasse. Die Bewertungen für Wissensarbeit verdoppeln sich ungefähr, und die agentischen Zeilen gehen von nahezu null zu nutzbar. Haiku 4.5 konnte eine Terminal-Bench-Aufgabe nicht abschließen; Haiku 5.5 schließt etwa zwei von fünf ab.
  • Im Vergleich zu GPT-6 Luna führt es in jeder gemeinsamen Zeile zum gleichen Listenpreis. Die größten Unterschiede liegen in der Computernutzung (72,4 % vs. 48,9 %) und im Terminal-Bench (39,2 % vs. 16,4 %).
  • Im Vergleich zu Sonnet 5.5 hängt die Lücke von der Aufgabe ab. Bei FrontierCode liegt Haiku innerhalb von sechs Punkten. Bei Terminal-Bench erzielt Sonnet 70,6 % gegenüber Haikus 39,2 %. Anthropic selbst sagt, dass Sonnet 5.5 und Opus 5.5 die bessere Wahl für komplexe agentische Codierung bleiben.

Lesen Sie das Kleingedruckte, bevor Sie diese Zahlen zitieren

Die Hauptwerte wurden mit maximalem Aufwand ermittelt, der teuersten Einstellung. Der Standard ist mittel, und die eigenen Mittelaufwandsläufe der Systemkarte liegen niedriger: 1277 auf GDPval-AA statt 1620 und 1372 auf AA-Briefcase statt 1578. Wenn Sie mit dem Standard arbeiten, vergleichen Sie mit diesen Zahlen, nicht mit der Starttabelle.

Die OSWorld-Zahl benötigt ebenfalls einen zweiten Blick. Die 72,4 % sind Teilgutschriften, die über die Prüfungen gemittelt werden. Der Anteil der Aufgaben, bei denen Haiku 5.5 jeden Punkt abgeschlossen hat, beträgt 37,1 % (Luna: 17,1 %). Für einen Browser-Agenten, der die gesamte Aufgabe abschließen muss, ist 37,1 % die Zahl, um die man planen sollte.

Was frühe Kunden berichteten

Anthropics Veröffentlichungsbeitrag zitiert mehrere Kunden, die das Modell vor der Veröffentlichung getestet haben. Diese sind vom Anbieter ausgewählt, aber sie weisen auf dieselben Arbeitslasten hin:

  • AlphaSense führt etwa 8 Millionen "Fragen im Dokument" pro Woche aus. Bei 400 Testanfragen erzielte Haiku 5.5 0,84 gegenüber 0,76 von Haiku 4.5.
  • Box verzeichnete einen Gewinn von 11 Punkten gegenüber Haiku 4.5 bei etwa der Hälfte der Latenz.
  • Asana maß über 30 % niedrigere Latenz pro Aufgabe und bis zu 2,5-fach schnellere Inferenz pro Agentenrunde im Vergleich zu ihrem aktuellen Modell.
  • HubSpot erzielte 92,8 % in seiner CRM-Suite, die beste Punktzahl, die es von einem kleinen Modell gesehen hat.
  • Cognition verwendet Haiku 5.5 als "Sidekick" unter Opus 5.5 in Devin Fusion und berichtet, dass das Paar eine FrontierCode-Wertung von 66,2 bei niedrigeren Kosten und Latenz hält.

Das Muster: kurze, wiederholte Arbeiten über Dokumente und Subagentenaufgaben unter einem größeren Modell.

Wo Haiku 5.5 die falsche Wahl ist

  • Komplexe agentische Codierung. Terminal-Bench ist der Bereich, in dem Sonnet 5.5 am weitesten voraus ist. Wenn eine Aufgabe viele Schritte, mehrdeutige Anforderungen oder eine lange Kette von Bearbeitungen benötigt, beginnen Sie mit Sonnet 5.5 oder Opus 5.5.
  • Prompts über 100K Tokens. Das 1M-Fenster ist real, aber der Preis ist nicht gleichmäßig verteilt. Über 100K Tokens bewegt sich die gesamte Anfrage auf 0,50 $ / 2,50 $, und da der neue Tokenizer etwa 30 % mehr Tokens zählt, liegt diese Grenze bei etwa 77K Tokens, wie Haiku 4.5 sie zählte. Der Preisbeitrag in dieser Serie arbeitet die Zahlen durch.
  • Arbeiten, die xhigh oder max benötigen, um zu bestehen. Die Ausgabe wird bei den höchsten Einstellungen lang und teuer. Anthropics eigene Anleitung empfiehlt, sich vor der endgültigen Entscheidung mit Sonnet 5.5 zu vergleichen.
  • Teams in der Priority Tier. Haiku 5.5 unterstützt dies nicht, sodass ein Haiku 4.5 Priority Tier-Engagement nicht übertragen wird.
  • Sicherheitstests. Haiku 5.5's Cyber-Schutzmaßnahmen sind strenger als die von Haiku 4.5 und blockieren Penetrationstests. Erwarten Sie refusal Stop-Gründe bei dieser Art von Arbeit, ohne serverseitige Rückfallmöglichkeit auf ein anderes Modell.

Probieren Sie es über AIHubMix aus

Die Aufwandeinstellung von Haiku 5.5 befindet sich in der Messages API's output_config, sodass der Claude Native-Endpunkt auf AIHubMix der direkteste Weg ist. Installieren Sie ein aktuelles Anthropic SDK (pip install -U anthropic) und richten Sie es auf AIHubMix aus:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # Platz für Denken lassen, nicht nur für die Antwort
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Klassifizieren Sie dieses Ticket als Abrechnung, Fehler oder anderes: "
                   "'Ich wurde für Oktober zweimal belastet.'",
    }],
)

# Denkblöcke können zuerst kommen, also wählen Sie den Textblock nach Typ aus.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

Zwei Dinge, die Sie bei Ihrem ersten Lauf überprüfen sollten. Lesen Sie response.usage.output_tokens bei low und erneut bei high mit demselben Prompt: Wenn sich die Zahlen nicht ändern, erreicht die Aufwandeinstellung das Modell nicht. Und beachten Sie, dass die Modellseite von AIHubMix derzeit eine Kontextlänge von 200K für dieses Modell angibt, unter Anthropics 1M, also bestätigen Sie das Limit, bevor Sie sehr lange Prompts senden.

Wer wechseln sollte, wer warten sollte

Jetzt wechseln, wenn Sie Klassifizierung, Extraktion, Routing, Zusammenfassungen oder Dokumenten-Q&A mit Prompts unter 100K Tokens durchführen. Sie erhalten ein viel stärkeres Modell zu einem Bruchteil des Tokenpreises. Planen Sie eine Stunde für die Änderungen am Anfragecode ein und testen Sie dann den Aufwand low im Vergleich zu medium bei Ihren eigenen Bewertungen.

Jetzt wechseln, wenn Sie ein großes Modell für Subagentenarbeiten verwenden, für die es überqualifiziert ist: eine Zahl aus einer Akte ziehen, eine Datei überprüfen, ein Toolergebnis zusammenfassen. Dies ist die Rolle, die Anthropic und seine Startkunden betonen.

Warten Sie einen Sprint, wenn Ihre Integration die Computernutzung mit dem computer_20250124 Werkzeug, Vorbefüllung oder temperature=0 verwendet. Jedes dieser Elemente gibt einen 400-Fehler bei Haiku 5.5 zurück, und deren Behebung ist Codearbeit, kein Austausch von Modell-Strings.

Bleiben Sie, wo Sie sind, wenn Ihre Arbeitslast lang ist (regelmäßig über etwa 77K Haiku 4.5 Tokens), von der Priority Tier abhängt oder komplexe agentische Codierung erfordert. Für die letzte Gruppe ist der nützliche Vergleich Haiku 5.5 gegen Sonnet 5.5 hinsichtlich der Kosten pro abgeschlossener Aufgabe, nicht Haiku 5.5 gegen Haiku 4.5.

Wenn Sie bereit sind zu vergleichen, listet die AIHubMix-Modellliste Haiku 5.5, Sonnet 5.5 und Opus 5.5 hinter einem API-Schlüssel auf, sodass dieselbe Bewertung gegen alle drei durchgeführt werden kann.

FAQ

Ist Claude Haiku 5.5 in allem besser als Haiku 4.5?
In jedem Benchmark in Anthropics Veröffentlichungstabelle, ja, oft mit großem Abstand. Die Ausnahmen sind praktisch und nicht qualitativ: Priority Tier wird nicht unterstützt, Prompts über 100K Tokens kosten pro Token mehr als der Kurzprompt-Tarif, und mehrere alte Anfrage-Muster geben jetzt Fehler zurück.

Ist Haiku 5.5 wirklich 90 % günstiger?
Der Preis pro Token ist für Prompts bis zu 100K Tokens um 90 % niedriger und um 50 % niedriger darüber hinaus. Da der neue Tokenizer etwa 30 % mehr Tokens für denselben Text zählt und das Denken jetzt Ausgabetokens produziert, schätzt Anthropic die typischen Einsparungen auf etwa 75 %.

Wie schneidet Haiku 5.5 im Vergleich zu GPT-6 Luna ab?
Beide listen zu 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens. In den von Anthropic berichteten Ergebnissen schneidet Haiku 5.5 in jedem Benchmark, in dem beide erscheinen, besser ab, am deutlichsten bei der Computernutzung und im Terminal-Bench. Luna hält seinen Basispreis bis zu einer längeren Promptlänge, sodass Arbeitslasten mit langen Prompts separat bepreist werden sollten.

Kann Haiku 5.5 Sonnet 5.5 beim Codieren ersetzen?
Für enge, gut definierte Änderungen und Subagentenaufgaben kann es sich lohnen, es zu testen. Für komplexe mehrstufige agentische Codierung erzielt Sonnet 5.5 bei Terminal-Bench 4.0 (70,6 % vs. 39,2 %) deutlich höhere Werte, und Anthropic empfiehlt Sonnet oder Opus für diese Arbeit.

Sind die Benchmark-Werte bei der Standardeinstellung?
Nein. Die Hauptwerte wurden mit maximalem Aufwand ermittelt. Der Standard ist mittel, bei dem die Systemkarte niedrigere Ergebnisse meldet, zum Beispiel 1277 statt 1620 auf GDPval-AA.

Bedeutet das 1M-Kontextfenster, dass ich 1M-Token-Prompts günstig senden kann?
Sie können sie senden, aber alles über 100K Tokens wird mit 0,50 $ Eingabe und 2,50 $ Ausgabe pro Million Tokens für die gesamte Anfrage abgerechnet. Überprüfen Sie auch das angegebene Kontextlimit Ihres Gateways.

Was muss ich in meinem Code ändern, um zu wechseln?
Mindestens: die Modell-ID, jedes manuelle Denkbudget, jede Temperatur- oder top_p-Einstellung, jede Vorbefüllung des Assistenten und Code, der den ersten Inhaltsblock als Antwort liest. Der Migrationsbeitrag in dieser Serie enthält die vollständige Liste.

Weiterlesen: die Claude Haiku 5.5-Serie

Quellen