Claude Haiku 5.5 Preisgestaltung: Die 100K-Grenze hinter dem 90%-Schnitt

AIHubMix8 Min. Lesezeit
Claude Haiku 5.5 Preisgestaltung: Die 100K-Grenze hinter dem 90%-Schnitt

Claude Haiku 5.5 kostet 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens, ein Zehntel von Haiku 4.5's 1 $ und 5 $. Das gilt für Eingaben bis zu 100.000 Tokens. Über dieser Grenze wird die gesamte Anfrage mit 0,50 $ und 2,50 $ abgerechnet, was die Hälfte des Preises von Haiku 4.5 und nicht ein Zehntel ist.

Anthropic schätzt die typischen Einsparungen auf etwa 75%, nicht 90%, und der Unterschied ergibt sich aus drei Faktoren, die in diesem Beitrag behandelt werden: wo Ihre Eingaben relativ zur 100K-Grenze liegen, wie viele Denktokens die Standardeinstellungen erzeugen, und ein neuer Tokenizer, der denselben Text als etwa 30% mehr Tokens zählt. Zwei Beispiele zeigen, wie eine echte Rechnung aussieht.

Die Preisliste

Preise pro Million Tokens, aus Anthropic's Haiku 5.5 Einführungspost und Preisseite:

Token-Typ Haiku 5.5, kurz Haiku 5.5, lang Haiku 4.5 Sonett 5.5
Eingabe 0,10 $ 0,50 $ 1,00 $ 2,00 $
Ausgabe 0,50 $ 2,50 $ 5,00 $ 10,00 $
Cache-Lesen 0,01 $ 0,05 $ 0,10 $ 0,10 $
Cache-Schreiben, 5 Minuten 0,125 $ 0,625 $ 1,25 $ 2,50 $
Cache-Schreiben, 1 Stunde 0,20 $ 1,00 $ 2,00 $ 4,00 $

"Kurz" bedeutet eine Eingabe von 100.000 Tokens oder weniger; "lang" bedeutet über 100.000. Die Batch-API reduziert die Eingabe- und Ausgabekosten um 50%. Der Preis für das Cache-Lesen von Sonett 5.5 wurde am selben Tag von 0,20 $ auf 0,10 $ gesenkt.

Die Haiku 5.5-Seite auf AIHubMix listet die gleichen zwei Stufen, mit einer Websuche zu 0,01 $ pro Anfrage.

Abrechnungsregeln, die leicht übersehen werden können

Die gesamte Anfrage wechselt die Stufe, nicht nur der Überschuss. Anthropic preist Haiku 5.5 mit zwei Preiskarten, die nach der Eingabelänge ausgewählt werden. Eine Eingabe von 100.000 Tokens zahlt 0,0100 $ für ihre Eingabe; eine Eingabe von 100.001 Tokens zahlt 0,0500 $, und ihre Ausgabe kostet ebenfalls fünfmal so viel. Haiku 5.5 ist hier die Ausnahme: Die anderen aktuellen 1M-Kontextmodelle von Anthropic berechnen das gesamte Fenster zu ihren Standardtarifen.

Die Grenze kommt früher, als Ihre alten Dashboards anzeigen. Haiku 5.5 verwendet einen neueren Tokenizer, und derselbe Text produziert etwa 30% mehr Tokens als bei Haiku 4.5. 100.000 geteilt durch 1,3 bringt die Grenze auf etwa 77.000 Tokens, wie Haiku 4.5 sie gezählt hat. Eine Eingabe von 78.000 Tokens auf Ihrem alten Dashboard wird auf Haiku 5.5 zu etwa 101.000 Tokens und zahlt den langen Tarif. Diese Berechnung stammt aus der 30%-Zahl in Anthropics Migrationsleitfaden; die genaue Erhöhung hängt vom Inhalt ab, also zählen Sie echte Eingaben im neuen Modell erneut.

Denken ist standardmäßig aktiviert und wird als Ausgabe abgerechnet. Haiku 4.5 dachte nur, wenn es angefordert wurde. Haiku 5.5 führt adaptives Denken mit medium Aufwand aus, es sei denn, Sie ändern es, sodass ein Weg, der früher 200 Ausgabetokens zurückgab, jetzt mehrere hundert mehr zurückgeben kann.

Kurze Eingaben können jetzt zwischengespeichert werden. Die minimale zwischenspeicherbare Eingabe sinkt von 4.096 Tokens bei Haiku 4.5 auf 512 bei Haiku 5.5, laut Anthropics Migrationsleitfaden. Eine 3.000-Token-Systemeingabe, die bei Haiku 4.5 niemals zwischengespeichert werden konnte, kann jetzt zwischengespeichert werden, und ein Cache-Lesen kostet ein Zehntel des Eingabetarifs.

Priority Tier ist nicht verfügbar. Wenn Sie ein Priority Tier-Engagement für Haiku 4.5 haben, wird dies nicht auf Haiku 5.5 übertragen. Planen Sie die Kapazität separat.

Zwischengespeicherte Tokens und die 100K-Grenze: Gehen Sie davon aus, dass sie zählen. Anthropic listet einen separaten Preis für das Cache-Lesen für jede Stufe, was darauf hindeutet, dass die gesamte Eingabe, zwischengespeichert oder nicht, die Stufe bestimmt. Anthropic hat dies nicht ausdrücklich erklärt, daher ist die sichere Annahme, dass ein 95K zwischengespeicherter Präfix plus eine 6K-Frage eine lange Eingabe ist.

Beispiel 1: Ein Klassifizierer für Support-Tickets

Annahmen, in Haiku 4.5 Token-Zählungen: eine 3.000-Token-Systemeingabe mit Tool-Definitionen, ein 1.000-Token-Ticket, eine 200-Token-Antwort und 1 Million Anfragen pro Monat. Haiku 4.5 läuft ohne Denken.

Bei Haiku 5.5 wird derselbe Text zu 3.900 + 1.300 Eingabetokens und einer 260-Token-Antwort. Es wird angenommen, dass das Denken 300 Tokens bei low Aufwand und 800 bei medium hinzufügt. Diese Denkwerten sind Annahmen; messen Sie Ihre.

Setup Pro Anfrage Pro Monat
Haiku 4.5 0,00500 $ 5.000 $
Haiku 5.5, niedrig, kein Cache 0,00080 $ 800 $
Haiku 5.5, niedrig, zwischengespeicherter Präfix 0,00045 $ 453 $
Haiku 5.5, medium, zwischengespeicherter Präfix 0,00070 $ 703 $
Sonett 5.5, medium, zwischengespeicherter Präfix 0,01359 $ 13.674 $

Monatliche zwischengespeicherte Zeilen beinhalten etwa 4 $ für Cache-Schreibvorgänge bei Haiku 5.5 und etwa 84 $ für Sonett 5.5, basierend auf einem 5-minütigen Schreibvorgang alle fünf Minuten. Sonett 5.5 verwendet die gleichen Token-Annahmen wie Haiku bei medium.

Wie sich die zwischengespeicherte low-Zeile summiert: 3.900 zwischengespeicherte Tokens zu 0,01 $ pro Million (0,000039 $), plus 1.300 frische Eingabetokens zu 0,10 $ (0,00013 $), plus 560 Ausgabetokens zu 0,50 $ (0,00028 $), für 0,000449 $ pro Anfrage.

Das Muster: Caching und Aufwand zusammen bewegen die Rechnung von 16% der alten Kosten (kein Cache, niedrig) auf 9% (zwischengespeichert, niedrig). Den Aufwand auf dem Standardwert anstelle von low zu belassen, erhöht die Kosten um etwa 250 $ pro Monat bei diesem Volumen. Keine der beiden Entscheidungen hat in absoluten Zahlen viel Einfluss im Vergleich zu Haiku 4.5's 5.000 $, weshalb der Klassifizierer-Fall der ist, in dem die 90%-Überschrift real ist.

Beispiel 2: Eine Vertragsprüfung, die die Grenze überschreitet

Annahmen, in Haiku 4.5 Token-Zählungen: ein Vertrag plus Anweisungen von 70.000 Tokens, eine 1.500-Token-Antwort, kein Caching. Bei Haiku 5.5 wird dies zu 91.000 Eingabetokens, einer 1.950-Token-Antwort und angenommenen 2.000 Denktokens bei medium, also 3.950 Ausgabetokens.

Jetzt machen wir den Vertrag 14% länger: 80.000 Tokens bei Haiku 4.5, 104.000 bei Haiku 5.5.

Vertragsgröße (Haiku 4.5 Zählung) Haiku 4.5 Haiku 5.5 Änderung
70.000 Tokens 0,0775 $ 0,0111 $ 86% niedriger
80.000 Tokens 0,0875 $ 0,0619 $ 29% niedriger

Die zweite Zeile: 104.000 Eingabetokens zu 0,50 $ pro Million (0,052 $) plus 3.950 Ausgabetokens zu 2,50 $ (0,0099 $). Vierzehn Prozent mehr Text kostet 5,6-mal so viel bei Haiku 5.5.

Die Lösung besteht darin, unter der Grenze zu bleiben. Wenn der längere Vertrag in zwei Anfragen von jeweils etwa 53.000 Tokens (die Hälfte des Vertrags plus die Anweisungen in jeder) aufgeteilt wird, kostet dies insgesamt etwa 0,015 $ zum kurzen Tarif, weniger als ein Viertel der einzelnen langen Anfrage. Ob eine Aufteilung funktioniert, hängt von der Aufgabe ab; eine Klausel-für-Klausel-Überprüfung lässt sich sauber aufteilen, eine Frage, die das gesamte Dokument auf einmal benötigt, nicht.

Wie es sich in Bezug auf die Kosten pro Aufgabe vergleicht

Im Vergleich zu Sonett 5.5 ist Haiku 5.5 etwa ein Zwanzigstel des Preises pro Token bei kurzen Eingaben. Aber der Preis pro Token ist nicht der Preis pro abgeschlossener Aufgabe. Bei komplexem agentischem Codieren erzielt Sonett 5.5 70,6% bei Terminal-Bench 4.0 im Vergleich zu Haiku 5.5's 39,2%, in den von Anthropic berichteten Ergebnissen, und eine günstigere Anfrage, die fehlschlägt und erneut versucht wird oder von einem größeren Modell erneut durchgeführt wird, ist nicht günstiger. Anthropics eigene Empfehlung ist, sich vor dem Ausführen von Haiku bei xhigh oder max mit Sonett 5.5 zu vergleichen. Sonett 5.5 wurde am selben Tag ebenfalls günstiger: Die Preise für Cache-Lesen wurden halbiert, was laut Anthropic die Kosten für die meisten agentischen Arbeiten um etwa 20% senkt.

Im Vergleich zu GPT-6 Luna sind die Listenpreise für kurze Eingaben identisch, einschließlich Cache-Lesen. Der Unterschied liegt in der Regel für lange Eingaben. Lunas Langzeitkontextpreis beginnt über 272.000 Eingabetokens und beträgt 0,20 $ / 0,75 $, während Haiku 5.5 über 100.000 beginnt und 0,50 $ / 2,50 $ beträgt. Für eine Arbeitslast zwischen 100K und 272K Tokens ist Luna auf Listenpreis deutlich günstiger. Die beiden Modelle verwenden unterschiedliche Tokenizer, also vergleichen Sie die tatsächlichen Rechnungen, nicht die Token-Zählungen.

Die Zahlen zur 100K-Grenze und dem Effekt des Tokenizers wurden ebenfalls von Roo's Newsletter behandelt, dessen Berechnungen mit den obigen Beispielen übereinstimmen.

Schritte zur Senkung der Rechnung

  1. Token im neuen Modell zählen und vor 100K warnen. Protokollieren Sie die gesamte Eingabegröße für jede Anfrage und warnen Sie bei etwa 90.000 Tokens, damit Eingaben, die nach oben driften, gekürzt oder aufgeteilt werden, bevor sie die Stufe wechseln.
  2. Den stabilen Präfix zwischenspeichern. Systemeingabe und Tool-Definitionen zuerst, variable Inhalte zuletzt. Mit einem Minimum von 512 Tokens qualifizieren sich die meisten Produktionssystemeingaben jetzt. AIHubMix's Leitfaden zum Caching von Claude-Eingaben zeigt das Anfrageformat.
  3. Aufwand explizit festlegen. Verwenden Sie low für hochvolumige, einfache Routen. Der Standardwert medium kostet bei jeder Anfrage mehr, unabhängig davon, ob die Route es benötigt oder nicht.
  4. Max_tokens für Denken plus Antwort festlegen. Zu klein und Sie zahlen für Denken, das ohne Antwort endet.
  5. Batchen, was warten kann. Die Batch-API halbiert die Eingabe- und Ausgabekosten.
  6. Routen Sie nach oben, anstatt nach unten zu wiederholen. Wenn ein Aufgabentyp häufig bei Haiku fehlschlägt, senden Sie ihn zuerst an Sonett 5.5, anstatt für Haiku-Versuche plus einen Rückfall zu zahlen.

Ein Protokollmuster für die Schritte 1 und 2 über AIHubMix's Claude-Native-Endpunkt:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Sie triagieren Support-Tickets..."  # stabiler, zwischenspeicherbarer Präfix

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"Warnung: Eingabe bei {prompt_tokens} Tokens, nahe der 100K-Preiskante")
    return next(b.text for b in r.content if b.type == "text")

Wenn cache_read_input_tokens über wiederholte Aufrufe hinweg bei null bleibt, ändert sich etwas im Präfix zwischen den Anfragen, wie ein Zeitstempel in der Systemeingabe.

Häufig gestellte Fragen

Wie viel kostet Claude Haiku 5.5?
Für Eingaben bis zu 100.000 Tokens, 0,10 $ pro Million Eingabetokens und 0,50 $ pro Million Ausgabetokens. Für längere Eingaben 0,50 $ und 2,50 $, die auf die gesamte Anfrage angewendet werden. Cache-Lesen kostet ein Zehntel des Eingabetarifs, und die Batch-API halbiert die Eingabe- und Ausgabepreise.

Ist Haiku 5.5 wirklich 90% günstiger als Haiku 4.5?
Pro Token, bei kurzen Eingaben, ja. Pro Aufgabe, weniger: Der neue Tokenizer zählt etwa 30% mehr Tokens für denselben Text, Denken ist standardmäßig aktiviert, und lange Eingaben erhalten nur einen 50%-Schnitt. Anthropic schätzt eine typische Einsparung von etwa 75%. Ein Klassifizierer für kurze Eingaben mit Caching kann etwa 90% sparen.

Was passiert, wenn meine Eingabe gerade über 100.000 Tokens liegt?
Die gesamte Anfrage wechselt zur höheren Preisliste, sowohl Eingabe als auch Ausgabe. Im obigen Vertragsbeispiel machte 14% mehr Text die Anfrage 5,6-mal so teuer.

Zählen zwischengespeicherte Tokens zur 100K-Grenze?
Anthropic hat dies nicht ausdrücklich erklärt. Die Preisgestaltung listet separate Preise für das Cache-Lesen für jede Stufe auf, sodass die sichere Annahme ist, dass die gesamte Eingabe, zwischengespeichert oder nicht, die Stufe bestimmt.

Kosten Denktokens extra?
Sie werden als Ausgabetokens zum normalen Ausgabepreis abgerechnet. Da das Denken standardmäßig bei mittlerem Aufwand aktiviert ist, können sie erheblich zu einer Route beitragen, die früher kurze Antworten lieferte. Den Aufwand zu senken, reduziert sie.

Ist Haiku 5.5 günstiger als GPT-6 Luna?
Bei Eingaben bis zu 100K Tokens sind die Listenpreise gleich. Zwischen 100K und 272K Tokens bleibt Luna bei ihrem Basispreis, während Haiku 5.5 auf ihren höheren wechselt, sodass Luna dort auf Listenpreis günstiger ist. Die Tokenizer unterscheiden sich, also vergleichen Sie die tatsächlichen Rechnungen.

Kann ich Priority Tier mit Haiku 5.5 verwenden?
Nein. Priority Tier wird bei Haiku 5.5 nicht unterstützt, sodass Verpflichtungen bei Haiku 4.5 nicht übertragen werden.

Weiterlesen: Die Claude Haiku 5.5-Serie

Quellen