Tarification de Claude Haiku 5.5 : La ligne des 100K derrière la réduction de 90%

AIHubMix8 min de lecture
Tarification de Claude Haiku 5.5 : La ligne des 100K derrière la réduction de 90%

Claude Haiku 5.5 coûte 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie, soit un dixième des 1 $ et 5 $ de Haiku 4.5. Cela s'applique aux invites jusqu'à 100 000 tokens. Au-delà de cette ligne, l'ensemble de la demande est facturé à 0,50 $ et 2,50 $, ce qui représente la moitié du prix de Haiku 4.5 plutôt qu'un dixième.

Anthropic estime l'économie typique à environ 75 %, et la différence provient de trois éléments que cet article examine : où se situent vos invites par rapport à la ligne des 100K, combien de tokens de réflexion les paramètres par défaut génèrent, et un nouveau tokenizer qui compte le même texte comme environ 30 % de tokens supplémentaires. Deux exemples concrets ci-dessous montrent comment une facture réelle se présente.

La grille tarifaire

Prix par million de tokens, provenant du post de lancement de Haiku 5.5 d'Anthropic et de la page de tarification :

Type de token Haiku 5.5, court Haiku 5.5, long Haiku 4.5 Sonnet 5.5
Entrée 0,10 $ 0,50 $ 1,00 $ 2,00 $
Sortie 0,50 $ 2,50 $ 5,00 $ 10,00 $
Lecture de cache 0,01 $ 0,05 $ 0,10 $ 0,10 $
Écriture de cache, 5 min 0,125 $ 0,625 $ 1,25 $ 2,50 $
Écriture de cache, 1 heure 0,20 $ 1,00 $ 2,00 $ 4,00 $

« Court » signifie une invite de 100 000 tokens ou moins ; « long » signifie plus de 100 000. L'API Batch applique une réduction de 50 % sur l'entrée et la sortie. Le prix de lecture de cache de Sonnet 5.5 a été réduit de 0,20 $ à 0,10 $ le même jour.

La page Haiku 5.5 sur AIHubMix liste les mêmes deux niveaux, avec une recherche web à 0,01 $ par demande.

Règles de facturation faciles à manquer

L'ensemble de la demande change de niveau, pas seulement l'excédent. Anthropic tarifie Haiku 5.5 avec deux grilles tarifaires choisies par la longueur de l'invite. Une invite de 100 000 tokens paie 0,0100 $ pour son entrée ; une invite de 100 001 tokens paie 0,0500 $, et sa sortie coûte également cinq fois plus. Haiku 5.5 est l'exception ici : les autres modèles actuels d'Anthropic avec un contexte de 1M facturent la fenêtre complète à leurs tarifs standard.

La ligne arrive plus tôt que ne le suggèrent vos anciens tableaux de bord. Haiku 5.5 utilise un tokenizer plus récent, et le même texte produit environ 30 % de tokens supplémentaires par rapport à Haiku 4.5. Diviser 100 000 par 1,3 place la ligne près de 77 000 tokens selon la façon dont Haiku 4.5 les comptait. Une invite de 78 000 tokens sur votre ancien tableau de bord devient environ 101 000 tokens sur Haiku 5.5, et paie le tarif long. Cette arithmétique provient du chiffre de 30 % dans le guide de migration d'Anthropic ; l'augmentation exacte dépend du contenu, donc recomptez les vraies invites sur le nouveau modèle.

La réflexion est activée par défaut et est facturée comme sortie. Haiku 4.5 ne réfléchissait que sur demande. Haiku 5.5 exécute une réflexion adaptative à un effort moyen à moins que vous ne le changiez, donc un chemin qui renvoyait auparavant 200 tokens de sortie peut maintenant en renvoyer plusieurs centaines de plus.

Les invites courtes peuvent maintenant être mises en cache. L'invite minimale pouvant être mise en cache passe de 4 096 tokens sur Haiku 4.5 à 512 sur Haiku 5.5, selon le guide de migration d'Anthropic. Une invite système de 3 000 tokens qui ne pouvait jamais être mise en cache sur Haiku 4.5 peut maintenant l'être, et une lecture de cache coûte un dixième du tarif d'entrée.

Le niveau de priorité n'est pas disponible. Si vous avez un engagement de niveau de priorité sur Haiku 4.5, il ne se transfère pas à Haiku 5.5. Planifiez la capacité séparément.

Les tokens mis en cache et la ligne des 100K : supposez qu'ils comptent. Anthropic liste un prix de lecture de cache séparé pour chaque niveau, ce qui suggère que l'ensemble de l'invite, mise en cache ou non, détermine le niveau. Anthropic ne l'a pas précisé, donc l'hypothèse prudente est qu'un préfixe mis en cache de 95K plus une question de 6K est une invite longue.

Exemple 1 : un classificateur de tickets de support

Hypothèses, en comptage de tokens de Haiku 4.5 : une invite système de 3 000 tokens avec définitions d'outils, un ticket de 1 000 tokens, une réponse de 200 tokens, et 1 million de demandes par mois. Haiku 4.5 fonctionne sans réflexion.

Sur Haiku 5.5, le même texte devient 3 900 + 1 300 tokens d'entrée et une réponse de 260 tokens. On suppose que la réflexion ajoute 300 tokens à un effort faible et 800 à un effort moyen. Ces chiffres de réflexion sont des hypothèses ; mesurez les vôtres.

Configuration Par demande Par mois
Haiku 4.5 0,00500 $ 5 000 $
Haiku 5.5, faible, sans cache 0,00080 $ 800 $
Haiku 5.5, faible, préfixe mis en cache 0,00045 $ 453 $
Haiku 5.5, moyen, préfixe mis en cache 0,00070 $ 703 $
Sonnet 5.5, moyen, préfixe mis en cache 0,01359 $ 13 674 $

Les lignes mensuelles mises en cache incluent environ 4 $ d'écritures de cache pour Haiku 5.5 et environ 84 $ pour Sonnet 5.5, en supposant une écriture de 5 minutes toutes les cinq minutes. Sonnet 5.5 utilise les mêmes hypothèses de tokens que Haiku à un niveau moyen.

Comment la ligne mise en cache faible s'additionne : 3 900 tokens mis en cache à 0,01 $ par million (0,000039 $), plus 1 300 tokens d'entrée frais à 0,10 $ (0,00013 $), plus 560 tokens de sortie à 0,50 $ (0,00028 $), pour 0,000449 $ par demande.

Le schéma : la mise en cache et l'effort ensemble déplacent la facture de 16 % du coût ancien (sans cache, faible) à 9 % (mis en cache, faible). Laisser l'effort par défaut au lieu de faible ajoute environ 250 $ par mois à ce volume. Aucun des choix n'a beaucoup d'importance en termes absolus par rapport aux 5 000 $ de Haiku 4.5, c'est pourquoi le cas du classificateur est celui où le titre de 90 % est réel.

Exemple 2 : une révision de contrat qui dépasse la ligne

Hypothèses, en comptage de tokens de Haiku 4.5 : un contrat plus des instructions de 70 000 tokens, une réponse de 1 500 tokens, sans mise en cache. Sur Haiku 5.5, cela devient 91 000 tokens d'entrée, une réponse de 1 950 tokens, et 2 000 tokens de réflexion supposés à moyen, donc 3 950 tokens de sortie.

Maintenant, faites en sorte que le contrat soit 14 % plus long : 80 000 tokens sur Haiku 4.5, 104 000 sur Haiku 5.5.

Taille du contrat (comptage Haiku 4.5) Haiku 4.5 Haiku 5.5 Changement
70 000 tokens 0,0775 $ 0,0111 $ 86 % moins cher
80 000 tokens 0,0875 $ 0,0619 $ 29 % moins cher

La deuxième ligne : 104 000 tokens d'entrée à 0,50 $ par million (0,052 $) plus 3 950 tokens de sortie à 2,50 $ (0,0099 $). Quatorze pour cent de texte supplémentaire coûte 5,6 fois plus sur Haiku 5.5.

La solution est de rester en dessous de la ligne. Diviser le contrat plus long en deux appels d'environ 53 000 tokens chacun (la moitié du contrat plus les instructions dans chaque) coûte environ 0,015 $ au tarif court, soit moins d'un quart d'un seul appel long. Que cette division fonctionne dépend de la tâche ; une révision clause par clause se divise proprement, une question qui nécessite l'ensemble du document à la fois ne le fait pas.

Comment cela se compare en coût par tâche

Par rapport à Sonnet 5.5, Haiku 5.5 coûte environ un vingtième du prix par token sur les courtes invites. Mais le prix par token n'est pas le prix par tâche terminée. Sur le codage agentique complexe, Sonnet 5.5 obtient 70,6 % sur Terminal-Bench 4.0 contre 39,2 % pour Haiku 5.5, dans les résultats rapportés par Anthropic, et une demande moins chère qui échoue et doit être réessayée, ou qui est refaite par un modèle plus grand, n'est pas moins chère. Le propre conseil d'Anthropic est de comparer avec Sonnet 5.5 avant d'exécuter Haiku à xhigh ou max. Sonnet 5.5 a également été rendu moins cher le même jour : ses lectures de cache ont été réduites de moitié, ce que dit Anthropic réduit d'environ 20 % la plupart des travaux agentiques.

Par rapport à GPT-6 Luna, les prix de liste pour les courtes invites sont identiques, lectures de cache incluses. La différence réside dans la règle des longues invites. Le tarif long de Luna commence au-dessus de 272 000 tokens d'entrée et est de 0,20 $ / 0,75 $, tandis que celui de Haiku 5.5 commence au-dessus de 100 000 et est de 0,50 $ / 2,50 $. Pour une charge de travail entre 100K et 272K tokens, Luna est beaucoup moins cher au prix de liste. Les deux modèles utilisent des tokenizers différents, donc comparez les factures mesurées, pas les comptages de tokens.

Les chiffres sur le seuil de 100K et l'effet du tokenizer ont également été examinés par la newsletter de Roo, dont l'arithmétique correspond aux exemples ci-dessus.

Étapes pour réduire la facture

  1. Comptez les tokens sur le nouveau modèle et alertez avant 100K. Enregistrez la taille complète de l'invite pour chaque demande et alertez autour de 90 000 tokens, afin que les invites qui dérivent vers le haut soient réduites ou divisées avant de changer de niveau.
  2. Mettez en cache le préfixe stable. Invite système et définitions d'outils en premier, contenu variable en dernier. Avec un minimum de 512 tokens, la plupart des invites système de production sont désormais éligibles. Le guide de mise en cache des invites Claude d'AIHubMix montre le format de demande.
  3. Définissez explicitement l'effort. Utilisez faible pour les routes simples à fort volume. Le moyen par défaut coûte plus cher sur chaque demande, que la route en ait besoin ou non.
  4. Définissez max_tokens pour la réflexion plus la réponse. Trop petit et vous payez pour une réflexion qui se termine sans réponse.
  5. Regroupez ce qui peut attendre. L'API Batch réduit de moitié les tarifs d'entrée et de sortie.
  6. Dirigez vers le haut au lieu de réessayer vers le bas. Si un type de tâche échoue souvent sur Haiku, envoyez-le d'abord à Sonnet 5.5 plutôt que de payer pour des tentatives Haiku plus un retour.

Un modèle d'enregistrement pour les étapes 1 et 2 via le point de terminaison natif Claude d'AIHubMix :

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Vous triez les tickets de support..."  # préfixe stable, pouvant être mis en cache

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"avertissement : invite à {prompt_tokens} tokens, près de la ligne de prix de 100K")
    return next(b.text for b in r.content if b.type == "text")

Si cache_read_input_tokens reste à zéro lors des appels répétés, quelque chose dans le préfixe change entre les demandes, comme un horodatage dans l'invite système.

FAQ

Combien coûte Claude Haiku 5.5 ?
Pour les invites jusqu'à 100 000 tokens, 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie. Pour les invites plus longues, 0,50 $ et 2,50 $, appliqués à l'ensemble de la demande. Les lectures de cache coûtent un dixième du tarif d'entrée, et l'API Batch réduit de moitié les prix d'entrée et de sortie.

Haiku 5.5 est-il vraiment 90 % moins cher que Haiku 4.5 ?
Par token, sur les courtes invites, oui. Par tâche, moins : le nouveau tokenizer compte environ 30 % de tokens supplémentaires pour le même texte, la réflexion est activée par défaut, et les longues invites ne bénéficient que d'une réduction de 50 %. Anthropic estime une économie typique d'environ 75 %. Un classificateur d'invites courtes avec mise en cache peut économiser environ 90 %.

Que se passe-t-il si mon invite dépasse juste 100 000 tokens ?
L'ensemble de la demande passe à la grille tarifaire supérieure, tant pour l'entrée que pour la sortie. Dans l'exemple de contrat ci-dessus, 14 % de texte supplémentaire a rendu la demande 5,6 fois plus coûteuse.

Les tokens mis en cache comptent-ils pour le seuil de 100K ?
Anthropic ne l'a pas déclaré explicitement. Ses tarifs listent des prix de lecture de cache séparés pour chaque niveau, donc l'hypothèse prudente est que l'ensemble de l'invite, mise en cache ou non, détermine le niveau.

Les tokens de réflexion coûtent-ils des frais supplémentaires ?
Ils sont facturés comme des tokens de sortie au tarif de sortie normal. Comme la réflexion est activée par défaut à un effort moyen, elle peut s'ajouter de manière significative à une route qui produisait auparavant des réponses courtes. Réduire l'effort les diminue.

Haiku 5.5 est-il moins cher que GPT-6 Luna ?
Pour les invites jusqu'à 100K tokens, les prix de liste sont les mêmes. Entre 100K et 272K tokens, Luna reste à son tarif de base tandis que Haiku 5.5 passe à son tarif supérieur, donc Luna est moins cher là au prix de liste. Les tokenizers diffèrent, donc comparez les factures réelles.

Puis-je utiliser le niveau de priorité avec Haiku 5.5 ?
Non. Le niveau de priorité n'est pas pris en charge sur Haiku 5.5, donc les engagements sur Haiku 4.5 ne se transfèrent pas.

Continuez à lire : la série Claude Haiku 5.5

Sources