Claude Haiku 4.5 a obtenu 0,0 % sur Terminal-Bench 4.0. Claude Haiku 5.5 obtient 39,2 %, et il coûte un dixième par jeton : 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, contre 1 $ et 5 $ pour Haiku 4.5.
C'est la mise à niveau en une ligne. Le petit modèle Claude est passé de "acceptable pour la classification, pas pour les agents" à un sous-agent utilisable, et son prix correspond désormais à celui de GPT-6 Luna d'OpenAI au centime près. Anthropic l'a publié le 7 octobre 2026 sous le nom de Claude Haiku 5.5, ID du modèle claude-haiku-5-5, et il est déjà répertorié sur AIHubMix.
Le prix est soumis à des conditions, tout comme les scores de référence. Cet article couvre ce qui a changé, à quel point Haiku 5.5 se rapproche de Sonnet 5.5, où ce n'est pas le bon choix, et qui devrait changer maintenant.
Ce qui a changé, et ce qui n'a pas changé
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Prix d'entrée / sortie | 1 $ / 5 $ | 0,10 $ / 0,50 $ |
| Fenêtre de contexte | 200K | 1M |
| Sortie max | 64K | 128K |
| Réflexion | Budget manuel, désactivé par défaut | Adaptatif, activé par défaut |
| Niveaux d'effort | Aucun | Cinq, par défaut moyen |
| Jetons pour le même texte | De base | Environ 30 % de plus |
| Outil d'utilisation du navigateur | Non | Oui |
Les prix de Haiku 5.5 s'appliquent aux invites jusqu'à 100K jetons ; les invites plus longues paient 0,50 $ / 2,50 $. Les prix sont par million de jetons.
Ce qui reste le même : la description du travail. Anthropic continue de proposer Haiku pour des travaux à fort volume et sensibles aux coûts (résumés, compactage, requêtes de base de données, classification) et pour des tâches de sous-agent sous un modèle plus grand. Anthropic affirme que les invites existantes de Haiku 4.5 devraient bien fonctionner sans modifications. Le code de demande existant est une autre affaire : cinq modèles de demande qui fonctionnaient sur Haiku 4.5 renvoient maintenant une erreur 400, comme l'indique le guide de migration d'Anthropic et le post de migration dans cette série le décrit.
Deux changements modifient le comportement par défaut du modèle. La réflexion est désormais activée à moins que vous ne la désactiviez, donc une demande qui n'a jamais mentionné la réflexion peut revenir avec des blocs thinking en premier et dépenser des jetons de sortie pour eux. Et Haiku 5.5 est le premier Haiku avec un paramètre d'effort, qui est désormais le principal réglage entre coût et qualité.
Comment il se classe par rapport à Haiku 4.5, Luna et Sonnet 5.5
Les chiffres ci-dessous proviennent des documents de lancement d'Anthropic et de la carte système de Haiku 5.5, compilés par Kingy.ai. Ils sont rapportés par le fournisseur, Anthropic a exécuté les modèles GPT lui-même, et personne n'a encore reproduit le tableau complet de manière indépendante.
| Référence | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (hors ligne) | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Le dernier examen de l'humanité | 45,9 % | 10,2 % | n/a | 56,9 % |
| Terminal-Bench 4.0 | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| FrontierCode 1.1 Principal | 46,4 % | n/a | 42,4 % | 52,1 % |
| Cartographie | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Le dernier examen de l'humanité et la cartographie se font sans outils. Le score FrontierCode de Sonnet 5.5 est à un effort xhigh.
Trois lectures comptent plus que n'importe quelle ligne :
- Par rapport à Haiku 4.5, c'est une classe de modèle différente. Les évaluations de travail de connaissance doublent à peu près, et les lignes agentiques passent de près de zéro à utilisables. Haiku 4.5 ne pouvait pas terminer une tâche de Terminal-Bench ; Haiku 5.5 termine environ deux tâches sur cinq.
- Par rapport à GPT-6 Luna, il est en tête sur chaque ligne partagée au même prix de liste. Les écarts les plus larges se trouvent sur l'utilisation de l'ordinateur (72,4 % contre 48,9 %) et Terminal-Bench (39,2 % contre 16,4 %).
- Par rapport à Sonnet 5.5, l'écart dépend de la tâche. Sur FrontierCode, Haiku est à six points. Sur Terminal-Bench, Sonnet obtient 70,6 % contre 39,2 % pour Haiku. Anthropic lui-même affirme que Sonnet 5.5 et Opus 5.5 restent le meilleur choix pour le codage agentique complexe.
Lisez les petites lignes avant de citer ces chiffres
Les scores principaux ont été réalisés à l'effort maximal, le réglage le plus coûteux. Le réglage par défaut est moyen, et les exécutions à effort moyen de la carte système donnent des résultats plus bas : 1277 sur GDPval-AA au lieu de 1620, et 1372 sur AA-Briefcase au lieu de 1578. Si vous déployez par défaut, comparez ces chiffres, pas le tableau de lancement.
Le chiffre OSWorld nécessite également un second regard. Les 72,4 % sont un crédit partiel, moyenné sur des points de contrôle. La part des tâches où Haiku 5.5 a complété chaque point de contrôle est de 37,1 % (Luna : 17,1 %). Pour un agent de navigateur qui doit terminer l'ensemble du travail, 37,1 % est le chiffre à prendre en compte.
Ce que les premiers clients ont rapporté
Le post de lancement d'Anthropic cite plusieurs clients qui ont testé le modèle avant sa sortie. Ceux-ci sont sélectionnés par le fournisseur, mais ils pointent vers les mêmes charges de travail :
- AlphaSense effectue environ 8 millions d'appels "Demander dans le document" par semaine. Sur 400 requêtes de test, Haiku 5.5 a obtenu 0,84 contre 0,76 pour Haiku 4.5.
- Box a constaté un gain de 11 points par rapport à Haiku 4.5 avec environ la moitié de la latence.
- Asana a mesuré une latence par tâche inférieure de plus de 30 % et jusqu'à 2,5 fois plus rapide en inférence par tour d'agent, par rapport à son modèle actuel.
- HubSpot a obtenu 92,8 % sur sa suite CRM, le meilleur score qu'il ait vu d'un petit modèle.
- Cognition utilise Haiku 5.5 comme "acolyte" sous Opus 5.5 dans Devin Fusion et rapporte que le duo obtient un score FrontierCode de 66,2 à un coût et une latence inférieurs.
Le schéma : travail court et répété sur des documents, et devoir de sous-agent sous un modèle plus grand.
Où Haiku 5.5 n'est pas le bon choix
- Codage agentique complexe. Terminal-Bench est là où Sonnet 5.5 prend le plus d'avance. Si une tâche nécessite de nombreuses étapes, des exigences ambiguës ou une longue chaîne de modifications, commencez par Sonnet 5.5 ou Opus 5.5.
- Invites de plus de 100K jetons. La fenêtre de 1M est réelle, mais le prix n'est pas uniforme. Au-delà de 100K jetons, l'ensemble de la demande passe à 0,50 $ / 2,50 $, et comme le nouveau tokenizer compte environ 30 % de jetons en plus, cette ligne se situe près de 77K jetons comme Haiku 4.5 les comptait. Le post de tarification dans cette série traite des chiffres.
- Travail qui nécessite un effort xhigh ou max pour passer. La sortie devient longue et coûteuse aux réglages les plus élevés. Les propres conseils d'Anthropic sont de comparer avec Sonnet 5.5 avant de s'y installer.
- Équipes sur le niveau de priorité. Haiku 5.5 ne le prend pas en charge, donc un engagement de niveau de priorité Haiku 4.5 ne se transfère pas.
- Tests de sécurité. Les mesures de cybersécurité de Haiku 5.5 sont plus strictes que celles de Haiku 4.5 et bloquent les tests de pénétration. Attendez-vous à des raisons d'arrêt
refusalpour ce type de travail, sans possibilité de repli sur un autre modèle côté serveur.
Essayez-le via AIHubMix
Le paramètre d'effort de Haiku 5.5 se trouve dans l'output_config de l'API Messages, donc le point de terminaison natif Claude sur AIHubMix est le chemin le plus direct. Installez un SDK Anthropic actuel (pip install -U anthropic) et pointez-le vers AIHubMix :
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # laissez de la place pour réfléchir, pas seulement pour la réponse
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Classifiez ce ticket comme facturation, bug ou autre : "
"'J'ai été facturé deux fois pour octobre.'",
}],
)
# Les blocs de réflexion peuvent venir en premier, donc choisissez le bloc de texte par type.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Deux choses à vérifier lors de votre première exécution. Lisez response.usage.output_tokens à low et à nouveau à high sur la même invite : si les chiffres ne bougent pas, le paramètre d'effort n'atteint pas le modèle. Et notez que la page modèle d'AIHubMix indique actuellement une longueur de contexte de 200K pour ce modèle, en dessous des 1M d'Anthropic, donc confirmez la limite avant d'envoyer des invites très longues.
Qui devrait changer, qui devrait attendre
Changez maintenant si vous effectuez des classifications, des extractions, des routages, des résumés ou des Q&A de documents avec des invites bien en dessous de 100K jetons. Vous obtenez un modèle beaucoup plus puissant à une fraction du prix par jeton. Prévoyez une heure pour les modifications du code de demande, puis testez l'effort low par rapport à medium sur vos propres évaluations.
Changez maintenant si vous utilisez un grand modèle pour un travail de sous-agent pour lequel il est surqualifié : extraire un chiffre d'un dossier, vérifier un fichier, résumer un résultat d'outil. C'est le rôle que souligne Anthropic et ses clients de lancement.
Attendez un sprint si votre intégration utilise l'utilisation de l'ordinateur avec l'outil computer_20250124, le préremplissage ou temperature=0. Chacun de ceux-ci renvoie une erreur 400 sur Haiku 5.5, et les corriger nécessite un travail de code, pas un simple échange de chaîne de modèle.
Restez où vous êtes si votre charge de travail est une invite longue (régulièrement au-dessus d'environ 77K jetons Haiku 4.5), dépend du niveau de priorité, ou est un codage agentique complexe. Pour ce dernier groupe, la comparaison utile est Haiku 5.5 par rapport à Sonnet 5.5 sur le coût par tâche terminée, pas Haiku 5.5 par rapport à Haiku 4.5.
Lorsque vous êtes prêt à comparer, la liste des modèles AIHubMix place Haiku 5.5, Sonnet 5.5 et Opus 5.5 derrière une seule clé API, de sorte que la même évaluation puisse être exécutée contre les trois.
FAQ
Claude Haiku 5.5 est-il meilleur que Haiku 4.5 dans tous les domaines ?
Sur chaque référence dans le tableau de lancement d'Anthropic, oui, souvent de manière significative. Les exceptions sont pratiques plutôt que qualitatives : le niveau de priorité n'est pas pris en charge, les invites de plus de 100K jetons coûtent plus par jeton que le tarif d'invite courte, et plusieurs anciens modèles de demande renvoient désormais des erreurs.
Haiku 5.5 est-il vraiment 90 % moins cher ?
Le prix par jeton est 90 % inférieur pour les invites jusqu'à 100K jetons et 50 % inférieur au-delà. Comme le nouveau tokenizer compte environ 30 % de jetons en plus pour le même texte, et que la réflexion produit désormais des jetons de sortie, Anthropic estime l'économie typique à environ 75 %.
Comment Haiku 5.5 se compare-t-il à GPT-6 Luna ?
Les deux sont listés à 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie. Dans les résultats rapportés par Anthropic, Haiku 5.5 obtient un score plus élevé sur chaque référence où les deux apparaissent, plus clairement sur l'utilisation de l'ordinateur et Terminal-Bench. Luna maintient son prix de base jusqu'à une longueur d'invite plus longue, donc les charges de travail d'invite longue devraient être tarifées séparément.
Haiku 5.5 peut-il remplacer Sonnet 5.5 pour le codage ?
Pour des changements étroits et bien définis et des tâches de sous-agent, cela peut valoir la peine d'être testé. Pour le codage agentique complexe en plusieurs étapes, Sonnet 5.5 obtient des scores beaucoup plus élevés sur Terminal-Bench 4.0 (70,6 % contre 39,2 %), et Anthropic recommande Sonnet ou Opus pour ce travail.
Les scores de référence sont-ils au réglage par défaut ?
Non. Les scores principaux ont été réalisés à l'effort maximal. Le réglage par défaut est moyen, où la carte système rapporte des résultats plus bas, par exemple 1277 au lieu de 1620 sur GDPval-AA.
La fenêtre de contexte de 1M signifie-t-elle que je peux envoyer des invites de 1M jetons à bas prix ?
Vous pouvez les envoyer, mais tout ce qui dépasse 100K jetons est facturé à 0,50 $ d'entrée et 2,50 $ de sortie par million de jetons pour l'ensemble de la demande. Vérifiez également la limite de contexte indiquée par votre passerelle.
Qu'est-ce que je dois changer dans mon code pour passer ?
Au minimum : l'ID du modèle, tout budget de réflexion manuel, tout réglage de température ou de top_p, tout préremplissage d'assistant, et le code qui lit le premier bloc de contenu comme réponse. Le post de migration dans cette série a la liste complète.
Continuez à lire : la série Claude Haiku 5.5
- Les scores principaux ont été réalisés à l'effort maximal, mais vous déploierez probablement à moyen ou faible. Pour voir ce que chaque niveau coûte en jetons et ce que vous perdez en diminuant, lisez Niveaux d'effort de Claude Haiku 5.5 : Le moyen est le par défaut, le faible est souvent suffisant
- Le chiffre d'un dixième du prix ne tient que sous une ligne de longueur d'invite que le nouveau tokenizer déplace. Pour des exemples de coûts travaillés et les règles de facturation qui sont faciles à manquer, lisez Tarification de Claude Haiku 5.5 : La ligne de 100K derrière la réduction de 90 %
- Changer est plus qu'un simple changement de chaîne de modèle : cinq anciens modèles de demande échouent désormais. Pour chaque erreur, sa cause et sa solution, lisez Migration de Claude Haiku 4.5 à 5.5 : Cinq erreurs 400 et les changements discrets
Sources
- Présentation de Claude Haiku 5.5 (Anthropic)
- Guide de migration de Claude Haiku 5.5 (Docs de la plateforme Claude)
- Claude Haiku 5.5 sur AIHubMix
- Claude Haiku 5.5 : Références, spécifications, Sol et Luna comparés (Kingy.ai)
- Analyse de l'intelligence, des performances et des prix de Claude Haiku 5.5 (Analyse Artificielle)



