Claude Haiku 5.5 Niveaux d'Effort : Moyen Est le Par Défaut, Faible Est Souvent Suffisant

AIHubMix7 min de lecture
Claude Haiku 5.5 Niveaux d'Effort : Moyen Est le Par Défaut, Faible Est Souvent Suffisant

Claude Haiku 5.5 est le premier Haiku avec un paramètre d'effort, et ce paramètre influence le résultat plus que tout autre élément que vous contrôlez. Dans les essais indépendants d'Artificial Analysis, Haiku 5.5 à l'effort maximal a obtenu un score de 43 sur son Indice d'Intelligence et à faible effort, un score de 29. Max a également utilisé 440 millions de tokens de sortie pour passer à travers l'indice ; faible a utilisé 32 millions.

Donc, la réponse courte : laissez la plupart des travaux au paramètre par défaut, moyen. Réduisez les routes simples à fort volume à faible. Augmentez le travail de connaissance et le suivi strict des instructions à élevé. Considérez xélevé et max comme des paramètres pour lesquels vous avez besoin de preuves, et comparez-les avec Sonnet 5.5 avant de vous engager.

Le reste de cet article montre ce que chaque niveau coûte, où passer à un niveau supérieur cesse d'être rentable, et quels paramètres se cassent ou deviennent coûteux lorsque vous changez l'effort.

Ce qu'est le paramètre

Claude Haiku 5.5 prend en charge cinq niveaux : faible, moyen, élevé, xélevé, et max. Le paramètre par défaut est moyen, ce qui est inhabituel : la plupart des modèles Claude actuels par défaut à élevé, et seuls Haiku 5.5 et Opus 5.5 par défaut un niveau plus bas. Envoyer moyen est équivalent à omettre le paramètre.

L'effort remplace le budget de réflexion manuelle que Haiku 4.5 utilisait. Une demande avec thinking: {"type": "enabled", "budget_tokens": N} renvoie maintenant un 400, donc il n'y a pas d'ancien nombre à transférer. Selon la documentation sur l'effort d'Anthropic, vous le définissez dans output_config :

output_config={"effort": "faible"}

Trois faits encadrent tout ce qui suit :

  • La réflexion est activée par défaut. Haiku 5.5 fonctionne avec une réflexion adaptative à moins qu'il n'en soit autrement indiqué. Un effort plus faible signifie moins de réflexion, et pour des demandes simples, le modèle peut complètement ignorer la réflexion.
  • Les tokens de réflexion sont des tokens de sortie. Ils comptent pour max_tokens et sont facturés au tarif de sortie (0,50 $ par million sur des invites allant jusqu'à 100K tokens).
  • Demander moins de réflexion dans l'invite ne fonctionne pas. Dans les tests d'Anthropic, le modèle a toujours réfléchi lorsque l'invite lui disait de répondre directement. L'effort est le levier.

Ce que chaque niveau coûte

Deux sources indépendantes ont mesuré Haiku 5.5 à travers les niveaux d'effort. Les chiffres de l'indice proviennent de Artificial Analysis ; les chiffres de FrontierCode proviennent du fichier de résultats publics de Cognition, compilé par Kingy.ai. Aucun ne couvre votre charge de travail, donc considérez-les comme la forme de la courbe, pas comme vos chiffres.

Indice d'Intelligence d'Artificial Analysis v4.3.2 (dix évaluations, du travail de connaissance aux tâches terminales) :

Effort Score de l'indice Tokens de sortie pour l'indice Coût par tâche Temps jusqu'au premier token
faible 29 32M 0,02 $ 9,9 s
moyen 34 54M 0,05 $ 13,4 s
élevé 38 97M 0,08 $ 28,0 s
max 43 440M 0,21 $ n/a

Artificial Analysis n'a pas publié de course xélevée. Son chiffre de latence à effort maximal semblait anormal, donc il est omis.

FrontierCode 1.1 Principal, Haiku 5.5 fonctionnant dans Claude Code :

Effort Score composite Coût par déploiement Tokens de sortie par déploiement
faible 34,8% 0,06 $ 23 868
moyen 41,6% 0,13 $ 36 172
élevé 41,9% 0,26 $ 55 149
xélevé 45,8% 0,63 $ 100 847
max 46,4% 1,33 $ 181 387

Les coûts sont arrondis au cent.

Lisez les deux tableaux ensemble et trois choses se démarquent.

Passer de faible à moyen est la montée la moins coûteuse. Sur l'indice, cela achète 5 points pour environ 1,7 fois les tokens de sortie. Sur FrontierCode, cela achète 6,8 points pour environ deux fois le coût par déploiement.

De moyen à élevé peut être plat. Sur FrontierCode, élevé a obtenu 0,3 points de plus que moyen et a coûté environ deux fois plus. Sur l'indice plus large, élevé a ajouté 4 points. Que votre charge de travail ressemble au premier cas ou au second est exactement ce qu'une évaluation rapide vous dira.

Les deux niveaux supérieurs sont coûteux. De élevé à max sur l'indice, les tokens de sortie augmentent d'environ 4,5 fois pour 5 points. Sur FrontierCode, max coûte environ dix fois ce que coûte moyen pour 4,8 points de plus, et le passage de xélevé à max double à peu près le coût pour 0,6 points. Les propres conseils d'Anthropic disent la même chose en termes plus simples : utilisez xélevé et max uniquement là où vos évaluations montrent un gain, et comparez-les avec Sonnet 5.5 sur la performance, le coût et la vitesse d'abord.

Une autre raison pour laquelle le paramètre par défaut est important : les benchmarks de lancement d'Anthropic ont été réalisés à l'effort maximal. Les résultats à effort moyen de la carte système sont plus bas (1277 sur GDPval-AA au lieu de 1620). Si vous déployez au paramètre par défaut, ce sont les chiffres à comparer.

Où commencer, par charge de travail

Charge de travail Commencer à Monter lorsque
Classification, routage, étiquetage faible Les étiquettes dérivent sur des cas difficiles
Extraction de documents courts faible Des champs sont manqués ou fusionnés
Chat et support en direct faible Les règles échappent dans de longues discussions
Résumés et compactage moyen Des détails clés disparaissent
Travail de sous-agent sous un modèle plus grand moyen Le modèle principal refait le travail
Codage agentique, changements étroits moyen Les tests échouent au premier essai
Travail de connaissance, longues tâches d'agent élevé Les évaluations montrent une marge de manœuvre

Ces points de départ suivent les conseils d'Anthropic pour Haiku 5.5 ; les signaux "monter" sont ce qu'il faut surveiller dans vos propres journaux.

La seule ligne qui mérite un second regard est le chat. Faible est le niveau le plus rapide, ce qui convient au support en direct. Mais Anthropic recommande élevé lorsque le suivi des instructions est le plus important, par exemple un assistant de support qui doit respecter ses règles de système-prompt pendant qu'un utilisateur argumente. Testez les deux sur les conversations qui ont mal tourné dans le passé.

Ce qui se casse ou devient coûteux lorsque l'effort change

Un max_tokens faible peut mettre fin à la réponse avant qu'elle ne commence. La réflexion compte pour max_tokens. Un plafond dimensionné pour une classification d'un mot, disons 50 tokens, peut être entièrement dépensé en réflexion, et la réponse se termine avec stop_reason: "max_tokens" et aucun texte. Augmentez le plafond pour laisser de la place, ou réduisez l'effort.

Changer l'effort en cours de conversation réinitialise le cache. Changer la valeur d'effort de haut niveau entre les demandes invalide le cache des messages de la conversation. Si un agent a besoin d'un tournant difficile à élevé dans une conversation à faible, Anthropic propose un changement d'effort par message (en-tête bêta mid-conversation-output-config-2026-07-01, API Claude et Google Cloud) qui conserve le cache. Cela nécessite que la réflexion soit activée. Il vaut la peine de vérifier si une passerelle passe cet en-tête bêta avant de vous y fier.

Désactiver la réflexion a des limites. thinking: {"type": "disabled"} est accepté à faible, moyen, et élevé. À xélevé ou max, cela renvoie un 400. Avec la réflexion désactivée, un changement d'effort par message renvoie également un 400, et le modèle peut ignorer un appel d'outil dont il a besoin lorsque la même demande demande une sortie JSON. Le conseil d'Anthropic est de garder la réflexion activée et d'utiliser un niveau d'effort plus bas à la place.

Un faible effort peut s'arrêter tôt. Avec un long prompt système d'agent de codage à faible, Haiku 5.5 s'arrête parfois avant que le travail ne soit terminé et rend la tâche. Dans les tests d'Anthropic, passer de faible à moyen a réduit de moitié l'arrêt précoce et plus que doublé les tokens de sortie par tentative. Le guide de prompt de Haiku 5.5 a une courte instruction "continuer à travailler jusqu'à ce que ce soit terminé" qui aborde le même problème à un prix inférieur.

Faible et moyen peuvent ignorer la vérification. Sur les tâches de codage, le modèle rapporte parfois un changement comme terminé sans exécuter de test. Le guide de prompt a un paragraphe de vérification pour cela ; cela coûte des tokens mais augmente la part des changements vérifiés.

Xélevé peut renvoyer une réponse vide. Dans des discussions multi-tours à xélevé, le modèle écrit parfois toute sa réponse dans sa réflexion et termine le tour sans texte visible. Si vous fonctionnez à xélevé, vérifiez les blocs de texte vides.

Forcer un outil ignore la réflexion. Haiku 5.5 accepte un tool_choice forcé, mais la réponse commence alors par l'appel de l'outil et aucune réflexion. Si le modèle doit raisonner avant d'appeler l'outil, utilisez auto et indiquez dans l'invite quand l'appeler.

Exécutez votre propre balayage d'effort à travers AIHubMix

Le moyen le plus rapide de choisir est d'exécuter les mêmes 20 à 50 vraies invites à deux ou trois niveaux et de comparer la qualité, les tokens de sortie et la latence. À travers le point de terminaison natif Claude d'AIHubMix, avec AIHUBMIX_API_KEY défini :

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Résumez ce ticket de support en une phrase : ...",
    "Extrayez le numéro de facture et le total de : ...",
]

for effort in ["faible", "moyen", "élevé"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Enregistrez `text` à côté de l'invite et évaluez-le selon votre propre grille.
    print(f"{effort}: {out_tokens} tokens de sortie, {seconds:.1f}s au total")

Si les tokens de sortie changent à peine entre faible et élevé, le paramètre n'atteint probablement pas le modèle ; vérifiez la demande que votre passerelle transmet. Sur la page Haiku 5.5 sur AIHubMix, le prix par token est le même à chaque niveau d'effort, donc le nombre de tokens de ce balayage se convertit directement en dollars.

FAQ

Quel est le niveau d'effort par défaut pour Claude Haiku 5.5 ?
Moyen. La plupart des modèles Claude actuels par défaut à élevé, donc le code qui dépendait du paramètre par défaut pour un autre modèle exécutera Haiku 5.5 un niveau plus bas à moins qu'il ne définisse explicitement l'effort.

Puis-je désactiver complètement la réflexion ?
À faible, moyen et élevé, oui, en définissant la réflexion sur désactivée. À xélevé et max, cela renvoie une erreur. Anthropic recommande de réduire l'effort à la place, car le modèle peut ignorer la réflexion sur des demandes simples par lui-même et conserve son comportement d'appel d'outil intact.

Quel niveau d'effort est le moins cher ?
Faible. Dans les essais d'Artificial Analysis, il a utilisé environ 32 millions de tokens de sortie pour l'ensemble de l'indice contre 54 millions à moyen et 440 millions à max. Le prix par token est le même à chaque niveau ; la différence réside dans le nombre de tokens générés.

Est-ce que l'effort maximal en vaut la peine sur Haiku 5.5 ?
Seulement avec des preuves provenant de vos propres évaluations. Sur FrontierCode, max coûtait environ dix fois plus que moyen pour un gain de 4,8 points. À ce stade, Anthropic suggère de comparer avec Sonnet 5.5, qui peut atteindre la même qualité pour moins.

Pourquoi mes réponses s'arrêtent-elles sans texte ?
Généralement parce que la réflexion a utilisé max_tokens avant que la réponse ne commence. Augmentez max_tokens ou réduisez l'effort. À xélevé dans des discussions multi-tours, une réponse vide peut également signifier que le modèle a mis sa réponse dans sa réflexion.

Changer l'effort affecte-t-il le cache des invites ?
Oui. Changer l'effort de haut niveau entre les demandes invalide les messages mis en cache pour cette conversation. Un changement d'effort par message, actuellement en bêta, évite cela.

Pourquoi les benchmarks de lancement ne correspondent-ils pas à ce que je vois par défaut ?
Les chiffres de lancement ont été réalisés à l'effort maximal. À moyen, la carte système rapporte des scores plus bas, par exemple 1277 au lieu de 1620 sur GDPval-AA.

Continuez à lire : la série Claude Haiku 5.5

Sources