Niveles de esfuerzo de Claude Haiku 5.5: Medio es el predeterminado, Bajo es a menudo suficiente

AIHubMix7 min de lectura
Niveles de esfuerzo de Claude Haiku 5.5: Medio es el predeterminado, Bajo es a menudo suficiente

Claude Haiku 5.5 es el primer Haiku con una configuración de esfuerzo, y esta configuración influye más en el resultado que cualquier otra cosa que controles. En las ejecuciones independientes de Artificial Analysis, Haiku 5.5 con esfuerzo máximo obtuvo 43 en su Índice de Inteligencia y con bajo esfuerzo obtuvo 29. El máximo también utilizó 440 millones de tokens de salida para completar el índice; el bajo utilizó 32 millones.

Así que la respuesta corta: deja la mayor parte del trabajo en el predeterminado, medio. Reduce las rutas simples de alto volumen a bajo. Aumenta el trabajo de conocimiento y el seguimiento estricto de instrucciones a alto. Trata xhigh y max como configuraciones para las que necesitas evidencia, y compáralas con Sonnet 5.5 antes de comprometerte.

El resto de esta publicación muestra lo que cuesta cada nivel, dónde dejar de aumentar no compensa, y qué configuraciones se rompen o se vuelven caras cuando cambias el esfuerzo.

Qué es la configuración

Claude Haiku 5.5 admite cinco niveles: bajo, medio, alto, xhigh y max. El predeterminado es medio, lo cual es inusual: la mayoría de los modelos actuales de Claude tienen como predeterminado alto, y solo Haiku 5.5 y Opus 5.5 tienen un nivel predeterminado más bajo. Enviar medio es lo mismo que omitir el parámetro.

El esfuerzo reemplaza el presupuesto de pensamiento manual que utilizaba Haiku 4.5. Una solicitud con thinking: {"type": "enabled", "budget_tokens": N} ahora devuelve un 400, por lo que no hay un número antiguo que llevar. Según la documentación de esfuerzo de Anthropic, lo configuras en output_config:

output_config={"effort": "low"}

Tres hechos enmarcan todo lo que sigue:

  • El pensamiento está activado por defecto. Haiku 5.5 realiza un pensamiento adaptativo a menos que se le indique lo contrario. Un esfuerzo menor significa menos pensamiento, y en solicitudes simples, el modelo puede omitir el pensamiento por completo.
  • Los tokens de pensamiento son tokens de salida. Cuentan para max_tokens y se facturan a la tasa de salida ($0.50 por millón en solicitudes de hasta 100K tokens).
  • Pedir menos pensamiento en el aviso no funciona. En las pruebas de Anthropic, el modelo aún pensó cuando el aviso le dijo que respondiera directamente. El esfuerzo es la palanca.

Qué cuesta cada nivel

Dos fuentes independientes midieron Haiku 5.5 a través de niveles de esfuerzo. Las cifras del índice provienen de Artificial Analysis; las cifras de FrontierCode provienen del archivo de resultados públicos de Cognition, compilado por Kingy.ai. Ninguna cubre tu carga de trabajo, así que trátalas como la forma de la curva, no como tus números.

Índice de Inteligencia de Artificial Analysis v4.3.2 (diez evaluaciones, desde trabajo de conocimiento hasta tareas terminales):

Esfuerzo Puntuación del índice Tokens de salida para el índice Costo por tarea Tiempo hasta el primer token
bajo 29 32M $0.02 9.9 s
medio 34 54M $0.05 13.4 s
alto 38 97M $0.08 28.0 s
max 43 440M $0.21 n/a

Artificial Analysis no publicó una ejecución xhigh. Su cifra de latencia de esfuerzo máximo parecía anómala, por lo que se omite.

FrontierCode 1.1 Principal, Haiku 5.5 ejecutándose en Claude Code:

Esfuerzo Puntuación compuesta Costo por implementación Tokens de salida por implementación
bajo 34.8% $0.06 23,868
medio 41.6% $0.13 36,172
alto 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
max 46.4% $1.33 181,387

Los costos están redondeados al centavo.

Lee las dos tablas juntas y tres cosas destacan.

Bajo a medio es el paso más barato. En el índice, compra 5 puntos por aproximadamente 1.7 veces los tokens de salida. En FrontierCode, compra 6.8 puntos por aproximadamente el doble del costo por implementación.

Medio a alto puede ser plano. En FrontierCode, alto obtuvo 0.3 puntos más que medio y costó aproximadamente el doble. En el índice más amplio, alto agregó 4 puntos. Si tu carga de trabajo se parece al primer caso o al segundo, eso es exactamente lo que una evaluación rápida te dice.

Los dos niveles superiores son caros. De alto a máximo en el índice, los tokens de salida aumentan aproximadamente 4.5 veces por 5 puntos. En FrontierCode, el máximo cuesta aproximadamente diez veces lo que cuesta el medio por 4.8 puntos más, y el paso de xhigh a max duplica aproximadamente el costo por 0.6 puntos. La propia guía de Anthropic dice lo mismo en términos más claros: usa xhigh y max solo donde tus evaluaciones muestren una ganancia, y compáralas con Sonnet 5.5 en rendimiento, costo y velocidad primero.

Una razón más por la que el predeterminado importa: los benchmarks de lanzamiento de Anthropic se realizaron con esfuerzo máximo. Los resultados de esfuerzo medio de la tarjeta del sistema son más bajos (1277 en GDPval-AA en lugar de 1620). Si implementas en el predeterminado, esos son los números con los que comparar.

Dónde comenzar, según la carga de trabajo

Carga de trabajo Comenzar en Subir cuando
Clasificación, enrutamiento, etiquetado bajo Las etiquetas se desvían en casos difíciles
Extracción de documentos cortos bajo Se pierden o fusionan campos
Chat y soporte en vivo bajo Las reglas se desvían en chats largos
Resúmenes y compresión medio Se pierden detalles clave
Trabajo de subagente bajo un modelo más grande medio El modelo principal rehace el trabajo
Codificación agente, cambios específicos medio Las pruebas fallan en el primer intento
Trabajo de conocimiento, tareas largas de agente alto Las evaluaciones muestran margen de mejora

Estos puntos de partida siguen la guía de Anthropic para Haiku 5.5; las señales de "subir" son lo que debes observar en tus propios registros.

La única fila que merece una segunda mirada es el chat. Bajo es el nivel más rápido, lo que se adapta al soporte en vivo. Pero Anthropic recomienda alto cuando el seguimiento de instrucciones es lo más importante, por ejemplo, un asistente de soporte que debe mantener sus reglas de sistema-prompt mientras un usuario argumenta. Prueba ambos en las conversaciones que salieron mal en el pasado.

Qué se rompe o se vuelve caro cuando cambia el esfuerzo

Un pequeño max_tokens puede terminar la respuesta antes de que comience. El pensamiento cuenta para max_tokens. Un límite diseñado para una clasificación de una palabra, digamos 50 tokens, puede gastarse completamente en pensamiento, y la respuesta termina con stop_reason: "max_tokens" y sin texto. Aumenta el límite para dejar espacio, o reduce el esfuerzo.

Cambiar el esfuerzo a mitad de conversación restablece la caché. Cambiar el valor de esfuerzo de nivel superior entre solicitudes invalida la caché de mensajes de la conversación. Si un agente necesita un giro difícil en alto dentro de una conversación bajo, Anthropic ofrece un cambio de esfuerzo por mensaje (cabezera beta mid-conversation-output-config-2026-07-01, Claude API y Google Cloud) que mantiene la caché. Requiere que el pensamiento esté activado. Vale la pena verificar si un gateway pasa esa cabecera beta antes de confiar en ella.

Desactivar el pensamiento tiene límites. thinking: {"type": "disabled"} es aceptado en bajo, medio y alto. En xhigh o max devuelve un 400. Con el pensamiento desactivado, un cambio de esfuerzo por mensaje también devuelve un 400, y el modelo puede omitir una llamada a una herramienta que necesita cuando la misma solicitud pide salida en JSON. El consejo de Anthropic es mantener el pensamiento activado y usar un nivel de esfuerzo más bajo en su lugar.

El bajo esfuerzo puede detenerse temprano. Con un largo aviso de sistema de agente de codificación en bajo, Haiku 5.5 a veces se detiene antes de que el trabajo esté terminado y devuelve la tarea. En las pruebas de Anthropic, pasar de bajo a medio redujo aproximadamente a la mitad la detención temprana y más que duplicó los tokens de salida por intento. La guía de aviso de Haiku 5.5 tiene una breve instrucción de "seguir trabajando hasta terminar" que aborda el mismo problema a un precio más bajo.

Bajo y medio pueden omitir la verificación. En tareas de codificación, el modelo a veces informa un cambio como hecho sin ejecutar una prueba. La guía de aviso tiene un párrafo de verificación para esto; cuesta tokens pero aumenta la proporción de cambios verificados.

Xhigh puede devolver una respuesta vacía. En chats de múltiples turnos en xhigh, el modelo a veces escribe toda su respuesta dentro de su pensamiento y termina el turno sin texto visible. Si ejecutas en xhigh, verifica si hay bloques de texto vacíos.

Forzar una herramienta omite el pensamiento. Haiku 5.5 acepta un tool_choice forzado, pero la respuesta comienza entonces con la llamada a la herramienta y sin pensamiento. Si el modelo necesita razonar antes de llamar a la herramienta, usa auto y di en el aviso cuándo llamarla.

Ejecuta tu propio barrido de esfuerzo a través de AIHubMix

La forma más rápida de elegir es ejecutar los mismos 20 a 50 avisos reales en dos o tres niveles y comparar calidad, tokens de salida y latencia. A través del punto final nativo de AIHubMix Claude, con AIHUBMIX_API_KEY configurado:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Resume este ticket de soporte en una oración: ...",
    "Extrae el número de factura y el total de: ...",
]

for effort in ["bajo", "medio", "alto"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Guarda `text` junto al aviso y califícalo según tu propia rúbrica.
    print(f"{effort}: {out_tokens} tokens de salida, {seconds:.1f}s en total")

Si los tokens de salida apenas cambian entre bajo y alto, la configuración probablemente no esté alcanzando el modelo; verifica la solicitud que tu gateway reenvía. En la página de Haiku 5.5 en AIHubMix, el precio por token es el mismo en cada nivel de esfuerzo, por lo que el conteo de tokens de este barrido se convierte directamente en dólares.

Preguntas frecuentes

¿Cuál es el nivel de esfuerzo predeterminado para Claude Haiku 5.5?
Medio. La mayoría de los modelos actuales de Claude tienen como predeterminado alto, por lo que el código que dependía del predeterminado de otro modelo ejecutará Haiku 5.5 un nivel más bajo a menos que establezca el esfuerzo explícitamente.

¿Puedo desactivar completamente el pensamiento?
En bajo, medio y alto esfuerzo, sí, configurando el pensamiento como deshabilitado. En xhigh y max eso devuelve un error. Anthropic recomienda reducir el esfuerzo en su lugar, porque el modelo puede omitir el pensamiento en solicitudes simples por sí mismo y mantiene su comportamiento de llamada a herramientas intacto.

¿Cuál nivel de esfuerzo es el más barato?
Bajo. En las ejecuciones de Artificial Analysis utilizó aproximadamente 32 millones de tokens de salida para todo el índice frente a 54 millones en medio y 440 millones en máximo. El precio por token es el mismo en cada nivel; la diferencia es cuántos tokens se generan.

¿Vale la pena el esfuerzo máximo en Haiku 5.5?
Solo con evidencia de tus propias evaluaciones. En FrontierCode, el máximo costó aproximadamente diez veces más que el medio por una ganancia de 4.8 puntos. En ese punto, Anthropic sugiere compararlo con Sonnet 5.5, que puede alcanzar la misma calidad por menos.

¿Por qué mis respuestas se detienen sin texto?
Generalmente porque el pensamiento utilizó max_tokens antes de que comenzara la respuesta. Aumenta max_tokens o reduce el esfuerzo. En xhigh en chats de múltiples turnos, una respuesta vacía también puede significar que el modelo puso su respuesta dentro de su pensamiento.

¿Cambiar el esfuerzo afecta la caché de avisos?
Sí. Cambiar el esfuerzo de nivel superior entre solicitudes invalida los mensajes en caché para esa conversación. Un cambio de esfuerzo por mensaje, actualmente en beta, evita eso.

¿Por qué los benchmarks de lanzamiento no coinciden con lo que veo en el predeterminado?
Las cifras de lanzamiento se realizaron con esfuerzo máximo. En medio, la tarjeta del sistema informa puntuaciones más bajas, por ejemplo, 1277 en lugar de 1620 en GDPval-AA.

Sigue leyendo: la serie Claude Haiku 5.5

Fuentes