Claude Haiku 4.5 obtuvo un 0.0% en Terminal-Bench 4.0. Claude Haiku 5.5 obtiene un 39.2%, y cuesta una décima parte por token: $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida, frente a $1 y $5 para Haiku 4.5.
Esa es la actualización en una línea. El pequeño modelo Claude pasó de "bueno para clasificación, no para agentes" a un subagente utilizable, y su precio ahora coincide con el de GPT-6 Luna de OpenAI al centavo. Anthropic lo lanzó el 7 de octubre de 2026 como Claude Haiku 5.5, ID de modelo claude-haiku-5-5, y ya está listado en AIHubMix.
El precio viene con condiciones, y también lo hacen las puntuaciones de referencia. Esta publicación cubre lo que cambió, cuán cerca está Haiku 5.5 de Sonnet 5.5, dónde es la elección equivocada y quién debería cambiar ahora.
Qué cambió y qué no
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Precio de entrada/salida | $1 / $5 | $0.10 / $0.50 |
| Ventana de contexto | 200K | 1M |
| Salida máxima | 64K | 128K |
| Pensamiento | Presupuesto manual, desactivado por defecto | Adaptativo, activado por defecto |
| Niveles de esfuerzo | Ninguno | Cinco, medio por defecto |
| Tokens para el mismo texto | Base | Aproximadamente un 30% más |
| Herramienta de uso del navegador | No | Sí |
Los precios de Haiku 5.5 se aplican a solicitudes de hasta 100K tokens; las solicitudes más largas pagan $0.50 / $2.50. Los precios son por millón de tokens.
Lo que permanece igual: la descripción del trabajo. Anthropic sigue promocionando Haiku para trabajos de alto volumen y sensibles al costo (resúmenes, compactación, consultas a bases de datos, clasificación) y para deberes de subagente bajo un modelo más grande. Anthropic dice que las solicitudes existentes de Haiku 4.5 deberían funcionar bien sin cambios. El código de solicitud existente es un asunto diferente: cinco patrones de solicitud que funcionaron en Haiku 4.5 ahora devuelven un error 400, como se indica en la guía de migración de Anthropic y la publicación de migración en esta serie lo explica.
Dos cambios alteran cómo se comporta el modelo por defecto. El pensamiento ahora está activado a menos que lo desactives, por lo que una solicitud que nunca mencionó el pensamiento puede regresar con bloques de thinking primero y gastar tokens de salida en ellos. Y Haiku 5.5 es el primer Haiku con una configuración de esfuerzo, que ahora es el principal dial entre costo y calidad.
Cómo se puntúa frente a Haiku 4.5, Luna y Sonnet 5.5
Las cifras a continuación provienen de los materiales de lanzamiento de Anthropic y la tarjeta del sistema de Haiku 5.5, compiladas por Kingy.ai. Son reportadas por el proveedor, Anthropic ejecutó los modelos GPT por sí mismo, y nadie ha reproducido la tabla completa de forma independiente aún.
| Referencia | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72.4% | 15.7% | 48.9% | 83.9% |
| El Último Examen de la Humanidad | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main | 46.4% | n/a | 42.4% | 52.1% |
| Cartografía | 46.4% | 6.4% | 29.1% | 61.6% |
El Último Examen de la Humanidad y la Cartografía están sin herramientas. La puntuación de FrontierCode de Sonnet 5.5 está en esfuerzo xalto.
Tres lecturas importan más que cualquier fila individual:
- Contra Haiku 4.5, es una clase de modelo diferente. Las calificaciones de trabajo del conocimiento se duplican aproximadamente, y las filas de agente pasan de casi cero a utilizables. Haiku 4.5 no pudo completar una tarea de Terminal-Bench; Haiku 5.5 completa aproximadamente dos de cinco.
- Contra GPT-6 Luna, lidera en cada fila compartida al mismo precio de lista. Las brechas más amplias están en el uso de computadoras (72.4% frente a 48.9%) y Terminal-Bench (39.2% frente a 16.4%).
- Contra Sonnet 5.5, la brecha depende de la tarea. En FrontierCode, Haiku está dentro de seis puntos. En Terminal-Bench, Sonnet obtiene un 70.6% frente al 39.2% de Haiku. Anthropic dice que Sonnet 5.5 y Opus 5.5 siguen siendo la mejor opción para codificación compleja de agentes.
Lee la letra pequeña antes de citar estos números
Las puntuaciones principales se ejecutaron con el esfuerzo máximo, la configuración más cara. El valor por defecto es medio, y las ejecuciones de esfuerzo medio de la tarjeta del sistema son más bajas: 1277 en GDPval-AA en lugar de 1620, y 1372 en AA-Briefcase en lugar de 1578. Si implementas en el valor por defecto, compáralo con esos números, no con la tabla de lanzamiento.
La cifra de OSWorld también necesita una segunda mirada. El 72.4% es crédito parcial, promediado sobre puntos de control. La proporción de tareas donde Haiku 5.5 completó cada punto de control es del 37.1% (Luna: 17.1%). Para un agente de navegador que debe terminar todo el trabajo, el 37.1% es el número a considerar.
Lo que informaron los primeros clientes
La publicación de lanzamiento de Anthropic cita a varios clientes que probaron el modelo antes del lanzamiento. Estos son seleccionados por el proveedor, pero apuntan a las mismas cargas de trabajo:
- AlphaSense realiza alrededor de 8 millones de llamadas "Preguntar en Documento" a la semana. En 400 consultas de prueba, Haiku 5.5 obtuvo 0.84 frente a 0.76 de Haiku 4.5.
- Box vio una mejora de 11 puntos sobre Haiku 4.5 con aproximadamente la mitad de la latencia.
- Asana midió una latencia por tarea más de un 30% más baja y hasta 2.5 veces más rápida en inferencia por turno de agente, en comparación con su modelo actual.
- HubSpot obtuvo un 92.8% en su suite CRM, la mejor puntuación que había visto de un modelo pequeño.
- Cognition utiliza Haiku 5.5 como un "compañero" bajo Opus 5.5 en Devin Fusion y reporta que la pareja tiene una puntuación de FrontierCode de 66.2 a un costo y latencia más bajos.
El patrón: trabajo corto y repetido sobre documentos, y deberes de subagente bajo un modelo más grande.
Dónde Haiku 5.5 es la elección equivocada
- Codificación compleja de agentes. Terminal-Bench es donde Sonnet 5.5 se adelanta más. Si una tarea necesita muchos pasos, requisitos ambiguos o una larga cadena de ediciones, comienza con Sonnet 5.5 u Opus 5.5.
- Solicitudes de más de 100K tokens. La ventana de 1M es real, pero el precio no es plano a lo largo de ella. Más allá de 100K tokens, toda la solicitud se mueve a $0.50 / $2.50, y debido a que el nuevo tokenizador cuenta aproximadamente un 30% más de tokens, esa línea se sitúa cerca de 77K tokens como los contaba Haiku 4.5. La publicación de precios en esta serie analiza los números.
- Trabajo que necesita xalto o máximo para aprobar. La salida se vuelve larga y costosa en las configuraciones más altas. La propia guía de Anthropic es comparar con Sonnet 5.5 antes de decidirse por allí.
- Equipos en el Nivel de Prioridad. Haiku 5.5 no lo soporta, por lo que un compromiso de Nivel de Prioridad de Haiku 4.5 no se transfiere.
- Pruebas de seguridad. Las salvaguardias cibernéticas de Haiku 5.5 son más estrictas que las de Haiku 4.5 y bloquean las pruebas de penetración. Espera razones de detención
refusalen ese tipo de trabajo, sin una alternativa de modelo en el lado del servidor.
Pruébalo a través de AIHubMix
La configuración de esfuerzo de Haiku 5.5 vive en el output_config de la API de Mensajes, por lo que el punto final nativo de Claude en AIHubMix es la ruta más directa. Instala un SDK actual de Anthropic (pip install -U anthropic) y apúntalo a AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # deja espacio para pensar, no solo para la respuesta
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Clasifica este ticket como facturación, error u otro: "
"'Me cobraron dos veces por octubre.'",
}],
)
# Los bloques de pensamiento pueden venir primero, así que elige el bloque de texto por tipo.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Dos cosas a verificar en tu primera ejecución. Lee response.usage.output_tokens en low y nuevamente en high con la misma solicitud: si los números no cambian, la configuración de esfuerzo no está alcanzando el modelo. Y ten en cuenta que la página del modelo de AIHubMix actualmente lista una longitud de contexto de 200K para este modelo, por debajo del 1M de Anthropic, así que confirma el límite antes de enviar solicitudes muy largas.
Quién debería cambiar, quién debería esperar
Cambia ahora si realizas clasificación, extracción, enrutamiento, resúmenes o preguntas y respuestas sobre documentos con solicitudes muy por debajo de 100K tokens. Obtienes un modelo mucho más fuerte a una fracción del precio por token. Planifica una hora para los cambios en el código de solicitud, luego prueba el esfuerzo low contra medium en tus propias evaluaciones.
Cambia ahora si utilizas un modelo grande para trabajo de subagente para el que está sobrado: extraer una cifra de un archivo, verificar un archivo, resumir un resultado de herramienta. Este es el papel que Anthropic y sus clientes de lanzamiento enfatizan.
Espera un sprint si tu integración utiliza uso de computadora con la herramienta computer_20250124, prellenado o temperature=0. Cada uno de esos devuelve un 400 en Haiku 5.5, y solucionarlos implica trabajo de código, no un cambio de cadena de modelo.
Quédate donde estás si tu carga de trabajo es de solicitud larga (regularmente más de aproximadamente 77K tokens de Haiku 4.5), depende del Nivel de Prioridad, o es codificación compleja de agentes. Para el último grupo, la comparación útil es Haiku 5.5 contra Sonnet 5.5 en costo por tarea finalizada, no Haiku 5.5 contra Haiku 4.5.
Cuando estés listo para comparar, la lista de modelos de AIHubMix coloca a Haiku 5.5, Sonnet 5.5 y Opus 5.5 detrás de una clave de API, por lo que la misma evaluación puede ejecutarse contra los tres.
Preguntas Frecuentes
¿Es Claude Haiku 5.5 mejor que Haiku 4.5 en todo?
En cada referencia de la tabla de lanzamiento de Anthropic, sí, a menudo por un amplio margen. Las excepciones son prácticas más que de calidad: el Nivel de Prioridad no es compatible, las solicitudes de más de 100K tokens cuestan más por token que la tarifa de solicitud corta, y varios patrones de solicitud antiguos ahora devuelven errores.
¿Es Haiku 5.5 realmente un 90% más barato?
El precio por token es un 90% más bajo para solicitudes de hasta 100K tokens y un 50% más bajo por encima de eso. Debido a que el nuevo tokenizador cuenta aproximadamente un 30% más de tokens para el mismo texto, y el pensamiento ahora produce tokens de salida, Anthropic estima que el ahorro típico es de alrededor del 75%.
¿Cómo se compara Haiku 5.5 con GPT-6 Luna?
Ambos tienen un precio de $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida. En los resultados reportados por Anthropic, Haiku 5.5 obtiene una puntuación más alta en cada referencia donde ambos aparecen, más claramente en el uso de computadoras y Terminal-Bench. Luna mantiene su precio base hasta una longitud de solicitud más larga, por lo que las cargas de trabajo de solicitudes largas deben ser cotizadas por separado.
¿Puede Haiku 5.5 reemplazar a Sonnet 5.5 para codificación?
Para cambios estrechos y bien definidos y tareas de subagente, puede valer la pena probar. Para codificación compleja de agentes en múltiples pasos, Sonnet 5.5 obtiene puntuaciones mucho más altas en Terminal-Bench 4.0 (70.6% frente a 39.2%), y Anthropic recomienda Sonnet u Opus para ese trabajo.
¿Las puntuaciones de referencia están en la configuración por defecto?
No. Las puntuaciones principales se ejecutaron con el esfuerzo máximo. El valor por defecto es medio, donde la tarjeta del sistema reporta resultados más bajos, por ejemplo, 1277 en lugar de 1620 en GDPval-AA.
¿Significa la ventana de contexto de 1M que puedo enviar solicitudes de 1M tokens de forma económica?
Puedes enviarlas, pero cualquier cosa por encima de 100K tokens se factura a $0.50 de entrada y $2.50 de salida por millón de tokens para toda la solicitud. Verifica también el límite de contexto listado por tu puerta de enlace.
¿Qué tengo que cambiar en mi código para cambiar?
Como mínimo: el ID del modelo, cualquier presupuesto manual de pensamiento, cualquier configuración de temperatura o top_p, cualquier prellenado de asistente y el código que lee el primer bloque de contenido como la respuesta. La publicación de migración en esta serie tiene la lista completa.
Sigue leyendo: la serie Claude Haiku 5.5
- Las puntuaciones principales se ejecutaron con el esfuerzo máximo, pero probablemente implementarás en medio o bajo. Para ver lo que cada nivel cuesta en tokens y lo que pierdes al bajar, lee Niveles de Esfuerzo de Claude Haiku 5.5: Medio es el Por Defecto, Bajo es a Menudo Suficiente
- La cifra de una décima del precio solo se mantiene por debajo de una línea de longitud de solicitud que el nuevo tokenizador mueve. Para ejemplos de costos trabajados y las reglas de facturación que son fáciles de pasar por alto, lee Precios de Claude Haiku 5.5: La Línea de 100K Detrás del Recorte del 90%
- Cambiar es más que un cambio de cadena de modelo: cinco patrones de solicitud antiguos ahora fallan. Para cada error, su causa y su solución, lee Migrando de Claude Haiku 4.5 a 5.5: Cinco Errores 400 y los Cambios Silenciosos
Fuentes
- Introducción a Claude Haiku 5.5 (Anthropic)
- Guía de migración de Claude Haiku 5.5 (Documentación de la Plataforma Claude)
- Claude Haiku 5.5 en AIHubMix
- Claude Haiku 5.5: Referencias, Especificaciones, Sol y Luna Comparados (Kingy.ai)
- Análisis de Inteligencia, Rendimiento y Precio de Claude Haiku 5.5 (Análisis Artificial)



