Precios de Claude Haiku 5.5: La Línea de 100K Detrás del Recorte del 90%

AIHubMix8 min de lectura
Precios de Claude Haiku 5.5: La Línea de 100K Detrás del Recorte del 90%

Claude Haiku 5.5 cuesta $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida, una décima parte de los $1 y $5 de Haiku 4.5. Esto se aplica a los prompts de hasta 100,000 tokens. Por encima de esa línea, toda la solicitud se factura a $0.50 y $2.50, que es la mitad del precio de Haiku 4.5 en lugar de una décima parte.

Anthropic estima que el ahorro típico es de alrededor del 75%, no del 90%, y la diferencia proviene de tres cosas que este artículo analiza: dónde caen tus prompts en relación con la línea de 100K, cuántos tokens de pensamiento generan la configuración predeterminada, y un nuevo tokenizador que cuenta el mismo texto como aproximadamente un 30% más de tokens. Dos ejemplos prácticos a continuación muestran cómo resulta una factura real.

La tabla de tarifas

Precios por millón de tokens, del artículo de lanzamiento de Haiku 5.5 de Anthropic y de la página de precios:

Tipo de token Haiku 5.5, corto Haiku 5.5, largo Haiku 4.5 Sonnet 5.5
Entrada $0.10 $0.50 $1.00 $2.00
Salida $0.50 $2.50 $5.00 $10.00
Lectura de caché $0.01 $0.05 $0.10 $0.10
Escritura de caché, 5 min $0.125 $0.625 $1.25 $2.50
Escritura de caché, 1 hora $0.20 $1.00 $2.00 $4.00

“Corto” significa un prompt de 100,000 tokens o menos; “largo” significa más de 100,000. La API Batch reduce en un 50% las tarifas de entrada y salida. El precio de lectura de caché de Sonnet 5.5 se redujo de $0.20 a $0.10 el mismo día.

La página de Haiku 5.5 en AIHubMix enumera los mismos dos niveles, con búsqueda web a $0.01 por solicitud.

Reglas de facturación que son fáciles de pasar por alto

Toda la solicitud cambia de nivel, no solo el exceso. Anthropic factura Haiku 5.5 con dos tablas de tarifas elegidas por la longitud del prompt. Un prompt de 100,000 tokens paga $0.0100 por su entrada; un prompt de 100,001 tokens paga $0.0500, y su salida también cuesta cinco veces más. Haiku 5.5 es la excepción aquí: los otros modelos actuales de contexto 1M de Anthropic facturan toda la ventana a sus tarifas estándar.

La línea llega antes de lo que sugieren tus antiguos paneles. Haiku 5.5 utiliza un tokenizador más nuevo, y el mismo texto produce aproximadamente un 30% más de tokens que en Haiku 4.5. Dividir 100,000 por 1.3 coloca la línea cerca de 77,000 tokens según cómo los contaba Haiku 4.5. Un prompt de 78,000 tokens en tu antiguo panel se convierte en aproximadamente 101,000 tokens en Haiku 5.5, y paga la tarifa larga. Esa aritmética proviene de la cifra del 30% en la guía de migración de Anthropic; el aumento exacto depende del contenido, así que vuelve a contar los prompts reales en el nuevo modelo.

El pensamiento está activado por defecto, y se factura como salida. Haiku 4.5 solo pensaba cuando se le pedía. Haiku 5.5 ejecuta pensamiento adaptativo con un esfuerzo medio a menos que lo cambies, por lo que una ruta que solía devolver 200 tokens de salida ahora puede devolver varios cientos más.

Los prompts cortos ahora pueden ser almacenados en caché. El mínimo de prompt que se puede almacenar en caché baja de 4,096 tokens en Haiku 4.5 a 512 en Haiku 5.5, según la guía de migración de Anthropic. Un prompt de sistema de 3,000 tokens que nunca pudo ser almacenado en caché en Haiku 4.5 ahora puede serlo, y una lectura de caché cuesta una décima parte de la tarifa de entrada.

El Nivel de Prioridad no está disponible. Si tienes un compromiso de Nivel de Prioridad en Haiku 4.5, no se transfiere a Haiku 5.5. Planifica la capacidad por separado.

Tokens en caché y la línea de 100K: asume que cuentan. Anthropic enumera un precio de lectura de caché separado para cada nivel, lo que sugiere que todo el prompt, en caché o no, decide el nivel. Anthropic no ha aclarado esto, así que la suposición segura es que un prefijo en caché de 95K más una pregunta de 6K es un prompt largo.

Ejemplo práctico 1: un clasificador de tickets de soporte

Suposiciones, en conteos de tokens de Haiku 4.5: un prompt de sistema de 3,000 tokens con definiciones de herramientas, un ticket de 1,000 tokens, una respuesta de 200 tokens, y 1 millón de solicitudes al mes. Haiku 4.5 funciona con el pensamiento desactivado.

En Haiku 5.5, el mismo texto se convierte en 3,900 + 1,300 tokens de entrada y una respuesta de 260 tokens. Se asume que el pensamiento añade 300 tokens con esfuerzo bajo y 800 con esfuerzo medio. Esas cifras de pensamiento son suposiciones; mide las tuyas.

Configuración Por solicitud Por mes
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, bajo, sin caché $0.00080 $800
Haiku 5.5, bajo, prefijo en caché $0.00045 $453
Haiku 5.5, medio, prefijo en caché $0.00070 $703
Sonnet 5.5, medio, prefijo en caché $0.01359 $13,674

Las filas mensuales en caché incluyen aproximadamente $4 de escrituras de caché para Haiku 5.5 y aproximadamente $84 para Sonnet 5.5, asumiendo una escritura de 5 minutos cada cinco minutos. Sonnet 5.5 utiliza las mismas suposiciones de tokens que Haiku a un nivel medio.

Cómo se suma la fila de bajo en caché: 3,900 tokens en caché a $0.01 por millón ($0.000039), más 1,300 tokens de entrada frescos a $0.10 ($0.00013), más 560 tokens de salida a $0.50 ($0.00028), para un total de $0.000449 por solicitud.

El patrón: el almacenamiento en caché y el esfuerzo juntos mueven la factura del 16% del costo antiguo (sin caché, bajo) al 9% (en caché, bajo). Dejar el esfuerzo en el valor predeterminado en lugar de bajo añade alrededor de $250 al mes a este volumen. Ninguna de las opciones importa mucho en términos absolutos al lado de los $5,000 de Haiku 4.5, que es por qué el caso del clasificador es donde el titular del 90% es real.

Ejemplo práctico 2: una revisión de contrato que cruza la línea

Suposiciones, en conteos de tokens de Haiku 4.5: un contrato más instrucciones de 70,000 tokens, una respuesta de 1,500 tokens, sin caché. En Haiku 5.5 eso se convierte en 91,000 tokens de entrada, una respuesta de 1,950 tokens, y se asumen 2,000 tokens de pensamiento a medio, por lo que 3,950 tokens de salida.

Ahora haz que el contrato sea un 14% más largo: 80,000 tokens en Haiku 4.5, 104,000 en Haiku 5.5.

Tamaño del contrato (conteo de Haiku 4.5) Haiku 4.5 Haiku 5.5 Cambio
70,000 tokens $0.0775 $0.0111 86% menos
80,000 tokens $0.0875 $0.0619 29% menos

La segunda fila: 104,000 tokens de entrada a $0.50 por millón ($0.052) más 3,950 tokens de salida a $2.50 ($0.0099). Catorce por ciento más de texto cuesta 5.6 veces más en Haiku 5.5.

La solución es mantenerse por debajo de la línea. Dividir el contrato más largo en dos llamadas de aproximadamente 53,000 tokens cada una (la mitad del contrato más las instrucciones en cada una) cuesta aproximadamente $0.015 en total a la tarifa corta, menos de una cuarta parte de la única llamada larga. Si una división funciona depende de la tarea; la revisión cláusula por cláusula se divide limpiamente, una pregunta que necesita todo el documento a la vez no lo hace.

Cómo se compara en costo por tarea

Contra Sonnet 5.5, Haiku 5.5 es aproximadamente una vigésima parte del precio por token en prompts cortos. Pero el precio por token no es el precio por tarea finalizada. En codificación compleja y agente, Sonnet 5.5 obtiene un 70.6% en Terminal-Bench 4.0 frente al 39.2% de Haiku 5.5, en los resultados reportados por Anthropic, y una solicitud más barata que falla y se vuelve a intentar, o que se rehace con un modelo más grande, no es más barata. El propio consejo de Anthropic es comparar contra Sonnet 5.5 antes de ejecutar Haiku a xhigh o max. Sonnet 5.5 también se volvió más barato el mismo día: sus lecturas de caché se redujeron a la mitad, lo que Anthropic dice que reduce aproximadamente un 20% de la mayoría del trabajo agente.

Contra GPT-6 Luna, los precios de lista para prompts cortos son idénticos, incluidas las lecturas de caché. La diferencia es la regla de prompts largos. La tarifa de contexto largo de Luna comienza por encima de 272,000 tokens de entrada y es de $0.20 / $0.75, mientras que la de Haiku 5.5 comienza por encima de 100,000 y es de $0.50 / $2.50. Para una carga de trabajo entre 100K y 272K tokens, Luna es mucho más barata en precio de lista. Los dos modelos utilizan diferentes tokenizadores, así que compara facturas medidas, no conteos de tokens.

Las cifras sobre el umbral de 100K y el efecto del tokenizador también han sido analizadas por Roo's Newsletter, cuya aritmética coincide con los ejemplos anteriores.

Pasos que reducen la factura

  1. Cuenta tokens en el nuevo modelo y alerta antes de 100K. Registra el tamaño completo del prompt para cada solicitud y alerta alrededor de 90,000 tokens, para que los prompts que se desvían hacia arriba se recorten o dividan antes de que cambien de nivel.
  2. Almacena en caché el prefijo estable. Primero el prompt del sistema y las definiciones de herramientas, último el contenido variable. Con un mínimo de 512 tokens, la mayoría de los prompts del sistema de producción ahora califican. La guía de almacenamiento en caché de prompts de Claude de AIHubMix muestra el formato de solicitud.
  3. Establece el esfuerzo explícitamente. Usa bajo para rutas simples de alto volumen. El valor predeterminado medio cuesta más en cada solicitud, ya sea que la ruta lo necesite o no.
  4. Dimensiona max_tokens para pensamiento más respuesta. Demasiado pequeño y pagas por un pensamiento que termina sin respuesta.
  5. Agrupa lo que puede esperar. La API Batch reduce a la mitad las tarifas de entrada y salida.
  6. Dirige hacia arriba en lugar de volver a intentar hacia abajo. Si un tipo de tarea falla a menudo en Haiku, envíalo primero a Sonnet 5.5 en lugar de pagar por intentos de Haiku más un respaldo.

Un patrón de registro para los pasos 1 y 2 a través del punto final nativo de Claude de AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Tú clasificas tickets de soporte..."  # prefijo estable, almacenable en caché

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"advertencia: prompt en {prompt_tokens} tokens, cerca de la línea de precio de 100K")
    return next(b.text for b in r.content if b.type == "text")

Si cache_read_input_tokens se mantiene en cero a través de llamadas repetidas, algo en el prefijo está cambiando entre solicitudes, como una marca de tiempo en el prompt del sistema.

FAQ

¿Cuánto cuesta Claude Haiku 5.5?
Para prompts de hasta 100,000 tokens, $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida. Para prompts más largos, $0.50 y $2.50, aplicados a toda la solicitud. Las lecturas de caché cuestan una décima parte de la tarifa de entrada, y la API Batch reduce a la mitad los precios de entrada y salida.

¿Es Haiku 5.5 realmente un 90% más barato que Haiku 4.5?
Por token, en prompts cortos, sí. Por tarea, menos: el nuevo tokenizador cuenta aproximadamente un 30% más de tokens para el mismo texto, el pensamiento está activado por defecto, y los prompts largos solo obtienen un recorte del 50%. Anthropic estima un ahorro típico de alrededor del 75%. Un clasificador de prompts cortos con caché puede ahorrar alrededor del 90%.

¿Qué sucede si mi prompt está justo por encima de 100,000 tokens?
Toda la solicitud se mueve a la tabla de tarifas más alta, tanto la entrada como la salida. En el ejemplo del contrato anterior, un 14% más de texto hizo que la solicitud fuera 5.6 veces más cara.

¿Los tokens en caché cuentan para el umbral de 100K?
Anthropic no ha declarado esto explícitamente. Sus precios enumeran precios de lectura de caché separados para cada nivel, así que la suposición segura es que todo el prompt, en caché o no, decide el nivel.

¿Los tokens de pensamiento tienen un costo adicional?
Se facturan como tokens de salida a la tarifa normal de salida. Debido a que el pensamiento está activado por defecto con esfuerzo medio, pueden añadir notablemente a una ruta que solía producir respuestas cortas. Reducir el esfuerzo los disminuye.

¿Es Haiku 5.5 más barato que GPT-6 Luna?
En prompts de hasta 100K tokens, los precios de lista son los mismos. Entre 100K y 272K tokens, Luna se mantiene en su tarifa base mientras que Haiku 5.5 pasa a su tarifa más alta, por lo que Luna es más barata allí en precio de lista. Los tokenizadores son diferentes, así que compara facturas reales.

¿Puedo usar el Nivel de Prioridad con Haiku 5.5?
No. El Nivel de Prioridad no es compatible con Haiku 5.5, por lo que los compromisos en Haiku 4.5 no se transfieren.

Sigue leyendo: la serie Claude Haiku 5.5

Fuentes