GPT-5.6 Ya Está Disponible: Cambios en la Facturación del Almacenamiento en Caché de Prompts Explicados

31 jul 2026 · AIHubMix · 8 min read · Opinión

GPT-5.6 Ya Está Disponible: Cambios en la Facturación del Almacenamiento en Caché de Prompts Explicados

OpenAI lanzó oficialmente la familia GPT-5.6 el 9 de julio de 2026. AIHubMix ha completado la integración de los tres niveles: gpt-5.6-sol, gpt-5.6-terra y gpt-5.6-luna ya están disponibles a través de Chat Completions y Responses. El lanzamiento también cambia el mecanismo de almacenamiento en caché de prompts y su facturación: las escrituras en caché ahora se facturan por separado. Esta publicación cubre la posición de los tres niveles y detalla los cambios en el almacenamiento en caché punto por punto.

Qué cambia con los tres niveles de GPT-5.6

GPT-5.6 revisa el esquema de nombres: el número denota la generación del modelo, mientras que Sol, Terra y Luna son niveles de capacidad que pueden evolucionar de forma independiente. Según las definiciones oficiales, Sol es el modelo insignia, Terra es un nivel de menor precio con un rendimiento comparable al de GPT-5.5, y Luna es el nivel más rápido y de menor precio.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
Posicionamiento oficial Modelo insignia para trabajo profesional complejo Inteligencia y costo equilibrados Para cargas de trabajo sensibles al costo
Ventana de contexto 1,050,000 1,050,000 1,050,000
Salida máxima 128,000 128,000 128,000
Fecha de corte de conocimiento 2026-02-16 2026-02-16 2026-02-16
Equivalente aproximado en la generación anterior Nivel sin sufijo nivel mini nivel nano

En cuanto a capacidades, la posición oficial: Sol logra resultados de vanguardia en tareas de codificación, trabajo de conocimiento, ciberseguridad y ciencia, y es descrito por OpenAI como su mejor modelo de codificación hasta la fecha, estableciendo nuevos récords en Terminal-Bench 2.1 y DeepSWE; Terra iguala el rendimiento de GPT-5.5 a la mitad del precio. La familia añade un nivel máximo de razonamiento, y la API de Responses gana capacidades de Llamada a Herramientas Programáticas y multi-agente (Beta).

La actualización del mecanismo de almacenamiento en caché, explicada

Antes de GPT-5.6, el almacenamiento en caché de prompts en los modelos GPT era completamente automático: los prefijos de 1,024 tokens o más se almacenaban en caché automáticamente, los desarrolladores no tenían control sobre lo que se almacenaba en caché o por cuánto tiempo, y las cachés se borraban después de 5 a 10 minutos de inactividad. OpenAI resume los cambios de GPT-5.6 como "almacenamiento en caché de prompts más predecible", con tres puntos concretos:

  1. La retención pasa de "tan corta como 5 minutos" a "al menos 30 minutos". prompt_cache_options.ttl actualmente solo admite "30m"; ese es un mínimo garantizado, y la retención real puede ser más larga.
  2. Los puntos de interrupción de caché explícitos son nuevos. Establecer prompt_cache_breakpoint en un bloque de contenido fija el límite de caché al final del contenido estable, por lo que los cambios después del punto de interrupción no invalidan el prefijo en caché anterior; con prompt_cache_options.mode configurado en "explicit", solo se utilizan puntos de interrupción manuales.
  3. prompt_cache_key pasa de ser una optimización a un requisito oficial. A partir de GPT-5.6, el parámetro debe configurarse para habilitar una coincidencia de caché más confiable; OpenAI recomienda mantener el tráfico por clave en aproximadamente 15 solicitudes por minuto.

Cómo evaluar la facturación de escrituras en caché a 1.25x

A partir de GPT-5.6, las escrituras en caché se facturan a 1.25x la tasa base de entrada y las lecturas en caché a 0.1x; en modelos anteriores, las escrituras en caché no tienen tarifa adicional. La redacción oficial (del anuncio de GPT-5.6): "Para GPT-5.6 y modelos posteriores, las escrituras en caché se facturan a 1.25x la tasa de entrada no almacenada en caché del modelo, mientras que las lecturas en caché continúan recibiendo el descuento del 90% en la entrada almacenada en caché."

Las matemáticas del punto de equilibrio siguen directamente de las tarifas oficiales: escribir un prefijo cuesta 0.25x más que no almacenar en caché, y cada acceso posterior ahorra 0.9x la tasa de entrada: un prefijo reutilizado incluso una vez produce un ahorro neto, y cuanto más se reutiliza, mayor es el ahorro.

  • Cargas de trabajo que claramente se benefician: flujos de trabajo de agentes con largos prompts del sistema, RAG que incluye repetidamente material de referencia largo, aplicaciones que llevan definiciones de herramientas grandes y conversaciones de múltiples turnos que solo añaden mensajes. Estas cargas de trabajo tienen una alta reutilización de prefijos, por lo que la tasa de lectura de 0.1x domina.
  • Cargas de trabajo a tener en cuenta: solicitudes largas únicas cuyo prefijo nunca se reutiliza. El almacenamiento en caché automático está activado por defecto, por lo que estas solicitudes incurren en una tarifa de escritura no recuperable de 1.25x; establecer prompt_cache_options.mode en "explicit" sin establecer ningún punto de interrupción hace que la solicitud omita completamente la caché y no incurra en ninguna tarifa de escritura.

Comparación: almacenamiento en caché de prompts en GPT-5.6 y Claude

El diseño de almacenamiento en caché de GPT-5.6 converge con el cache_control de Claude en varias dimensiones, con la diferencia principal en el comportamiento predeterminado: GPT almacena en caché automáticamente sin parámetros requeridos, mientras que Claude requiere que el almacenamiento en caché esté habilitado en la solicitud, ya sea el campo de cache_control de nivel superior (punto de interrupción automático) o puntos de interrupción explícitos a nivel de bloque de contenido.

Dimensión Familia GPT-5.6 Familia Claude (todos los modelos activos)
Activación Almacenamiento en caché automático, puntos de interrupción explícitos opcionales Debe ser habilitado: punto de interrupción automático de cache_control de nivel superior, o puntos de interrupción explícitos a nivel de bloque de contenido
Parámetro de punto de interrupción prompt_cache_breakpoint (nivel de bloque de contenido) cache_control (nivel superior o nivel de bloque de contenido)
Límite de punto de interrupción Como máximo 4 nuevas escrituras en caché por solicitud Como máximo 4 puntos de interrupción
Retención de caché Al menos 30 minutos 5 minutos por defecto (refrescado sin costo en cada acceso), opcional 1 hora
Facturación de escrituras en caché 1.25x tasa de entrada 1.25x para el nivel de 5 minutos, 2x para el nivel de 1 hora
Facturación de lecturas en caché 0.1x tasa de entrada 0.1x tasa de entrada
Longitud mínima almacenable en caché 1,024 tokens 512–4,096 tokens dependiendo del modelo
Requisito de coincidencia Byte por byte idéntico antes del punto de interrupción Byte por byte idéntico antes del punto de interrupción

La columna de Claude refleja las reglas compartidas por todos los modelos activos de Claude: 1.25x para las escrituras del nivel de 5 minutos, 2x para el nivel de 1 hora, y 0.1x para las lecturas se aplican uniformemente en toda la línea (documentación de almacenamiento en caché de prompts de Anthropic), con diferencias por modelo limitadas a la longitud mínima almacenable en caché; la columna de GPT-5.6 proviene de la guía de almacenamiento en caché de prompts de OpenAI.

Los límites de puntos de interrupción, tasas de escritura (para los niveles correspondientes) y tasas de lectura coinciden exactamente entre los dos proveedores; en términos prácticos, la misma estrategia de estructuración de prompts "contenido estático primero, contenido cambiante después" se traslada entre ellos. El costo de migración se concentra en la sintaxis de los parámetros: GPT utiliza prompt_cache_breakpoint + prompt_cache_key, Claude utiliza cache_control.

El mismo patrón de almacenamiento en caché en ambos protocolos

Para el mismo escenario de "almacenar en caché una instrucción larga estática", las implementaciones mínimas en los dos protocolos son las siguientes. Los ejemplos utilizan gpt-5.6-sol y claude-opus-4-8. Ambos comparten el mismo precio base de entrada ($5/M), por lo que los precios efectivos por token derivados de las escrituras en caché (1.25x) y las lecturas (0.1x) también son idénticos; solo la sintaxis difiere.

El protocolo GPT establece prompt_cache_key en el nivel superior (los prefijos largos se almacenan en caché automáticamente, no se necesita marcador de punto de interrupción); el protocolo Claude establece cache_control en el nivel superior para habilitar el almacenamiento en caché automático, cambiando a puntos de interrupción a nivel de bloque de contenido cuando se necesita un control preciso sobre el límite de caché:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[Instrucciones largas estáticas, >=1024 tokens]"
      },
      {
        "role": "user",
        "content": "Resume las cifras clave."
      }
    ]
  }'

Claude (Messages)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[Instrucciones largas estáticas, >=1024 tokens]",
    "messages": [
      {
        "role": "user",
        "content": "Resume las cifras clave."
      }
    ]
  }'

Comparando las dos solicitudes, las diferencias se reducen a: el endpoint (/v1/chat/completions vs /v1/messages), los encabezados de autenticación (Authorization: Bearer vs x-api-key + anthropic-version), el parámetro de almacenamiento en caché (nivel superior prompt_cache_key vs nivel superior cache_control), y Claude requiere un max_tokens explícito. Ambas solicitudes fueron verificadas contra aihubmix.com (2026-07-10): gpt-5.6-sol devolvió cached_tokens: 2816 en la segunda llamada; claude-opus-4-8 devolvió cache_creation_input_tokens: 3632 en la primera llamada y cache_read_input_tokens: 3632 en la segunda.

Más allá del formato de la solicitud, quedan tres diferencias a nivel de mecanismo:

  1. Activación: GPT almacena en caché automáticamente incluso sin ningún parámetro de almacenamiento en caché, con prompt_cache_key mejorando la fiabilidad de coincidencia; Claude requiere una declaración: un punto de interrupción cache_control a nivel de bloque de contenido, o el modo automático de cache_control a nivel superior.
  2. Campos de uso: GPT informa las lecturas en caché en prompt_tokens_details.cached_tokens; Claude informa las escrituras y lecturas por separado como cache_creation_input_tokens y cache_read_input_tokens, facilitando la verificación de escrituras y accesos de forma independiente.
  3. Control de duración: el ttl de GPT-5.6 actualmente solo admite "30m"; Claude tiene un valor por defecto de 5 minutos (refrescado sin costo en cada acceso), con un "ttl": "1h" opcional (escrituras facturadas a 2x).

Qué cambiar al intercambiar modelos entre protocolos

El gateway de AIHubMix admite llamadas entre protocolos: el endpoint compatible con OpenAI puede llamar a modelos de Claude (cache_control se inserta directamente en los bloques de contenido de mensajes en formato OpenAI; ver Prácticas de Almacenamiento en Caché de Prompts), y el endpoint /v1/messages compatible con Claude puede llamar a GPT-5.6 (verificado que funciona). Al intercambiar modelos, verifica tres cosas:

  • Cambia model al ID del modelo objetivo;
  • Cambia la sintaxis del parámetro de almacenamiento en caché: prompt_cache_key / puntos de interrupción explícitos corresponden a cache_control de Claude;
  • Cambia los nombres de los campos de uso: cached_tokens corresponde a cache_read_input_tokens de Claude.

Caminos recomendados para el almacenamiento en caché de prompts: modelos GPT a través de Chat Completions (el camino de acceso verificado en esta publicación); modelos Claude funcionan a través de cualquiera de los protocolos.

Comparación: GPT-5.6 vs almacenamiento en caché de GPT anterior

Dimensión Antes de GPT-5.6 GPT-5.6 y posteriores
Escrituras en caché Sin tarifa adicional 1.25x tasa de entrada
Retención de caché Borrado después de 5–10 minutos de inactividad, hasta 1 hora Al menos 30 minutos
Control de caché Ninguno Puntos de interrupción explícitos, modo explícito, coincidencia confiable de prompt_cache_key
Retención extendida de 24 horas prompt_cache_retention en algunos modelos Reemplazado por prompt_cache_options.ttl (actualmente solo 30m)

Los cambios apuntan en una dirección: el almacenamiento en caché de generaciones anteriores era gratuito en términos de tarifas de escritura pero incontrolable, con retención incierta; GPT-5.6 cobra por las escrituras mientras proporciona un piso de retención garantizado y controles de caché precisos. Según las tarifas, un prefijo reutilizado más de una vez en promedio ahorra más que el costo adicional de escritura; el piso de retención de 30 minutos y los puntos de interrupción controlables hacen que alcanzar esa tasa de reutilización sea más predecible.

Comenzando en AIHubMix

Los tres niveles están disponibles, con IDs de modelo gpt-5.6-sol, gpt-5.6-terra y gpt-5.6-luna. El almacenamiento en caché no requiere configuración adicional; las solicitudes consecutivas con el mismo prefijo largo acceden a la caché:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "Eres un asistente meticuloso para analizar informes financieros trimestrales... [Instrucciones largas estáticas, >=1024 tokens]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "Resume las cifras clave en una oración."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

Un valor de usage.prompt_tokens_details.cached_tokens mayor que 0 en la segunda llamada indica un acceso (ejemplo medido: cached_tokens: 2816). Para detalles de parámetros, especificaciones de facturación y solución de problemas de accesos, consulta la documentación de Almacenamiento en Caché de Prompts de GPT.

FAQ

¿Qué APIs pueden llamar a GPT-5.6 en AIHubMix?

Chat Completions (/v1/chat/completions), Responses (/v1/responses) y la API de Messages compatible con Claude (/v1/messages) pueden llamar a los modelos, y los tres niveles están disponibles. Para el almacenamiento en caché de prompts, Chat Completions es actualmente el camino recomendado.

Si mi cliente no cambia nada, ¿qué cambia en la facturación después de actualizar a GPT-5.6?

El almacenamiento en caché de prompts se aplica automáticamente por defecto: las solicitudes cuyo prefijo alcanza 1,024 tokens incurren en un ítem de escritura en caché facturado a 1.25x la tasa de entrada, y los prefijos reutilizados se facturan a la tasa de lectura de 0.1x. Las aplicaciones con alta reutilización de prefijos suelen ver costos totales más bajos; las solicitudes largas únicas que nunca reutilizan un prefijo pueden desactivar el almacenamiento en caché con el modo explícito.

He utilizado el almacenamiento en caché de prompts de Claude. ¿Qué debo cambiar para migrar a GPT-5.6?

La estrategia de estructuración de prompts se mantiene igual: contenido estático primero, contenido cambiante después. Los parámetros cambian de cache_control a prompt_cache_breakpoint, además de prompt_cache_key; la retención cambia de los niveles de 5 minutos/1 hora a un piso garantizado de 30 minutos.

¿Cómo elijo entre los tres niveles de GPT-5.6?

Según el posicionamiento oficial: elige Sol para trabajo profesional complejo y tareas de codificación; elige Terra para cargas de trabajo diarias (rendimiento a nivel de GPT-5.5 a la mitad del precio); elige Luna para escenarios sensibles al costo y de alto volumen. Los tres niveles comparten la misma ventana de contexto y salida máxima, por lo que puedes dirigir según la complejidad de la tarea.

Referencias oficiales

Las especificaciones del modelo, mecanismos de almacenamiento en caché y tarifas de facturación en esta publicación provienen de estas fuentes oficiales:

Documentación relacionada en este sitio: Almacenamiento en Caché de Prompts de GPT · Almacenamiento en Caché de Prompts de Claude · Prácticas de Almacenamiento en Caché de Prompts


Visita la galería de modelos para precios de GPT-5.6, o explora más opciones de integración en el centro de documentación.


Última actualización: 2026-07-10

More from the blog