Lo que realmente cuesta GPT-6.1 Sol: más allá de la etiqueta de precio de $2 / $10

AIHubMix6 min de lectura
Lo que realmente cuesta GPT-6.1 Sol: más allá de la etiqueta de precio de $2 / $10

GPT-6.1 Sol tiene el mismo precio de lista que GPT-6 Sol: $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Tu factura real depende de otras cuatro cosas: con qué frecuencia accedes a la caché, si superas los 272K tokens de entrada, qué nivel de servicio utilizas y cuántos tokens de razonamiento quema el modelo. Esta publicación analiza cada uno de ellos.


La lista de precios completa

Tarifas estándar (por 1M de tokens)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Entrada$2.00$2.00$10.00$0.10
Entrada en caché$0.10$0.20$1.00—
Escrituras en caché$2.50$2.50——
Salida (incl. razonamiento)$10.00$10.00$50.00$0.50
La tarifa de caché de Astra proviene de informes de terceros. Su tarifa de escritura en caché debería ser de $12.50 bajo la regla de 1.25× de OpenAI. Para la fijación de precios de caché de Luna, consulta la página de precios de OpenAI.

Multiplicadores

Estas reglas provienen de la página del modelo GPT-6.1 Sol:

CondiciónQué sucede
Más de 272K tokens de entradaLa solicitud completa se factura a 2× entrada y caché, 1.5× salida ($4 / $15, lecturas de caché $0.20, escrituras de caché $5)
Lote / FlexLa mitad de la tarifa estándar
Modo rápidoEl doble de la tarifa estándar (no disponible con residencia de datos en la UE)
Procesamiento regional+10%
Llamadas a herramientas (búsqueda, uso de computadora, etc.)Se cobra por llamada. AIHubMix lista la búsqueda web a $0.01 por solicitud
Ultrafast (próximamente en Codex)Aún no tiene precio oficial. Un informe dice 6× estándar, no confirmado

En AIHubMix, las rutas de OpenAI y Azure cuestan lo mismo que OpenAI directo, y el nivel de más de 272K ya está listado.


El cambio real: lecturas de caché al 5% de la entrada

El precio de lista no se movió. Las lecturas de caché sí, de 10% de la tarifa de entrada ($0.20) a 5% ($0.10). Los documentos de caché de prompts de OpenAI lo expresan claramente: las lecturas de caché son 0.1× entrada en la mayoría de los modelos y "0.05× en GPT-6.1 Sol."

Esto es importante porque los agentes reenvían el mismo material en cada paso: prompt del sistema, definiciones de herramientas, contexto del repositorio e historial de conversación. La mayor parte de su entrada es contenido repetido. Para estas cargas de trabajo, la tarifa en caché es efectivamente tu verdadero precio de entrada.

Ejemplo práctico: una tarea de agente de codificación

Suposiciones:

  • Un prefijo fijo de 200K tokens (prompt del sistema, herramientas, contexto del repositorio)
  • 50 pasos, cada uno añadiendo 2K nuevos tokens de entrada y produciendo 3K tokens de salida (incluyendo razonamiento)
  • Para simplificar, el prefijo se mantiene del mismo tamaño, se escribe en caché en el paso 1 y se accede en los 49 pasos restantes
6.1 Sol, sin caché6 Sol + caché6.1 Sol + cachéAstra + caché
Escritura inicial de 200K en caché—$0.50$0.50$2.50
49 lecturas de caché—$1.96$0.98$9.80
Prefijo facturado como entrada regular$20.00———
100K nueva entrada (a la tarifa de escritura)$0.20$0.25$0.25$1.25
150K salida$1.50$1.50$1.50$7.50
Total$21.70$4.21$3.23$21.05

Tres conclusiones:

  1. El almacenamiento en caché es el mayor apalancamiento. Mismo modelo, mismo trabajo, y la ejecución sin caché cuesta casi 7× más.
  2. 6.1 Sol es aproximadamente un 23% más barato que 6 Sol en este caso, mientras que también obtiene una puntuación más alta.
  3. Para trabajos que requieren mucho caché, Astra cuesta más de lo que sugiere la diferencia de precio de 5×. En este ejemplo es 6.5×, porque Astra descuenta la entrada en caché en un 90% y 6.1 Sol lo descuenta en un 95%.

Eso se alinea con los costos por tarea reportados por OpenAI (compilados por Vellum y The Next Web): alrededor de $1.50 frente a $7.70 en DeepSWE, $1.30 frente a $9.30 en OSWorld, y $5.47 frente a $23.80 en Terminal-Bench Science.

Una advertencia: OpenAI dice que Astra generalmente necesita menos tokens de salida para completar la misma tarea. Compara modelos en costo por tarea, no en costo por token.

Las escrituras en caché no son gratuitas

Las escrituras en caché en 6.1 Sol cuestan 1.25× la tarifa de entrada. Si un prefijo se utiliza solo una vez, el almacenamiento en caché lo hace un 25% más caro. Usando la fórmula de los documentos de OpenAI:

  • Una escritura más una lectura: 1.35× el costo regular de entrada (1.3× en 6.1 Sol), frente a 2× sin almacenamiento en caché
  • Una escritura más nueve lecturas: aproximadamente 2.15× (aproximadamente 1.7× en 6.1 Sol), frente a 10×

El prefijo mínimo que se puede almacenar en caché es de 1,024 tokens. Las matemáticas de punto de equilibrio de OpenAI dicen que un prefijo de 102 tokens o menos nunca se amortiza. Si esperas 10 o más reutilizaciones, aumentar cualquier cosa por encima de 221 tokens hasta 1,024 resulta más barato.

Para llamadas únicas como clasificación de un solo turno o extracción masiva, utiliza el modo explícito (prompt_cache_options.mode: "explicit") sin puntos de interrupción. No se te cobrará por ninguna escritura.


El límite de 272K

6.1 Sol acepta 1.05M tokens de contexto, pero una vez que la entrada supera los 272K, toda la solicitud pasa a la tarifa más alta, no solo los tokens que superan el límite.

SolicitudEntradaSalidaCosto
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

Diez mil tokens de entrada más casi duplican la factura.

Cómo mantenerse por debajo de este límite:

  • Cuenta los tokens del lado del cliente y compacta o recorta antes de alcanzar los 272K
  • Recupera las partes relevantes de documentos largos en lugar de enviar todo
  • Cuando realmente necesites un contexto largo, coloca la parte fija en un prefijo en caché

Cómo se refleja el esfuerzo de razonamiento en la factura

Los tokens de razonamiento se facturan a la tarifa de salida, $10 por millón. Mover la misma tarea de baja a máxima puede multiplicar los tokens de razonamiento por diez o más.

Los costos por tarea reportados por OpenAI dan una idea de la escala (estos son diferentes puntos de referencia, así que solo compara las magnitudes):

  • AutomationBench (medio): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (alto): ~$1.50
  • Terminal-Bench Science (máximo): ~$5.47

La Parte 2 cubre cómo elegir un nivel. Un recordatorio aquí: cambiar reasoning.effort a mitad de conversación invalida la caché. Usa configuration_update en su lugar.


Cómo se compara a este precio

ModeloEntrada / salidaEntrada en caché
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol y Claude Sonnet 5.5 comparten un precio de lista, y la tarifa en caché de 6.1 Sol es la mitad de la de Sonnet. Sin embargo, son fuertes en diferentes aspectos. En AutomationBench, por ejemplo, Sonnet 5.5 obtiene una puntuación mucho más alta. Cuando dos modelos cuestan lo mismo por token, el que tiene el costo más bajo por tarea en tu carga de trabajo es el más barato.

La lista de modelos de AIHubMix muestra los precios actuales, y una clave API funciona para todos ellos, por lo que las pruebas lado a lado son fáciles.

Los precios de los competidores provienen de fuentes de terceros y pueden cambiar. Consulta las páginas de precios oficiales antes de confiar en ellos.

Lista de verificación de costos

  1. Poner contenido estable primero. El prompt del sistema, las definiciones de herramientas y el material de referencia van en la parte superior. Las marcas de tiempo y los datos por usuario van al final.
  2. Agregar, no reescribir. Resumir, truncar y compactar reinicia la caché.
  3. Mantener estable la lista de herramientas. No agregar ni eliminar herramientas por solicitud. Usa tool_choice o allowed_tools en su lugar.
  4. Cambiar el esfuerzo con configuration_update, no el parámetro de solicitud.
  5. Mantenerse por debajo de 272K de entrada.
  6. Enviar trabajo no urgente a través de Batch o Flex por la mitad de precio.
  7. Rutar por tarea. Luna para trabajo simple de alto volumen, 6.1 Sol para la mayoría de las cosas, Astra para los problemas más difíciles.
  8. Vigilar tres números: cached_tokens, cache_write_tokens, y reasoning_tokens.

La conclusión es: el precio de lista no cambió, pero las lecturas de caché se volvieron un 50% más baratas. Para cargas de trabajo de agentes, eso hace que 6.1 Sol sea el modelo de mejor valor en la familia GPT-6, siempre que uses bien el almacenamiento en caché y te mantengas por debajo de 272K.

Próximo tema: los problemas que probablemente enfrentarás al cambiar.


Preguntas frecuentes

¿Cuánto cuesta GPT-6.1 Sol? $2 por millón de tokens de entrada, $10 por millón de tokens de salida, $0.10 por entrada en caché y $2.50 por escrituras en caché. Las solicitudes de más de 272K tokens de entrada se facturan a $4 de entrada y $15 de salida para toda la solicitud.

¿Es más barato a través de AIHubMix o OpenAI directamente? Mismo precio. Las rutas de OpenAI y Azure de AIHubMix coinciden con las tarifas oficiales de OpenAI.

¿Por qué mi factura es más alta de lo que estimé? Cuatro razones comunes: los tokens de razonamiento se facturan a la tarifa de salida; superaste los 272K de entrada; perdiste la caché o pagaste cargos de escritura en prefijos únicos; o el modo rápido o el procesamiento regional están activados.

¿Las escrituras en caché tienen un costo adicional? Los tokens escritos se facturan a 1.25× la tarifa de entrada. Eso reemplaza el cargo normal de entrada en lugar de sumarse a él. Un prefijo se amortiza después de dos usos. Para prefijos únicos, el modo explícito te permite omitir las escrituras por completo.

¿Cuánto más barato es 6.1 Sol que Astra? Cinco veces más barato en precio de lista. Para trabajos de agentes que requieren mucho caché, la diferencia puede alcanzar de 6 a 7× porque 6.1 Sol descuenta la entrada en caché más drásticamente. Sin embargo, Astra a menudo utiliza menos tokens de salida por tarea, así que compara el costo por tarea.

¿Se puede combinar Batch con caché? Batch y Flex son ambos a mitad de precio. Para saber cómo se combinan con el almacenamiento en caché, consulta la página de precios de OpenAI.


Sigue leyendo: la serie GPT-6.1 Sol


Fuentes