GPT-6.1 Sol vs GPT-6 Sol: Una actualización de una semana que casi alcanza a Astra

AIHubMix7 min de lectura
GPT-6.1 Sol vs GPT-6 Sol: Una actualización de una semana que casi alcanza a Astra

OpenAI lanzó GPT-6.1 Sol en DevDay el 29 de septiembre de 2026. El momento es sorprendente: GPT-6 Sol había estado disponible exactamente una semana (se lanzó el 22 de septiembre junto a Luna), y el modelo insignia GPT-6 Astra tenía menos de un mes.

La página oficial del modelo resume la propuesta en una línea: "Rendimiento cercano a Astra para trabajos complejos a un costo menor." Concretamente, eso significa codificación agente, uso de computadoras y tareas profesionales con una calidad aproximadamente igual a la de Astra, por una quinta parte del precio por token de Astra.

Esta publicación responde a dos preguntas: ¿qué cambió realmente de 6 Sol y cuán grande es la brecha restante con Astra?


Dónde se sitúa 6.1 Sol en la alineación

GPT-6.1 Sol ya está disponible en AIHubMix al mismo precio que OpenAI directo. Aquí está la familia actual de GPT-6:

CategoríaModeloMejor paraEntrada / salida por 1M
InsigniaGPT-6 AstraRazonamiento y codificación más difíciles$10 / $50
EquilibradoGPT-6.1 SolCalidad cercana a Astra, costo menor$2 / $10
AnteriorGPT-6 SolCodificación y flujos de trabajo de agentes$2 / $10
PequeñoGPT-6 LunaTareas simples de alto volumen$0.10 / $0.50

Un poco de contexto sobre por qué este lanzamiento es un Sol y no un Astra: el día antes de DevDay, el Wall Street Journal informó que OpenAI había archivado GPT-6.1 Astra, que estaba programado para octubre, después de que regresara en pruebas internas de seguridad que cubrían la alineación y mantenerse dentro del alcance autorizado por un usuario. Así que la actualización ".1" solo llegó a Sol, y Astra se queda en 6.0 por ahora.


Hoja de especificaciones: qué es igual, qué es diferente

GPT-6 SolGPT-6.1 Sol
Ventana de contexto1.05M1.05M
Máx. entrada / salida922K / 128K922K / 128K
Corte de conocimientoAbr 20, 2026Abr 30, 2026
EntradaTexto, imagenTexto, imagen
Esfuerzo de razonamientoninguno – máximobajo – máximo
Esfuerzo por defectomediomedio
Herramientas en Completaciones de ChatSolo en ningunoNo, usa Respuestas
Precio de entrada / salida$2 / $10$2 / $10
Entrada en caché$0.20$0.10
Escrituras en caché$2.50$2.50
Más de 272K de entrada2× en, 1.5× fueraIgual

Sobre el papel, los dos modelos parecen casi idénticos. Tres cosas realmente importan:

  1. Es notablemente más inteligente al mismo precio. Los números están en la siguiente sección.
  2. Las lecturas en caché cuestan la mitad. Los agentes reenvían el mismo prefijo largo en cada paso, por lo que este ítem a menudo importa más que el precio principal. La Parte 3 realiza los cálculos.
  3. none ha desaparecido. Si dependías de none para llamadas baratas, o para llamar herramientas dentro de Completaciones de Chat, cambiar el nombre del modelo romperá las cosas. La guía de migración de GPT-6 de OpenAI cubre esto, y la Parte 4 explica las soluciones.

Referencias

Una nota sobre las fuentes: las cifras en esta sección y la siguiente provienen de los materiales de lanzamiento de OpenAI, compilados por DataCamp y Vellum. OpenAI ejecutó sus propios modelos y obtuvo puntajes de competidores de informes públicos. Nadie los ha reproducido de forma independiente aún. Úsalos como una dirección, luego realiza tus propias evaluaciones.

Codificación y agentes

Referencia6.1 Sol6 SolAstraCosto/tarea (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
Depuración de investigación75.52%64.20%——

Niveles de esfuerzo: DeepSWE en alto (6 Sol en máximo); OSWorld y Terminal-Bench Science en máximo; AutomationBench en medio.

Lo que destaca:

  • En DeepSWE empata con Astra, en alto esfuerzo en lugar de máximo. Eso son 6.4 puntos por encima del mejor resultado de GPT-6 Sol, a un costo menor por tarea ($1.50 vs $2.60).
  • En OSWorld está aproximadamente 2 puntos detrás de Astra, por aproximadamente una séptima parte del costo por tarea.
  • Astra todavía gana en el trabajo de investigación más difícil (Terminal-Bench Science) y en varias evaluaciones de bio y seguridad, generalmente por 4 a 16 puntos donde lidera. OpenAI recomienda Astra para las tareas de investigación más difíciles.
  • No es el mejor modelo en todo. En AutomationBench, Claude Sonnet 5.5 obtiene un 44.7% a $1.14 por tarea, muy por encima del 35.4% de 6.1 Sol.

Precisión fáctica

A bajo esfuerzo, la proporción de respuestas con un error fáctico cayó del 11.4% en 6 Sol a 7.7%, aproximadamente un tercio menos. A través de los niveles de esfuerzo, 6.1 Sol se mantiene dentro de 1.9 puntos de Astra.

Una advertencia: el conjunto de evaluación se construyó a partir de indicaciones difíciles donde los usuarios señalaron errores anteriores, y OpenAI dice que no es representativo del uso típico.

Otros dominios (6.1 Sol / 6 Sol / Astra)

  • HealthBench Duro: 36.2 / 30.1 / 36.6
  • HealthBench Profesional: 64.2 / 60.8 / 64.7
  • Seguimiento de instrucciones de cadena de pensamiento: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

En salud, 6.1 Sol está esencialmente al nivel de Astra. En control de cadena de pensamiento y tareas de seguridad ofensiva, Astra mantiene una clara ventaja.


Alineación: mejor en general, con algunas regresiones

OpenAI realizó 49,650 tareas simuladas de implementación de Codex y contó incidentes de severidad 3 o más:

ModeloIncidentesTasa
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Eso es un tercio menos que 6 Sol y aproximadamente al mismo nivel que Astra. El modelo también es más honesto sobre herramientas rotas: falló en mencionar una herramienta de búsqueda rota el 2.1% del tiempo, bajando del 4.9% (Astra: 1.5%).

Sin embargo, algunos números se movieron en la dirección equivocada:

  • Eludir restricciones explícitas: 23.5%, frente al 17.4% de Astra. 6 Sol estaba supuestamente en 64.4%, por lo que esto sigue siendo una gran mejora sobre el modelo anterior.
  • Engaño en tareas de codificación: 1.50%, ligeramente por encima del 1.30% de 6 Sol y muy por encima del 0.51% de Astra.
  • Contactar a otros agentes: 38%, subiendo del 26%. La tasa de llevar a cabo una acción no autorizada cayó del 11% al 3%.

Si le estás dando a 6.1 Sol permisos reales, la Parte 4 cubre cómo establecer límites.


Disponibilidad

  • API: gpt-6.1-sol en Completaciones de Chat (sin herramientas), Respuestas y Lotes.
  • ChatGPT: Los usuarios de Plus, Pro, Business, Enterprise y Edu lo obtienen en ChatGPT Work y Codex. Aún no está en el chat regular de ChatGPT. Los administradores de Enterprise y Edu deben activarlo.
  • Terceros: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot y otros. AIHubMix enruta a través de OpenAI y Azure al mismo precio y vuelve a intentar automáticamente en el otro proveedor si uno falla o se ralentiza.
  • Ultrafast: OpenAI dice que una opción Ultrafast de GPT-6.1 Sol para Codex, con hasta 8× más rápida generación, llegará en unos días.

Para solicitudes de texto simple sin herramientas, Completaciones de Chat funciona bien. Si es tu primera vez, el inicio rápido de AIHubMix cubre la configuración.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explica el almacenamiento en caché de indicaciones en tres oraciones."}],
)
print(resp.choices[0].message.content)

Una vez que necesites herramientas, cambia a la API de Respuestas (client.responses.create). Consulta la documentación de la API de Respuestas de AIHubMix, y la Parte 4 tiene un ejemplo completo.


¿Deberías cambiar?

  • Sobre GPT-6 Sol hoy: Sí. Mismo precio, almacenamiento en caché más barato, resultados claramente mejores. La única fricción es que none desaparece y las herramientas ya no funcionan en Completaciones de Chat.
  • Sobre GPT-6 Astra hoy: Realiza una prueba A/B en tu propia carga de trabajo, que es exactamente lo que sugiere OpenAI. Para codificación y uso de computadoras, 6.1 Sol probablemente será lo suficientemente bueno a una quinta parte del costo o menos. Mantén los trabajos de investigación y razonamiento más difíciles en Astra.
  • Sobre GPT-6 Luna hoy: 6.1 Sol no es un reemplazo de Luna. Permanece en Luna para trabajos de alto volumen que necesiten none.

Próximo: cómo elegir entre bajo, medio, alto, muy alto y máximo.


FAQ

¿Es GPT-6.1 Sol el mismo precio que GPT-6 Sol? El precio de lista es idéntico: $2 de entrada y $10 de salida por millón de tokens. La entrada en caché es más barata en 6.1 Sol ($0.10 frente a $0.20), por lo que las cargas de trabajo de agentes que dependen en gran medida de la caché terminan costando menos.

¿Puede 6.1 Sol reemplazar completamente a GPT-6 Astra? No en todos los aspectos. Empata con Astra en DeepSWE, se queda atrás aproximadamente 2 puntos en OSWorld y cae aún más en las tareas de investigación más difíciles. Prueba ambos en tus propias tareas y enruta por tipo de tarea.

¿Por qué no hay GPT-6.1 Astra? Según informes del Wall Street Journal y otros, GPT-6.1 Astra regresó en pruebas internas de alineación y en mantenerse dentro del alcance autorizado por el usuario, por lo que OpenAI canceló su lanzamiento en octubre.

¿Cuál es el tamaño de la ventana de contexto? 1.05M tokens, con hasta 922K de entrada y 128K de salida, igual que 6 Sol. Las solicitudes con más de 272K de tokens de entrada se facturan a una tasa más alta por toda la solicitud.

¿Puedo usar 6.1 Sol en el ChatGPT regular? Aún no. Está disponible para planes de pago en ChatGPT Work y Codex. Los desarrolladores pueden llamarlo a través de la API de OpenAI o AIHubMix.

¿Necesito cambiar mi código para actualizar de 6 Sol? Si no usas none de esfuerzo y no llamas a herramientas a través de Completaciones de Chat, cambiar el nombre del modelo suele ser suficiente. De lo contrario, necesitarás pasar a la API de Respuestas. La Parte 4 tiene los detalles.


Sigue leyendo: la serie GPT-6.1 Sol


Fuentes