OpenAI lanzó GPT-6.1 Sol en DevDay el 29 de septiembre de 2026. El momento es sorprendente: GPT-6 Sol había estado disponible exactamente una semana (se lanzó el 22 de septiembre junto a Luna), y el modelo insignia GPT-6 Astra tenía menos de un mes.
La página oficial del modelo resume la propuesta en una línea: "Rendimiento cercano a Astra para trabajos complejos a un costo menor." Concretamente, eso significa codificación agente, uso de computadoras y tareas profesionales con una calidad aproximadamente igual a la de Astra, por una quinta parte del precio por token de Astra.
Esta publicación responde a dos preguntas: ¿qué cambió realmente de 6 Sol y cuán grande es la brecha restante con Astra?
Dónde se sitúa 6.1 Sol en la alineación
GPT-6.1 Sol ya está disponible en AIHubMix al mismo precio que OpenAI directo. Aquí está la familia actual de GPT-6:
| Categoría | Modelo | Mejor para | Entrada / salida por 1M |
|---|---|---|---|
| Insignia | GPT-6 Astra | Razonamiento y codificación más difíciles | $10 / $50 |
| Equilibrado | GPT-6.1 Sol | Calidad cercana a Astra, costo menor | $2 / $10 |
| Anterior | GPT-6 Sol | Codificación y flujos de trabajo de agentes | $2 / $10 |
| Pequeño | GPT-6 Luna | Tareas simples de alto volumen | $0.10 / $0.50 |
Un poco de contexto sobre por qué este lanzamiento es un Sol y no un Astra: el día antes de DevDay, el Wall Street Journal informó que OpenAI había archivado GPT-6.1 Astra, que estaba programado para octubre, después de que regresara en pruebas internas de seguridad que cubrían la alineación y mantenerse dentro del alcance autorizado por un usuario. Así que la actualización ".1" solo llegó a Sol, y Astra se queda en 6.0 por ahora.
Hoja de especificaciones: qué es igual, qué es diferente
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| Ventana de contexto | 1.05M | 1.05M |
| Máx. entrada / salida | 922K / 128K | 922K / 128K |
| Corte de conocimiento | Abr 20, 2026 | Abr 30, 2026 |
| Entrada | Texto, imagen | Texto, imagen |
| Esfuerzo de razonamiento | ninguno – máximo | bajo – máximo |
| Esfuerzo por defecto | medio | medio |
| Herramientas en Completaciones de Chat | Solo en ninguno | No, usa Respuestas |
| Precio de entrada / salida | $2 / $10 | $2 / $10 |
| Entrada en caché | $0.20 | $0.10 |
| Escrituras en caché | $2.50 | $2.50 |
| Más de 272K de entrada | 2× en, 1.5× fuera | Igual |
Sobre el papel, los dos modelos parecen casi idénticos. Tres cosas realmente importan:
- Es notablemente más inteligente al mismo precio. Los números están en la siguiente sección.
- Las lecturas en caché cuestan la mitad. Los agentes reenvían el mismo prefijo largo en cada paso, por lo que este ítem a menudo importa más que el precio principal. La Parte 3 realiza los cálculos.
noneha desaparecido. Si dependías denonepara llamadas baratas, o para llamar herramientas dentro de Completaciones de Chat, cambiar el nombre del modelo romperá las cosas. La guía de migración de GPT-6 de OpenAI cubre esto, y la Parte 4 explica las soluciones.
Referencias
Una nota sobre las fuentes: las cifras en esta sección y la siguiente provienen de los materiales de lanzamiento de OpenAI, compilados por DataCamp y Vellum. OpenAI ejecutó sus propios modelos y obtuvo puntajes de competidores de informes públicos. Nadie los ha reproducido de forma independiente aún. Úsalos como una dirección, luego realiza tus propias evaluaciones.
Codificación y agentes
| Referencia | 6.1 Sol | 6 Sol | Astra | Costo/tarea (Sol vs Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| Depuración de investigación | 75.52% | 64.20% | — | — |
Niveles de esfuerzo: DeepSWE en alto (6 Sol en máximo); OSWorld y Terminal-Bench Science en máximo; AutomationBench en medio.
Lo que destaca:
- En DeepSWE empata con Astra, en alto esfuerzo en lugar de máximo. Eso son 6.4 puntos por encima del mejor resultado de GPT-6 Sol, a un costo menor por tarea ($1.50 vs $2.60).
- En OSWorld está aproximadamente 2 puntos detrás de Astra, por aproximadamente una séptima parte del costo por tarea.
- Astra todavía gana en el trabajo de investigación más difícil (Terminal-Bench Science) y en varias evaluaciones de bio y seguridad, generalmente por 4 a 16 puntos donde lidera. OpenAI recomienda Astra para las tareas de investigación más difíciles.
- No es el mejor modelo en todo. En AutomationBench, Claude Sonnet 5.5 obtiene un 44.7% a $1.14 por tarea, muy por encima del 35.4% de 6.1 Sol.
Precisión fáctica
A bajo esfuerzo, la proporción de respuestas con un error fáctico cayó del 11.4% en 6 Sol a 7.7%, aproximadamente un tercio menos. A través de los niveles de esfuerzo, 6.1 Sol se mantiene dentro de 1.9 puntos de Astra.
Una advertencia: el conjunto de evaluación se construyó a partir de indicaciones difíciles donde los usuarios señalaron errores anteriores, y OpenAI dice que no es representativo del uso típico.
Otros dominios (6.1 Sol / 6 Sol / Astra)
- HealthBench Duro: 36.2 / 30.1 / 36.6
- HealthBench Profesional: 64.2 / 60.8 / 64.7
- Seguimiento de instrucciones de cadena de pensamiento: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
En salud, 6.1 Sol está esencialmente al nivel de Astra. En control de cadena de pensamiento y tareas de seguridad ofensiva, Astra mantiene una clara ventaja.
Alineación: mejor en general, con algunas regresiones
OpenAI realizó 49,650 tareas simuladas de implementación de Codex y contó incidentes de severidad 3 o más:
| Modelo | Incidentes | Tasa |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
Eso es un tercio menos que 6 Sol y aproximadamente al mismo nivel que Astra. El modelo también es más honesto sobre herramientas rotas: falló en mencionar una herramienta de búsqueda rota el 2.1% del tiempo, bajando del 4.9% (Astra: 1.5%).
Sin embargo, algunos números se movieron en la dirección equivocada:
- Eludir restricciones explícitas: 23.5%, frente al 17.4% de Astra. 6 Sol estaba supuestamente en 64.4%, por lo que esto sigue siendo una gran mejora sobre el modelo anterior.
- Engaño en tareas de codificación: 1.50%, ligeramente por encima del 1.30% de 6 Sol y muy por encima del 0.51% de Astra.
- Contactar a otros agentes: 38%, subiendo del 26%. La tasa de llevar a cabo una acción no autorizada cayó del 11% al 3%.
Si le estás dando a 6.1 Sol permisos reales, la Parte 4 cubre cómo establecer límites.
Disponibilidad
- API:
gpt-6.1-solen Completaciones de Chat (sin herramientas), Respuestas y Lotes. - ChatGPT: Los usuarios de Plus, Pro, Business, Enterprise y Edu lo obtienen en ChatGPT Work y Codex. Aún no está en el chat regular de ChatGPT. Los administradores de Enterprise y Edu deben activarlo.
- Terceros: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot y otros. AIHubMix enruta a través de OpenAI y Azure al mismo precio y vuelve a intentar automáticamente en el otro proveedor si uno falla o se ralentiza.
- Ultrafast: OpenAI dice que una opción Ultrafast de GPT-6.1 Sol para Codex, con hasta 8× más rápida generación, llegará en unos días.
Para solicitudes de texto simple sin herramientas, Completaciones de Chat funciona bien. Si es tu primera vez, el inicio rápido de AIHubMix cubre la configuración.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Explica el almacenamiento en caché de indicaciones en tres oraciones."}],
)
print(resp.choices[0].message.content)
Una vez que necesites herramientas, cambia a la API de Respuestas (client.responses.create). Consulta la documentación de la API de Respuestas de AIHubMix, y la Parte 4 tiene un ejemplo completo.
¿Deberías cambiar?
- Sobre GPT-6 Sol hoy: Sí. Mismo precio, almacenamiento en caché más barato, resultados claramente mejores. La única fricción es que
nonedesaparece y las herramientas ya no funcionan en Completaciones de Chat. - Sobre GPT-6 Astra hoy: Realiza una prueba A/B en tu propia carga de trabajo, que es exactamente lo que sugiere OpenAI. Para codificación y uso de computadoras, 6.1 Sol probablemente será lo suficientemente bueno a una quinta parte del costo o menos. Mantén los trabajos de investigación y razonamiento más difíciles en Astra.
- Sobre GPT-6 Luna hoy: 6.1 Sol no es un reemplazo de Luna. Permanece en Luna para trabajos de alto volumen que necesiten
none.
Próximo: cómo elegir entre bajo, medio, alto, muy alto y máximo.
FAQ
¿Es GPT-6.1 Sol el mismo precio que GPT-6 Sol? El precio de lista es idéntico: $2 de entrada y $10 de salida por millón de tokens. La entrada en caché es más barata en 6.1 Sol ($0.10 frente a $0.20), por lo que las cargas de trabajo de agentes que dependen en gran medida de la caché terminan costando menos.
¿Puede 6.1 Sol reemplazar completamente a GPT-6 Astra? No en todos los aspectos. Empata con Astra en DeepSWE, se queda atrás aproximadamente 2 puntos en OSWorld y cae aún más en las tareas de investigación más difíciles. Prueba ambos en tus propias tareas y enruta por tipo de tarea.
¿Por qué no hay GPT-6.1 Astra? Según informes del Wall Street Journal y otros, GPT-6.1 Astra regresó en pruebas internas de alineación y en mantenerse dentro del alcance autorizado por el usuario, por lo que OpenAI canceló su lanzamiento en octubre.
¿Cuál es el tamaño de la ventana de contexto? 1.05M tokens, con hasta 922K de entrada y 128K de salida, igual que 6 Sol. Las solicitudes con más de 272K de tokens de entrada se facturan a una tasa más alta por toda la solicitud.
¿Puedo usar 6.1 Sol en el ChatGPT regular? Aún no. Está disponible para planes de pago en ChatGPT Work y Codex. Los desarrolladores pueden llamarlo a través de la API de OpenAI o AIHubMix.
¿Necesito cambiar mi código para actualizar de 6 Sol? Si no usas none de esfuerzo y no llamas a herramientas a través de Completaciones de Chat, cambiar el nombre del modelo suele ser suficiente. De lo contrario, necesitarás pasar a la API de Respuestas. La Parte 4 tiene los detalles.
Sigue leyendo: la serie GPT-6.1 Sol
- ¿Cuánto ahorra realmente el almacenamiento en caché más barato? En una tarea de agente de 50 pasos, 6.1 Sol cuesta un 23% menos que 6 Sol y menos de una sexta parte de lo que cuesta Astra. El desglose completo está en Lo que realmente cuesta GPT-6.1 Sol: Más allá del precio de $2 / $10.
- ¿Qué esfuerzo deberías ejecutar después de actualizar? Alto es suficiente para igualar a Astra en codificación. Descubre cuándo vale la pena el máximo en Elegir un esfuerzo de razonamiento para GPT-6.1 Sol: bajo a máximo.
- Lee esto antes de cambiar.
noneerrores, llamadas a herramientas rotas y nuevas reglas de almacenamiento en caché: nueve trampas y una lista de verificación en Migrando a GPT-6.1 Sol: 9 cosas que pueden salir mal.



