GPT-6.1 Sol tiene cinco niveles de esfuerzo de razonamiento: bajo, medio (el predeterminado), alto, xalto, y máximo. El gran cambio respecto a GPT-6 Sol es que ninguno y mínimo han desaparecido, por lo que bajo ahora es el mínimo.
Esta única configuración afecta tanto la latencia como el costo. Nunca ves los tokens de razonamiento, pero pagas por ellos a la tarifa de salida ($10 por millón para 6.1 Sol en AIHubMix), y ocupan espacio en la ventana de contexto. Elegir el nivel incorrecto puede hacer que pagues varias veces más de lo que necesitas.
Para qué sirve cada nivel
Esta tabla combina las descripciones de OpenAI del guía de razonamiento con nuestras propias recomendaciones:
| Nivel | Descripción de OpenAI | Buena opción | Mala opción |
|---|---|---|---|
| bajo | Razonamiento eficiente con un aumento modesto en la latencia | Pasos intermedios en bucles de herramientas, búsqueda, planificación ligera, clasificación, extracción, respuestas de soporte | Depuración difícil, refactorizaciones de múltiples archivos |
| medio (predeterminado) | El predeterminado equilibrado para la mayoría de las cargas de trabajo | Codificación diaria, revisión de código, escritura, tareas típicas de agentes | Uso interactivo crítico en latencia |
| alto | Razonamiento difícil, depuración compleja, planificación profunda | Errores complicados, trabajo de arquitectura, tareas al estilo SWE | Tráfico en línea de alta QPS |
| xalto | Investigación profunda, trabajo asíncrono, ejecuciones largas de agentes | Trabajos en segundo plano, informes de investigación | Cualquier cosa que tus evaluaciones no hayan justificado |
| máximo | Razonamiento máximo para las tareas más difíciles | Uso de computadoras, problemas de grado de investigación, trabajo pesado fuera de línea | Casi todas las solicitudes diarias |
OpenAI llama al esfuerzo "una perilla de ajuste, no la forma principal de recuperar calidad." Cuando los resultados son malos, mira primero el aviso, las definiciones de herramientas y el contexto. Aumenta el esfuerzo solo después de eso.
Lo que dicen los benchmarks sobre cada nivel
Estos son los propios números de OpenAI, compilados por Vellum y DataCamp. Trátalos como una guía, no como un evangelio.
Para codificación, alto suele ser suficiente. En DeepSWE v1.1, 6.1 Sol en alto obtiene 75.2, igualando a Astra en alto (74.8), por alrededor de $1.50 por tarea. Su curva de costo alcanza entre el 72% y el 75% por entre $0.50 y $1.50 por tarea. GPT-6 Sol alcanzó un máximo de 68.8 por alrededor de $2.60.
Superar el medio no siempre ayuda. En AutomationBench, 6.1 Sol obtiene 35.4% en medio y solo alrededor de 36.0% en esfuerzo más alto. Para la automatización empresarial, los tokens de razonamiento adicionales compraron casi nada.
Reserva el máximo para uso de computadoras e investigación. En OSWorld 2.0, el máximo obtiene 71.4 a alrededor de $1.30 por tarea. Terminal-Bench Science en máximo cuesta $5.47 por tarea: mucho más barato que los $23.80 de Astra, pero un orden de magnitud por encima de la mayoría de las otras cargas de trabajo.
El bajo también mejoró. La tasa de error fáctico en bajo cayó del 11.4% en 6 Sol al 7.7%. Si aumentaste las tareas a medio en 6 Sol porque bajo no era lo suficientemente preciso, prueba bajo nuevamente.
Puntos de partida por caso de uso
| Caso de uso | Comenzar en | Notas |
|---|---|---|
| Llamadas que usaron ninguno en 6 Sol | bajo | Mapeo oficial de OpenAI. Si la latencia es crítica, considera GPT-6 Luna, que aún admite ninguno |
| Llamadas que usaron mínimo | bajo | Comienza en bajo y compara resultados |
| Chatbots, soporte al cliente | bajo | Pide al modelo una introducción de una línea para obtener el primer token más rápido |
| RAG Q&A | bajo → medio | La calidad de recuperación importa más que el esfuerzo |
| Asistente de codificación IDE | medio | El predeterminado funciona |
| Corrección automática de errores, agentes SWE | alto | DeepSWE muestra que alto ya iguala a Astra |
| Uso de computadoras, agentes de navegador | alto → máximo | OSWorld alcanza su punto máximo en máximo |
| Investigación de fondo, ejecuciones largas | xalto | Solo cuando las evaluaciones muestran una ganancia. El procesamiento por lotes reduce a la mitad el costo si no necesitas resultados de inmediato |
| Los problemas de investigación más difíciles | máximo, o simplemente usa Astra | OpenAI también recomienda Astra aquí |
Los mapeos de ninguno y mínimo provienen de la guía de migración de GPT-6 de OpenAI.
Cambiar el esfuerzo a mitad de conversación
Un patrón común es planificar en alto, ejecutar en bajo y volver a alto cuando algo falla.
El truco: editar reasoning.effort en la solicitud rompe tu caché de aviso. El esfuerzo es parte del prefijo en caché (ver la guía de caché de aviso). En 6.1 Sol, una lectura de caché cuesta $0.10 por millón de tokens, mientras que reescribir la caché cuesta $2.50. Esa es una diferencia de 25×.
La familia GPT-6 soluciona esto con un elemento de entrada configuration_update. Deja el reasoning.effort a nivel de solicitud sin cambios y inserta una actualización antes del siguiente mensaje del usuario. Así es como se ve a través de la API de Respuestas de AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Turno 1: planificar en alto esfuerzo
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"},
input="Descubre por qué las pruebas de este repositorio están fallando y propone un plan de solución.",
)
# Turno 2: bajar a bajo para la ejecución, sin tocar el esfuerzo a nivel de solicitud
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"}, # sin cambios, por lo que la caché sobrevive
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "bajo"}},
{"role": "user", "content": "Lleva a cabo el paso 1 del plan."},
],
)
La forma deconfiguration_updateanterior es ilustrativa. Consulta la guía de razonamiento de OpenAI para el esquema exacto. La documentación de Respuestas de AIHubMix actualmente enumera cuatro niveles (mínimo a alto), así que envía una pequeña solicitud de prueba para confirmar quexalto,máximoyconfiguration_updatese transmiten.
Algunos límites a tener en cuenta:
- Solo funciona en modo estándar de un solo agente, y solo cambia el esfuerzo.
- No pueden haber dos actualizaciones una al lado de la otra.
- No se mezcla con la compactación automática o la truncación. La compactación explícita está bien, pero añade una nueva actualización después.
- El campo
reasoning.effortde la respuesta aún muestra el valor a nivel de solicitud, así que no leas demasiado en ello.
Configuraciones que van con el esfuerzo
Deja espacio en max_output_tokens. El límite incluye tokens de razonamiento. Si lo estableces demasiado bajo, el modelo puede detenerse antes de producir texto visible. Obtienes status: incomplete y aún pagas por la entrada y el razonamiento. OpenAI sugiere reservar al menos 25,000 tokens para comenzar, y más para xalto o máximo.
Rastrea los tokens de razonamiento. Están en usage.output_tokens_details.reasoning_tokens. Mirar la distribución por nivel de esfuerzo supera la afinación por intuición.
Activa resúmenes si necesitas visibilidad. reasoning.summary: "auto" devuelve un resumen del razonamiento del modelo (puedes necesitar verificar tu organización primero). El razonamiento en bruto nunca se expone.
El modo pro es un interruptor separado. Hace que el modelo realice más trabajo, facturado a tarifas estándar pero con más tokens en general. Úsalo para problemas difíciles donde una latencia adicional es aceptable.
Un proceso de ajuste que realmente puedes ejecutar
- Reúne de 20 a 50 tareas reales en un conjunto de evaluación.
- Ejecuta una línea base en
medio. Registra la tasa de éxito, el promedio de tokens de razonamiento y la latencia P95. - Prueba
bajo. Si el éxito apenas disminuye, cambia. - Prueba
alto. Si el éxito mejora claramente, usa alto solo para ese tipo de tarea. - Solo busca
xaltoomáximocuando alto no sea suficiente, y compara con GPT-6 Astra en alto mientras lo haces. A veces, un modelo más grande supera a un mayor esfuerzo. En AIHubMix, eso es solo un cambio en el parámetromodel, y la lista de modelos muestra lo que está disponible. - Dirige por tipo de tarea en lugar de usar una configuración global.
La versión corta: comienza en medio, ahorra dinero con bajo, usa alto para codificación, y haz que xalto y máximo se demuestren en tus evaluaciones.
Próximo: lo que realmente significa la etiqueta de precio de $2 / $10 una vez que entran en juego la caché, el contexto largo y los multiplicadores de facturación.
FAQ
¿Cuál es el esfuerzo de razonamiento predeterminado para GPT-6.1 Sol? medio. Si no lo estableces, eso es lo que obtienes.
¿Por qué ninguno devuelve un error? 6.1 Sol no admite ninguno o mínimo. OpenAI recomienda cambiar a bajo. Si realmente necesitas ninguno, mantente en GPT-6 Sol o GPT-6 Luna.
¿Cómo se facturan los tokens de razonamiento? A la tarifa de salida ($10 por millón para 6.1 Sol), y cuentan contra la ventana de contexto. Consulta usage.output_tokens_details.reasoning_tokens para los números reales.
¿Es el nombre del parámetro el mismo en Chat Completions y Responses? No. Chat Completions utiliza un reasoning_effort a nivel superior. Responses utiliza un reasoning: {"effort": ...} anidado. Mezclarlos devuelve Unsupported parameter.
¿El esfuerzo más alto siempre da mejores resultados? No. En AutomationBench, superar el medio solo movió la puntuación del 35.4% a alrededor del 36.0%, mientras que costó notablemente más. Prueba en tus propias tareas.
¿Puedo cambiar el esfuerzo a mitad de conversación? Sí. Usa un elemento configuration_update y deja el reasoning.effort a nivel de solicitud sin cambios para que la caché de aviso permanezca válida. No funciona con compactación automática o truncación.
¿Por qué obtuve status: incomplete sin salida? Lo más probable es que max_output_tokens fuera demasiado bajo y el razonamiento lo haya utilizado todo. OpenAI recomienda reservar al menos 25,000 tokens.
Sigue leyendo: la serie GPT-6.1 Sol
- ¿Cuánto de tu factura es razonamiento? El esfuerzo es solo una palanca. La caché, el umbral de 272K y los descuentos por lotes moldean el número final. Consulta Lo que realmente cuesta GPT-6.1 Sol: Más allá de la etiqueta de precio de $2 / $10.
- ¿Código que usó
ninguno? Cambiar abajoes solo el comienzo. Las llamadas a herramientas, parámetros de muestreo y configuraciones de caché también necesitan cambios: Migrando a GPT-6.1 Sol: 9 cosas que pueden salir mal. - ¿Cuánto mejor es 6.1 Sol que 6 Sol y Astra? Especificaciones y benchmarks lado a lado en GPT-6.1 Sol vs GPT-6 Sol: Una actualización de una semana que casi alcanza a Astra.



