Eligiendo un Esfuerzo de Razonamiento para GPT-6.1 Sol: bajo a máximo

AIHubMix6 min de lectura
Eligiendo un Esfuerzo de Razonamiento para GPT-6.1 Sol: bajo a máximo

GPT-6.1 Sol tiene cinco niveles de esfuerzo de razonamiento: bajo, medio (el predeterminado), alto, xalto, y máximo. El gran cambio respecto a GPT-6 Sol es que ninguno y mínimo han desaparecido, por lo que bajo ahora es el mínimo.

Esta única configuración afecta tanto la latencia como el costo. Nunca ves los tokens de razonamiento, pero pagas por ellos a la tarifa de salida ($10 por millón para 6.1 Sol en AIHubMix), y ocupan espacio en la ventana de contexto. Elegir el nivel incorrecto puede hacer que pagues varias veces más de lo que necesitas.


Para qué sirve cada nivel

Esta tabla combina las descripciones de OpenAI del guía de razonamiento con nuestras propias recomendaciones:

NivelDescripción de OpenAIBuena opciónMala opción
bajoRazonamiento eficiente con un aumento modesto en la latenciaPasos intermedios en bucles de herramientas, búsqueda, planificación ligera, clasificación, extracción, respuestas de soporteDepuración difícil, refactorizaciones de múltiples archivos
medio (predeterminado)El predeterminado equilibrado para la mayoría de las cargas de trabajoCodificación diaria, revisión de código, escritura, tareas típicas de agentesUso interactivo crítico en latencia
altoRazonamiento difícil, depuración compleja, planificación profundaErrores complicados, trabajo de arquitectura, tareas al estilo SWETráfico en línea de alta QPS
xaltoInvestigación profunda, trabajo asíncrono, ejecuciones largas de agentesTrabajos en segundo plano, informes de investigaciónCualquier cosa que tus evaluaciones no hayan justificado
máximoRazonamiento máximo para las tareas más difícilesUso de computadoras, problemas de grado de investigación, trabajo pesado fuera de líneaCasi todas las solicitudes diarias

OpenAI llama al esfuerzo "una perilla de ajuste, no la forma principal de recuperar calidad." Cuando los resultados son malos, mira primero el aviso, las definiciones de herramientas y el contexto. Aumenta el esfuerzo solo después de eso.


Lo que dicen los benchmarks sobre cada nivel

Estos son los propios números de OpenAI, compilados por Vellum y DataCamp. Trátalos como una guía, no como un evangelio.

Para codificación, alto suele ser suficiente. En DeepSWE v1.1, 6.1 Sol en alto obtiene 75.2, igualando a Astra en alto (74.8), por alrededor de $1.50 por tarea. Su curva de costo alcanza entre el 72% y el 75% por entre $0.50 y $1.50 por tarea. GPT-6 Sol alcanzó un máximo de 68.8 por alrededor de $2.60.

Superar el medio no siempre ayuda. En AutomationBench, 6.1 Sol obtiene 35.4% en medio y solo alrededor de 36.0% en esfuerzo más alto. Para la automatización empresarial, los tokens de razonamiento adicionales compraron casi nada.

Reserva el máximo para uso de computadoras e investigación. En OSWorld 2.0, el máximo obtiene 71.4 a alrededor de $1.30 por tarea. Terminal-Bench Science en máximo cuesta $5.47 por tarea: mucho más barato que los $23.80 de Astra, pero un orden de magnitud por encima de la mayoría de las otras cargas de trabajo.

El bajo también mejoró. La tasa de error fáctico en bajo cayó del 11.4% en 6 Sol al 7.7%. Si aumentaste las tareas a medio en 6 Sol porque bajo no era lo suficientemente preciso, prueba bajo nuevamente.


Puntos de partida por caso de uso

Caso de usoComenzar enNotas
Llamadas que usaron ninguno en 6 SolbajoMapeo oficial de OpenAI. Si la latencia es crítica, considera GPT-6 Luna, que aún admite ninguno
Llamadas que usaron mínimobajoComienza en bajo y compara resultados
Chatbots, soporte al clientebajoPide al modelo una introducción de una línea para obtener el primer token más rápido
RAG Q&Abajo → medioLa calidad de recuperación importa más que el esfuerzo
Asistente de codificación IDEmedioEl predeterminado funciona
Corrección automática de errores, agentes SWEaltoDeepSWE muestra que alto ya iguala a Astra
Uso de computadoras, agentes de navegadoralto → máximoOSWorld alcanza su punto máximo en máximo
Investigación de fondo, ejecuciones largasxaltoSolo cuando las evaluaciones muestran una ganancia. El procesamiento por lotes reduce a la mitad el costo si no necesitas resultados de inmediato
Los problemas de investigación más difícilesmáximo, o simplemente usa AstraOpenAI también recomienda Astra aquí

Los mapeos de ninguno y mínimo provienen de la guía de migración de GPT-6 de OpenAI.


Cambiar el esfuerzo a mitad de conversación

Un patrón común es planificar en alto, ejecutar en bajo y volver a alto cuando algo falla.

El truco: editar reasoning.effort en la solicitud rompe tu caché de aviso. El esfuerzo es parte del prefijo en caché (ver la guía de caché de aviso). En 6.1 Sol, una lectura de caché cuesta $0.10 por millón de tokens, mientras que reescribir la caché cuesta $2.50. Esa es una diferencia de 25×.

La familia GPT-6 soluciona esto con un elemento de entrada configuration_update. Deja el reasoning.effort a nivel de solicitud sin cambios y inserta una actualización antes del siguiente mensaje del usuario. Así es como se ve a través de la API de Respuestas de AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Turno 1: planificar en alto esfuerzo
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},
    input="Descubre por qué las pruebas de este repositorio están fallando y propone un plan de solución.",
)

# Turno 2: bajar a bajo para la ejecución, sin tocar el esfuerzo a nivel de solicitud
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},           # sin cambios, por lo que la caché sobrevive
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "bajo"}},
        {"role": "user", "content": "Lleva a cabo el paso 1 del plan."},
    ],
)
La forma de configuration_update anterior es ilustrativa. Consulta la guía de razonamiento de OpenAI para el esquema exacto. La documentación de Respuestas de AIHubMix actualmente enumera cuatro niveles (mínimo a alto), así que envía una pequeña solicitud de prueba para confirmar que xalto, máximo y configuration_update se transmiten.

Algunos límites a tener en cuenta:

  • Solo funciona en modo estándar de un solo agente, y solo cambia el esfuerzo.
  • No pueden haber dos actualizaciones una al lado de la otra.
  • No se mezcla con la compactación automática o la truncación. La compactación explícita está bien, pero añade una nueva actualización después.
  • El campo reasoning.effort de la respuesta aún muestra el valor a nivel de solicitud, así que no leas demasiado en ello.

Configuraciones que van con el esfuerzo

Deja espacio en max_output_tokens. El límite incluye tokens de razonamiento. Si lo estableces demasiado bajo, el modelo puede detenerse antes de producir texto visible. Obtienes status: incomplete y aún pagas por la entrada y el razonamiento. OpenAI sugiere reservar al menos 25,000 tokens para comenzar, y más para xalto o máximo.

Rastrea los tokens de razonamiento. Están en usage.output_tokens_details.reasoning_tokens. Mirar la distribución por nivel de esfuerzo supera la afinación por intuición.

Activa resúmenes si necesitas visibilidad. reasoning.summary: "auto" devuelve un resumen del razonamiento del modelo (puedes necesitar verificar tu organización primero). El razonamiento en bruto nunca se expone.

El modo pro es un interruptor separado. Hace que el modelo realice más trabajo, facturado a tarifas estándar pero con más tokens en general. Úsalo para problemas difíciles donde una latencia adicional es aceptable.


Un proceso de ajuste que realmente puedes ejecutar

  1. Reúne de 20 a 50 tareas reales en un conjunto de evaluación.
  2. Ejecuta una línea base en medio. Registra la tasa de éxito, el promedio de tokens de razonamiento y la latencia P95.
  3. Prueba bajo. Si el éxito apenas disminuye, cambia.
  4. Prueba alto. Si el éxito mejora claramente, usa alto solo para ese tipo de tarea.
  5. Solo busca xalto o máximo cuando alto no sea suficiente, y compara con GPT-6 Astra en alto mientras lo haces. A veces, un modelo más grande supera a un mayor esfuerzo. En AIHubMix, eso es solo un cambio en el parámetro model, y la lista de modelos muestra lo que está disponible.
  6. Dirige por tipo de tarea en lugar de usar una configuración global.

La versión corta: comienza en medio, ahorra dinero con bajo, usa alto para codificación, y haz que xalto y máximo se demuestren en tus evaluaciones.

Próximo: lo que realmente significa la etiqueta de precio de $2 / $10 una vez que entran en juego la caché, el contexto largo y los multiplicadores de facturación.


FAQ

¿Cuál es el esfuerzo de razonamiento predeterminado para GPT-6.1 Sol? medio. Si no lo estableces, eso es lo que obtienes.

¿Por qué ninguno devuelve un error? 6.1 Sol no admite ninguno o mínimo. OpenAI recomienda cambiar a bajo. Si realmente necesitas ninguno, mantente en GPT-6 Sol o GPT-6 Luna.

¿Cómo se facturan los tokens de razonamiento? A la tarifa de salida ($10 por millón para 6.1 Sol), y cuentan contra la ventana de contexto. Consulta usage.output_tokens_details.reasoning_tokens para los números reales.

¿Es el nombre del parámetro el mismo en Chat Completions y Responses? No. Chat Completions utiliza un reasoning_effort a nivel superior. Responses utiliza un reasoning: {"effort": ...} anidado. Mezclarlos devuelve Unsupported parameter.

¿El esfuerzo más alto siempre da mejores resultados? No. En AutomationBench, superar el medio solo movió la puntuación del 35.4% a alrededor del 36.0%, mientras que costó notablemente más. Prueba en tus propias tareas.

¿Puedo cambiar el esfuerzo a mitad de conversación? Sí. Usa un elemento configuration_update y deja el reasoning.effort a nivel de solicitud sin cambios para que la caché de aviso permanezca válida. No funciona con compactación automática o truncación.

¿Por qué obtuve status: incomplete sin salida? Lo más probable es que max_output_tokens fuera demasiado bajo y el razonamiento lo haya utilizado todo. OpenAI recomienda reservar al menos 25,000 tokens.


Sigue leyendo: la serie GPT-6.1 Sol


Fuentes