O GPT-6.1 Sol possui cinco níveis de esforço de raciocínio: baixo, médio (o padrão), alto, xalto e máximo. A grande mudança em relação ao GPT-6 Sol é que nenhum e mínimo foram removidos, então baixo agora é o piso.
Essa única configuração influencia tanto a latência quanto o custo. Você nunca vê os tokens de raciocínio, mas paga por eles na taxa de saída (US$10 por milhão para o 6.1 Sol no AIHubMix), e eles ocupam espaço na janela de contexto. Escolher o nível errado pode fazer você pagar várias vezes mais do que precisa.
Para que serve cada nível
Esta tabela combina as descrições da OpenAI do guia de raciocínio com nossas próprias recomendações:
| Nível | Descrição da OpenAI | Bom ajuste | Ajuste ruim |
|---|---|---|---|
| baixo | Raciocínio eficiente com um modesto aumento de latência | Passos intermediários em loops de ferramentas, pesquisa, planejamento leve, classificação, extração, respostas de suporte | Depuração difícil, refatorações em múltiplos arquivos |
| médio (padrão) | O padrão equilibrado para a maioria das cargas de trabalho | Codificação cotidiana, revisão de código, escrita, tarefas típicas de agentes | Uso interativo crítico em latência |
| alto | Raciocínio difícil, depuração complexa, planejamento profundo | Bugs complicados, trabalho de arquitetura, tarefas no estilo SWE | Tráfego online de alta QPS |
| xalto | Pesquisa profunda, trabalho assíncrono, longas execuções de agentes | Trabalhos em segundo plano, relatórios de pesquisa | Qualquer coisa que suas avaliações não tenham justificado |
| máximo | Raciocínio máximo para as tarefas mais difíceis | Uso de computador, problemas de nível de pesquisa, trabalho pesado offline | Quase todos os pedidos do dia a dia |
A OpenAI chama o esforço de "um botão de ajuste, não a principal maneira de recuperar qualidade." Quando os resultados são ruins, olhe primeiro para o prompt, as definições de ferramentas e o contexto. Aumente o esforço apenas depois disso.
O que os benchmarks dizem sobre cada nível
Estes são os próprios números da OpenAI, compilados por Vellum e DataCamp. Trate-os como um guia, não como um evangelho.
Para codificação, alto geralmente é suficiente. No DeepSWE v1.1, o 6.1 Sol em alto pontua 75.2, igualando o Astra em alto (74.8), por cerca de US$1.50 por tarefa. Sua curva de custo atinge 72% a 75% por entre US$0.50 e US$1.50 por tarefa. O GPT-6 Sol teve um máximo de 68.8 por cerca de US$2.60.
Subir acima de médio nem sempre ajuda. No AutomationBench, o 6.1 Sol pontua 35.4% em médio e apenas cerca de 36.0% em esforço mais alto. Para automação de negócios, os tokens de raciocínio extras não trouxeram quase nada.
Reserve o máximo para uso de computador e pesquisa. No OSWorld 2.0, o máximo obtém 71.4 a cerca de US$1.30 por tarefa. O Terminal-Bench Science no máximo custa US$5.47 por tarefa: muito mais barato que os US$23.80 do Astra, mas uma ordem de magnitude acima da maioria das outras cargas de trabalho.
O baixo também melhorou. A taxa de erro factual em baixo caiu de 11.4% no 6 Sol para 7.7%. Se você aumentou as tarefas para médio no 6 Sol porque o baixo não era preciso o suficiente, tente o baixo novamente.
Pontos de partida por caso de uso
| Caso de uso | Comece em | Notas |
|---|---|---|
| Chamadas que usaram nenhum no 6 Sol | baixo | Mapeamento oficial da OpenAI. Se a latência for crítica, considere o GPT-6 Luna, que ainda suporta nenhum |
| Chamadas que usaram mínimo | baixo | Comece em baixo e compare os resultados |
| Chatbots, suporte ao cliente | baixo | Peça ao modelo uma introdução de uma linha para obter o primeiro token mais rápido |
| RAG Q&A | baixo → médio | A qualidade da recuperação importa mais do que o esforço |
| Assistente de codificação IDE | médio | O padrão funciona |
| Correção automática de bugs, agentes SWE | alto | DeepSWE mostra que alto já iguala o Astra |
| Uso de computador, agentes de navegador | alto → máximo | O OSWorld atinge o pico no máximo |
| Pesquisa de fundo, longas execuções | xalto | Apenas quando as avaliações mostram um ganho. O lote reduz pela metade o custo se você não precisar de resultados imediatamente |
| Os problemas de pesquisa mais difíceis | máximo, ou apenas use o Astra | A OpenAI recomenda o Astra aqui também |
Os mapeamentos de nenhum e mínimo vem do guia de migração do GPT-6 da OpenAI.
Mudando o esforço no meio da conversa
Um padrão comum é planejar em alto, executar em baixo e voltar para alto quando algo falha.
A pegadinha: editar reasoning.effort na solicitação quebra o cache do seu prompt. O esforço é parte do prefixo em cache (veja o guia de cache de prompt). No 6.1 Sol, uma leitura de cache custa US$0.10 por milhão de tokens, enquanto reescrever o cache custa US$2.50. Essa é uma diferença de 25×.
A família GPT-6 corrige isso com um item de entrada configuration_update. Mantenha o reasoning.effort no nível da solicitação inalterado e insira uma atualização antes da próxima mensagem do usuário. Veja como isso se parece através da API de Respostas do AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Turno 1: planejar em alto esforço
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"},
input="Descubra por que os testes deste repositório estão falhando e proponha um plano de correção.",
)
# Turno 2: cair para baixo para execução, sem tocar no esforço de nível de solicitação
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"}, # inalterado, para que o cache sobreviva
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "baixo"}},
{"role": "user", "content": "Execute o passo 1 do plano."},
],
)
O formato deconfiguration_updateacima é ilustrativo. Verifique o guia de raciocínio da OpenAI para o esquema exato. A documentação de Respostas do AIHubMix atualmente lista quatro níveis (mínimo a alto), então envie uma pequena solicitação de teste para confirmar quexalto,máximoeconfiguration_updatepassam.
Alguns limites a serem conhecidos:
- Funciona apenas no modo padrão de agente único e apenas altera o esforço.
- Duas atualizações não podem ficar lado a lado.
- Não se mistura com compactação ou truncamento automáticos. A compactação explícita é aceitável, mas adicione uma nova atualização depois.
- O campo
reasoning.effortda resposta ainda mostra o valor do nível da solicitação, então não leia muito nisso.
Configurações que acompanham o esforço
Deixe espaço em max_output_tokens. O limite inclui tokens de raciocínio. Se você definir muito baixo, o modelo pode parar antes de produzir qualquer texto visível. Você recebe status: incomplete e ainda paga por entrada e raciocínio. A OpenAI sugere reservar pelo menos 25.000 tokens para começar, e mais para xalto ou máximo.
Rastreie tokens de raciocínio. Eles estão em usage.output_tokens_details.reasoning_tokens. Olhar para a distribuição por nível de esforço é melhor do que ajustar por intuição.
Ative resumos se precisar de visibilidade. reasoning.summary: "auto" retorna um resumo do raciocínio do modelo (você pode precisar verificar sua organização primeiro). O raciocínio bruto nunca é exposto.
O modo pro é um interruptor separado. Ele faz o modelo trabalhar mais, cobrado nas taxas padrão, mas com mais tokens no total. Use-o para problemas difíceis onde uma latência extra é aceitável.
Um processo de ajuste que você pode realmente executar
- Reúna de 20 a 50 tarefas reais em um conjunto de avaliação.
- Execute uma linha de base em
médio. Registre a taxa de sucesso, tokens de raciocínio médios e latência P95. - Tente
baixo. Se o sucesso cair pouco, mude. - Tente
alto. Se o sucesso melhorar claramente, use alto apenas para esse tipo de tarefa. - Somente busque
xaltooumáximoquando alto não for suficiente e compare com o GPT-6 Astra em alto enquanto estiver nisso. Às vezes, um modelo maior supera mais esforço. No AIHubMix, isso é apenas uma mudança no parâmetromodel, e a lista de modelos mostra o que está disponível. - Roteie por tipo de tarefa em vez de usar uma configuração global única.
A versão curta: comece em médio, economize dinheiro com baixo, use alto para codificação e faça xalto e máximo se provarem seu valor em suas avaliações.
Próximo: o que a etiqueta de preço de US$2 / US$10 realmente significa uma vez que o cache, o longo contexto e os multiplicadores de cobrança entram em jogo.
FAQ
Qual é o esforço de raciocínio padrão para o GPT-6.1 Sol? médio. Se você não configurá-lo, é isso que você recebe.
Por que nenhum retorna um erro? O 6.1 Sol não suporta nenhum ou mínimo. A OpenAI recomenda mudar para baixo. Se você realmente precisar de nenhum, permaneça no GPT-6 Sol ou GPT-6 Luna.
Como os tokens de raciocínio são cobrados? Na taxa de saída (US$10 por milhão para 6.1 Sol), e eles contam contra a janela de contexto. Verifique usage.output_tokens_details.reasoning_tokens para os números reais.
O nome do parâmetro é o mesmo em Chat Completions e Responses? Não. Chat Completions usa um reasoning_effort de nível superior. Responses usa um reasoning: {"effort": ...} aninhado. Misturá-los retorna Unsupported parameter.
Um esforço maior sempre dá melhores resultados? Não. No AutomationBench, subir acima de médio apenas moveu a pontuação de 35.4% para cerca de 36.0%, enquanto custava visivelmente mais. Teste em suas próprias tarefas.
Posso mudar o esforço no meio de uma conversa? Sim. Use um item de configuration_update e mantenha o reasoning.effort de nível de solicitação inalterado para que o cache do prompt permaneça válido. Não funciona com compactação ou truncamento automáticos.
Por que recebi status: incomplete sem saída? Provavelmente max_output_tokens estava muito baixo e o raciocínio usou tudo. A OpenAI recomenda reservar pelo menos 25.000 tokens.
Continue lendo: a série GPT-6.1 Sol
- Quanto da sua conta é raciocínio? O esforço é apenas uma alavanca. O cache, o limite de 272K e os descontos de lote moldam o número final. Veja O que o GPT-6.1 Sol realmente custa: Além da etiqueta de preço de US$2 / US$10.
- Código que usou
nenhum? Mudar parabaixoé apenas o começo. Chamadas de ferramentas, parâmetros de amostragem e configurações de cache também precisam de mudanças: Migrando para o GPT-6.1 Sol: 9 Coisas que Podem Dar Errado. - Quão melhor é o 6.1 Sol do que o 6 Sol e o Astra? Especificações e benchmarks lado a lado em GPT-6.1 Sol vs GPT-6 Sol: Uma Atualização de Uma Semana que Quase Alcança o Astra.



