Escolhendo um Nível de Esforço de Raciocínio para o GPT-6.1 Sol: baixo a máximo

AIHubMix6 min de leitura
Escolhendo um Nível de Esforço de Raciocínio para o GPT-6.1 Sol: baixo a máximo

O GPT-6.1 Sol possui cinco níveis de esforço de raciocínio: baixo, médio (o padrão), alto, xalto e máximo. A grande mudança em relação ao GPT-6 Sol é que nenhum e mínimo foram removidos, então baixo agora é o piso.

Essa única configuração influencia tanto a latência quanto o custo. Você nunca vê os tokens de raciocínio, mas paga por eles na taxa de saída (US$10 por milhão para o 6.1 Sol no AIHubMix), e eles ocupam espaço na janela de contexto. Escolher o nível errado pode fazer você pagar várias vezes mais do que precisa.


Para que serve cada nível

Esta tabela combina as descrições da OpenAI do guia de raciocínio com nossas próprias recomendações:

NívelDescrição da OpenAIBom ajusteAjuste ruim
baixoRaciocínio eficiente com um modesto aumento de latênciaPassos intermediários em loops de ferramentas, pesquisa, planejamento leve, classificação, extração, respostas de suporteDepuração difícil, refatorações em múltiplos arquivos
médio (padrão)O padrão equilibrado para a maioria das cargas de trabalhoCodificação cotidiana, revisão de código, escrita, tarefas típicas de agentesUso interativo crítico em latência
altoRaciocínio difícil, depuração complexa, planejamento profundoBugs complicados, trabalho de arquitetura, tarefas no estilo SWETráfego online de alta QPS
xaltoPesquisa profunda, trabalho assíncrono, longas execuções de agentesTrabalhos em segundo plano, relatórios de pesquisaQualquer coisa que suas avaliações não tenham justificado
máximoRaciocínio máximo para as tarefas mais difíceisUso de computador, problemas de nível de pesquisa, trabalho pesado offlineQuase todos os pedidos do dia a dia

A OpenAI chama o esforço de "um botão de ajuste, não a principal maneira de recuperar qualidade." Quando os resultados são ruins, olhe primeiro para o prompt, as definições de ferramentas e o contexto. Aumente o esforço apenas depois disso.


O que os benchmarks dizem sobre cada nível

Estes são os próprios números da OpenAI, compilados por Vellum e DataCamp. Trate-os como um guia, não como um evangelho.

Para codificação, alto geralmente é suficiente. No DeepSWE v1.1, o 6.1 Sol em alto pontua 75.2, igualando o Astra em alto (74.8), por cerca de US$1.50 por tarefa. Sua curva de custo atinge 72% a 75% por entre US$0.50 e US$1.50 por tarefa. O GPT-6 Sol teve um máximo de 68.8 por cerca de US$2.60.

Subir acima de médio nem sempre ajuda. No AutomationBench, o 6.1 Sol pontua 35.4% em médio e apenas cerca de 36.0% em esforço mais alto. Para automação de negócios, os tokens de raciocínio extras não trouxeram quase nada.

Reserve o máximo para uso de computador e pesquisa. No OSWorld 2.0, o máximo obtém 71.4 a cerca de US$1.30 por tarefa. O Terminal-Bench Science no máximo custa US$5.47 por tarefa: muito mais barato que os US$23.80 do Astra, mas uma ordem de magnitude acima da maioria das outras cargas de trabalho.

O baixo também melhorou. A taxa de erro factual em baixo caiu de 11.4% no 6 Sol para 7.7%. Se você aumentou as tarefas para médio no 6 Sol porque o baixo não era preciso o suficiente, tente o baixo novamente.


Pontos de partida por caso de uso

Caso de usoComece emNotas
Chamadas que usaram nenhum no 6 SolbaixoMapeamento oficial da OpenAI. Se a latência for crítica, considere o GPT-6 Luna, que ainda suporta nenhum
Chamadas que usaram mínimobaixoComece em baixo e compare os resultados
Chatbots, suporte ao clientebaixoPeça ao modelo uma introdução de uma linha para obter o primeiro token mais rápido
RAG Q&Abaixo → médioA qualidade da recuperação importa mais do que o esforço
Assistente de codificação IDEmédioO padrão funciona
Correção automática de bugs, agentes SWEaltoDeepSWE mostra que alto já iguala o Astra
Uso de computador, agentes de navegadoralto → máximoO OSWorld atinge o pico no máximo
Pesquisa de fundo, longas execuçõesxaltoApenas quando as avaliações mostram um ganho. O lote reduz pela metade o custo se você não precisar de resultados imediatamente
Os problemas de pesquisa mais difíceismáximo, ou apenas use o AstraA OpenAI recomenda o Astra aqui também

Os mapeamentos de nenhum e mínimo vem do guia de migração do GPT-6 da OpenAI.


Mudando o esforço no meio da conversa

Um padrão comum é planejar em alto, executar em baixo e voltar para alto quando algo falha.

A pegadinha: editar reasoning.effort na solicitação quebra o cache do seu prompt. O esforço é parte do prefixo em cache (veja o guia de cache de prompt). No 6.1 Sol, uma leitura de cache custa US$0.10 por milhão de tokens, enquanto reescrever o cache custa US$2.50. Essa é uma diferença de 25×.

A família GPT-6 corrige isso com um item de entrada configuration_update. Mantenha o reasoning.effort no nível da solicitação inalterado e insira uma atualização antes da próxima mensagem do usuário. Veja como isso se parece através da API de Respostas do AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Turno 1: planejar em alto esforço
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},
    input="Descubra por que os testes deste repositório estão falhando e proponha um plano de correção.",
)

# Turno 2: cair para baixo para execução, sem tocar no esforço de nível de solicitação
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},           # inalterado, para que o cache sobreviva
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "baixo"}},
        {"role": "user", "content": "Execute o passo 1 do plano."},
    ],
)
O formato de configuration_update acima é ilustrativo. Verifique o guia de raciocínio da OpenAI para o esquema exato. A documentação de Respostas do AIHubMix atualmente lista quatro níveis (mínimo a alto), então envie uma pequena solicitação de teste para confirmar que xalto, máximo e configuration_update passam.

Alguns limites a serem conhecidos:

  • Funciona apenas no modo padrão de agente único e apenas altera o esforço.
  • Duas atualizações não podem ficar lado a lado.
  • Não se mistura com compactação ou truncamento automáticos. A compactação explícita é aceitável, mas adicione uma nova atualização depois.
  • O campo reasoning.effort da resposta ainda mostra o valor do nível da solicitação, então não leia muito nisso.

Configurações que acompanham o esforço

Deixe espaço em max_output_tokens. O limite inclui tokens de raciocínio. Se você definir muito baixo, o modelo pode parar antes de produzir qualquer texto visível. Você recebe status: incomplete e ainda paga por entrada e raciocínio. A OpenAI sugere reservar pelo menos 25.000 tokens para começar, e mais para xalto ou máximo.

Rastreie tokens de raciocínio. Eles estão em usage.output_tokens_details.reasoning_tokens. Olhar para a distribuição por nível de esforço é melhor do que ajustar por intuição.

Ative resumos se precisar de visibilidade. reasoning.summary: "auto" retorna um resumo do raciocínio do modelo (você pode precisar verificar sua organização primeiro). O raciocínio bruto nunca é exposto.

O modo pro é um interruptor separado. Ele faz o modelo trabalhar mais, cobrado nas taxas padrão, mas com mais tokens no total. Use-o para problemas difíceis onde uma latência extra é aceitável.


Um processo de ajuste que você pode realmente executar

  1. Reúna de 20 a 50 tarefas reais em um conjunto de avaliação.
  2. Execute uma linha de base em médio. Registre a taxa de sucesso, tokens de raciocínio médios e latência P95.
  3. Tente baixo. Se o sucesso cair pouco, mude.
  4. Tente alto. Se o sucesso melhorar claramente, use alto apenas para esse tipo de tarefa.
  5. Somente busque xalto ou máximo quando alto não for suficiente e compare com o GPT-6 Astra em alto enquanto estiver nisso. Às vezes, um modelo maior supera mais esforço. No AIHubMix, isso é apenas uma mudança no parâmetro model, e a lista de modelos mostra o que está disponível.
  6. Roteie por tipo de tarefa em vez de usar uma configuração global única.

A versão curta: comece em médio, economize dinheiro com baixo, use alto para codificação e faça xalto e máximo se provarem seu valor em suas avaliações.

Próximo: o que a etiqueta de preço de US$2 / US$10 realmente significa uma vez que o cache, o longo contexto e os multiplicadores de cobrança entram em jogo.


FAQ

Qual é o esforço de raciocínio padrão para o GPT-6.1 Sol? médio. Se você não configurá-lo, é isso que você recebe.

Por que nenhum retorna um erro? O 6.1 Sol não suporta nenhum ou mínimo. A OpenAI recomenda mudar para baixo. Se você realmente precisar de nenhum, permaneça no GPT-6 Sol ou GPT-6 Luna.

Como os tokens de raciocínio são cobrados? Na taxa de saída (US$10 por milhão para 6.1 Sol), e eles contam contra a janela de contexto. Verifique usage.output_tokens_details.reasoning_tokens para os números reais.

O nome do parâmetro é o mesmo em Chat Completions e Responses? Não. Chat Completions usa um reasoning_effort de nível superior. Responses usa um reasoning: {"effort": ...} aninhado. Misturá-los retorna Unsupported parameter.

Um esforço maior sempre dá melhores resultados? Não. No AutomationBench, subir acima de médio apenas moveu a pontuação de 35.4% para cerca de 36.0%, enquanto custava visivelmente mais. Teste em suas próprias tarefas.

Posso mudar o esforço no meio de uma conversa? Sim. Use um item de configuration_update e mantenha o reasoning.effort de nível de solicitação inalterado para que o cache do prompt permaneça válido. Não funciona com compactação ou truncamento automáticos.

Por que recebi status: incomplete sem saída? Provavelmente max_output_tokens estava muito baixo e o raciocínio usou tudo. A OpenAI recomenda reservar pelo menos 25.000 tokens.


Continue lendo: a série GPT-6.1 Sol


Fontes