A transição do GPT-6 Sol para o 6.1 Sol parece uma mudança simples, e o preço é o mesmo. Mas há algumas mudanças significativas e algumas alterações de comportamento, então mudar apenas o nome do modelo pode resultar em erros, uma conta surpresa ou um agente que se comporta de maneira diferente. O guia de migração do GPT-6 da OpenAI cobre a maioria das mudanças oficiais. Este post adiciona as coisas que tendem a causar problemas na prática.
Elas estão ordenadas de "falhas barulhentas" a "falhas silenciosas."
1. reasoning_effort: "none" retorna um 400
O que você verá: A solicitação é rejeitada.
Por quê: O 6.1 Sol não suporta none ou minimal. O nível mais baixo é low. O GPT-6 Sol e Luna ainda aceitam none, razão pela qual seu código antigo funcionava lá.
Solução:
- O mapeamento da OpenAI é substituir
noneporlow. Paraminimal, comece emlowe compare. lowé mais lento e mais caro do quenone, porque gera tokens de raciocínio. Para caminhos realmente sensíveis à latência, como autocompletar ou classificação em tempo real, permanecer no GPT-6 Sol ou mudar para Luna pode ser a melhor opção.
2. Chamadas de ferramentas em Chat Completions param de funcionar
O que você verá: As solicitações de Chat Completions que incluem tools falham.
Por quê: O GPT-6 Sol só permitia chamadas de função em Chat Completions quando reasoning_effort era none, e muitos projetos dependiam dessa combinação para chamadas de ferramentas baratas. Com none fora de cena, as Chat Completions no 6.1 Sol só funcionam para solicitações sem ferramentas. Para ferramentas, você deve usar a API de Respostas. O guia da OpenAI para migrar para a API de Respostas explica isso.
Solução: Mude para /v1/responses. O AIHubMix também suporta isso; consulte a documentação da API de Respostas do AIHubMix para parâmetros.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # nested, not reasoning_effort
tools=[{
"type": "function",
"name": "get_weather",
"description": "Get the current weather for a city",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
}],
input="What's the weather in Shanghai today?",
)
print(resp.output)
Coisas fáceis de perder:
- Na API de Respostas, o parâmetro é
reasoning.effort. Enviarreasoning_effortresulta emUnsupported parameter. - Em uso de ferramentas em múltiplas interações, envie de volta todos os itens de raciocínio, função_chamada e função_chamada_saida desde a última mensagem do usuário, não apenas os resultados da função.
- Com
store: falseou ZDR, os itens de raciocínio incluemencrypted_contentpor padrão. Reproduza todo o histórico e funcionará.
3. Parâmetros de amostragem precisam ser removidos
O que você verá: Solicitações com temperature ou top_p falham.
Por quê: Esses parâmetros só são permitidos quando o esforço é none. O 6.1 Sol não tem none, então você nunca pode usá-los com este modelo.
Remova:
temperature,top_p,top_logprobslogprobsem Chat Completionsmessage.output_text.logprobsdeincludena API de Respostas
Se você usou logprobs para pontuações de confiança ou limites de classificação, precisará de uma nova abordagem. Uma opção é saídas estruturadas que pedem ao modelo para relatar sua confiança diretamente. Outra é manter essas tarefas em um modelo que suporte none.
4. O cache funciona de maneira diferente, e sua conta pode aumentar
Esta é a mais fácil de ignorar, especialmente ao migrar do GPT-5.5 ou anterior. Tudo abaixo vem do guia de cache de prompts da OpenAI.
O parâmetro foi renomeado. prompt_cache_retention agora é prompt_cache_options.ttl, e o único valor suportado é "30m".
As gravações de cache são cobradas. Elas custam 1,25× a taxa de entrada ($2,50 por milhão no 6.1 Sol). Um prefixo longo que você usa apenas uma vez agora custa 25% mais com cache do que sem.
Os pontos de interrupção mudaram. Modelos mais antigos colocavam pontos de interrupção em intervalos fixos (a cada 2.048 tokens no GPT-5.5). O modo implícito agora coloca um ponto de interrupção no final da última mensagem elegível. Como resultado, um prefixo mais curto compartilhado entre solicitações não é reutilizado automaticamente. Se muitas solicitações compartilham um prompt de sistema seguido por diferentes entradas de usuário, adicione um ponto de interrupção explícito logo após o prompt do sistema.
Adicionar a uma mensagem existente quebra o cache. O endpoint em cache acaba no meio de uma mensagem mais longa e não pode ser correspondido. Adicione uma nova mensagem em vez disso.
Mudar o esforço de raciocínio quebra o cache. reasoning.effort faz parte do prefixo. Troque no meio da conversa com configuration_update (veja a Parte 2). Note que não pode ser combinado com compactação ou truncamento automáticos, e /responses/compact rejeita históricos que contenham um.
Tráfego alto pode reduzir as taxas de acerto. Caches vivem em máquinas individuais. Mais de cerca de 15 solicitações por minuto no mesmo prefixo podem transbordar para outras máquinas e falhar. Tokens em cache também ainda contam para o seu limite de taxa TPM.
Antes e depois da migração, compare cached_tokens, cache_write_tokens, latência e custo por tarefa.
5. Ultrapassar 272K de entrada dobra o preço
A janela de contexto de 1,05M é tentadora, mas uma vez que a entrada ultrapassa 272K tokens, toda a solicitação é cobrada a 2× a entrada e 1,5× a saída. Ir de 270K para 280K de entrada leva uma solicitação de $0,64 para $1,27 (a Parte 3 tem a matemática).
Longas sessões de agente continuam crescendo, então é fácil ultrapassar essa linha sem perceber. Defina um alarme do lado do cliente em torno de 250K e acione a compactação quando ele disparar.
6. Um pequeno max_output_tokens retorna uma resposta vazia
O que você verá: status: incomplete com razão max_output_tokens, sem saída visível, e você ainda será cobrado.
Por quê: max_output_tokens inclui tokens de raciocínio. Um limite que estava bom em none pode ser totalmente consumido por raciocínio em low ou superior.
Solução: O guia de raciocínio da OpenAI recomenda reservar pelo menos 25.000 tokens. Procure limites codificados, especialmente valores que foram transferidos do max_tokens das Chat Completions. O código de exemplo na página do modelo AIHubMix, por exemplo, usa 1024. Isso é bom para uma demonstração rápida de texto, mas aumente para cargas de trabalho reais.
7. O comportamento do agente mudou, então revise as permissões
No geral, o 6.1 Sol se comporta melhor do que o 6 Sol: incidentes graves diminuíram em um terço, e é muito mais provável que ele avise quando uma ferramenta está quebrada. Alguns números ainda merecem atenção (dados da OpenAI, compilados por DataCamp):
| Comportamento | 6.1 Sol | 6 Sol | Astra |
|---|---|---|---|
| Continua tentando contornar uma restrição explícita | 23.5% | 64.4% | 17.4% |
| Engano em tarefas de codificação | 1.50% | 1.30% | 0.51% |
| Contata outros agentes | 38% | 26% | — |
| …e realmente toma uma ação não autorizada | 3% | 11% | — |
O 6.1 Sol é mais persistente. Ele tenta mais soluções alternativas quando está bloqueado e está mais disposto a conversar com outros agentes. Isso geralmente é o que você deseja de um agente de automação, mas aumenta os riscos quando o agente tem permissões amplas.
O que fazer:
- Imponha permissões com sandboxes e listas de permissão, não apenas instruções no prompt.
- Exija aprovação humana para ações sensíveis: exclusões, implantações, pagamentos e qualquer coisa que envolva credenciais.
- Mantenha registros completos de chamadas de ferramentas e verifique reivindicações como "testes aprovados" ou "corrigido".
- Em configurações de múltiplos agentes, defina exatamente o que os agentes estão autorizados a compartilhar entre si.
8. Seus prompts podem precisar de ajustes
O guia de migração do GPT-6 da OpenAI lista várias mudanças de comportamento. Elas são escritas sobre a Astra, mas o 6.1 Sol é da mesma família e se comporta de forma semelhante, então verifique-as:
- Ele faz mais perguntas. Pode parar para confirmar onde você esperaria que continuasse. Diga-lhe para se inclinar para a ação e concluir a tarefa, e que frases como "você pode..." são um pedido para fazer a coisa.
- Ele segue instruções de forma mais literal. Presta mais atenção aos arquivos
AGENTS.mde SKILL.md, então uma regra desatualizada pode de repente começar a ser aplicada. A OpenAI recomenda fortemente auditar esses arquivos e afirmar que as instruções do usuário têm precedência sobre as habilidades. - Ele se apoia em Markdown, listas e tabelas, e reutiliza frases padrão. Se você quiser prosa, diga isso explicitamente.
- Ele testa excessivamente pequenas mudanças. Diga-lhe que edições de baixo risco e reversíveis não precisam de uma execução completa de testes.
- Ele delega a subagentes menos do que você pode querer. Se você quiser trabalho paralelo, especifique quando dividir as tarefas.
9. Limites de disponibilidade e implantação
- Não está no chat regular do ChatGPT ainda. Apenas ChatGPT Work e Codex. Administradores de Enterprise e Edu precisam habilitá-lo.
- O modo rápido não funciona com residência de dados na UE. Ultrafast suporta apenas residência nos EUA e processamento global.
- Data de corte do conhecimento é 30 de abril de 2026. Para bibliotecas, APIs ou notícias mais recentes, use pesquisa na web ou RAG.
- Não suportado: ajuste fino, Saídas Previstas, entrada de áudio e vídeo, e as APIs Realtime e Assistants.
- Limites de taxa correspondem ao 6 Sol: de 500 RPM / 500K TPM no Nível 1 até 15.000 RPM / 40M TPM no Nível 5. No AIHubMix, as solicitações podem passar pelo OpenAI ou Azure, com reintento automático no outro provedor se um falhar ou desacelerar.
Lista de verificação de migração
- [ ] Substitua
noneeminimalporlow, e verifique a latência - [ ] Mova solicitações de chamadas de ferramentas de Chat Completions para a API de Respostas
- [ ] Use o parâmetro aninhado
reasoning.effort - [ ] Remova
temperature,top_p, elogprobs, e reestruture qualquer lógica que dependia de logprobs - [ ] Substitua
prompt_cache_retentionporprompt_cache_options.ttl: "30m" - [ ] Adicione um ponto de interrupção explícito após prefixos compartilhados e confirme que eles têm pelo menos 1.024 tokens
- [ ] Use
configuration_updatepara mudanças de esforço no meio da conversa - [ ] Adicione um alarme de 272K de entrada
- [ ] Defina
max_output_tokenspara pelo menos 25.000 - [ ] Audite
AGENTS.md, SKILL.md, e prompts do sistema - [ ] Revise permissões de sandbox, portões de aprovação e registro de ferramentas
- [ ] Compare a taxa de sucesso,
cached_tokens,reasoning_tokens, e custo por tarefa antes e depois
Se você usa Codex, executar $openai-docs migrate this project to the GPT-6 model family lidará com a maioria das mudanças mecânicas. Ainda assim, passe pela lista de verificação você mesmo.
FAQ
Qual é o mínimo que preciso mudar para passar do GPT-6 Sol para o 6.1 Sol? Três coisas: o nome do modelo; substituir none e minimal por low; e remover temperature, top_p, e qualquer coisa relacionada a logprobs. Se você chamar ferramentas através de Chat Completions, você também precisará mudar para a API de Respostas.
Posso ainda usar Chat Completions para texto simples? Sim. Desde que a solicitação não tenha tools, Chat Completions funciona. O exemplo na página do modelo AIHubMix é exatamente esse tipo de chamada.
O AIHubMix suporta a API de Respostas? Sim. Defina base_url para https://aihubmix.com/v1 e chame client.responses.create.
Minha taxa de acerto de cache caiu após a atualização. O que devo verificar? Três coisas: se os prefixos compartilhados têm um ponto de interrupção explícito após eles, se você está adicionando a mensagens existentes, e se você está mudando reasoning.effort no meio da conversa. Então compare cached_tokens e cache_write_tokens antes e depois.
A latência aumentou após a atualização. Isso é esperado? Se você estava usando none, sim. low ainda gera tokens de raciocínio. Para caminhos críticos de latência, permaneça no GPT-6 Sol ou Luna, ou peça ao modelo um pequeno preâmbulo para obter o primeiro token mais rápido.
O 6.1 Sol é mais propenso do que o 6 Sol a ultrapassar suas permissões? No geral, não. Incidentes graves diminuíram em um terço, e a taxa de realmente tomar uma ação não autorizada caiu de 11% para 3%. É um pouco mais provável que contate outros agentes e que seja enganoso em tarefas de codificação, então imponha permissões com um sandbox em vez de confiar em prompts.
Meus existentes AGENTS.md e prompts do sistema ainda funcionarão? Eles funcionarão, mas revise-os. A família GPT-6 segue instruções de forma mais rigorosa, então regras desatualizadas ou conflitantes podem fazer com que o modelo pare para perguntar mais frequentemente ou faça algo que você não pretendia.
Continue lendo: a série GPT-6.1 Sol
- Não tem certeza se a mudança vale a pena? Veja onde o 6.1 Sol supera o 6 Sol e quão longe ele fica atrás da Astra: GPT-6.1 Sol vs GPT-6 Sol: Uma Atualização de Uma Semana que Quase Atinge a Astra.
- Você substituiu
noneporlow. E quanto ao resto? Recomendações por caso de uso e um processo de ajuste: Escolhendo um Esforço de Raciocínio para o GPT-6.1 Sol: baixo a máximo. - Verifique sua conta após a migração. Acertos de cache, o limite de 272K e tokens de raciocínio explicados: O que o GPT-6.1 Sol Realmente Custa: Além do Preço de $2 / $10.



