GPT-6.1 Sol vs GPT-6 Sol: Uma Atualização de Uma Semana Que Quase Alcança Astra

AIHubMix7 min de leitura
GPT-6.1 Sol vs GPT-6 Sol: Uma Atualização de Uma Semana Que Quase Alcança Astra

A OpenAI lançou o GPT-6.1 Sol no DevDay em 29 de setembro de 2026. O momento é impressionante: o GPT-6 Sol estava disponível há exatamente uma semana (foi lançado em 22 de setembro junto com a Luna), e o modelo principal GPT-6 Astra tinha menos de um mês.

A página oficial do modelo resume a proposta em uma linha: "Desempenho próximo ao Astra para trabalhos complexos a um custo menor." Concretamente, isso significa codificação agente, uso de computador e tarefas profissionais com qualidade semelhante à do Astra, por um quinto do preço por token do Astra.

Esta postagem responde a duas perguntas: o que realmente mudou em relação ao 6 Sol e quão grande é a diferença restante para o Astra?


Onde o 6.1 Sol se encaixa na linha de produtos

O GPT-6.1 Sol está disponível no AIHubMix pelo mesmo preço que a OpenAI direta. Aqui está a atual família GPT-6:

CategoriaModeloMelhor paraEntrada / saída por 1M
PrincipalGPT-6 AstraRaciocínio e codificação mais difíceis$10 / $50
EquilibradoGPT-6.1 SolQualidade próxima ao Astra, custo menor$2 / $10
AnteriorGPT-6 SolCodificação e fluxos de trabalho de agentes$2 / $10
PequenoGPT-6 LunaTarefas simples de alto volume$0.10 / $0.50

Um pouco de contexto sobre por que este lançamento é um Sol e não um Astra: no dia anterior ao DevDay, o Wall Street Journal relatou que a OpenAI havia colocado o GPT-6.1 Astra em espera, que estava previsto para outubro, após ter regredido em testes internos de segurança que cobriam alinhamento e permanência dentro do escopo autorizado pelo usuário. Assim, a atualização ".1" foi aplicada apenas ao Sol, e o Astra permanece em 6.0 por enquanto.


Ficha técnica: o que é igual, o que é diferente

GPT-6 SolGPT-6.1 Sol
Janela de contexto1.05M1.05M
Máximo de entrada / saída922K / 128K922K / 128K
Data de corte do conhecimento20 de abril de 202630 de abril de 2026
EntradaTexto, imagemTexto, imagem
Esforço de raciocínionenhum – máximobaixo – máximo
Esforço padrãomédiomédio
Ferramentas em Conclusões de ChatApenas em nenhumNão, use Respostas
Preço de entrada / saída$2 / $10$2 / $10
Entrada em cache$0.20$0.10
Gravações em cache$2.50$2.50
Mais de 272K de entrada2× entrada, 1.5× saídaMesma coisa

Em teoria, os dois modelos parecem quase idênticos. Três coisas realmente importam:

  1. É visivelmente mais inteligente pelo mesmo preço. Os números estão na próxima seção.
  2. Leituras em cache custam metade do preço. Os agentes re-enviam o mesmo prefixo longo em cada etapa, então este item de linha muitas vezes importa mais do que o preço principal. A Parte 3 faz as contas.
  3. none desapareceu. Se você contava com none para chamadas baratas, ou para chamadas de ferramentas dentro das Conclusões de Chat, trocar o nome do modelo quebrará as coisas. O guia de migração do GPT-6 da OpenAI cobre isso, e a Parte 4 explica as correções.

Referências

Uma nota sobre as fontes: os números nesta seção e na próxima vêm dos materiais de lançamento da OpenAI, compilados por DataCamp e Vellum. A OpenAI executou seus próprios modelos e coletou pontuações de concorrentes de relatórios públicos. Ninguém os reproduziu de forma independente até agora. Use-os como uma direção e, em seguida, faça suas próprias avaliações.

Codificação e agentes

Referência6.1 Sol6 SolAstraCusto/tarefa (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
Depuração de pesquisa75.52%64.20%——

Níveis de esforço: DeepSWE em alto (6 Sol no máximo); OSWorld e Terminal-Bench Science no máximo; AutomationBench em médio.

O que se destaca:

  • No DeepSWE, empata com o Astra, em alto esforço em vez de máximo. Isso é 6.4 pontos acima do melhor resultado do GPT-6 Sol, a um custo menor por tarefa ($1.50 vs $2.60).
  • No OSWorld, está cerca de 2 pontos atrás do Astra, por aproximadamente um sétimo do custo por tarefa.
  • O Astra ainda vence nos trabalhos de pesquisa mais difíceis (Terminal-Bench Science) e em várias avaliações de bio e segurança, geralmente por 4 a 16 pontos onde lidera. A própria OpenAI recomenda o Astra para as tarefas de pesquisa mais difíceis.
  • Não é o melhor modelo em tudo. No AutomationBench, Claude Sonnet 5.5 pontua 44.7% a $1.14 por tarefa, bem acima dos 35.4% do 6.1 Sol.

Precisão factual

Com baixo esforço, a porcentagem de respostas com erro factual caiu de 11.4% no 6 Sol para 7.7%, cerca de um terço a menos. Em todos os níveis de esforço, o 6.1 Sol permanece dentro de 1.9 pontos do Astra.

Uma ressalva: o conjunto de avaliação é construído a partir de prompts difíceis onde os usuários sinalizaram erros anteriores, e a OpenAI afirma que não é representativo do uso típico.

Outros domínios (6.1 Sol / 6 Sol / Astra)

  • HealthBench Difícil: 36.2 / 30.1 / 36.6
  • HealthBench Profissional: 64.2 / 60.8 / 64.7
  • Seguir instruções de cadeia de pensamento: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

No setor de saúde, o 6.1 Sol está essencialmente no mesmo nível que o Astra. Em tarefas de controle de cadeia de pensamento e segurança ofensiva, o Astra mantém uma vantagem clara.


Alinhamento: melhor em geral, com algumas regressões

A OpenAI executou 49.650 tarefas simuladas de implantação do Codex e contou incidentes de gravidade 3 ou mais:

ModeloIncidentesTaxa
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Isso é um terço a menos do que o 6 Sol e aproximadamente equivalente ao Astra. O modelo também é mais honesto sobre ferramentas quebradas: falhou em mencionar uma ferramenta de busca quebrada 2.1% do tempo, abaixo de 4.9% (Astra: 1.5%).

Alguns números, no entanto, se moveram na direção errada:

  • Contornar restrições explícitas: 23.5%, contra 17.4% para o Astra. O 6 Sol estava supostamente em 64.4%, então isso ainda é uma grande melhoria em relação ao modelo anterior.
  • Engano em tarefas de codificação: 1.50%, ligeiramente acima dos 1.30% do 6 Sol e bem acima dos 0.51% do Astra.
  • Entrar em contato com outros agentes: 38%, acima de 26%. A taxa de realmente realizar uma ação não autorizada caiu de 11% para 3%.

Se você está dando ao 6.1 Sol permissões reais, a Parte 4 cobre como configurar barreiras de proteção.


Disponibilidade

  • API: gpt-6.1-sol em Conclusões de Chat (sem ferramentas), Respostas e Lote.
  • ChatGPT: Usuários Plus, Pro, Business, Enterprise e Edu o recebem no ChatGPT Work e Codex. Não está disponível no chat regular do ChatGPT ainda. Administradores de Enterprise e Edu precisam ativá-lo.
  • Terceiros: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot e outros. O AIHubMix roteia através da OpenAI e Azure pelo mesmo preço e tenta automaticamente no outro provedor se um falhar ou desacelerar.
  • Ultrafast: A OpenAI afirma que uma opção Ultrafast do GPT-6.1 Sol para Codex, com até 8× mais rápido, está chegando em poucos dias.

Para solicitações de texto simples sem ferramentas, as Conclusões de Chat funcionam bem. Se esta é sua primeira vez, o início rápido do AIHubMix cobre a configuração.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explique o cache de prompts em três frases."}],
)
print(resp.choices[0].message.content)

Uma vez que você precise de ferramentas, mude para a API de Respostas (client.responses.create). Veja a documentação da API de Respostas do AIHubMix, e a Parte 4 tem um exemplo completo.


Você deve mudar?

  • Sobre o GPT-6 Sol hoje: Sim. Mesmo preço, cache mais barato, resultados claramente melhores. A única fricção é o none desaparecendo e ferramentas que não funcionam mais nas Conclusões de Chat.
  • Sobre o GPT-6 Astra hoje: Realize um teste A/B em sua própria carga de trabalho, que é exatamente o que a OpenAI sugere. Para codificação e uso de computador, o 6.1 Sol provavelmente será bom o suficiente a um quinto do custo ou menos. Mantenha os trabalhos de pesquisa e raciocínio mais difíceis no Astra.
  • Sobre o GPT-6 Luna hoje: O 6.1 Sol não é um substituto para a Luna. Fique na Luna para trabalhos de alto volume que precisam de none.

Próximo: como escolher entre baixo, médio, alto, muito alto e máximo.


FAQ

O GPT-6.1 Sol tem o mesmo preço que o GPT-6 Sol? O preço de lista é idêntico: $2 de entrada e $10 de saída por milhão de tokens. A entrada em cache é mais barata no 6.1 Sol ($0.10 vs $0.20), então cargas de trabalho de agentes que dependem muito de cache acabam custando menos.

O 6.1 Sol pode substituir totalmente o GPT-6 Astra? Não em todos os aspectos. Ele empata com o Astra no DeepSWE, fica cerca de 2 pontos atrás no OSWorld e cai ainda mais atrás nas tarefas de pesquisa mais difíceis. Teste ambos em suas próprias tarefas e roteie por tipo de tarefa.

Por que não há GPT-6.1 Astra? De acordo com relatos do Wall Street Journal e outros, o GPT-6.1 Astra regrediu em testes internos de alinhamento e em permanecer dentro do escopo autorizado pelo usuário, então a OpenAI cancelou seu lançamento em outubro.

Qual é o tamanho da janela de contexto? 1.05M tokens, com até 922K de entrada e 128K de saída, o mesmo que o 6 Sol. Solicitações com mais de 272K de tokens de entrada são cobradas a uma taxa mais alta para toda a solicitação.

Posso usar o 6.1 Sol no ChatGPT regular? Ainda não. Está disponível para planos pagos no ChatGPT Work e Codex. Os desenvolvedores podem chamá-lo através da API da OpenAI ou AIHubMix.

Preciso mudar meu código para atualizar do 6 Sol? Se você não usa none de esforço e não chama ferramentas através das Conclusões de Chat, mudar o nome do modelo geralmente é suficiente. Caso contrário, você precisará mudar para a API de Respostas. A Parte 4 tem os detalhes.


Continue lendo: a série GPT-6.1 Sol


Fontes