Quanto realmente custa o GPT-6.1 Sol: além da etiqueta de preço de $2 / $10

AIHubMix6 min de leitura
Quanto realmente custa o GPT-6.1 Sol: além da etiqueta de preço de $2 / $10

GPT-6.1 Sol tem o mesmo preço de tabela que o GPT-6 Sol: $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída. Sua fatura real depende de quatro outras coisas: com que frequência você acessa o cache, se você ultrapassa 272K tokens de entrada, qual nível de serviço você usa e quantos tokens de raciocínio o modelo consome. Este post aborda cada um deles.


A lista completa de preços

Taxas padrão (por 1M de tokens)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Entrada$2.00$2.00$10.00$0.10
Entrada em cache$0.10$0.20$1.00—
Gravações de cache$2.50$2.50——
Saída (incl. raciocínio)$10.00$10.00$50.00$0.50
A taxa de cache do Astra vem de relatórios de terceiros. Sua taxa de gravação em cache deve ser $12.50 sob a regra de 1.25× da OpenAI. Para a precificação do cache do Luna, veja a página de preços da OpenAI.

Multiplicadores

Essas regras vêm da página do modelo GPT-6.1 Sol:

CondiçãoO que acontece
Mais de 272K tokens de entradaA solicitação inteira custa 2× a entrada e o cache, 1.5× a saída ($4 / $15, leituras de cache $0.20, gravações de cache $5)
Lote / FlexMetade da taxa padrão
Modo rápidoO dobro da taxa padrão (não disponível com residência de dados na UE)
Processamento regional+10%
Chamadas de ferramentas (pesquisa, uso de computador, etc.)Cobradas por chamada. O AIHubMix lista pesquisa na web a $0.01 por solicitação
Ultrafast (chegando ao Codex)Ainda não tem preço oficial. Um relatório diz 6× o padrão, não confirmado

No AIHubMix, as rotas da OpenAI e Azure custam o mesmo que a OpenAI direta, e o nível acima de 272K já está listado.


A verdadeira mudança: leituras de cache a 5% da entrada

O preço de tabela não mudou. As leituras de cache mudaram, de 10% da taxa de entrada ($0.20) para 5% ($0.10). Os documentos de cache de prompt da OpenAI deixam claro: as leituras de cache são 0.1× a entrada na maioria dos modelos e "0.05× no GPT-6.1 Sol."

Isso é importante porque os agentes reenviam o mesmo material em cada etapa: prompt do sistema, definições de ferramentas, contexto do repositório e histórico de conversação. A maior parte da entrada deles é conteúdo repetido. Para essas cargas de trabalho, a taxa em cache é efetivamente seu verdadeiro preço de entrada.

Exemplo prático: uma tarefa de agente de codificação

Suposições:

  • Um prefixo fixo de 200K tokens (prompt do sistema, ferramentas, contexto do repositório)
  • 50 etapas, cada uma adicionando 2K novos tokens de entrada e produzindo 3K tokens de saída (incluindo raciocínio)
  • Para simplificar, o prefixo permanece do mesmo tamanho, é gravado em cache na etapa 1 e é acessado em todas as 49 etapas restantes
6.1 Sol, sem cache6 Sol + cache6.1 Sol + cacheAstra + cache
Gravação inicial de 200K em cache—$0.50$0.50$2.50
49 leituras de cache—$1.96$0.98$9.80
Prefixo cobrado como entrada regular$20.00———
100K nova entrada (na taxa de gravação)$0.20$0.25$0.25$1.25
150K saída$1.50$1.50$1.50$7.50
Total$21.70$4.21$3.23$21.05

Três conclusões:

  1. O cache é o maior fator. Mesmo modelo, mesmo trabalho, e a execução sem cache custa quase 7× mais.
  2. O 6.1 Sol é cerca de 23% mais barato que o 6 Sol neste caso, enquanto também pontua mais alto.
  3. Para trabalhos que dependem muito do cache, o Astra custa mais do que a diferença de preço de 5× sugere. Neste exemplo, é 6.5×, porque o Astra desconta a entrada em cache em 90% e o 6.1 Sol a desconta em 95%.

Isso se alinha com os custos por tarefa relatados pela OpenAI (compilados por Vellum e The Next Web): cerca de $1.50 contra $7.70 no DeepSWE, $1.30 contra $9.30 no OSWorld e $5.47 contra $23.80 no Terminal-Bench Science.

Uma ressalva: a OpenAI diz que o Astra geralmente precisa de menos tokens de saída para concluir a mesma tarefa. Compare os modelos pelo custo por tarefa, não pelo custo por token.

As gravações de cache não são gratuitas

As gravações de cache no 6.1 Sol custam 1.25× a taxa de entrada. Se um prefixo é usado apenas uma vez, o cache o torna 25% mais caro. Usando a fórmula dos documentos da OpenAI:

  • Uma gravação mais uma leitura: 1.35× o custo normal de entrada (1.3× no 6.1 Sol), contra 2× sem cache
  • Uma gravação mais nove leituras: cerca de 2.15× (cerca de 1.7× no 6.1 Sol), contra 10×

O prefixo mínimo que pode ser armazenado em cache é de 1.024 tokens. A matemática de ponto de equilíbrio da OpenAI diz que um prefixo de 102 tokens ou menos nunca compensa. Se você espera 10 ou mais reutilizações, aumentar qualquer coisa acima de 221 tokens até 1.024 sai mais barato.

Para chamadas únicas, como classificação de uma única vez ou extração em massa, use o modo explícito (prompt_cache_options.mode: "explicit") sem pontos de interrupção. Você não será cobrado por nenhuma gravação.


O limite de 272K

O 6.1 Sol aceita 1.05M tokens de contexto, mas uma vez que a entrada ultrapassa 272K, toda a solicitação passa para a taxa mais alta, não apenas os tokens acima do limite.

SolicitaçãoEntradaSaídaCusto
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

Dez mil tokens de entrada a mais quase dobra a conta.

Como ficar abaixo disso:

  • Conte os tokens do lado do cliente e compacte ou corte antes de atingir 272K
  • Recupere as partes relevantes de documentos longos em vez de enviar o documento inteiro
  • Quando você realmente precisa de um contexto longo, coloque a parte fixa em um prefixo em cache

Como o esforço de raciocínio aparece na fatura

Tokens de raciocínio são cobrados na taxa de saída, $10 por milhão. Mover a mesma tarefa de baixa para máxima pode multiplicar os tokens de raciocínio por dez ou mais.

Os custos por tarefa relatados pela OpenAI dão uma noção de escala (esses são benchmarks diferentes, então compare apenas as magnitudes):

  • AutomationBench (médio): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (alto): ~$1.50
  • Terminal-Bench Science (máximo): ~$5.47

A Parte 2 cobre como escolher um nível. Uma lembrança aqui: mudar reasoning.effort no meio da conversa invalida o cache. Use configuration_update em vez disso.


Como se compara neste ponto de preço

ModeloEntrada / saídaEntrada em cache
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

O 6.1 Sol e o Claude Sonnet 5.5 compartilham um preço de tabela, e a taxa em cache do 6.1 Sol é metade da do Sonnet. No entanto, eles são fortes em coisas diferentes. No AutomationBench, por exemplo, o Sonnet 5.5 pontua muito mais alto. Quando dois modelos custam o mesmo por token, aquele com o custo mais baixo por tarefa em sua carga de trabalho é o mais barato.

A lista de modelos do AIHubMix mostra os preços atuais, e uma chave de API funciona para todos eles, então testes lado a lado são fáceis.

Os preços dos concorrentes vêm de fontes de terceiros e podem mudar. Verifique as páginas de preços oficiais antes de confiar nelas.

Lista de verificação de custos

  1. Coloque conteúdo estável primeiro. Prompt do sistema, definições de ferramentas e material de referência vão no topo. Carimbos de data e dados por usuário vão no final.
  2. Adicione, não reescreva. Resumir, truncar e compactar reinicia o cache.
  3. Mantenha a lista de ferramentas estável. Não adicione ou remova ferramentas por solicitação. Use tool_choice ou allowed_tools em vez disso.
  4. Troque o esforço com configuration_update, não o parâmetro de solicitação.
  5. Mantenha-se abaixo de 272K de entrada.
  6. Envie trabalhos não urgentes através de Lote ou Flex por metade do preço.
  7. Roteie por tarefa. Luna para trabalho simples de alto volume, 6.1 Sol para a maioria das coisas, Astra para os problemas mais difíceis.
  8. Observe três números: cached_tokens, cache_write_tokens, e reasoning_tokens.

A conclusão é: o preço de tabela não mudou, mas as leituras de cache ficaram 50% mais baratas. Para cargas de trabalho de agentes, isso torna o 6.1 Sol o modelo com melhor custo-benefício na família GPT-6, desde que você use o cache corretamente e permaneça abaixo de 272K.

Próximo: os problemas que você provavelmente encontrará ao mudar.


FAQ

Quanto custa o GPT-6.1 Sol? $2 por milhão de tokens de entrada, $10 por milhão de tokens de saída, $0.10 por entrada em cache e $2.50 por gravações de cache. Solicitações acima de 272K tokens de entrada são cobradas a $4 de entrada e $15 de saída para toda a solicitação.

É mais barato através do AIHubMix ou da OpenAI diretamente? Mesmo preço. As rotas da OpenAI e Azure do AIHubMix correspondem às taxas oficiais da OpenAI.

Por que minha fatura está mais alta do que eu estimei? Quatro razões comuns: tokens de raciocínio são cobrados na taxa de saída; você ultrapassou 272K de entrada; você perdeu o cache ou pagou taxas de gravação em prefixos únicos; ou o modo rápido ou processamento regional está ativado.

As gravações de cache custam extra? Tokens gravados são cobrados a 1.25× a taxa de entrada. Isso substitui a cobrança normal de entrada em vez de adicionar a ela. Um prefixo se paga após duas utilizações. Para prefixos únicos, o modo explícito permite que você evite gravações completamente.

Quanto mais barato é o 6.1 Sol do que o Astra? Cinco vezes mais barato no preço de tabela. Para trabalhos de agentes que dependem muito do cache, a diferença pode chegar a 6 a 7× porque o 6.1 Sol desconta a entrada em cache de forma mais acentuada. No entanto, o Astra geralmente usa menos tokens de saída por tarefa, então compare o custo por tarefa.

O Lote pode ser combinado com cache? Lote e Flex custam ambos metade do preço. Para saber como eles se acumulam com o cache, verifique a página de preços da OpenAI.


Continue lendo: a série GPT-6.1 Sol


Fontes