GPT-5.6 Está Ao Vivo: Mudanças na Cobrança de Cache de Prompt Explicadas

31 de jul. de 2026 · AIHubMix · 8 min read · Opinião

GPT-5.6 Está Ao Vivo: Mudanças na Cobrança de Cache de Prompt Explicadas

A OpenAI lançou oficialmente a família GPT-5.6 em 9 de julho de 2026. O AIHubMix completou a integração dos três níveis: gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna agora estão disponíveis através de Chat Completions e Responses. O lançamento também altera o mecanismo de cache de prompt e sua cobrança: as gravações de cache agora são cobradas separadamente. Este post cobre o posicionamento dos três níveis e detalha as mudanças no cache ponto a ponto.

Quais mudanças nos três níveis do GPT-5.6

O GPT-5.6 revisa o esquema de nomenclatura: o número denota a geração do modelo, enquanto Sol, Terra e Luna são níveis de capacidade que podem evoluir independentemente. De acordo com as definições oficiais, Sol é o modelo principal, Terra é um nível de preço mais baixo com desempenho comparável ao GPT-5.5, e Luna é o nível mais rápido e de menor preço.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
Posicionamento oficial Modelo principal para trabalho profissional complexo Inteligência e custo equilibrados Para cargas de trabalho sensíveis a custo
Janela de contexto 1.050.000 1.050.000 1.050.000
Saída máxima 128.000 128.000 128.000
Data de corte do conhecimento 2026-02-16 2026-02-16 2026-02-16
Equivalente aproximado na geração anterior Nível sem sufixo nível mini nível nano

Sobre as capacidades, a posição oficial: Sol alcança resultados de ponta em codificação, trabalho de conhecimento, cibersegurança e tarefas científicas, sendo descrito pela OpenAI como seu melhor modelo de codificação até hoje, e estabelece novos recordes no Terminal-Bench 2.1 e DeepSWE; Terra iguala o desempenho do GPT-5.5 a metade do preço. A família adiciona um nível máximo de raciocínio, e a API de Responses ganha chamadas de ferramentas programáticas e capacidades multi-agente (Beta).

A atualização do mecanismo de cache, explicada

Antes do GPT-5.6, o cache de prompt nos modelos GPT era totalmente automático: prefixos de 1.024 tokens ou mais eram armazenados automaticamente, os desenvolvedores não tinham controle sobre o que era armazenado ou por quanto tempo, e os caches eram limpos após 5 a 10 minutos de inatividade. A OpenAI resume as mudanças do GPT-5.6 como "cache de prompt mais previsível", com três pontos concretos:

  1. A retenção passa de "tão curta quanto 5 minutos" para "pelo menos 30 minutos". prompt_cache_options.ttl atualmente suporta apenas "30m"; esse é um mínimo garantido, e a retenção real pode ser mais longa.
  2. Pontos de interrupção de cache explícitos são novos. Definir prompt_cache_breakpoint em um bloco de conteúdo fixa o limite do cache no final do conteúdo estável, de modo que alterações após o ponto de interrupção não invalidem o prefixo armazenado antes dele; com prompt_cache_options.mode definido como "explicit", apenas pontos de interrupção manuais são usados.
  3. prompt_cache_key passa de uma otimização para um requisito oficial. A partir do GPT-5.6, o parâmetro deve ser definido para permitir um emparelhamento de cache mais confiável; a OpenAI recomenda manter o tráfego por chave em cerca de 15 solicitações por minuto.

Como avaliar a cobrança de gravação de cache 1.25x

A partir do GPT-5.6, as gravações de cache são cobradas a 1,25x a taxa de entrada base e as leituras de cache a 0,1x; em modelos anteriores, as gravações de cache não têm taxa adicional. A redação oficial (do anúncio do GPT-5.6): "Para o GPT-5.6 e modelos posteriores, as gravações de cache são cobradas a 1,25x a taxa de entrada não armazenada do modelo, enquanto as leituras de cache continuam a receber o desconto de 90% na entrada armazenada."

A matemática do ponto de equilíbrio segue diretamente das taxas oficiais: escrever um prefixo custa 0,25x a taxa de entrada a mais do que não armazenar, e cada acesso subsequente economiza 0,9x a taxa de entrada: um prefixo reutilizado mesmo uma vez produz uma economia líquida, e quanto mais reutilização, maior a economia.

  • Cargas de trabalho que claramente se beneficiam: fluxos de trabalho de agentes com longas solicitações do sistema, RAG que inclui repetidamente longos materiais de referência, aplicações que carregam grandes definições de ferramentas e conversas de múltiplas turnos que apenas adicionam mensagens. Essas cargas de trabalho têm alta reutilização de prefixo, então a taxa de leitura de 0,1x domina.
  • Cargas de trabalho a serem observadas: solicitações longas únicas cujo prefixo nunca é reutilizado. O cache automático está ativado por padrão, então essas solicitações incorrerão em uma taxa de gravação irrecuperável de 1,25x; definir prompt_cache_options.mode como "explicit" sem definir nenhum ponto de interrupção faz com que a solicitação ignore completamente o cache e não incorra em taxa de gravação.

Comparação: cache de prompt no GPT-5.6 e Claude

O design de cache do GPT-5.6 converge com o cache_control do Claude em várias dimensões, com a principal diferença no comportamento padrão: o GPT armazena automaticamente sem parâmetros necessários, enquanto o Claude requer que o cache seja ativado na solicitação, seja pelo campo cache_control de nível superior (ponto de interrupção automático) ou por pontos de interrupção explícitos em nível de bloco de conteúdo.

Dimensão Família GPT-5.6 Família Claude (todos os modelos ativos)
Ativação Cache automático, pontos de interrupção explícitos opcionais Deve ser ativado: ponto de interrupção automático cache_control de nível superior, ou pontos de interrupção explícitos em nível de bloco de conteúdo
Parâmetro de ponto de interrupção prompt_cache_breakpoint (nível de bloco de conteúdo) cache_control (nível superior ou nível de bloco de conteúdo)
Limite de ponto de interrupção No máximo 4 novas gravações de cache por solicitação No máximo 4 pontos de interrupção
Retenção de cache Pelo menos 30 minutos 5 minutos por padrão (atualizado sem custo em cada acesso), opcional 1 hora
Cobrança de gravação de cache 1,25x taxa de entrada 1,25x para o nível de 5 minutos, 2x para o nível de 1 hora
Cobrança de leitura de cache 0,1x taxa de entrada 0,1x taxa de entrada
Comprimento mínimo armazenável 1.024 tokens 512–4.096 tokens dependendo do modelo
Requisito de acesso Idêntico byte a byte antes do ponto de interrupção Idêntico byte a byte antes do ponto de interrupção

A coluna do Claude reflete as regras compartilhadas por todos os modelos ativos do Claude: 1,25x para gravações no nível de 5 minutos, 2x para o nível de 1 hora, e 0,1x para leituras se aplicam uniformemente em toda a linha (documentação de cache de prompt da Anthropic), com diferenças por modelo limitadas ao comprimento mínimo armazenável; a coluna do GPT-5.6 vem do guia de cache de prompt da OpenAI.

Os limites de ponto de interrupção, taxas de gravação (para os níveis correspondentes) e taxas de leitura correspondem exatamente entre os dois provedores; em termos práticos, a mesma estratégia de estruturação de prompt "conteúdo estático primeiro, conteúdo em mudança por último" se aplica entre eles. O custo de migração está concentrado na sintaxe dos parâmetros: o GPT usa prompt_cache_breakpoint + prompt_cache_key, o Claude usa cache_control.

O mesmo padrão de cache em ambos os protocolos

Para o mesmo cenário "armazenar uma instrução longa estática", as implementações mínimas nos dois protocolos seguem. Os exemplos usam gpt-5.6-sol e claude-opus-4-8. Ambos compartilham o mesmo preço base de entrada ($5/M), então os preços efetivos por token derivados de gravações de cache (1,25x) e leituras (0,1x) também são idênticos; apenas a sintaxe difere.

O protocolo GPT define prompt_cache_key no nível superior (prefixos longos são armazenados automaticamente, sem necessidade de marcador de ponto de interrupção); o protocolo Claude define cache_control no nível superior para habilitar o cache automático, mudando para pontos de interrupção em nível de bloco de conteúdo quando um controle preciso sobre o limite do cache é necessário:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[Instruções longas e estáticas, >=1024 tokens]"
      },
      {
        "role": "user",
        "content": "Resuma os principais números."
      }
    ]
  }'

Claude (Mensagens)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[Instruções longas e estáticas, >=1024 tokens]",
    "messages": [
      {
        "role": "user",
        "content": "Resuma os principais números."
      }
    ]
  }'

Comparando as duas solicitações, as diferenças se resumem a: o endpoint (/v1/chat/completions vs /v1/messages), os cabeçalhos de autenticação (Authorization: Bearer vs x-api-key + anthropic-version), o parâmetro de cache (nível superior prompt_cache_key vs nível superior cache_control), e o Claude requer um max_tokens explícito. Ambas as solicitações foram verificadas contra aihubmix.com (2026-07-10): gpt-5.6-sol retornou cached_tokens: 2816 na segunda chamada; claude-opus-4-8 retornou cache_creation_input_tokens: 3632 na primeira chamada e cache_read_input_tokens: 3632 na segunda.

Além do formato da solicitação, três diferenças em nível de mecanismo permanecem:

  1. Ativação: o GPT armazena automaticamente mesmo sem quaisquer parâmetros de cache, com prompt_cache_key melhorando a confiabilidade do acesso; o Claude requer uma declaração: um ponto de interrupção cache_control em nível de bloco de conteúdo, ou o modo automático cache_control de nível superior.
  2. Campos de uso: o GPT relata leituras de cache em prompt_tokens_details.cached_tokens; o Claude relata gravações e leituras separadamente como cache_creation_input_tokens e cache_read_input_tokens, facilitando a verificação de gravações e acessos de forma independente.
  3. Controle de duração: o ttl do GPT-5.6 atualmente suporta apenas "30m"; o Claude tem como padrão 5 minutos (atualizado sem custo em cada acesso), com um "ttl": "1h" opcional (gravações cobradas a 2x).

O que mudar ao trocar modelos entre protocolos

O gateway AIHubMix suporta chamadas entre protocolos: o endpoint compatível com OpenAI pode chamar modelos do Claude (cache_control vai diretamente para os blocos de conteúdo da mensagem no formato OpenAI; veja Práticas de Cache de Prompt), e o endpoint /v1/messages compatível com Claude pode chamar o GPT-5.6 (verificado como funcionando). Ao trocar modelos, verifique três coisas:

  • Altere model para o ID do modelo alvo;
  • Troque a sintaxe do parâmetro de cache: prompt_cache_key / pontos de interrupção explícitos correspondem ao cache_control do Claude;
  • Troque os nomes dos campos de uso: cached_tokens corresponde a cache_read_input_tokens do Claude.

Caminhos recomendados para cache de prompt: modelos GPT através de Chat Completions (o caminho de acesso ao cache verificado neste post); modelos Claude funcionam através de qualquer protocolo.

Comparação: GPT-5.6 vs cache de GPT anterior

Dimensão Antes do GPT-5.6 GPT-5.6 e posteriores
Gravações de cache Sem taxa adicional 1,25x taxa de entrada
Retenção de cache Limpa após 5–10 minutos de inatividade, até 1 hora Pelo menos 30 minutos
Controle de cache Nenhum Pontos de interrupção explícitos, modo explícito, prompt_cache_key para emparelhamento confiável
Retenção estendida de 24 horas prompt_cache_retention em alguns modelos Substituído por prompt_cache_options.ttl (atualmente apenas 30m)

As mudanças apontam em uma direção: o cache de gerações anteriores era livre de taxas de gravação, mas incontrolável, com retenção incerta; o GPT-5.6 cobra por gravações enquanto fornece um piso de retenção garantido e controles de cache precisos. Pelas taxas, um prefixo reutilizado mais de uma vez em média economiza mais do que o custo adicional de gravação; o piso de retenção de 30 minutos e pontos de interrupção controláveis tornam mais previsível alcançar essa taxa de reutilização.

Começando no AIHubMix

Todos os três níveis estão ao vivo, com IDs de modelo gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna. O cache não requer configuração extra; solicitações consecutivas com o mesmo prefixo longo atingem o cache:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "Você é um assistente meticuloso para analisar relatórios financeiros trimestrais... [Instruções longas e estáticas, >=1024 tokens]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "Resuma os principais números em uma frase."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

Um valor usage.prompt_tokens_details.cached_tokens maior que 0 na segunda chamada indica um acesso (exemplo medido: cached_tokens: 2816). Para detalhes sobre parâmetros, especificações de cobrança e solução de problemas de acesso, veja a documentação de Cache de Prompt do GPT.

FAQ

Quais APIs podem chamar o GPT-5.6 no AIHubMix?

Chat Completions (/v1/chat/completions), Responses (/v1/responses) e a API de Mensagens compatível com Claude (/v1/messages) podem chamar todos os modelos, e todos os três níveis estão ao vivo. Para cache de prompt, Chat Completions é atualmente o caminho recomendado.

Se meu cliente não mudar nada, o que muda na cobrança após a atualização para o GPT-5.6?

O cache de prompt se aplica automaticamente por padrão: solicitações cujo prefixo atinge 1.024 tokens incorrerão em um item de gravação de cache cobrado a 1,25x a taxa de entrada, e prefixos reutilizados são cobrados a 0,1x a taxa de leitura. Aplicações com alta reutilização de prefixo geralmente veem custos totais mais baixos; solicitações longas únicas que nunca reutilizam um prefixo podem desativar o cache com o modo explícito.

Eu usei o cache de prompt do Claude. O que eu mudo para migrar para o GPT-5.6?

A estratégia de estruturação de prompt permanece a mesma: conteúdo estático primeiro, conteúdo em mudança por último. Os parâmetros mudam de cache_control para prompt_cache_breakpoint, além de prompt_cache_key; a retenção muda dos níveis de 5 minutos/1 hora para um piso garantido de 30 minutos.

Como escolho entre os três níveis do GPT-5.6?

De acordo com o posicionamento oficial: escolha Sol para trabalho profissional complexo e tarefas de codificação; escolha Terra para cargas de trabalho do dia a dia (desempenho nível GPT-5.5 a metade do preço); escolha Luna para cenários sensíveis a custo e de alto volume. Todos os três níveis compartilham a mesma janela de contexto e saída máxima, então você pode direcionar pela complexidade da tarefa.

Referências oficiais

Especificações do modelo, mecanismos de cache e taxas de cobrança neste post vêm dessas fontes oficiais:

Documentação relacionada neste site: Cache de Prompt do GPT · Cache de Prompt do Claude · Práticas de Cache de Prompt


Visite a galeria de modelos para preços do GPT-5.6, ou explore mais opções de integração no centro de documentação.


Última atualização: 2026-07-10

More from the blog