A OpenAI lançou oficialmente a família GPT-5.6 em 9 de julho de 2026. O AIHubMix completou a integração dos três níveis: gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna agora estão disponíveis através de Chat Completions e Responses. O lançamento também altera o mecanismo de cache de prompt e sua cobrança: as gravações de cache agora são cobradas separadamente. Este post cobre o posicionamento dos três níveis e detalha as mudanças no cache ponto a ponto.
Quais mudanças nos três níveis do GPT-5.6
O GPT-5.6 revisa o esquema de nomenclatura: o número denota a geração do modelo, enquanto Sol, Terra e Luna são níveis de capacidade que podem evoluir independentemente. De acordo com as definições oficiais, Sol é o modelo principal, Terra é um nível de preço mais baixo com desempenho comparável ao GPT-5.5, e Luna é o nível mais rápido e de menor preço.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Posicionamento oficial | Modelo principal para trabalho profissional complexo | Inteligência e custo equilibrados | Para cargas de trabalho sensíveis a custo |
| Janela de contexto | 1.050.000 | 1.050.000 | 1.050.000 |
| Saída máxima | 128.000 | 128.000 | 128.000 |
| Data de corte do conhecimento | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Equivalente aproximado na geração anterior | Nível sem sufixo | nível mini | nível nano |
Sobre as capacidades, a posição oficial: Sol alcança resultados de ponta em codificação, trabalho de conhecimento, cibersegurança e tarefas científicas, sendo descrito pela OpenAI como seu melhor modelo de codificação até hoje, e estabelece novos recordes no Terminal-Bench 2.1 e DeepSWE; Terra iguala o desempenho do GPT-5.5 a metade do preço. A família adiciona um nível máximo de raciocínio, e a API de Responses ganha chamadas de ferramentas programáticas e capacidades multi-agente (Beta).
A atualização do mecanismo de cache, explicada
Antes do GPT-5.6, o cache de prompt nos modelos GPT era totalmente automático: prefixos de 1.024 tokens ou mais eram armazenados automaticamente, os desenvolvedores não tinham controle sobre o que era armazenado ou por quanto tempo, e os caches eram limpos após 5 a 10 minutos de inatividade. A OpenAI resume as mudanças do GPT-5.6 como "cache de prompt mais previsível", com três pontos concretos:
- A retenção passa de "tão curta quanto 5 minutos" para "pelo menos 30 minutos".
prompt_cache_options.ttlatualmente suporta apenas"30m"; esse é um mínimo garantido, e a retenção real pode ser mais longa. - Pontos de interrupção de cache explícitos são novos. Definir
prompt_cache_breakpointem um bloco de conteúdo fixa o limite do cache no final do conteúdo estável, de modo que alterações após o ponto de interrupção não invalidem o prefixo armazenado antes dele; comprompt_cache_options.modedefinido como"explicit", apenas pontos de interrupção manuais são usados. prompt_cache_keypassa de uma otimização para um requisito oficial. A partir do GPT-5.6, o parâmetro deve ser definido para permitir um emparelhamento de cache mais confiável; a OpenAI recomenda manter o tráfego por chave em cerca de 15 solicitações por minuto.
Como avaliar a cobrança de gravação de cache 1.25x
A partir do GPT-5.6, as gravações de cache são cobradas a 1,25x a taxa de entrada base e as leituras de cache a 0,1x; em modelos anteriores, as gravações de cache não têm taxa adicional. A redação oficial (do anúncio do GPT-5.6): "Para o GPT-5.6 e modelos posteriores, as gravações de cache são cobradas a 1,25x a taxa de entrada não armazenada do modelo, enquanto as leituras de cache continuam a receber o desconto de 90% na entrada armazenada."
A matemática do ponto de equilíbrio segue diretamente das taxas oficiais: escrever um prefixo custa 0,25x a taxa de entrada a mais do que não armazenar, e cada acesso subsequente economiza 0,9x a taxa de entrada: um prefixo reutilizado mesmo uma vez produz uma economia líquida, e quanto mais reutilização, maior a economia.
- Cargas de trabalho que claramente se beneficiam: fluxos de trabalho de agentes com longas solicitações do sistema, RAG que inclui repetidamente longos materiais de referência, aplicações que carregam grandes definições de ferramentas e conversas de múltiplas turnos que apenas adicionam mensagens. Essas cargas de trabalho têm alta reutilização de prefixo, então a taxa de leitura de 0,1x domina.
- Cargas de trabalho a serem observadas: solicitações longas únicas cujo prefixo nunca é reutilizado. O cache automático está ativado por padrão, então essas solicitações incorrerão em uma taxa de gravação irrecuperável de 1,25x; definir
prompt_cache_options.modecomo"explicit"sem definir nenhum ponto de interrupção faz com que a solicitação ignore completamente o cache e não incorra em taxa de gravação.
Comparação: cache de prompt no GPT-5.6 e Claude
O design de cache do GPT-5.6 converge com o cache_control do Claude em várias dimensões, com a principal diferença no comportamento padrão: o GPT armazena automaticamente sem parâmetros necessários, enquanto o Claude requer que o cache seja ativado na solicitação, seja pelo campo cache_control de nível superior (ponto de interrupção automático) ou por pontos de interrupção explícitos em nível de bloco de conteúdo.
| Dimensão | Família GPT-5.6 | Família Claude (todos os modelos ativos) |
|---|---|---|
| Ativação | Cache automático, pontos de interrupção explícitos opcionais | Deve ser ativado: ponto de interrupção automático cache_control de nível superior, ou pontos de interrupção explícitos em nível de bloco de conteúdo |
| Parâmetro de ponto de interrupção | prompt_cache_breakpoint (nível de bloco de conteúdo) |
cache_control (nível superior ou nível de bloco de conteúdo) |
| Limite de ponto de interrupção | No máximo 4 novas gravações de cache por solicitação | No máximo 4 pontos de interrupção |
| Retenção de cache | Pelo menos 30 minutos | 5 minutos por padrão (atualizado sem custo em cada acesso), opcional 1 hora |
| Cobrança de gravação de cache | 1,25x taxa de entrada | 1,25x para o nível de 5 minutos, 2x para o nível de 1 hora |
| Cobrança de leitura de cache | 0,1x taxa de entrada | 0,1x taxa de entrada |
| Comprimento mínimo armazenável | 1.024 tokens | 512–4.096 tokens dependendo do modelo |
| Requisito de acesso | Idêntico byte a byte antes do ponto de interrupção | Idêntico byte a byte antes do ponto de interrupção |
A coluna do Claude reflete as regras compartilhadas por todos os modelos ativos do Claude: 1,25x para gravações no nível de 5 minutos, 2x para o nível de 1 hora, e 0,1x para leituras se aplicam uniformemente em toda a linha (documentação de cache de prompt da Anthropic), com diferenças por modelo limitadas ao comprimento mínimo armazenável; a coluna do GPT-5.6 vem do guia de cache de prompt da OpenAI.
Os limites de ponto de interrupção, taxas de gravação (para os níveis correspondentes) e taxas de leitura correspondem exatamente entre os dois provedores; em termos práticos, a mesma estratégia de estruturação de prompt "conteúdo estático primeiro, conteúdo em mudança por último" se aplica entre eles. O custo de migração está concentrado na sintaxe dos parâmetros: o GPT usa prompt_cache_breakpoint + prompt_cache_key, o Claude usa cache_control.
O mesmo padrão de cache em ambos os protocolos
Para o mesmo cenário "armazenar uma instrução longa estática", as implementações mínimas nos dois protocolos seguem. Os exemplos usam gpt-5.6-sol e claude-opus-4-8. Ambos compartilham o mesmo preço base de entrada ($5/M), então os preços efetivos por token derivados de gravações de cache (1,25x) e leituras (0,1x) também são idênticos; apenas a sintaxe difere.
O protocolo GPT define prompt_cache_key no nível superior (prefixos longos são armazenados automaticamente, sem necessidade de marcador de ponto de interrupção); o protocolo Claude define cache_control no nível superior para habilitar o cache automático, mudando para pontos de interrupção em nível de bloco de conteúdo quando um controle preciso sobre o limite do cache é necessário:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Instruções longas e estáticas, >=1024 tokens]"
},
{
"role": "user",
"content": "Resuma os principais números."
}
]
}'
Claude (Mensagens)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Instruções longas e estáticas, >=1024 tokens]",
"messages": [
{
"role": "user",
"content": "Resuma os principais números."
}
]
}'
Comparando as duas solicitações, as diferenças se resumem a: o endpoint (/v1/chat/completions vs /v1/messages), os cabeçalhos de autenticação (Authorization: Bearer vs x-api-key + anthropic-version), o parâmetro de cache (nível superior prompt_cache_key vs nível superior cache_control), e o Claude requer um max_tokens explícito. Ambas as solicitações foram verificadas contra aihubmix.com (2026-07-10): gpt-5.6-sol retornou cached_tokens: 2816 na segunda chamada; claude-opus-4-8 retornou cache_creation_input_tokens: 3632 na primeira chamada e cache_read_input_tokens: 3632 na segunda.
Além do formato da solicitação, três diferenças em nível de mecanismo permanecem:
- Ativação: o GPT armazena automaticamente mesmo sem quaisquer parâmetros de cache, com
prompt_cache_keymelhorando a confiabilidade do acesso; o Claude requer uma declaração: um ponto de interrupçãocache_controlem nível de bloco de conteúdo, ou o modo automáticocache_controlde nível superior. - Campos de uso: o GPT relata leituras de cache em
prompt_tokens_details.cached_tokens; o Claude relata gravações e leituras separadamente comocache_creation_input_tokensecache_read_input_tokens, facilitando a verificação de gravações e acessos de forma independente. - Controle de duração: o
ttldo GPT-5.6 atualmente suporta apenas"30m"; o Claude tem como padrão 5 minutos (atualizado sem custo em cada acesso), com um"ttl": "1h"opcional (gravações cobradas a 2x).
O que mudar ao trocar modelos entre protocolos
O gateway AIHubMix suporta chamadas entre protocolos: o endpoint compatível com OpenAI pode chamar modelos do Claude (cache_control vai diretamente para os blocos de conteúdo da mensagem no formato OpenAI; veja Práticas de Cache de Prompt), e o endpoint /v1/messages compatível com Claude pode chamar o GPT-5.6 (verificado como funcionando). Ao trocar modelos, verifique três coisas:
- Altere
modelpara o ID do modelo alvo; - Troque a sintaxe do parâmetro de cache:
prompt_cache_key/ pontos de interrupção explícitos correspondem aocache_controldo Claude; - Troque os nomes dos campos de uso:
cached_tokenscorresponde acache_read_input_tokensdo Claude.
Caminhos recomendados para cache de prompt: modelos GPT através de Chat Completions (o caminho de acesso ao cache verificado neste post); modelos Claude funcionam através de qualquer protocolo.
Comparação: GPT-5.6 vs cache de GPT anterior
| Dimensão | Antes do GPT-5.6 | GPT-5.6 e posteriores |
|---|---|---|
| Gravações de cache | Sem taxa adicional | 1,25x taxa de entrada |
| Retenção de cache | Limpa após 5–10 minutos de inatividade, até 1 hora | Pelo menos 30 minutos |
| Controle de cache | Nenhum | Pontos de interrupção explícitos, modo explícito, prompt_cache_key para emparelhamento confiável |
| Retenção estendida de 24 horas | prompt_cache_retention em alguns modelos |
Substituído por prompt_cache_options.ttl (atualmente apenas 30m) |
As mudanças apontam em uma direção: o cache de gerações anteriores era livre de taxas de gravação, mas incontrolável, com retenção incerta; o GPT-5.6 cobra por gravações enquanto fornece um piso de retenção garantido e controles de cache precisos. Pelas taxas, um prefixo reutilizado mais de uma vez em média economiza mais do que o custo adicional de gravação; o piso de retenção de 30 minutos e pontos de interrupção controláveis tornam mais previsível alcançar essa taxa de reutilização.
Começando no AIHubMix
Todos os três níveis estão ao vivo, com IDs de modelo gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna. O cache não requer configuração extra; solicitações consecutivas com o mesmo prefixo longo atingem o cache:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Você é um assistente meticuloso para analisar relatórios financeiros trimestrais... [Instruções longas e estáticas, >=1024 tokens]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Resuma os principais números em uma frase."},
],
)
print(completion.usage.prompt_tokens_details)
Um valor usage.prompt_tokens_details.cached_tokens maior que 0 na segunda chamada indica um acesso (exemplo medido: cached_tokens: 2816). Para detalhes sobre parâmetros, especificações de cobrança e solução de problemas de acesso, veja a documentação de Cache de Prompt do GPT.
FAQ
Quais APIs podem chamar o GPT-5.6 no AIHubMix?
Chat Completions (/v1/chat/completions), Responses (/v1/responses) e a API de Mensagens compatível com Claude (/v1/messages) podem chamar todos os modelos, e todos os três níveis estão ao vivo. Para cache de prompt, Chat Completions é atualmente o caminho recomendado.
Se meu cliente não mudar nada, o que muda na cobrança após a atualização para o GPT-5.6?
O cache de prompt se aplica automaticamente por padrão: solicitações cujo prefixo atinge 1.024 tokens incorrerão em um item de gravação de cache cobrado a 1,25x a taxa de entrada, e prefixos reutilizados são cobrados a 0,1x a taxa de leitura. Aplicações com alta reutilização de prefixo geralmente veem custos totais mais baixos; solicitações longas únicas que nunca reutilizam um prefixo podem desativar o cache com o modo explícito.
Eu usei o cache de prompt do Claude. O que eu mudo para migrar para o GPT-5.6?
A estratégia de estruturação de prompt permanece a mesma: conteúdo estático primeiro, conteúdo em mudança por último. Os parâmetros mudam de cache_control para prompt_cache_breakpoint, além de prompt_cache_key; a retenção muda dos níveis de 5 minutos/1 hora para um piso garantido de 30 minutos.
Como escolho entre os três níveis do GPT-5.6?
De acordo com o posicionamento oficial: escolha Sol para trabalho profissional complexo e tarefas de codificação; escolha Terra para cargas de trabalho do dia a dia (desempenho nível GPT-5.5 a metade do preço); escolha Luna para cenários sensíveis a custo e de alto volume. Todos os três níveis compartilham a mesma janela de contexto e saída máxima, então você pode direcionar pela complexidade da tarefa.
Referências oficiais
Especificações do modelo, mecanismos de cache e taxas de cobrança neste post vêm dessas fontes oficiais:
- Anúncio do GPT-5.6 (OpenAI, 2026-07-09)
- Guia de cache de prompt da OpenAI
- Preços da OpenAI
- Documentação de cache de prompt da Anthropic
Documentação relacionada neste site: Cache de Prompt do GPT · Cache de Prompt do Claude · Práticas de Cache de Prompt
Visite a galeria de modelos para preços do GPT-5.6, ou explore mais opções de integração no centro de documentação.
Última atualização: 2026-07-10