OpenAI a officiellement lancé la famille GPT-5.6 le 9 juillet 2026. AIHubMix a terminé l'intégration des trois niveaux : gpt-5.6-sol, gpt-5.6-terra et gpt-5.6-luna sont désormais disponibles via les complétions de chat et les réponses. La sortie modifie également le mécanisme de mise en cache des requêtes et sa facturation : les écritures de cache sont désormais facturées séparément. Cet article couvre le positionnement des trois niveaux et passe en revue les changements de mise en cache point par point.
Quelles sont les modifications apportées aux trois niveaux GPT-5.6
GPT-5.6 révise le schéma de nommage : le numéro désigne la génération du modèle, tandis que Sol, Terra et Luna sont des niveaux de capacité qui peuvent évoluer indépendamment. Selon les définitions officielles, Sol est le modèle phare, Terra est un niveau à prix réduit avec des performances comparables à GPT-5.5, et Luna est le niveau le plus rapide et le moins cher.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Positionnement officiel | Modèle phare pour un travail professionnel complexe | Intelligence et coût équilibrés | Pour des charges de travail sensibles au coût |
| Fenêtre de contexte | 1 050 000 | 1 050 000 | 1 050 000 |
| Sortie max | 128 000 | 128 000 | 128 000 |
| Date limite de connaissance | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Équivalent approximatif dans la génération précédente | Niveau sans suffixe | Niveau mini | Niveau nano |
Concernant les capacités, la position officielle : Sol obtient des résultats à la pointe de la technologie sur les tâches de codage, de travail de connaissance, de cybersécurité et de science, est décrit par OpenAI comme son meilleur modèle de codage à ce jour, et établit de nouveaux records sur Terminal-Bench 2.1 et DeepSWE ; Terra égalise les performances de GPT-5.5 à moitié prix. La famille ajoute un niveau de raisonnement maximum, et l'API des réponses gagne des capacités d'appel d'outils programmatiques et multi-agents (Beta).
Explication de la mise à niveau du mécanisme de mise en cache
Avant GPT-5.6, la mise en cache des requêtes sur les modèles GPT était entièrement automatique : les préfixes de 1 024 tokens ou plus étaient mis en cache automatiquement, les développeurs n'avaient aucun contrôle sur ce qui était mis en cache ou pendant combien de temps, et les caches étaient effacés après 5 à 10 minutes d'inactivité. OpenAI résume les changements de GPT-5.6 comme "une mise en cache des requêtes plus prévisible", avec trois points concrets :
- La durée de conservation passe de "aussi courte que 5 minutes" à "au moins 30 minutes".
prompt_cache_options.ttlprend actuellement en charge uniquement"30m"; c'est un minimum garanti, et la durée de conservation réelle peut être plus longue. - Les points d'arrêt de cache explicites sont nouveaux. La définition de
prompt_cache_breakpointsur un bloc de contenu fixe la limite de cache à la fin du contenu stable, de sorte que les changements après le point d'arrêt n'invalident pas le préfixe mis en cache avant ; avecprompt_cache_options.modedéfini sur"explicit", seuls les points d'arrêt manuels sont utilisés. prompt_cache_keypasse d'une optimisation à une exigence officielle. À partir de GPT-5.6, le paramètre doit être défini pour permettre un appariement de cache plus fiable ; OpenAI recommande de maintenir le trafic par clé à environ 15 requêtes par minute.
Comment évaluer la facturation des écritures de cache à 1,25x
À partir de GPT-5.6, les écritures de cache sont facturées à 1,25x le taux d'entrée de base et les lectures de cache à 0,1x ; sur les modèles précédents, les écritures de cache n'ont pas de frais supplémentaires. La formulation officielle (de l'annonce GPT-5.6) : "Pour GPT-5.6 et les modèles ultérieurs, les écritures de cache sont facturées à 1,25x le taux d'entrée non mis en cache du modèle, tandis que les lectures de cache continuent de bénéficier de la remise de 90 % sur l'entrée mise en cache."
Les calculs de rentabilité découlent directement des taux officiels : écrire un préfixe coûte 0,25x le taux d'entrée de plus que de ne pas mettre en cache, et chaque appel suivant économise 0,9x le taux d'entrée : un préfixe réutilisé même une fois produit une économie nette, et plus il y a de réutilisations, plus l'économie est importante.
- Charges de travail qui bénéficient clairement : flux de travail d'agents avec de longs prompts système, RAG qui inclut à plusieurs reprises de longs documents de référence, applications portant de grandes définitions d'outils, et conversations multi-tours qui n'ajoutent que des messages. Ces charges de travail ont une forte réutilisation de préfixes, donc le taux de lecture de 0,1x domine.
- Charges de travail à surveiller : demandes longues uniques dont le préfixe n'est jamais réutilisé. La mise en cache automatique est activée par défaut, donc ces demandes entraînent des frais d'écriture non récupérables de 1,25x ; définir
prompt_cache_options.modesur"explicit"sans définir de points d'arrêt fait que la demande ignore complètement le cache et n'entraîne aucun frais d'écriture.
Comparaison : mise en cache des requêtes sur GPT-5.6 et Claude
Le design de mise en cache de GPT-5.6 converge avec cache_control de Claude sur plusieurs dimensions, la différence principale étant le comportement par défaut : GPT met en cache automatiquement sans paramètres requis, tandis que Claude nécessite que la mise en cache soit activée dans la demande, soit le champ cache_control de niveau supérieur (point d'arrêt automatique) ou des points d'arrêt explicites au niveau du bloc de contenu.
| Dimension | Famille GPT-5.6 | Famille Claude (tous les modèles actifs) |
|---|---|---|
| Activation | Mise en cache automatique, points d'arrêt explicites optionnels | Doit être activé : point d'arrêt automatique cache_control de niveau supérieur, ou points d'arrêt explicites au niveau du bloc de contenu |
| Paramètre de point d'arrêt | prompt_cache_breakpoint (niveau bloc de contenu) |
cache_control (niveau supérieur ou niveau bloc de contenu) |
| Limite de point d'arrêt | Au maximum 4 nouvelles écritures de cache par demande | Au maximum 4 points d'arrêt |
| Conservation du cache | Au moins 30 minutes | 5 minutes par défaut (rafraîchi sans frais à chaque appel), optionnel 1 heure |
| Facturation des écritures de cache | 1,25x taux d'entrée | 1,25x pour le niveau de 5 minutes, 2x pour le niveau de 1 heure |
| Facturation des lectures de cache | 0,1x taux d'entrée | 0,1x taux d'entrée |
| Longueur minimale mise en cache | 1 024 tokens | 512–4 096 tokens selon le modèle |
| Exigence de correspondance | Identique au byte près avant le point d'arrêt | Identique au byte près avant le point d'arrêt |
La colonne Claude reflète les règles partagées par tous les modèles Claude actifs : 1,25x pour les écritures du niveau de 5 minutes, 2x pour le niveau de 1 heure, et 0,1x pour les lectures s'appliquent uniformément à toute la gamme (documentation sur la mise en cache des requêtes d'Anthropic), les différences par modèle étant limitées à la longueur minimale mise en cache ; la colonne GPT-5.6 provient du guide de mise en cache des requêtes d'OpenAI.
Les limites de points d'arrêt, les taux d'écriture (pour les niveaux correspondants) et les taux de lecture correspondent exactement entre les deux fournisseurs ; en termes pratiques, la même stratégie de structuration des requêtes "contenu statique d'abord, contenu changeant ensuite" se transpose entre eux. Le coût de migration est concentré dans la syntaxe des paramètres : GPT utilise prompt_cache_breakpoint + prompt_cache_key, Claude utilise cache_control.
Le même modèle de mise en cache dans les deux protocoles
Pour le même scénario "mettre en cache une longue instruction statique", les implémentations minimales dans les deux protocoles suivent. Les exemples utilisent gpt-5.6-sol et claude-opus-4-8. Les deux partagent le même prix d'entrée de base (5 $/M), donc les prix effectifs par token dérivés des écritures de cache (1,25x) et des lectures (0,1x) sont également identiques ; seule la syntaxe diffère.
Le protocole GPT définit prompt_cache_key au niveau supérieur (les longs préfixes sont mis en cache automatiquement, aucun marqueur de point d'arrêt nécessaire) ; le protocole Claude définit cache_control au niveau supérieur pour activer la mise en cache automatique, passant à des points d'arrêt au niveau du bloc de contenu lorsque le contrôle précis de la limite de cache est nécessaire :
GPT-5.6 (Complétions de chat)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Instructions longues statiques, >=1024 tokens]"
},
{
"role": "user",
"content": "Résumez les chiffres clés."
}
]
}'
Claude (Messages)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Instructions longues statiques, >=1024 tokens]",
"messages": [
{
"role": "user",
"content": "Résumez les chiffres clés."
}
]
}'
En comparant les deux demandes, les différences se résument à : le point de terminaison (/v1/chat/completions contre /v1/messages), les en-têtes d'authentification (Authorization: Bearer contre x-api-key + anthropic-version), le paramètre de mise en cache (niveau supérieur prompt_cache_key contre niveau supérieur cache_control), et Claude nécessitant un max_tokens explicite. Les deux demandes ont été vérifiées contre aihubmix.com (2026-07-10) : gpt-5.6-sol a retourné cached_tokens: 2816 lors du deuxième appel ; claude-opus-4-8 a retourné cache_creation_input_tokens: 3632 lors du premier appel et cache_read_input_tokens: 3632 lors du second.
Au-delà du format de la demande, trois différences au niveau du mécanisme subsistent :
- Activation : GPT met en cache automatiquement même sans aucun paramètre de mise en cache, avec
prompt_cache_keyaméliorant la fiabilité des correspondances ; Claude nécessite une déclaration : un point d'arrêtcache_controlau niveau du bloc de contenu, ou le mode automatiquecache_controlde niveau supérieur. - Champs d'utilisation : GPT rapporte les lectures de cache dans
prompt_tokens_details.cached_tokens; Claude rapporte les écritures et les lectures séparément commecache_creation_input_tokensetcache_read_input_tokens, ce qui facilite la vérification des écritures et des correspondances indépendamment. - Contrôle de la durée de vie : le
ttlde GPT-5.6 prend actuellement en charge uniquement"30m"; Claude par défaut est de 5 minutes (rafraîchi sans frais à chaque appel), avec un"ttl": "1h"optionnel (écritures facturées à 2x).
Que changer lors de l'échange de modèles entre protocoles
La passerelle AIHubMix prend en charge les appels inter-protocoles : le point de terminaison compatible avec OpenAI peut appeler des modèles Claude (cache_control va directement dans les blocs de contenu au format OpenAI ; voir Pratiques de mise en cache des requêtes), et le point de terminaison /v1/messages compatible avec Claude peut appeler GPT-5.6 (vérifié comme fonctionnant). Lors de l'échange de modèles, vérifiez trois choses :
- Changer
modelpour l'ID du modèle cible ; - Changer la syntaxe du paramètre de mise en cache :
prompt_cache_key/ points d'arrêt explicites correspondent àcache_controlde Claude ; - Changer les noms des champs d'utilisation :
cached_tokenscorrespond àcache_read_input_tokensde Claude.
Chemins recommandés pour la mise en cache des requêtes : modèles GPT via les complétions de chat (le chemin de correspondance de cache vérifié dans cet article) ; les modèles Claude fonctionnent via l'un ou l'autre protocole.
Comparaison : GPT-5.6 vs mise en cache GPT précédente
| Dimension | Avant GPT-5.6 | GPT-5.6 et ultérieurs |
|---|---|---|
| Écritures de cache | Pas de frais supplémentaires | 1,25x taux d'entrée |
| Conservation du cache | Effacée après 5 à 10 minutes d'inactivité, jusqu'à 1 heure | Au moins 30 minutes |
| Contrôle du cache | Aucun | Points d'arrêt explicites, mode explicite, prompt_cache_key correspondance fiable |
| Conservation prolongée de 24 heures | prompt_cache_retention sur certains modèles |
Remplacé par prompt_cache_options.ttl (actuellement 30m uniquement) |
Les changements vont dans une seule direction : la mise en cache de génération antérieure était gratuite en frais d'écriture mais incontrôlable, avec une conservation incertaine ; GPT-5.6 facture les écritures tout en fournissant un plancher de conservation garanti et des contrôles de cache précis. Selon les taux, un préfixe réutilisé plus d'une fois en moyenne économise plus que le coût d'écriture supplémentaire ; le plancher de conservation de 30 minutes et les points d'arrêt contrôlables rendent le taux de réutilisation plus prévisible.
Commencer sur AIHubMix
Les trois niveaux sont en ligne, avec les ID de modèle gpt-5.6-sol, gpt-5.6-terra et gpt-5.6-luna. La mise en cache ne nécessite aucune configuration supplémentaire ; les demandes consécutives avec le même long préfixe touchent le cache :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Vous êtes un assistant méticuleux pour analyser les rapports financiers trimestriels... [Instructions longues statiques, >=1024 tokens]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Résumez les chiffres clés en une phrase."},
],
)
print(completion.usage.prompt_tokens_details)
Une valeur usage.prompt_tokens_details.cached_tokens supérieure à 0 lors du deuxième appel indique un succès (exemple mesuré : cached_tokens: 2816). Pour les détails des paramètres, les spécificités de facturation et le dépannage des succès, consultez la documentation sur la mise en cache des requêtes GPT.
FAQ
Quelles API peuvent appeler GPT-5.6 sur AIHubMix ?
Les complétions de chat (/v1/chat/completions), les réponses (/v1/responses) et l'API Messages compatible avec Claude (/v1/messages) peuvent toutes appeler les modèles, et les trois niveaux sont en ligne. Pour la mise en cache des requêtes, les complétions de chat sont actuellement le chemin recommandé.
Si mon client ne change rien, quels changements dans la facturation après la mise à niveau vers GPT-5.6 ?
La mise en cache des requêtes s'applique automatiquement par défaut : les demandes dont le préfixe atteint 1 024 tokens entraînent un élément d'écriture de cache facturé à 1,25x le taux d'entrée, et les préfixes réutilisés sont facturés au taux de lecture de 0,1x. Les applications avec une forte réutilisation de préfixes voient généralement des coûts totaux plus bas ; les demandes longues uniques qui ne réutilisent jamais un préfixe peuvent désactiver la mise en cache avec le mode explicite.
J'ai utilisé la mise en cache des requêtes de Claude. Que dois-je changer pour migrer vers GPT-5.6 ?
La stratégie de structuration des requêtes reste la même : contenu statique d'abord, contenu changeant ensuite. Les paramètres changent de cache_control à prompt_cache_breakpoint, plus prompt_cache_key ; la conservation passe des niveaux de 5 minutes/1 heure à un plancher garanti de 30 minutes.
Comment choisir parmi les trois niveaux GPT-5.6 ?
Selon le positionnement officiel : choisissez Sol pour un travail professionnel complexe et des tâches de codage ; choisissez Terra pour des charges de travail quotidiennes (performances de niveau GPT-5.5 à moitié prix) ; choisissez Luna pour des scénarios sensibles au coût et à fort volume. Les trois niveaux partagent la même fenêtre de contexte et la même sortie maximale, vous pouvez donc les orienter en fonction de la complexité des tâches.
Références officielles
Les spécifications des modèles, les mécanismes de mise en cache et les taux de facturation dans cet article proviennent de ces sources officielles :
- Annonce GPT-5.6 (OpenAI, 2026-07-09)
- Guide de mise en cache des requêtes d'OpenAI
- Tarification d'OpenAI
- Documentation sur la mise en cache des requêtes d'Anthropic
Documentation connexe sur ce site : Mise en cache des requêtes GPT · Mise en cache des requêtes Claude · Pratiques de mise en cache des requêtes
Visitez la galerie de modèles pour les prix de GPT-5.6, ou explorez d'autres options d'intégration dans le centre de documentation.
Dernière mise à jour : 2026-07-10