GPT-6.1 Sol a le même prix de liste que GPT-6 Sol : 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie. Votre facture réelle dépend de quatre autres éléments : la fréquence à laquelle vous accédez au cache, si vous dépassez 272K tokens d'entrée, le niveau de service que vous utilisez et le nombre de tokens de raisonnement que le modèle consomme. Cet article passe en revue chacun d'eux.
La liste complète des prix
Tarifs standard (par 1M de tokens)
| GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra | GPT-6 Luna | |
|---|---|---|---|---|
| Entrée | 2,00 $ | 2,00 $ | 10,00 $ | 0,10 $ |
| Entrée mise en cache | 0,10 $ | 0,20 $ | 1,00 $ | — |
| Écritures de cache | 2,50 $ | 2,50 $ | — | — |
| Sortie (incl. raisonnement) | 10,00 $ | 10,00 $ | 50,00 $ | 0,50 $ |
Le tarif mis en cache d'Astra provient de rapports tiers. Son tarif d'écriture de cache devrait être de 12,50 $ selon la règle 1,25× d'OpenAI. Pour les prix du cache de Luna, voir la page de tarification d'OpenAI.
Multiplicateurs
Ces règles proviennent de la page du modèle GPT-6.1 Sol :
| Condition | Ce qui se passe |
|---|---|
| Plus de 272K tokens d'entrée | La demande entière est facturée à 2× l'entrée et le cache, 1,5× la sortie (4 $ / 15 $, lectures de cache 0,20 $, écritures de cache 5 $) |
| Batch / Flex | La moitié du tarif standard |
| Mode rapide | Le double du tarif standard (non disponible avec la résidence de données dans l'UE) |
| Traitement régional | +10% |
| Appels d'outils (recherche, utilisation de l'ordinateur, etc.) | Facturé par appel. AIHubMix liste la recherche web à 0,01 $ par demande |
| Ultrafast (à venir sur Codex) | Pas encore officiellement tarifé. Un rapport indique 6× le tarif standard, non confirmé |
Sur AIHubMix, les routes OpenAI et Azure coûtent le même prix que directement via OpenAI, et le niveau au-dessus de 272K est déjà listé.
Le véritable changement : lectures de cache à 5 % de l'entrée
Le prix de liste n'a pas changé. Les lectures de cache ont changé, passant de 10 % du tarif d'entrée (0,20 $) à 5 % (0,10 $). Les documents de mise en cache des invites d'OpenAI le disent clairement : les lectures de cache sont à 0,1× l'entrée sur la plupart des modèles et "0,05× sur GPT-6.1 Sol."
Cela est important car les agents renvoient le même matériel à chaque étape : invite système, définitions d'outils, contexte de dépôt et historique de conversation. La plupart de leur entrée est du contenu répété. Pour ces charges de travail, le tarif mis en cache est effectivement votre véritable prix d'entrée.
Exemple concret : une tâche d'agent de codage
Hypothèses :
- Un préfixe fixe de 200K tokens (invite système, outils, contexte de dépôt)
- 50 étapes, chacune ajoutant 2K nouveaux tokens d'entrée et produisant 3K tokens de sortie (y compris le raisonnement)
- Pour simplifier, le préfixe reste de la même taille, est écrit dans le cache à l'étape 1 et est utilisé à toutes les 49 étapes restantes
| 6.1 Sol, sans cache | 6 Sol + cache | 6.1 Sol + cache | Astra + cache | |
|---|---|---|---|---|
| Écriture initiale de 200K dans le cache | — | 0,50 $ | 0,50 $ | 2,50 $ |
| 49 lectures de cache | — | 1,96 $ | 0,98 $ | 9,80 $ |
| Préfixe facturé comme entrée régulière | 20,00 $ | — | — | — |
| 100K nouvelle entrée (au tarif d'écriture) | 0,20 $ | 0,25 $ | 0,25 $ | 1,25 $ |
| 150K sortie | 1,50 $ | 1,50 $ | 1,50 $ | 7,50 $ |
| Total | 21,70 $ | 4,21 $ | 3,23 $ | 21,05 $ |
Trois points à retenir :
- La mise en cache est le plus grand levier. Même modèle, même travail, et l'exécution sans cache coûte presque 7× plus.
- 6.1 Sol est environ 23 % moins cher que 6 Sol ici, tout en obtenant également de meilleurs résultats.
- Pour les travaux lourds en cache, Astra coûte plus cher que ce que l'écart de prix de 5× suggère. Dans cet exemple, c'est 6,5×, car Astra réduit le coût de l'entrée mise en cache de 90 % et 6.1 Sol de 95 %.
Cela correspond aux coûts par tâche rapportés par OpenAI (compilés par Vellum et The Next Web) : environ 1,50 $ contre 7,70 $ sur DeepSWE, 1,30 $ contre 9,30 $ sur OSWorld, et 5,47 $ contre 23,80 $ sur Terminal-Bench Science.
Une mise en garde : OpenAI dit qu'Astra a généralement besoin de moins de tokens de sortie pour terminer la même tâche. Comparez les modèles sur le coût par tâche, pas le coût par token.
Les écritures de cache ne sont pas gratuites
Les écritures de cache sur 6.1 Sol coûtent 1,25× le tarif d'entrée. Si un préfixe n'est utilisé qu'une seule fois, la mise en cache le rend 25 % plus cher. En utilisant la formule des documents d'OpenAI :
- Une écriture plus une lecture : 1,35× le coût d'entrée normal (1,3× sur 6.1 Sol), contre 2× sans mise en cache
- Une écriture plus neuf lectures : environ 2,15× (environ 1,7× sur 6.1 Sol), contre 10×
Le préfixe minimum pouvant être mis en cache est de 1 024 tokens. Les calculs de seuil de rentabilité d'OpenAI indiquent qu'un préfixe de 102 tokens ou moins ne sera jamais rentable. Si vous prévoyez 10 réutilisations ou plus, ajouter des tokens au-delà de 221 jusqu'à 1 024 revient moins cher.
Pour des appels uniques tels que la classification à tour unique ou l'extraction en masse, utilisez le mode explicite (prompt_cache_options.mode: "explicit") sans points de rupture. Vous ne serez pas facturé pour les écritures.
Le seuil de 272K
6.1 Sol accepte 1,05M de tokens de contexte, mais une fois que l'entrée dépasse 272K, l'ensemble de la demande passe au tarif supérieur, pas seulement les tokens au-delà de la limite.
| Demande | Entrée | Sortie | Coût |
|---|---|---|---|
| A | 270K | 10K | 0,27 × 2 $ + 0,01 × 10 $ = 0,64 $ |
| B | 280K | 10K | 0,28 × 4 $ + 0,01 × 15 $ = 1,27 $ |
Dix mille tokens d'entrée supplémentaires doublent presque la facture.
Comment rester en dessous :
- Comptez les tokens côté client et compressez ou réduisez avant d'atteindre 272K
- Récupérez les parties pertinentes de longs documents au lieu d'envoyer l'ensemble
- Lorsque vous avez réellement besoin d'un long contexte, mettez la partie fixe dans un préfixe mis en cache
Comment l'effort de raisonnement se reflète sur la facture
Les tokens de raisonnement sont facturés au tarif de sortie, 10 $ par million. Passer la même tâche de faible à maximum peut multiplier les tokens de raisonnement par dix ou plus.
Les coûts par tâche rapportés par OpenAI donnent une idée de l'échelle (ce sont des benchmarks différents, donc ne comparez que les magnitudes) :
- AutomationBench (moyen) : ~0,30 $
- GDP.pdf : ~0,38 $
- DeepSWE (élevé) : ~1,50 $
- Terminal-Bench Science (max) : ~5,47 $
La partie 2 couvre comment choisir un niveau. Un rappel ici : changer reasoning.effort en cours de conversation invalide le cache. Utilisez configuration_update à la place.
Comment cela se compare à ce prix
| Modèle | Entrée / sortie | Entrée mise en cache |
|---|---|---|
| GPT-6.1 Sol | 2 $ / 10 $ | 0,10 $ |
| Claude Sonnet 5.5 | 2 $ / 10 $ | 0,20 $ |
| GPT-6 Astra | 10 $ / 50 $ | 1,00 $ |
6.1 Sol et Claude Sonnet 5.5 partagent un prix de liste, et le tarif mis en cache de 6.1 Sol est la moitié de celui de Sonnet. Cependant, ils excellent dans des domaines différents. Sur AutomationBench, par exemple, Sonnet 5.5 obtient de bien meilleurs résultats. Lorsque deux modèles coûtent le même prix par token, celui avec le coût le plus bas par tâche pour votre charge de travail est le moins cher.
La liste des modèles AIHubMix montre les prix actuels, et une clé API fonctionne pour tous, ce qui facilite les tests côte à côte.
Les prix des concurrents proviennent de sources tierces et peuvent changer. Vérifiez les pages de tarification officielles avant de vous y fier.
Liste de contrôle des coûts
- Mettez le contenu stable en premier. L'invite système, les définitions d'outils et le matériel de référence vont en haut. Les horodatages et les données par utilisateur vont à la fin.
- Ajoutez, ne réécrivez pas. Résumer, tronquer et compacter redémarre tous le cache.
- Gardez la liste des outils stable. N'ajoutez ni ne retirez d'outils par demande. Utilisez
tool_choiceouallowed_toolsà la place. - Changez l'effort avec
configuration_update, pas le paramètre de demande. - Restez en dessous de 272K d'entrée.
- Envoyez des travaux non urgents via Batch ou Flex pour moitié prix.
- Dirigez par tâche. Luna pour un travail simple à fort volume, 6.1 Sol pour la plupart des choses, Astra pour les problèmes les plus difficiles.
- Surveillez trois chiffres :
cached_tokens,cache_write_tokens, etreasoning_tokens.
En résumé : le prix de liste n'a pas changé, mais les lectures de cache sont devenues 50 % moins chères. Pour les charges de travail d'agents, cela fait de 6.1 Sol le modèle offrant le meilleur rapport qualité-prix dans la famille GPT-6, tant que vous utilisez bien la mise en cache et restez en dessous de 272K.
Prochain sujet : les problèmes que vous êtes susceptibles de rencontrer lors de la transition.
FAQ
Combien coûte GPT-6.1 Sol ? 2 $ par million de tokens d'entrée, 10 $ par million de tokens de sortie, 0,10 $ pour l'entrée mise en cache et 2,50 $ pour les écritures de cache. Les demandes dépassant 272K tokens d'entrée sont facturées à 4 $ pour l'entrée et 15 $ pour la sortie pour l'ensemble de la demande.
Est-ce moins cher via AIHubMix ou OpenAI directement ? Même prix. Les routes OpenAI et Azure d'AIHubMix correspondent toutes deux aux tarifs officiels d'OpenAI.
Pourquoi ma facture est-elle plus élevée que ce que j'avais estimé ? Quatre raisons courantes : les tokens de raisonnement sont facturés au tarif de sortie ; vous avez dépassé 272K d'entrée ; vous avez manqué le cache ou payé des frais d'écriture sur des préfixes uniques ; ou le mode rapide ou le traitement régional est activé.
Les écritures de cache coûtent-elles plus cher ? Les tokens écrits sont facturés à 1,25× le tarif d'entrée. Cela remplace le coût normal d'entrée plutôt que de s'y ajouter. Un préfixe se rentabilise après deux utilisations. Pour des préfixes uniques, le mode explicite vous permet de sauter complètement les écritures.
Combien 6.1 Sol est-il moins cher qu'Astra ? Cinq fois moins cher au prix de liste. Pour un travail d'agent lourd en cache, l'écart peut atteindre 6 à 7× car 6.1 Sol réduit davantage le coût de l'entrée mise en cache. Astra utilise souvent moins de tokens de sortie par tâche, donc comparez le coût par tâche.
Le Batch peut-il être combiné avec la mise en cache ? Batch et Flex sont tous deux à moitié prix. Pour savoir comment ils s'empilent avec la mise en cache, consultez la page de tarification d'OpenAI.
Continuez à lire : la série GPT-6.1 Sol
- Les tokens de raisonnement sont le coût le plus facile à perdre de vue. Quelles tâches sont acceptables à faible coût, et quand le maximum est rentable : Choisir un effort de raisonnement pour GPT-6.1 Sol : de faible à maximum.
- Les nouvelles règles de mise en cache peuvent augmenter votre facture après votre migration. Points de rupture, facturation des écritures, TTL et huit autres pièges : Migrer vers GPT-6.1 Sol : 9 choses qui peuvent mal tourner.
- Moins cher, mais est-ce suffisant ? À quel point 6.1 Sol se rapproche d'Astra en matière de codage et d'utilisation de l'ordinateur : GPT-6.1 Sol contre GPT-6 Sol : une mise à niveau d'une semaine qui rattrape presque Astra.



