OpenAI a lancé GPT-6.1 Sol lors de DevDay le 29 septembre 2026. Le timing est frappant : GPT-6 Sol était disponible depuis exactement une semaine (il a été lancé le 22 septembre en même temps que Luna), et le modèle phare GPT-6 Astra avait moins d'un mois.
La page officielle du modèle résume l'argument en une ligne : "Performance proche d'Astra pour des travaux complexes à un coût inférieur." Concrètement, cela signifie un codage agentique, une utilisation informatique et des tâches professionnelles d'une qualité à peu près équivalente à celle d'Astra, pour un cinquième du prix par jeton d'Astra.
Ce post répond à deux questions : qu'est-ce qui a réellement changé par rapport à 6 Sol, et quelle est la taille de l'écart restant avec Astra ?
Position de 6.1 Sol dans la gamme
GPT-6.1 Sol est déjà disponible sur AIHubMix au même prix qu'OpenAI direct. Voici la famille actuelle de GPT-6 :
| Niveau | Modèle | Meilleur pour | Entrée / sortie par 1M |
|---|---|---|---|
| Phare | GPT-6 Astra | Raisonnement et codage les plus difficiles | $10 / $50 |
| Équilibré | GPT-6.1 Sol | Qualité proche d'Astra, coût inférieur | $2 / $10 |
| Précédent | GPT-6 Sol | Codage et flux de travail agentiques | $2 / $10 |
| Petit | GPT-6 Luna | Tâches simples à fort volume | $0.10 / $0.50 |
Un peu de contexte sur pourquoi cette version est un Sol et non un Astra : la veille de DevDay, le Wall Street Journal a rapporté qu'OpenAI avait mis de côté GPT-6.1 Astra, qui devait sortir en octobre, après qu'il ait régressé lors de tests de sécurité internes portant sur l'alignement et le respect du périmètre autorisé par un utilisateur. Ainsi, la mise à niveau ".1" a atterri uniquement sur Sol, et Astra reste à 6.0 pour l'instant.
Fiche technique : ce qui est identique, ce qui est différent
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| Fenêtre de contexte | 1.05M | 1.05M |
| Max entrée / sortie | 922K / 128K | 922K / 128K |
| Date limite de connaissance | 20 avril 2026 | 30 avril 2026 |
| Entrée | Texte, image | Texte, image |
| Effort de raisonnement | aucun – max | faible – max |
| Effort par défaut | moyen | moyen |
| Outils dans les complétions de chat | Uniquement à aucun | Non, utilisez les réponses |
| Prix d'entrée / sortie | $2 / $10 | $2 / $10 |
| Entrée mise en cache | $0.20 | $0.10 |
| Écritures en cache | $2.50 | $2.50 |
| Plus de 272K d'entrée | 2× en, 1.5× sortant | Identique |
Sur le papier, les deux modèles semblent presque identiques. Trois choses comptent réellement :
- Il est nettement plus intelligent au même prix. Les chiffres se trouvent dans la section suivante.
- Les lectures en cache coûtent deux fois moins cher. Les agents renvoient le même long préfixe à chaque étape, donc cet élément est souvent plus important que le prix principal. La partie 3 effectue les calculs.
aucuna disparu. Si vous comptiez suraucunpour des appels peu coûteux, ou pour appeler des outils dans les complétions de chat, changer le nom du modèle va casser des choses. Le guide de migration GPT-6 d'OpenAI en parle, et la partie 4 explique les solutions.
Évaluations
Une note sur les sources : les chiffres de cette section et de la suivante proviennent des documents de lancement d'OpenAI, compilés par DataCamp et Vellum. OpenAI a exécuté ses propres modèles et a extrait les scores des concurrents à partir de rapports publics. Personne ne les a reproduits de manière indépendante pour le moment. Utilisez-les comme une direction, puis effectuez vos propres évaluations.
Codage et agents
| Évaluation | 6.1 Sol | 6 Sol | Astra | Coût/tâche (Sol vs Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| Débogage de recherche | 75.52% | 64.20% | — | — |
Niveaux d'effort : DeepSWE à haut (6 Sol à max) ; OSWorld et Terminal-Bench Science à max ; AutomationBench à moyen.
Ce qui se démarque :
- Sur DeepSWE, il égalise Astra, à un effort élevé plutôt qu'à max. C'est 6.4 points au-dessus du meilleur résultat de GPT-6 Sol, à un coût par tâche inférieur ($1.50 contre $2.60).
- Sur OSWorld, il est environ 2 points derrière Astra, pour environ un septième du coût par tâche.
- Astra gagne toujours sur les travaux de recherche les plus difficiles (Terminal-Bench Science) et sur plusieurs évaluations bio et de sécurité, généralement de 4 à 16 points où il mène. OpenAI lui-même recommande Astra pour les tâches de recherche les plus difficiles.
- Ce n'est pas le meilleur modèle dans tous les domaines. Sur AutomationBench, Claude Sonnet 5.5 obtient 44.7% à $1.14 par tâche, bien au-dessus des 35.4% de 6.1 Sol.
Exactitude factuelle
À faible effort, la part des réponses comportant une erreur factuelle est tombée de 11.4% sur 6 Sol à 7.7%, soit environ un tiers de moins. À tous les niveaux d'effort, 6.1 Sol reste dans 1.9 points d'Astra.
Une mise en garde : l'ensemble d'évaluation est construit à partir de prompts difficiles où les utilisateurs ont signalé des erreurs antérieures, et OpenAI dit qu'il n'est pas représentatif d'une utilisation typique.
Autres domaines (6.1 Sol / 6 Sol / Astra)
- HealthBench Hard : 36.2 / 30.1 / 36.6
- HealthBench Professional : 64.2 / 60.8 / 64.7
- Suivi des instructions de chaîne de pensée : 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1) : 78.8% / 66.3% / 85.4%
En matière de santé, 6.1 Sol est essentiellement au même niveau qu'Astra. Sur le contrôle de chaîne de pensée et les tâches de sécurité offensive, Astra conserve une avance claire.
Alignement : meilleur dans l'ensemble, avec quelques régressions
OpenAI a exécuté 49 650 tâches de déploiement Codex simulées et a compté les incidents de gravité 3+ :
| Modèle | Incidents | Taux |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
C'est un tiers de moins que 6 Sol et à peu près au même niveau qu'Astra. Le modèle est également plus honnête sur les outils défectueux : il a omis de mentionner un outil de recherche défectueux 2.1% du temps, contre 4.9% (Astra : 1.5%).
Cependant, quelques chiffres ont évolué dans le mauvais sens :
- Contourner les restrictions explicites : 23.5%, contre 17.4% pour Astra. 6 Sol était apparemment à 64.4%, donc c'est toujours une grande amélioration par rapport au modèle précédent.
- Déception dans les tâches de codage : 1.50%, légèrement en hausse par rapport à 1.30% de 6 Sol et bien au-dessus de 0.51% d'Astra.
- Contacter d'autres agents : 38%, en hausse par rapport à 26%. Le taux d'exécution d'une action non autorisée est tombé de 11% à 3%.
Si vous donnez de réelles permissions à 6.1 Sol, la partie 4 couvre comment mettre en place des garde-fous.
Disponibilité
- API :
gpt-6.1-solsur les complétions de chat (pas d'outils), Réponses, et Batch. - ChatGPT : Les utilisateurs Plus, Pro, Business, Enterprise et Edu y ont accès dans ChatGPT Work et Codex. Il n'est pas encore dans le chat régulier de ChatGPT. Les administrateurs Enterprise et Edu doivent l'activer.
- Tiers : AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot, et d'autres. AIHubMix passe par OpenAI et Azure au même prix et réessaie automatiquement sur l'autre fournisseur si l'un échoue ou ralentit.
- Ultrafast : OpenAI annonce qu'une option Ultrafast pour GPT-6.1 Sol pour Codex, avec une génération jusqu'à 8× plus rapide, arrive dans quelques jours.
Pour les demandes de texte brut sans outils, les complétions de chat fonctionnent bien. Si c'est votre première fois, le démarrage rapide AIHubMix couvre la configuration.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)
Une fois que vous avez besoin d'outils, passez à l'API des Réponses (client.responses.create). Consultez la documentation de l'API des Réponses AIHubMix, et la partie 4 contient un exemple complet.
Devez-vous changer ?
- Sur GPT-6 Sol aujourd'hui : Oui. Même prix, mise en cache moins chère, résultats clairement meilleurs. Le seul obstacle est la disparition de
aucunet le fait que les outils ne fonctionnent plus dans les complétions de chat. - Sur GPT-6 Astra aujourd'hui : Effectuez un test A/B sur votre propre charge de travail, ce que suggère exactement OpenAI. Pour le codage et l'utilisation informatique, 6.1 Sol sera probablement suffisant à un cinquième du coût ou moins. Gardez les tâches de recherche et de raisonnement les plus difficiles sur Astra.
- Sur GPT-6 Luna aujourd'hui : 6.1 Sol n'est pas un remplacement de Luna. Restez sur Luna pour un travail à fort volume qui nécessite
aucun.
Prochainement : comment choisir entre faible, moyen, élevé, très élevé et max.
FAQ
GPT-6.1 Sol est-il au même prix que GPT-6 Sol ? Le prix de liste est identique : $2 d'entrée et $10 de sortie par million de jetons. L'entrée mise en cache est moins chère sur 6.1 Sol ($0.10 contre $0.20), donc les charges de travail d'agent lourdes en cache finissent par coûter moins cher.
6.1 Sol peut-il remplacer complètement GPT-6 Astra ? Pas dans tous les domaines. Il égalise Astra sur DeepSWE, est en retard d'environ 2 points sur OSWorld, et est encore plus en retard sur les tâches de recherche les plus difficiles. Testez les deux sur vos propres tâches et routez par type de tâche.
Pourquoi n'y a-t-il pas de GPT-6.1 Astra ? Selon les rapports du Wall Street Journal et d'autres, GPT-6.1 Astra a régressé lors des tests d'alignement internes et sur le respect du périmètre autorisé par l'utilisateur, donc OpenAI a annulé son lancement d'octobre.
Quelle est la taille de la fenêtre de contexte ? 1.05M de jetons, avec jusqu'à 922K d'entrée et 128K de sortie, identique à 6 Sol. Les demandes avec plus de 272K de jetons d'entrée sont facturées à un tarif plus élevé pour l'ensemble de la demande.
Puis-je utiliser 6.1 Sol dans le ChatGPT régulier ? Pas encore. Il est disponible pour les plans payants dans ChatGPT Work et Codex. Les développeurs peuvent l'appeler via l'API OpenAI ou AIHubMix.
Dois-je changer mon code pour passer de 6 Sol ? Si vous n'utilisez pas aucun comme effort et que vous n'appelez pas d'outils via les complétions de chat, changer le nom du modèle est généralement suffisant. Sinon, vous devrez passer à l'API des Réponses. La partie 4 contient les détails.
Continuez à lire : la série GPT-6.1 Sol
- Combien d'économies réelles apporte la mise en cache moins chère ? Sur une tâche d'agent de 50 étapes, 6.1 Sol coûte 23% de moins que 6 Sol et moins d'un sixième de ce que coûte Astra. Le détail complet se trouve dans Ce que coûte réellement GPT-6.1 Sol : au-delà du prix de $2 / $10.
- Quel effort devriez-vous déployer après la mise à niveau ? Un effort élevé suffit pour égaler Astra en codage. Découvrez quand le max en vaut la peine dans Choisir un effort de raisonnement pour GPT-6.1 Sol : de faible à max.
- Lisez ceci avant de changer.
aucunerreurs, appels d'outils défectueux et nouvelles règles de mise en cache : neuf pièges et une liste de contrôle dans Migration vers GPT-6.1 Sol : 9 choses qui peuvent mal tourner.



