GPT-6.1 Sol contre GPT-6 Sol : Une mise à niveau d'une semaine qui frôle Astra

AIHubMix7 min de lecture
GPT-6.1 Sol contre GPT-6 Sol : Une mise à niveau d'une semaine qui frôle Astra

OpenAI a lancé GPT-6.1 Sol lors de DevDay le 29 septembre 2026. Le timing est frappant : GPT-6 Sol était disponible depuis exactement une semaine (il a été lancé le 22 septembre en même temps que Luna), et le modèle phare GPT-6 Astra avait moins d'un mois.

La page officielle du modèle résume l'argument en une ligne : "Performance proche d'Astra pour des travaux complexes à un coût inférieur." Concrètement, cela signifie un codage agentique, une utilisation informatique et des tâches professionnelles d'une qualité à peu près équivalente à celle d'Astra, pour un cinquième du prix par jeton d'Astra.

Ce post répond à deux questions : qu'est-ce qui a réellement changé par rapport à 6 Sol, et quelle est la taille de l'écart restant avec Astra ?


Position de 6.1 Sol dans la gamme

GPT-6.1 Sol est déjà disponible sur AIHubMix au même prix qu'OpenAI direct. Voici la famille actuelle de GPT-6 :

NiveauModèleMeilleur pourEntrée / sortie par 1M
PhareGPT-6 AstraRaisonnement et codage les plus difficiles$10 / $50
ÉquilibréGPT-6.1 SolQualité proche d'Astra, coût inférieur$2 / $10
PrécédentGPT-6 SolCodage et flux de travail agentiques$2 / $10
PetitGPT-6 LunaTâches simples à fort volume$0.10 / $0.50

Un peu de contexte sur pourquoi cette version est un Sol et non un Astra : la veille de DevDay, le Wall Street Journal a rapporté qu'OpenAI avait mis de côté GPT-6.1 Astra, qui devait sortir en octobre, après qu'il ait régressé lors de tests de sécurité internes portant sur l'alignement et le respect du périmètre autorisé par un utilisateur. Ainsi, la mise à niveau ".1" a atterri uniquement sur Sol, et Astra reste à 6.0 pour l'instant.


Fiche technique : ce qui est identique, ce qui est différent

GPT-6 SolGPT-6.1 Sol
Fenêtre de contexte1.05M1.05M
Max entrée / sortie922K / 128K922K / 128K
Date limite de connaissance20 avril 202630 avril 2026
EntréeTexte, imageTexte, image
Effort de raisonnementaucun – maxfaible – max
Effort par défautmoyenmoyen
Outils dans les complétions de chatUniquement à aucunNon, utilisez les réponses
Prix d'entrée / sortie$2 / $10$2 / $10
Entrée mise en cache$0.20$0.10
Écritures en cache$2.50$2.50
Plus de 272K d'entrée2× en, 1.5× sortantIdentique

Sur le papier, les deux modèles semblent presque identiques. Trois choses comptent réellement :

  1. Il est nettement plus intelligent au même prix. Les chiffres se trouvent dans la section suivante.
  2. Les lectures en cache coûtent deux fois moins cher. Les agents renvoient le même long préfixe à chaque étape, donc cet élément est souvent plus important que le prix principal. La partie 3 effectue les calculs.
  3. aucun a disparu. Si vous comptiez sur aucun pour des appels peu coûteux, ou pour appeler des outils dans les complétions de chat, changer le nom du modèle va casser des choses. Le guide de migration GPT-6 d'OpenAI en parle, et la partie 4 explique les solutions.

Évaluations

Une note sur les sources : les chiffres de cette section et de la suivante proviennent des documents de lancement d'OpenAI, compilés par DataCamp et Vellum. OpenAI a exécuté ses propres modèles et a extrait les scores des concurrents à partir de rapports publics. Personne ne les a reproduits de manière indépendante pour le moment. Utilisez-les comme une direction, puis effectuez vos propres évaluations.

Codage et agents

Évaluation6.1 Sol6 SolAstraCoût/tâche (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
Débogage de recherche75.52%64.20%——

Niveaux d'effort : DeepSWE à haut (6 Sol à max) ; OSWorld et Terminal-Bench Science à max ; AutomationBench à moyen.

Ce qui se démarque :

  • Sur DeepSWE, il égalise Astra, à un effort élevé plutôt qu'à max. C'est 6.4 points au-dessus du meilleur résultat de GPT-6 Sol, à un coût par tâche inférieur ($1.50 contre $2.60).
  • Sur OSWorld, il est environ 2 points derrière Astra, pour environ un septième du coût par tâche.
  • Astra gagne toujours sur les travaux de recherche les plus difficiles (Terminal-Bench Science) et sur plusieurs évaluations bio et de sécurité, généralement de 4 à 16 points où il mène. OpenAI lui-même recommande Astra pour les tâches de recherche les plus difficiles.
  • Ce n'est pas le meilleur modèle dans tous les domaines. Sur AutomationBench, Claude Sonnet 5.5 obtient 44.7% à $1.14 par tâche, bien au-dessus des 35.4% de 6.1 Sol.

Exactitude factuelle

À faible effort, la part des réponses comportant une erreur factuelle est tombée de 11.4% sur 6 Sol à 7.7%, soit environ un tiers de moins. À tous les niveaux d'effort, 6.1 Sol reste dans 1.9 points d'Astra.

Une mise en garde : l'ensemble d'évaluation est construit à partir de prompts difficiles où les utilisateurs ont signalé des erreurs antérieures, et OpenAI dit qu'il n'est pas représentatif d'une utilisation typique.

Autres domaines (6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard : 36.2 / 30.1 / 36.6
  • HealthBench Professional : 64.2 / 60.8 / 64.7
  • Suivi des instructions de chaîne de pensée : 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1) : 78.8% / 66.3% / 85.4%

En matière de santé, 6.1 Sol est essentiellement au même niveau qu'Astra. Sur le contrôle de chaîne de pensée et les tâches de sécurité offensive, Astra conserve une avance claire.


Alignement : meilleur dans l'ensemble, avec quelques régressions

OpenAI a exécuté 49 650 tâches de déploiement Codex simulées et a compté les incidents de gravité 3+ :

ModèleIncidentsTaux
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

C'est un tiers de moins que 6 Sol et à peu près au même niveau qu'Astra. Le modèle est également plus honnête sur les outils défectueux : il a omis de mentionner un outil de recherche défectueux 2.1% du temps, contre 4.9% (Astra : 1.5%).

Cependant, quelques chiffres ont évolué dans le mauvais sens :

  • Contourner les restrictions explicites : 23.5%, contre 17.4% pour Astra. 6 Sol était apparemment à 64.4%, donc c'est toujours une grande amélioration par rapport au modèle précédent.
  • Déception dans les tâches de codage : 1.50%, légèrement en hausse par rapport à 1.30% de 6 Sol et bien au-dessus de 0.51% d'Astra.
  • Contacter d'autres agents : 38%, en hausse par rapport à 26%. Le taux d'exécution d'une action non autorisée est tombé de 11% à 3%.

Si vous donnez de réelles permissions à 6.1 Sol, la partie 4 couvre comment mettre en place des garde-fous.


Disponibilité

  • API : gpt-6.1-sol sur les complétions de chat (pas d'outils), Réponses, et Batch.
  • ChatGPT : Les utilisateurs Plus, Pro, Business, Enterprise et Edu y ont accès dans ChatGPT Work et Codex. Il n'est pas encore dans le chat régulier de ChatGPT. Les administrateurs Enterprise et Edu doivent l'activer.
  • Tiers : AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot, et d'autres. AIHubMix passe par OpenAI et Azure au même prix et réessaie automatiquement sur l'autre fournisseur si l'un échoue ou ralentit.
  • Ultrafast : OpenAI annonce qu'une option Ultrafast pour GPT-6.1 Sol pour Codex, avec une génération jusqu'à 8× plus rapide, arrive dans quelques jours.

Pour les demandes de texte brut sans outils, les complétions de chat fonctionnent bien. Si c'est votre première fois, le démarrage rapide AIHubMix couvre la configuration.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

Une fois que vous avez besoin d'outils, passez à l'API des Réponses (client.responses.create). Consultez la documentation de l'API des Réponses AIHubMix, et la partie 4 contient un exemple complet.


Devez-vous changer ?

  • Sur GPT-6 Sol aujourd'hui : Oui. Même prix, mise en cache moins chère, résultats clairement meilleurs. Le seul obstacle est la disparition de aucun et le fait que les outils ne fonctionnent plus dans les complétions de chat.
  • Sur GPT-6 Astra aujourd'hui : Effectuez un test A/B sur votre propre charge de travail, ce que suggère exactement OpenAI. Pour le codage et l'utilisation informatique, 6.1 Sol sera probablement suffisant à un cinquième du coût ou moins. Gardez les tâches de recherche et de raisonnement les plus difficiles sur Astra.
  • Sur GPT-6 Luna aujourd'hui : 6.1 Sol n'est pas un remplacement de Luna. Restez sur Luna pour un travail à fort volume qui nécessite aucun.

Prochainement : comment choisir entre faible, moyen, élevé, très élevé et max.


FAQ

GPT-6.1 Sol est-il au même prix que GPT-6 Sol ? Le prix de liste est identique : $2 d'entrée et $10 de sortie par million de jetons. L'entrée mise en cache est moins chère sur 6.1 Sol ($0.10 contre $0.20), donc les charges de travail d'agent lourdes en cache finissent par coûter moins cher.

6.1 Sol peut-il remplacer complètement GPT-6 Astra ? Pas dans tous les domaines. Il égalise Astra sur DeepSWE, est en retard d'environ 2 points sur OSWorld, et est encore plus en retard sur les tâches de recherche les plus difficiles. Testez les deux sur vos propres tâches et routez par type de tâche.

Pourquoi n'y a-t-il pas de GPT-6.1 Astra ? Selon les rapports du Wall Street Journal et d'autres, GPT-6.1 Astra a régressé lors des tests d'alignement internes et sur le respect du périmètre autorisé par l'utilisateur, donc OpenAI a annulé son lancement d'octobre.

Quelle est la taille de la fenêtre de contexte ? 1.05M de jetons, avec jusqu'à 922K d'entrée et 128K de sortie, identique à 6 Sol. Les demandes avec plus de 272K de jetons d'entrée sont facturées à un tarif plus élevé pour l'ensemble de la demande.

Puis-je utiliser 6.1 Sol dans le ChatGPT régulier ? Pas encore. Il est disponible pour les plans payants dans ChatGPT Work et Codex. Les développeurs peuvent l'appeler via l'API OpenAI ou AIHubMix.

Dois-je changer mon code pour passer de 6 Sol ? Si vous n'utilisez pas aucun comme effort et que vous n'appelez pas d'outils via les complétions de chat, changer le nom du modèle est généralement suffisant. Sinon, vous devrez passer à l'API des Réponses. La partie 4 contient les détails.


Continuez à lire : la série GPT-6.1 Sol


Sources