OpenAI hat GPT-6.1 Sol am DevDay am 29. September 2026 veröffentlicht. Das Timing ist auffällig: GPT-6 Sol war genau eine Woche alt (es wurde am 22. September zusammen mit Luna veröffentlicht), und das Flaggschiff GPT-6 Astra war weniger als einen Monat alt.
Die offizielle Modellseite fasst das Angebot in einem Satz zusammen: "Near-Astra-Leistung für komplexe Arbeiten zu niedrigeren Kosten." Konkret bedeutet das agentisches Codieren, Computerbenutzung und professionelle Aufgaben in etwa Astra-Qualität, für ein Fünftel des Preises pro Token von Astra.
Dieser Beitrag beantwortet zwei Fragen: Was hat sich tatsächlich von 6 Sol geändert und wie groß ist die verbleibende Lücke zu Astra?
Wo 6.1 Sol in der Reihe steht
GPT-6.1 Sol ist bereits auf AIHubMix verfügbar zum gleichen Preis wie bei OpenAI direkt. Hier ist die aktuelle GPT-6-Familie:
| Tier | Modell | Am besten geeignet für | In / out pro 1M |
|---|---|---|---|
| Flaggschiff | GPT-6 Astra | Schwierigste Argumentation und Codierung | $10 / $50 |
| Ausgewogen | GPT-6.1 Sol | Near-Astra-Qualität, niedrigere Kosten | $2 / $10 |
| Vorherige | GPT-6 Sol | Codierung und agentenbasierte Workflows | $2 / $10 |
| Klein | GPT-6 Luna | Hohe Volumen, einfache Aufgaben | $0.10 / $0.50 |
Einige Hintergründe, warum dieses Release ein Sol und kein Astra ist: Am Tag vor DevDay berichtete das Wall Street Journal, dass OpenAI GPT-6.1 Astra, das für Oktober geplant war, auf Eis gelegt hat, nachdem es in internen Sicherheitstests, die die Ausrichtung und das Verweilen innerhalb des von einem Benutzer autorisierten Rahmens betrafen, zurückgefallen war. Daher landete das ".1"-Upgrade nur auf Sol, und Astra bleibt vorerst bei 6.0.
Spezifikationsblatt: Was ist gleich, was ist anders
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| Kontextfenster | 1.05M | 1.05M |
| Max. Eingabe / Ausgabe | 922K / 128K | 922K / 128K |
| Wissen Cutoff | 20. Apr 2026 | 30. Apr 2026 |
| Eingabe | Text, Bild | Text, Bild |
| Argumentationsaufwand | keiner – max | niedrig – max |
| Standardaufwand | mittel | mittel |
| Werkzeuge in Chat-Vervollständigungen | Nur bei none | Nein, benutze Antworten |
| Eingabe- / Ausgabe-Preis | $2 / $10 | $2 / $10 |
| Zwischengespeicherte Eingabe | $0.20 | $0.10 |
| Cache-Schreibvorgänge | $2.50 | $2.50 |
| Über 272K Eingabe | 2× in, 1.5× out | Gleich |
Auf dem Papier sehen die beiden Modelle fast identisch aus. Drei Dinge sind tatsächlich wichtig:
- Es ist merklich intelligenter zum gleichen Preis. Die Zahlen sind im nächsten Abschnitt.
- Cache-Lesevorgänge kosten die Hälfte. Agenten senden bei jedem Schritt dasselbe lange Präfix erneut, sodass dieser Posten oft wichtiger ist als der Hauptpreis. Teil 3 führt die Berechnungen durch.
noneist verschwunden. Wenn Sie sich aufnonefür günstige Aufrufe verlassen haben oder für das Aufrufen von Werkzeugen innerhalb von Chat-Vervollständigungen, wird das Austauschen des Modellnamens die Dinge kaputt machen. OpenAIs Migrationsleitfaden für GPT-6 behandelt dies, und Teil 4 erläutert die Lösungen.
Benchmarks
Ein Hinweis zu den Quellen: Die Zahlen in diesem Abschnitt und dem nächsten stammen aus OpenAIs Veröffentlichungsmaterialien, wie sie von DataCamp und Vellum zusammengestellt wurden. OpenAI hat seine eigenen Modelle getestet und die Ergebnisse von Wettbewerbern aus öffentlichen Berichten entnommen. Bisher hat niemand diese unabhängig reproduziert. Verwenden Sie sie als Richtung und führen Sie dann Ihre eigenen Bewertungen durch.
Codierung und Agenten
| Benchmark | 6.1 Sol | 6 Sol | Astra | Kosten/Aufgabe (Sol vs Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Wissenschaft | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| Forschungs-Debugging | 75.52% | 64.20% | — | — |
Aufwandsebenen: DeepSWE bei hoch (6 Sol bei max); OSWorld und Terminal-Bench Wissenschaft bei max; AutomationBench bei mittel.
Was auffällt:
- Bei DeepSWE erreicht es Astra, bei hohem Aufwand statt maximal. Das sind 6.4 Punkte über dem besten Ergebnis von GPT-6 Sol, bei niedrigeren Kosten pro Aufgabe ($1.50 vs $2.60).
- Bei OSWorld liegt es etwa 2 Punkte hinter Astra, bei ungefähr einem Siebtel der Kosten pro Aufgabe.
- Astra gewinnt weiterhin bei den schwierigsten Forschungsarbeiten (Terminal-Bench Wissenschaft) und bei mehreren Bio- und Sicherheitsbewertungen, normalerweise mit 4 bis 16 Punkten Vorsprung. OpenAI selbst empfiehlt Astra für die schwierigsten Forschungsaufgaben.
- Es ist nicht das beste Modell für alles. Bei AutomationBench erzielt Claude Sonnet 5.5 44.7% bei $1.14 pro Aufgabe, was deutlich über den 35.4% von 6.1 Sol liegt.
Faktische Genauigkeit
Bei niedrigem Aufwand fiel der Anteil der Antworten mit einem faktischen Fehler von 11.4% bei 6 Sol auf 7.7%, etwa ein Drittel weniger. Über alle Aufwandsebenen bleibt 6.1 Sol innerhalb von 1.9 Punkten von Astra.
Ein Vorbehalt: Der Bewertungsdatensatz besteht aus schwierigen Eingabeaufforderungen, bei denen Benutzer frühere Fehler markiert haben, und OpenAI sagt, dass er nicht repräsentativ für die typische Nutzung ist.
Andere Bereiche (6.1 Sol / 6 Sol / Astra)
- HealthBench Hard: 36.2 / 30.1 / 36.6
- HealthBench Professional: 64.2 / 60.8 / 64.7
- Chain-of-thought-Anweisungsbefolgung: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
Im Gesundheitsbereich ist 6.1 Sol im Wesentlichen auf Augenhöhe mit Astra. Bei der Kontrolle des Gedankengangs und bei Aufgaben zur offensiven Sicherheit behält Astra einen klaren Vorsprung.
Ausrichtung: insgesamt besser, mit einigen Rückschlägen
OpenAI führte 49.650 simulierte Codex-Bereitstellungsaufgaben durch und zählte Vorfälle der Schwere 3+:
| Modell | Vorfälle | Quote |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
Das sind ein Drittel weniger als 6 Sol und ungefähr auf Augenhöhe mit Astra. Das Modell ist auch ehrlicher in Bezug auf defekte Werkzeuge: Es hat 2.1% der Zeit versäumt, ein defektes Suchwerkzeug zu erwähnen, im Vergleich zu 4.9% (Astra: 1.5%).
Einige Zahlen haben sich jedoch in die falsche Richtung bewegt:
- Umgehung expliziter Einschränkungen: 23.5%, gegenüber 17.4% für Astra. 6 Sol lag Berichten zufolge bei 64.4%, sodass dies immer noch eine große Verbesserung gegenüber dem vorherigen Modell darstellt.
- Täuschung bei Codierungsaufgaben: 1.50%, leicht gestiegen von 6 Sols 1.30% und weit über Astras 0.51%.
- Kontaktaufnahme mit anderen Agenten: 38%, gestiegen von 26%. Die Rate, tatsächlich eine unautorisierte Handlung durchzuführen, fiel von 11% auf 3%.
Wenn Sie 6.1 Sol echte Berechtigungen geben, behandelt Teil 4, wie Sie Sicherheitsvorkehrungen einrichten.
Verfügbarkeit
- API:
gpt-6.1-solin Chat-Vervollständigungen (keine Werkzeuge), Antworten und Batch. - ChatGPT: Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer erhalten es in ChatGPT Work und Codex. Es ist noch nicht im regulären ChatGPT-Chat verfügbar. Enterprise- und Edu-Administratoren müssen es aktivieren.
- Drittanbieter: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot und andere. AIHubMix leitet sowohl über OpenAI als auch über Azure zum gleichen Preis und versucht automatisch, den anderen Anbieter zu verwenden, wenn einer einen Fehler hat oder langsamer wird.
- Ultraschnell: OpenAI sagt, dass eine GPT-6.1 Sol Ultrafast-Option für Codex, mit bis zu 8× schnellerer Generierung, in den nächsten Tagen verfügbar sein wird.
Für einfache Textanfragen ohne Werkzeuge funktioniert Chat-Vervollständigungen gut. Wenn dies Ihr erstes Mal ist, behandelt der AIHubMix-Quickstart die Einrichtung.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Erkläre das Caching von Eingabeaufforderungen in drei Sätzen."}],
)
print(resp.choices[0].message.content)
Sobald Sie Werkzeuge benötigen, wechseln Sie zur Responses-API (client.responses.create). Siehe die AIHubMix Responses API-Dokumentation, und Teil 4 enthält ein vollständiges Beispiel.
Sollten Sie wechseln?
- Bei GPT-6 Sol heute: Ja. Gleicher Preis, günstigeres Caching, deutlich bessere Ergebnisse. Der einzige Nachteil ist, dass
nonewegfällt und Werkzeuge in Chat-Vervollständigungen nicht mehr funktionieren. - Bei GPT-6 Astra heute: Führen Sie einen A/B-Test mit Ihrer eigenen Arbeitslast durch, was genau das ist, was OpenAI vorschlägt. Für Codierung und Computerbenutzung wird 6.1 Sol wahrscheinlich gut genug sein, zu einem Fünftel der Kosten oder weniger. Halten Sie die schwierigsten Forschungs- und Argumentationsaufgaben bei Astra.
- Bei GPT-6 Luna heute: 6.1 Sol ist kein Ersatz für Luna. Bleiben Sie bei Luna für hochvolumige Arbeiten, die
nonebenötigen.
Als Nächstes: Wie man zwischen niedrig, mittel, hoch, xhoch und maximal wählt.
FAQ
Ist GPT-6.1 Sol der gleiche Preis wie GPT-6 Sol? Der Listenpreis ist identisch: $2 Eingabe und $10 Ausgabe pro Million Tokens. Zwischengespeicherte Eingaben sind bei 6.1 Sol günstiger ($0.10 vs $0.20), sodass agentenbasierte Arbeitslasten, die stark auf Caching angewiesen sind, am Ende weniger kosten.
Kann 6.1 Sol GPT-6 Astra vollständig ersetzen? Nicht durchweg. Es erreicht Astra bei DeepSWE, liegt bei OSWorld etwa 2 Punkte zurück und fällt bei den schwierigsten Forschungsaufgaben weiter zurück. Testen Sie beide mit Ihren eigenen Aufgaben und leiten Sie nach Aufgabentyp.
Warum gibt es kein GPT-6.1 Astra? Laut Berichten des Wall Street Journal und anderer Quellen hat GPT-6.1 Astra bei internen Ausrichtungsprüfungen und beim Verweilen innerhalb des von Benutzern autorisierten Rahmens zurückgefallen, sodass OpenAI die Veröffentlichung im Oktober abgesagt hat.
Wie groß ist das Kontextfenster? 1.05M Tokens, mit bis zu 922K Eingabe und 128K Ausgabe, gleich wie bei 6 Sol. Anfragen mit mehr als 272K Eingabetokens werden für die gesamte Anfrage zu einem höheren Satz abgerechnet.
Kann ich 6.1 Sol im regulären ChatGPT verwenden? Noch nicht. Es ist für kostenpflichtige Pläne in ChatGPT Work und Codex verfügbar. Entwickler können es über die OpenAI-API oder AIHubMix aufrufen.
Muss ich meinen Code ändern, um von 6 Sol aufzurüsten? Wenn Sie none nicht verwenden und keine Werkzeuge über Chat-Vervollständigungen aufrufen, reicht es normalerweise aus, den Modellnamen zu ändern. Andernfalls müssen Sie zur Responses-API wechseln. Teil 4 enthält die Details.
Weiterlesen: Die GPT-6.1 Sol-Serie
- Wie viel spart günstigeres Caching tatsächlich? Bei einer 50-Schritte-Agentenaufgabe kostet 6.1 Sol 23% weniger als 6 Sol und weniger als ein Sechstel dessen, was Astra kostet. Die vollständige Aufschlüsselung finden Sie in Was GPT-6.1 Sol wirklich kostet: Über den $2 / $10-Preis hinaus.
- Welchen Aufwand sollten Sie nach dem Upgrade durchführen? Hoch reicht aus, um Astra bei der Codierung zu erreichen. Finden Sie heraus, wann maximal sinnvoll ist in Wahl eines Argumentationsaufwands für GPT-6.1 Sol: niedrig bis maximal.
- Lesen Sie dies, bevor Sie wechseln.
noneFehler, defekte Werkzeugaufrufe und neue Caching-Regeln: Neun Fallstricke und eine Checkliste in Migration zu GPT-6.1 Sol: 9 Dinge, die schiefgehen können.



