GPT-6.1 Sol hat fünf Denkaufwandsstufen: low, medium (der Standard), high, xhigh und max. Die große Änderung im Vergleich zu GPT-6 Sol ist, dass none und minimal verschwunden sind, sodass low jetzt die unterste Stufe ist.
Diese eine Einstellung beeinflusst sowohl die Latenz als auch die Kosten. Sie sehen niemals Denk-Tokens, aber Sie zahlen dafür zum Ausgabepreis (10 $ pro Million für 6.1 Sol auf AIHubMix), und sie nehmen Platz im Kontextfenster ein. Wählen Sie die falsche Stufe und Sie können leicht mehrere Male mehr bezahlen, als Sie müssen.
Was jede Stufe bewirkt
| Stufe | OpenAI-Beschreibung | Gute Passform | Schlechte Passform |
|---|---|---|---|
| niedrig | Effizientes Denken mit moderatem Anstieg der Latenz | Zwischenschritte in Tool-Schleifen, Suche, leichte Planung, Klassifizierung, Extraktion, Unterstützung von Antworten | Schwieriges Debugging, Refaktorisierung mehrerer Dateien |
| mittel (Standard) | Der ausgewogene Standard für die meisten Arbeitslasten | Alltägliches Programmieren, Code-Überprüfung, Schreiben, typische Agentenaufgaben | Latenz-kritische interaktive Nutzung |
| hoch | Schwieriges Denken, komplexes Debugging, tiefgehende Planung | Schwierige Bugs, Architekturarbeit, SWE-ähnliche Aufgaben | Hoher QPS-Online-Verkehr |
| xhoch | Tiefgehende Forschung, asynchrone Arbeit, lange Agentenläufe | Hintergrundjobs, Forschungsberichte | Alles, was Ihre Bewertungen nicht gerechtfertigt haben |
| max | Maximaler Denkaufwand für die schwierigsten Aufgaben | Computer-Nutzung, forschungsgradige Probleme, Offline-Schwerarbeit | Fast alle alltäglichen Anfragen |
OpenAI bezeichnet den Aufwand als "einen Einstellungsregler, nicht als die primäre Möglichkeit, Qualität zu verbessern." Wenn die Ergebnisse schlecht sind, schauen Sie zuerst auf das Prompt, die Tool-Definitionen und den Kontext. Erhöhen Sie den Aufwand erst danach.
Was die Benchmarks über jede Stufe sagen
Dies sind die eigenen Zahlen von OpenAI, zusammengestellt von Vellum und DataCamp. Behandeln Sie sie als Leitfaden, nicht als Evangelium.
Für das Programmieren ist hoch normalerweise ausreichend. Auf DeepSWE v1.1 erzielt 6.1 Sol bei hoch 75.2, was Astra bei hoch (74.8) entspricht, für etwa 1,50 $ pro Aufgabe. Seine Kostenkurve erreicht 72 % bis 75 % für zwischen 0,50 $ und 1,50 $ pro Aufgabe. GPT-6 Sol erreichte maximal 68.8 für etwa 2,60 $.
Über mittel hinaus zu gehen, hilft nicht immer. Auf AutomationBench erzielt 6.1 Sol 35,4 % bei mittel und nur etwa 36,0 % bei höherem Aufwand. Für die Geschäftsautomatisierung brachten die zusätzlichen Denk-Tokens fast nichts.
Maximal für Computer-Nutzung und Forschung aufbewahren. Auf OSWorld 2.0 erzielt maximal 71,4 bei etwa 1,30 $ pro Aufgabe. Terminal-Bench Science bei maximal kostet 5,47 $ pro Aufgabe: weit günstiger als Astras 23,80 $, aber um eine Größenordnung höher als die meisten anderen Arbeitslasten.
Niedrig hat sich ebenfalls verbessert. Die faktische Fehlerquote bei niedrig sank von 11,4 % auf 7,7 %. Wenn Sie Aufgaben auf mittel bei 6 Sol erhöht haben, weil niedrig nicht genau genug war, versuchen Sie es erneut mit niedrig.
Ausgangspunkt nach Anwendungsfall
| Anwendungsfall | Start bei | Hinweise |
|---|---|---|
| Anrufe, die bei 6 Sol keine verwendet haben | niedrig | Offizielle Zuordnung von OpenAI. Wenn die Latenz kritisch ist, ziehen Sie GPT-6 Luna in Betracht, das weiterhin keine unterstützt |
| Anrufe, die minimal verwendet haben | niedrig | Starten Sie bei niedrig und vergleichen Sie die Ergebnisse |
| Chatbots, Kundenservice | niedrig | Bitten Sie das Modell um eine einzeilige Einleitung, um das erste Token schneller zu erhalten |
| RAG Q&A | niedrig → mittel | Die Qualität der Abrufung ist wichtiger als der Aufwand |
| IDE-Coding-Assistent | mittel | Der Standard funktioniert |
| Automatisierte Fehlerbehebung, SWE-Agenten | hoch | DeepSWE zeigt, dass hoch bereits Astra entspricht |
| Computer-Nutzung, Browser-Agenten | hoch → maximal | OSWorld erreicht maximal |
| Hintergrundforschung, lange Läufe | xhoch | Nur wenn Bewertungen einen Gewinn zeigen. Batch halbiert die Kosten, wenn Sie die Ergebnisse nicht sofort benötigen |
| Die schwierigsten Forschungsprobleme | max, oder einfach Astra verwenden | OpenAI empfiehlt auch hier Astra |
Die none und minimal Zuordnungen stammen aus OpenAIs GPT-6-Migrationsleitfaden.
Ändern des Aufwands während des Gesprächs
Ein häufiges Muster ist, bei hoch zu planen, bei niedrig auszuführen und bei Problemen wieder auf hoch zu wechseln.
Der Haken: Das Bearbeiten von reasoning.effort in der Anfrage bricht Ihren Prompt-Cache. Der Aufwand ist Teil des zwischengespeicherten Präfixes (siehe den Leitfaden zur Prompt-Caching). Bei 6.1 Sol kostet ein Cache-Lesevorgang 0,10 $ pro Million Tokens, während das Neuschreiben des Caches 2,50 $ kostet. Das ist ein Unterschied von 25×.
Die GPT-6-Familie behebt dies mit einem configuration_update Eingabeelement. Belassen Sie den Anfrageebene reasoning.effort unverändert und fügen Sie ein Update vor der nächsten Benutzer-Nachricht ein. So sieht das über die AIHubMix Responses API aus:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Runde 1: bei hohem Aufwand planen
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"},
input="Finden Sie heraus, warum die Tests dieses Repos fehlschlagen und schlagen Sie einen Reparaturplan vor.",
)
# Runde 2: auf niedrig für die Ausführung wechseln, ohne den Anfrageebene Aufwand zu berühren
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # unverändert, damit der Cache erhalten bleibt
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "low"}},
{"role": "user", "content": "Führen Sie Schritt 1 des Plans aus."},
],
)
Dieconfiguration_updateStruktur oben ist illustrativ. Überprüfen Sie OpenAIs Denkleitfaden für das genaue Schema. Die Dokumentation von AIHubMix zu Antworten listet derzeit vier Stufen (minimal bis hoch), also senden Sie eine kleine Testanfrage, um zu bestätigen, dassxhigh,maxundconfiguration_updatedurchgehen.
Einige Grenzen, die Sie kennen sollten:
- Es funktioniert nur im Standardmodus mit einem Agenten und ändert nur den Aufwand.
- Zwei Updates können nicht nebeneinander stehen.
- Es mischt sich nicht mit automatischer Verdichtung oder Trunkierung. Explizite Verdichtung ist in Ordnung, aber fügen Sie danach ein frisches Update hinzu.
- Das Feld
reasoning.effortder Antwort zeigt weiterhin den Wert auf Anfrageebene an, also lesen Sie nicht zu viel hinein.
Einstellungen, die mit Aufwand einhergehen
Belassen Sie Platz in max_output_tokens. Die Obergrenze umfasst Denk-Tokens. Setzen Sie es zu niedrig, kann das Modell stoppen, bevor es sichtbaren Text produziert. Sie erhalten status: incomplete und zahlen trotzdem für Eingaben und Denken. OpenAI empfiehlt, mindestens 25.000 Tokens zu reservieren, um zu beginnen, und mehr für xhoch oder maximal.
Verfolgen Sie Denk-Tokens. Sie befinden sich in usage.output_tokens_details.reasoning_tokens. Die Verteilung pro Aufwandstufe zu betrachten, ist besser als nach Gefühl zu optimieren.
Aktivieren Sie Zusammenfassungen, wenn Sie Sichtbarkeit benötigen. reasoning.summary: "auto" gibt eine Zusammenfassung des Denkens des Modells zurück (möglicherweise müssen Sie zuerst Ihre Organisation überprüfen). Das rohe Denken wird niemals offengelegt.
Der Pro-Modus ist ein separater Schalter. Er lässt das Modell mehr Arbeit leisten, wird zu den Standardtarifen abgerechnet, aber mit insgesamt mehr Tokens. Verwenden Sie ihn für schwierige Probleme, bei denen zusätzliche Latenz akzeptabel ist.
Ein Abstimmungsprozess, den Sie tatsächlich durchführen können
- Holen Sie 20 bis 50 echte Aufgaben in ein Evaluationsset.
- Führen Sie eine Basislinie bei
mediumaus. Zeichnen Sie die Erfolgsquote, die durchschnittlichen Denk-Tokens und die P95-Latenz auf. - Versuchen Sie
low. Wenn der Erfolg kaum sinkt, wechseln Sie. - Versuchen Sie
high. Wenn der Erfolg deutlich steigt, verwenden Sie hoch nur für diesen Aufgabentyp. - Greifen Sie nur auf
xhighodermaxzu, wenn hoch nicht ausreicht, und vergleichen Sie es währenddessen mit GPT-6 Astra bei hoch. Manchmal schlägt ein größeres Modell mehr Aufwand. Auf AIHubMix ist das nur eine Änderung desmodelParameters, und die Modellliste zeigt, was verfügbar ist. - Leiten Sie nach Aufgabentyp anstatt eine globale Einstellung zu verwenden.
Die kurze Version: Starten Sie bei mittel, sparen Sie Geld mit niedrig, verwenden Sie hoch für das Programmieren und lassen Sie xhoch und maximal sich in Ihren Bewertungen beweisen.
Als Nächstes: Was die Preisschilder von 2 $ / 10 $ wirklich bedeuten, wenn Caching, langer Kontext und Abrechnungsfaktoren ins Spiel kommen.
Häufig gestellte Fragen
Was ist der Standard-Denkaufwand für GPT-6.1 Sol? medium. Wenn Sie ihn nicht festlegen, ist das, was Sie erhalten.
Warum gibt none einen Fehler zurück? 6.1 Sol unterstützt none oder minimal nicht. OpenAI empfiehlt, auf low zu wechseln. Wenn Sie wirklich none benötigen, bleiben Sie bei GPT-6 Sol oder GPT-6 Luna.
Wie werden Denk-Tokens abgerechnet? Zum Ausgabepreis (10 $ pro Million für 6.1 Sol), und sie zählen gegen das Kontextfenster. Überprüfen Sie usage.output_tokens_details.reasoning_tokens für die tatsächlichen Zahlen.
Ist der Parametername in Chat Completions und Responses derselbe? Nein. Chat Completions verwendet ein oberstes reasoning_effort. Responses verwendet ein geschachteltes reasoning: {"effort": ...}. Wenn Sie sie verwechseln, erhalten Sie Unsupported parameter.
Gibt es bei höherem Aufwand immer bessere Ergebnisse? Nein. Auf AutomationBench bewegte sich der Score bei über mittel nur von 35,4 % auf etwa 36,0 %, während es merklich mehr kostete. Testen Sie Ihre eigenen Aufgaben.
Kann ich den Aufwand während eines Gesprächs ändern? Ja. Verwenden Sie ein configuration_update Element und belassen Sie den Anfrageebene reasoning.effort unverändert, damit der Prompt-Cache gültig bleibt. Es funktioniert nicht mit automatischer Verdichtung oder Trunkierung.
Warum habe ich status: incomplete ohne Ausgabe erhalten? Wahrscheinlich war max_output_tokens zu niedrig und das Denken hat alles aufgebraucht. OpenAI empfiehlt, mindestens 25.000 Tokens zu reservieren.
Weiterlesen: die GPT-6.1 Sol-Serie
- Wie viel von Ihrer Rechnung ist Denken? Der Aufwand ist nur ein Hebel. Caching, die 272K-Schwelle und Batch-Rabatte beeinflussen alle die endgültige Zahl. Siehe Was GPT-6.1 Sol wirklich kostet: Über das Preisschild von 2 $ / 10 $.
- Code, der
noneverwendet hat? Der Wechsel zulowist nur der Anfang. Toolaufrufe, Sampling-Parameter und Cache-Einstellungen müssen ebenfalls geändert werden: Migration zu GPT-6.1 Sol: 9 Dinge, die schiefgehen können. - Wie viel besser ist 6.1 Sol als 6 Sol und Astra? Spezifikationen und Benchmarks nebeneinander in GPT-6.1 Sol vs GPT-6 Sol: Ein einwöchiges Upgrade, das Astra fast einholt.



