Auswahl eines Denkaufwands für GPT-6.1 Sol: niedrig bis maximal

AIHubMix6 Min. Lesezeit
Auswahl eines Denkaufwands für GPT-6.1 Sol: niedrig bis maximal

GPT-6.1 Sol hat fünf Denkaufwandsstufen: low, medium (der Standard), high, xhigh und max. Die große Änderung im Vergleich zu GPT-6 Sol ist, dass none und minimal verschwunden sind, sodass low jetzt die unterste Stufe ist.

Diese eine Einstellung beeinflusst sowohl die Latenz als auch die Kosten. Sie sehen niemals Denk-Tokens, aber Sie zahlen dafür zum Ausgabepreis (10 $ pro Million für 6.1 Sol auf AIHubMix), und sie nehmen Platz im Kontextfenster ein. Wählen Sie die falsche Stufe und Sie können leicht mehrere Male mehr bezahlen, als Sie müssen.


Was jede Stufe bewirkt

Denkleitfaden mit unseren eigenen Empfehlungen:

StufeOpenAI-BeschreibungGute PassformSchlechte Passform
niedrigEffizientes Denken mit moderatem Anstieg der LatenzZwischenschritte in Tool-Schleifen, Suche, leichte Planung, Klassifizierung, Extraktion, Unterstützung von AntwortenSchwieriges Debugging, Refaktorisierung mehrerer Dateien
mittel (Standard)Der ausgewogene Standard für die meisten ArbeitslastenAlltägliches Programmieren, Code-Überprüfung, Schreiben, typische AgentenaufgabenLatenz-kritische interaktive Nutzung
hochSchwieriges Denken, komplexes Debugging, tiefgehende PlanungSchwierige Bugs, Architekturarbeit, SWE-ähnliche AufgabenHoher QPS-Online-Verkehr
xhochTiefgehende Forschung, asynchrone Arbeit, lange AgentenläufeHintergrundjobs, ForschungsberichteAlles, was Ihre Bewertungen nicht gerechtfertigt haben
maxMaximaler Denkaufwand für die schwierigsten AufgabenComputer-Nutzung, forschungsgradige Probleme, Offline-SchwerarbeitFast alle alltäglichen Anfragen

OpenAI bezeichnet den Aufwand als "einen Einstellungsregler, nicht als die primäre Möglichkeit, Qualität zu verbessern." Wenn die Ergebnisse schlecht sind, schauen Sie zuerst auf das Prompt, die Tool-Definitionen und den Kontext. Erhöhen Sie den Aufwand erst danach.


Was die Benchmarks über jede Stufe sagen

Dies sind die eigenen Zahlen von OpenAI, zusammengestellt von Vellum und DataCamp. Behandeln Sie sie als Leitfaden, nicht als Evangelium.

Für das Programmieren ist hoch normalerweise ausreichend. Auf DeepSWE v1.1 erzielt 6.1 Sol bei hoch 75.2, was Astra bei hoch (74.8) entspricht, für etwa 1,50 $ pro Aufgabe. Seine Kostenkurve erreicht 72 % bis 75 % für zwischen 0,50 $ und 1,50 $ pro Aufgabe. GPT-6 Sol erreichte maximal 68.8 für etwa 2,60 $.

Über mittel hinaus zu gehen, hilft nicht immer. Auf AutomationBench erzielt 6.1 Sol 35,4 % bei mittel und nur etwa 36,0 % bei höherem Aufwand. Für die Geschäftsautomatisierung brachten die zusätzlichen Denk-Tokens fast nichts.

Maximal für Computer-Nutzung und Forschung aufbewahren. Auf OSWorld 2.0 erzielt maximal 71,4 bei etwa 1,30 $ pro Aufgabe. Terminal-Bench Science bei maximal kostet 5,47 $ pro Aufgabe: weit günstiger als Astras 23,80 $, aber um eine Größenordnung höher als die meisten anderen Arbeitslasten.

Niedrig hat sich ebenfalls verbessert. Die faktische Fehlerquote bei niedrig sank von 11,4 % auf 7,7 %. Wenn Sie Aufgaben auf mittel bei 6 Sol erhöht haben, weil niedrig nicht genau genug war, versuchen Sie es erneut mit niedrig.


Ausgangspunkt nach Anwendungsfall

AnwendungsfallStart beiHinweise
Anrufe, die bei 6 Sol keine verwendet habenniedrigOffizielle Zuordnung von OpenAI. Wenn die Latenz kritisch ist, ziehen Sie GPT-6 Luna in Betracht, das weiterhin keine unterstützt
Anrufe, die minimal verwendet habenniedrigStarten Sie bei niedrig und vergleichen Sie die Ergebnisse
Chatbots, KundenserviceniedrigBitten Sie das Modell um eine einzeilige Einleitung, um das erste Token schneller zu erhalten
RAG Q&Aniedrig → mittelDie Qualität der Abrufung ist wichtiger als der Aufwand
IDE-Coding-AssistentmittelDer Standard funktioniert
Automatisierte Fehlerbehebung, SWE-AgentenhochDeepSWE zeigt, dass hoch bereits Astra entspricht
Computer-Nutzung, Browser-Agentenhoch → maximalOSWorld erreicht maximal
Hintergrundforschung, lange LäufexhochNur wenn Bewertungen einen Gewinn zeigen. Batch halbiert die Kosten, wenn Sie die Ergebnisse nicht sofort benötigen
Die schwierigsten Forschungsproblememax, oder einfach Astra verwendenOpenAI empfiehlt auch hier Astra

Die none und minimal Zuordnungen stammen aus OpenAIs GPT-6-Migrationsleitfaden.


Ändern des Aufwands während des Gesprächs

Ein häufiges Muster ist, bei hoch zu planen, bei niedrig auszuführen und bei Problemen wieder auf hoch zu wechseln.

Der Haken: Das Bearbeiten von reasoning.effort in der Anfrage bricht Ihren Prompt-Cache. Der Aufwand ist Teil des zwischengespeicherten Präfixes (siehe den Leitfaden zur Prompt-Caching). Bei 6.1 Sol kostet ein Cache-Lesevorgang 0,10 $ pro Million Tokens, während das Neuschreiben des Caches 2,50 $ kostet. Das ist ein Unterschied von 25×.

Die GPT-6-Familie behebt dies mit einem configuration_update Eingabeelement. Belassen Sie den Anfrageebene reasoning.effort unverändert und fügen Sie ein Update vor der nächsten Benutzer-Nachricht ein. So sieht das über die AIHubMix Responses API aus:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Runde 1: bei hohem Aufwand planen
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="Finden Sie heraus, warum die Tests dieses Repos fehlschlagen und schlagen Sie einen Reparaturplan vor.",
)

# Runde 2: auf niedrig für die Ausführung wechseln, ohne den Anfrageebene Aufwand zu berühren
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # unverändert, damit der Cache erhalten bleibt
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "Führen Sie Schritt 1 des Plans aus."},
    ],
)
Die configuration_update Struktur oben ist illustrativ. Überprüfen Sie OpenAIs Denkleitfaden für das genaue Schema. Die Dokumentation von AIHubMix zu Antworten listet derzeit vier Stufen (minimal bis hoch), also senden Sie eine kleine Testanfrage, um zu bestätigen, dass xhigh, max und configuration_update durchgehen.

Einige Grenzen, die Sie kennen sollten:

  • Es funktioniert nur im Standardmodus mit einem Agenten und ändert nur den Aufwand.
  • Zwei Updates können nicht nebeneinander stehen.
  • Es mischt sich nicht mit automatischer Verdichtung oder Trunkierung. Explizite Verdichtung ist in Ordnung, aber fügen Sie danach ein frisches Update hinzu.
  • Das Feld reasoning.effort der Antwort zeigt weiterhin den Wert auf Anfrageebene an, also lesen Sie nicht zu viel hinein.

Einstellungen, die mit Aufwand einhergehen

Belassen Sie Platz in max_output_tokens. Die Obergrenze umfasst Denk-Tokens. Setzen Sie es zu niedrig, kann das Modell stoppen, bevor es sichtbaren Text produziert. Sie erhalten status: incomplete und zahlen trotzdem für Eingaben und Denken. OpenAI empfiehlt, mindestens 25.000 Tokens zu reservieren, um zu beginnen, und mehr für xhoch oder maximal.

Verfolgen Sie Denk-Tokens. Sie befinden sich in usage.output_tokens_details.reasoning_tokens. Die Verteilung pro Aufwandstufe zu betrachten, ist besser als nach Gefühl zu optimieren.

Aktivieren Sie Zusammenfassungen, wenn Sie Sichtbarkeit benötigen. reasoning.summary: "auto" gibt eine Zusammenfassung des Denkens des Modells zurück (möglicherweise müssen Sie zuerst Ihre Organisation überprüfen). Das rohe Denken wird niemals offengelegt.

Der Pro-Modus ist ein separater Schalter. Er lässt das Modell mehr Arbeit leisten, wird zu den Standardtarifen abgerechnet, aber mit insgesamt mehr Tokens. Verwenden Sie ihn für schwierige Probleme, bei denen zusätzliche Latenz akzeptabel ist.


Ein Abstimmungsprozess, den Sie tatsächlich durchführen können

  1. Holen Sie 20 bis 50 echte Aufgaben in ein Evaluationsset.
  2. Führen Sie eine Basislinie bei medium aus. Zeichnen Sie die Erfolgsquote, die durchschnittlichen Denk-Tokens und die P95-Latenz auf.
  3. Versuchen Sie low. Wenn der Erfolg kaum sinkt, wechseln Sie.
  4. Versuchen Sie high. Wenn der Erfolg deutlich steigt, verwenden Sie hoch nur für diesen Aufgabentyp.
  5. Greifen Sie nur auf xhigh oder max zu, wenn hoch nicht ausreicht, und vergleichen Sie es währenddessen mit GPT-6 Astra bei hoch. Manchmal schlägt ein größeres Modell mehr Aufwand. Auf AIHubMix ist das nur eine Änderung des model Parameters, und die Modellliste zeigt, was verfügbar ist.
  6. Leiten Sie nach Aufgabentyp anstatt eine globale Einstellung zu verwenden.

Die kurze Version: Starten Sie bei mittel, sparen Sie Geld mit niedrig, verwenden Sie hoch für das Programmieren und lassen Sie xhoch und maximal sich in Ihren Bewertungen beweisen.

Als Nächstes: Was die Preisschilder von 2 $ / 10 $ wirklich bedeuten, wenn Caching, langer Kontext und Abrechnungsfaktoren ins Spiel kommen.


Häufig gestellte Fragen

Was ist der Standard-Denkaufwand für GPT-6.1 Sol? medium. Wenn Sie ihn nicht festlegen, ist das, was Sie erhalten.

Warum gibt none einen Fehler zurück? 6.1 Sol unterstützt none oder minimal nicht. OpenAI empfiehlt, auf low zu wechseln. Wenn Sie wirklich none benötigen, bleiben Sie bei GPT-6 Sol oder GPT-6 Luna.

Wie werden Denk-Tokens abgerechnet? Zum Ausgabepreis (10 $ pro Million für 6.1 Sol), und sie zählen gegen das Kontextfenster. Überprüfen Sie usage.output_tokens_details.reasoning_tokens für die tatsächlichen Zahlen.

Ist der Parametername in Chat Completions und Responses derselbe? Nein. Chat Completions verwendet ein oberstes reasoning_effort. Responses verwendet ein geschachteltes reasoning: {"effort": ...}. Wenn Sie sie verwechseln, erhalten Sie Unsupported parameter.

Gibt es bei höherem Aufwand immer bessere Ergebnisse? Nein. Auf AutomationBench bewegte sich der Score bei über mittel nur von 35,4 % auf etwa 36,0 %, während es merklich mehr kostete. Testen Sie Ihre eigenen Aufgaben.

Kann ich den Aufwand während eines Gesprächs ändern? Ja. Verwenden Sie ein configuration_update Element und belassen Sie den Anfrageebene reasoning.effort unverändert, damit der Prompt-Cache gültig bleibt. Es funktioniert nicht mit automatischer Verdichtung oder Trunkierung.

Warum habe ich status: incomplete ohne Ausgabe erhalten? Wahrscheinlich war max_output_tokens zu niedrig und das Denken hat alles aufgebraucht. OpenAI empfiehlt, mindestens 25.000 Tokens zu reservieren.


Weiterlesen: die GPT-6.1 Sol-Serie


Quellen