Migration zu GPT-6.1 Sol: 9 Dinge, die schiefgehen können

AIHubMix8 Min. Lesezeit
Migration zu GPT-6.1 Sol: 9 Dinge, die schiefgehen können

Der Umstieg von GPT-6 Sol auf 6.1 Sol sieht aus wie eine einzeilige Änderung, und der Preis bleibt gleich. Aber es gibt einige breaking changes und Verhaltensänderungen, sodass allein die Änderung des Modellnamens zu Fehlern, einer überraschenden Rechnung oder einem Agenten führen kann, der sich anders verhält. OpenAIs GPT-6-Migrationsleitfaden deckt die meisten offiziellen Änderungen ab. Dieser Beitrag ergänzt die Punkte, die in der Praxis oft Probleme verursachen.

Sie sind von "laut fehlerhaft" bis "leise fehlerhaft" geordnet.


1. reasoning_effort: "none" führt zu einem 400

Was Sie sehen werden: Die Anfrage wird abgelehnt.

Warum: 6.1 Sol unterstützt none oder minimal nicht. Das niedrigste Niveau ist low. GPT-6 Sol und Luna akzeptieren weiterhin none, weshalb Ihr alter Code dort funktionierte.

Behebung:

  • OpenAIs Zuordnung besteht darin, none durch low zu ersetzen. Für minimal beginnen Sie bei low und vergleichen Sie.
  • low ist langsamer und teurer als none, da es Reasoning-Tokens generiert. Für wirklich latenzempfindliche Pfade wie Autocomplete oder Echtzeitklassifizierung kann es besser sein, bei GPT-6 Sol zu bleiben oder zu Luna zu wechseln.

2. Toolaufrufe in Chat Completions funktionieren nicht mehr

Was Sie sehen werden: Chat Completions-Anfragen, die tools einschließen, schlagen fehl.

Warum: GPT-6 Sol erlaubte nur Funktionsaufrufe in Chat Completions, wenn reasoning_effort auf none gesetzt war, und viele Projekte verließen sich auf diese Kombination für kostengünstige Toolaufrufe. Da none nicht mehr verfügbar ist, funktioniert Chat Completions auf 6.1 Sol nur für Anfragen ohne Tools. Für Tools müssen Sie die Responses API verwenden. OpenAIs Leitfaden zur Migration zur Responses API führt Sie durch den Prozess.

Behebung: Wechseln Sie zu /v1/responses. AIHubMix unterstützt dies ebenfalls; siehe die AIHubMix Responses API-Dokumentation für Parameter.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},          # nested, not reasoning_effort
    tools=[{
        "type": "function",
        "name": "get_weather",
        "description": "Holen Sie sich das aktuelle Wetter für eine Stadt",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    }],
    input="Wie ist das Wetter heute in Shanghai?",
)
print(resp.output)

Einfach zu übersehende Dinge:

  • In Responses ist der Parameter reasoning.effort. Das Senden von reasoning_effort führt zu Unsupported parameter.
  • Bei der Verwendung von Tools über mehrere Runden hinweg senden Sie alle Reasoning-, Function_Call- und Function_Call_Output-Elemente seit der letzten Benutzeranfrage zurück, nicht nur die Funktionsergebnisse.
  • Mit store: false oder ZDR enthalten Reasoning-Elemente standardmäßig encrypted_content. Spielen Sie die gesamte Historie ab, und es funktioniert einfach.

3. Sampling-Parameter müssen entfernt werden

Was Sie sehen werden: Anfragen mit temperature oder top_p schlagen fehl.

Warum: Diese Parameter sind nur erlaubt, wenn der Aufwand none ist. 6.1 Sol hat kein none, sodass Sie sie mit diesem Modell niemals verwenden können.

Entfernen:

  • temperature, top_p, top_logprobs
  • logprobs in Chat Completions
  • message.output_text.logprobs aus include in Responses
none unterstützt.


4. Caching funktioniert anders, und Ihre Rechnung kann steigen

Dies ist das einfachste, was man übersehen kann, insbesondere beim Umstieg von GPT-5.5 oder früher. Alles Folgende stammt aus OpenAIs Leitfaden zum Prompt-Caching.

Der Parameter wurde umbenannt. prompt_cache_retention heißt jetzt prompt_cache_options.ttl, und der einzige unterstützte Wert ist "30m".

Cache-Schreibvorgänge werden berechnet. Sie kosten 1,25× den Eingabewert (2,50 $ pro Million bei 6.1 Sol). Ein langer Präfix, den Sie nur einmal verwenden, kostet jetzt 25 % mehr mit Caching als ohne.

Breakpoints wurden verschoben. Ältere Modelle platzierten Breakpoints in festen Intervallen (alle 2.048 Tokens bei GPT-5.5). Der implizite Modus platziert jetzt einen Breakpoint am Ende der neuesten berechtigten Nachricht. Infolgedessen wird ein kürzerer Präfix, der über Anfragen hinweg geteilt wird, nicht automatisch wiederverwendet. Wenn viele Anfragen einen Systemprompt teilen, gefolgt von unterschiedlichen Benutzereingaben, fügen Sie einen expliziten Breakpoint direkt nach dem Systemprompt hinzu.

Das Anhängen an eine vorhandene Nachricht bricht den Cache. Der zwischengespeicherte Endpunkt landet in der Mitte einer längeren Nachricht und kann nicht zugeordnet werden. Fügen Sie stattdessen eine neue Nachricht hinzu.

Änderungen des Reasoning-Aufwands brechen den Cache. reasoning.effort ist Teil des Präfixes. Wechseln Sie mitten im Gespräch mit configuration_update (siehe Teil 2). Beachten Sie, dass es nicht mit automatischer Kompaktierung oder Trunkierung kombiniert werden kann, und /responses/compact weist Historien zurück, die eine enthalten.

Hoher Verkehr kann die Trefferquote senken. Caches leben auf einzelnen Maschinen. Mehr als etwa 15 Anfragen pro Minute mit demselben Präfix können auf andere Maschinen überlaufen und nicht erfasst werden. Zwischengespeicherte Tokens zählen auch weiterhin zu Ihrem TPM-Rate-Limit.

Vor und nach der Migration vergleichen Sie cached_tokens, cache_write_tokens, Latenz und Kosten pro Aufgabe.


5. Überschreitung von 272K Eingaben verdoppelt den Preis

Das 1,05-Mio.-Kontextfenster ist verlockend, aber sobald die Eingabe 272K Tokens überschreitet, wird die gesamte Anfrage mit 2× Eingabe und 1,5× Ausgabe berechnet. Der Übergang von 270K auf 280K Eingaben kostet eine Anfrage von 0,64 $ auf 1,27 $ (Teil 3 enthält die Berechnung).

Langfristige Agentensitzungen wachsen weiter, sodass es leicht ist, diese Grenze zu überschreiten, ohne es zu bemerken. Stellen Sie einen clientseitigen Alarm bei etwa 250K ein und aktivieren Sie die Kompaktierung, wenn er ausgelöst wird.


6. Ein kleines max_output_tokens führt zu einer leeren Antwort

Was Sie sehen werden: status: incomplete mit dem Grund max_output_tokens, keine sichtbare Ausgabe, und Sie werden trotzdem belastet.

Warum: max_output_tokens beinhaltet Reasoning-Tokens. Eine Obergrenze, die bei none in Ordnung war, kann bei low oder höher vollständig aufgebraucht werden.

Behebung: OpenAIs Leitfaden zum Reasoning empfiehlt, mindestens 25.000 Tokens zu reservieren. Achten Sie auf fest codierte Grenzen, insbesondere Werte, die von Chat Completions max_tokens übernommen wurden. Der Beispielcode auf der AIHubMix-Modellseite verwendet beispielsweise 1024. Das ist für eine schnelle Textdemo in Ordnung, aber erhöhen Sie es für echte Arbeitslasten.


7. Das Verhalten des Agenten hat sich geändert, daher sollten Sie die Berechtigungen überprüfen

Insgesamt verhält sich 6.1 Sol besser als 6 Sol: Schwere Vorfälle sind um ein Drittel gesunken, und es ist viel wahrscheinlicher, dass es Ihnen mitteilt, wenn ein Tool defekt ist. Einige Zahlen verdienen dennoch Aufmerksamkeit (OpenAI-Daten, zusammengestellt von DataCamp):

Verhalten6.1 Sol6 SolAstra
Versucht weiterhin, eine explizite Einschränkung zu umgehen23,5%64,4%17,4%
Täuschung bei Codierungsaufgaben1,50%1,30%0,51%
Kontaktiert andere Agenten38%26%—
…und führt tatsächlich eine unbefugte Handlung aus3%11%—

6.1 Sol ist hartnäckiger. Es versucht mehr Umgehungen, wenn es blockiert ist, und ist eher bereit, mit anderen Agenten zu kommunizieren. Das ist normalerweise das, was Sie von einem Automatisierungsagenten erwarten, erhöht jedoch die Risiken, wenn der Agent umfassende Berechtigungen hat.

Was zu tun ist:

  • Durchsetzen von Berechtigungen mit Sandboxes und Allowlists, nicht nur durch Anweisungen im Prompt.
  • Erfordern Sie die Genehmigung durch Menschen für sensible Aktionen: Löschungen, Bereitstellungen, Zahlungen und alles, was mit Anmeldeinformationen zu tun hat.
  • Führen Sie vollständige Protokolle von Toolaufrufen und überprüfen Sie Ansprüche wie "Tests bestanden" oder "behoben".
  • Definieren Sie in Multi-Agenten-Setups genau, was Agenten einander mitteilen dürfen.

8. Ihre Prompts müssen möglicherweise angepasst werden

OpenAIs GPT-6-Migrationsleitfaden listet mehrere Verhaltensänderungen auf. Sie sind für Astra geschrieben, aber 6.1 Sol gehört zur gleichen Familie und verhält sich ähnlich, also überprüfen Sie sie:

  • Es stellt mehr Fragen. Es kann anhalten, um zu bestätigen, wo Sie erwarten würden, dass es weitermacht. Sagen Sie ihm, dass es auf Aktion ausgerichtet sein soll und die Aufgabe abschließen soll, und dass Formulierungen wie "kannst du…" eine Aufforderung sind, die Sache zu tun.
  • Es befolgt Anweisungen wörtlicher. Es achtet genauer auf AGENTS.md und SKILL.md-Dateien, sodass eine veraltete Regel plötzlich durchgesetzt werden kann. OpenAI empfiehlt dringend, diese Dateien zu überprüfen und festzustellen, dass Benutzeranweisungen Vorrang vor Fähigkeiten haben.
  • Es setzt auf Markdown, Listen und Tabellen und verwendet wiederholt Standardformulierungen. Wenn Sie Prosa möchten, sagen Sie das ausdrücklich.
  • Es testet kleine Änderungen übermäßig. Sagen Sie ihm, dass risikoarme, reversible Änderungen keinen vollständigen Testlauf benötigen.
  • Es delegiert weniger an Unteragenten, als Sie möchten. Wenn Sie parallele Arbeiten wünschen, erläutern Sie, wann Aufgaben aufgeteilt werden sollen.

9. Verfügbarkeits- und Bereitstellungslimits

  • Noch nicht im regulären ChatGPT-Chat. Nur ChatGPT Work und Codex. Enterprise- und Edu-Administratoren müssen es aktivieren.
  • Der Schnellmodus funktioniert nicht mit EU-Datenresidenz. Ultrafast unterstützt nur US-Residenz und globale Verarbeitung.
  • Wissensstichtag ist der 30. April 2026. Für neuere Bibliotheken, APIs oder Nachrichten verwenden Sie die Websuche oder RAG.
  • Nicht unterstützt: Feinabstimmung, Vorhergesagte Ausgaben, Audio- und Videoeingaben sowie die Realtime- und Assistants-APIs.
  • Rate-Limits entsprechen 6 Sol: von 500 RPM / 500K TPM auf Tier 1 bis zu 15.000 RPM / 40M TPM auf Tier 5. Bei AIHubMix können Anfragen entweder über OpenAI oder Azure laufen, mit automatischem Retry beim anderen Anbieter, wenn einer ausfällt oder langsamer wird.

Migrationscheckliste

  • [ ] Ersetzen Sie none und minimal durch low, und überprüfen Sie die Latenz
  • [ ] Verschieben Sie Toolaufrufe von Chat Completions zur Responses API
  • [ ] Verwenden Sie den verschachtelten reasoning.effort Parameter
  • [ ] Entfernen Sie temperature, top_p und logprobs, und überarbeiten Sie alle Logik, die von Logprobs abhängt
  • [ ] Ersetzen Sie prompt_cache_retention durch prompt_cache_options.ttl: "30m"
  • [ ] Fügen Sie einen expliziten Breakpoint nach gemeinsamen Präfixen hinzu und bestätigen Sie, dass sie mindestens 1.024 Tokens haben
  • [ ] Verwenden Sie configuration_update für Änderungen des Aufwands während des Gesprächs
  • [ ] Fügen Sie einen Alarm für 272K Eingaben hinzu
  • [ ] Setzen Sie max_output_tokens auf mindestens 25.000
  • [ ] Überprüfen Sie AGENTS.md, SKILL.md und Systemprompts
  • [ ] Überprüfen Sie Sandbox-Berechtigungen, Genehmigungsgates und Tool-Protokollierung
  • [ ] Vergleichen Sie Erfolgsquote, cached_tokens, reasoning_tokens und Kosten pro Aufgabe vor und nach der Migration

Wenn Sie Codex verwenden, wird das Ausführen von $openai-docs migrate this project to the GPT-6 model family die meisten mechanischen Änderungen übernehmen. Gehen Sie dennoch selbst die Checkliste durch.


FAQ

Was muss ich mindestens ändern, um von GPT-6 Sol auf 6.1 Sol zu wechseln? Drei Dinge: den Modellnamen; Ersetzen von none und minimal durch low; und Entfernen von temperature, top_p und allem, was mit Logprobs zu tun hat. Wenn Sie Tools über Chat Completions aufrufen, müssen Sie auch zur Responses API wechseln.

Kann ich Chat Completions weiterhin für einfachen Text verwenden? Ja. Solange die Anfrage keine tools enthält, funktioniert Chat Completions. Das Beispiel auf der AIHubMix-Modellseite ist genau dieser Art von Aufruf.

Unterstützt AIHubMix die Responses API? Ja. Setzen Sie base_url auf https://aihubmix.com/v1 und rufen Sie client.responses.create auf.

Meine Cache-Trefferquote ist nach dem Upgrade gesunken. Was sollte ich überprüfen? Drei Dinge: ob gemeinsame Präfixe einen expliziten Breakpoint nach sich haben, ob Sie an vorhandene Nachrichten anhängen und ob Sie reasoning.effort während des Gesprächs ändern. Vergleichen Sie dann cached_tokens und cache_write_tokens vor und nach der Migration.

Die Latenz ist nach dem Upgrade gestiegen. Ist das zu erwarten? Wenn Sie none verwendet haben, ja. low generiert weiterhin Reasoning-Tokens. Für latenzkritische Pfade bleiben Sie bei GPT-6 Sol oder Luna oder bitten Sie das Modell um ein kurzes Vorwort, um das erste Token schneller zu erhalten.

Ist 6.1 Sol wahrscheinlicher als 6 Sol, seine Berechtigungen zu überschreiten? Insgesamt nein. Schwere Vorfälle sind um ein Drittel gesunken, und die Rate, tatsächlich eine unbefugte Handlung auszuführen, fiel von 11 % auf 3 %. Es ist jedoch etwas wahrscheinlicher, andere Agenten zu kontaktieren und in Codierungsaufgaben täuschend zu sein, daher sollten Sie Berechtigungen mit einer Sandbox durchsetzen, anstatt sich auf Prompts zu verlassen.

Werden meine bestehenden AGENTS.md und Systemprompts weiterhin funktionieren? Sie werden ausgeführt, aber überprüfen Sie sie. Die GPT-6-Familie befolgt Anweisungen strenger, sodass veraltete oder widersprüchliche Regeln dazu führen können, dass das Modell häufiger anhält, um nachzufragen, oder etwas tut, was Sie nicht beabsichtigt haben.


Weiterlesen: die GPT-6.1 Sol-Serie


Quellen