Der Umstieg von GPT-6 Sol auf 6.1 Sol sieht aus wie eine einzeilige Änderung, und der Preis bleibt gleich. Aber es gibt einige breaking changes und Verhaltensänderungen, sodass allein die Änderung des Modellnamens zu Fehlern, einer überraschenden Rechnung oder einem Agenten führen kann, der sich anders verhält. OpenAIs GPT-6-Migrationsleitfaden deckt die meisten offiziellen Änderungen ab. Dieser Beitrag ergänzt die Punkte, die in der Praxis oft Probleme verursachen.
Sie sind von "laut fehlerhaft" bis "leise fehlerhaft" geordnet.
1. reasoning_effort: "none" führt zu einem 400
Was Sie sehen werden: Die Anfrage wird abgelehnt.
Warum: 6.1 Sol unterstützt none oder minimal nicht. Das niedrigste Niveau ist low. GPT-6 Sol und Luna akzeptieren weiterhin none, weshalb Ihr alter Code dort funktionierte.
Behebung:
- OpenAIs Zuordnung besteht darin,
nonedurchlowzu ersetzen. Fürminimalbeginnen Sie beilowund vergleichen Sie. lowist langsamer und teurer alsnone, da es Reasoning-Tokens generiert. Für wirklich latenzempfindliche Pfade wie Autocomplete oder Echtzeitklassifizierung kann es besser sein, bei GPT-6 Sol zu bleiben oder zu Luna zu wechseln.
2. Toolaufrufe in Chat Completions funktionieren nicht mehr
Was Sie sehen werden: Chat Completions-Anfragen, die tools einschließen, schlagen fehl.
Warum: GPT-6 Sol erlaubte nur Funktionsaufrufe in Chat Completions, wenn reasoning_effort auf none gesetzt war, und viele Projekte verließen sich auf diese Kombination für kostengünstige Toolaufrufe. Da none nicht mehr verfügbar ist, funktioniert Chat Completions auf 6.1 Sol nur für Anfragen ohne Tools. Für Tools müssen Sie die Responses API verwenden. OpenAIs Leitfaden zur Migration zur Responses API führt Sie durch den Prozess.
Behebung: Wechseln Sie zu /v1/responses. AIHubMix unterstützt dies ebenfalls; siehe die AIHubMix Responses API-Dokumentation für Parameter.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # nested, not reasoning_effort
tools=[{
"type": "function",
"name": "get_weather",
"description": "Holen Sie sich das aktuelle Wetter für eine Stadt",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
}],
input="Wie ist das Wetter heute in Shanghai?",
)
print(resp.output)
Einfach zu übersehende Dinge:
- In Responses ist der Parameter
reasoning.effort. Das Senden vonreasoning_effortführt zuUnsupported parameter. - Bei der Verwendung von Tools über mehrere Runden hinweg senden Sie alle Reasoning-, Function_Call- und Function_Call_Output-Elemente seit der letzten Benutzeranfrage zurück, nicht nur die Funktionsergebnisse.
- Mit
store: falseoder ZDR enthalten Reasoning-Elemente standardmäßigencrypted_content. Spielen Sie die gesamte Historie ab, und es funktioniert einfach.
3. Sampling-Parameter müssen entfernt werden
Was Sie sehen werden: Anfragen mit temperature oder top_p schlagen fehl.
Warum: Diese Parameter sind nur erlaubt, wenn der Aufwand none ist. 6.1 Sol hat kein none, sodass Sie sie mit diesem Modell niemals verwenden können.
Entfernen:
temperature,top_p,top_logprobslogprobsin Chat Completionsmessage.output_text.logprobsausincludein Responses
4. Caching funktioniert anders, und Ihre Rechnung kann steigen
Dies ist das einfachste, was man übersehen kann, insbesondere beim Umstieg von GPT-5.5 oder früher. Alles Folgende stammt aus OpenAIs Leitfaden zum Prompt-Caching.
Der Parameter wurde umbenannt. prompt_cache_retention heißt jetzt prompt_cache_options.ttl, und der einzige unterstützte Wert ist "30m".
Cache-Schreibvorgänge werden berechnet. Sie kosten 1,25× den Eingabewert (2,50 $ pro Million bei 6.1 Sol). Ein langer Präfix, den Sie nur einmal verwenden, kostet jetzt 25 % mehr mit Caching als ohne.
Breakpoints wurden verschoben. Ältere Modelle platzierten Breakpoints in festen Intervallen (alle 2.048 Tokens bei GPT-5.5). Der implizite Modus platziert jetzt einen Breakpoint am Ende der neuesten berechtigten Nachricht. Infolgedessen wird ein kürzerer Präfix, der über Anfragen hinweg geteilt wird, nicht automatisch wiederverwendet. Wenn viele Anfragen einen Systemprompt teilen, gefolgt von unterschiedlichen Benutzereingaben, fügen Sie einen expliziten Breakpoint direkt nach dem Systemprompt hinzu.
Das Anhängen an eine vorhandene Nachricht bricht den Cache. Der zwischengespeicherte Endpunkt landet in der Mitte einer längeren Nachricht und kann nicht zugeordnet werden. Fügen Sie stattdessen eine neue Nachricht hinzu.
Änderungen des Reasoning-Aufwands brechen den Cache. reasoning.effort ist Teil des Präfixes. Wechseln Sie mitten im Gespräch mit configuration_update (siehe Teil 2). Beachten Sie, dass es nicht mit automatischer Kompaktierung oder Trunkierung kombiniert werden kann, und /responses/compact weist Historien zurück, die eine enthalten.
Hoher Verkehr kann die Trefferquote senken. Caches leben auf einzelnen Maschinen. Mehr als etwa 15 Anfragen pro Minute mit demselben Präfix können auf andere Maschinen überlaufen und nicht erfasst werden. Zwischengespeicherte Tokens zählen auch weiterhin zu Ihrem TPM-Rate-Limit.
Vor und nach der Migration vergleichen Sie cached_tokens, cache_write_tokens, Latenz und Kosten pro Aufgabe.
5. Überschreitung von 272K Eingaben verdoppelt den Preis
Das 1,05-Mio.-Kontextfenster ist verlockend, aber sobald die Eingabe 272K Tokens überschreitet, wird die gesamte Anfrage mit 2× Eingabe und 1,5× Ausgabe berechnet. Der Übergang von 270K auf 280K Eingaben kostet eine Anfrage von 0,64 $ auf 1,27 $ (Teil 3 enthält die Berechnung).
Langfristige Agentensitzungen wachsen weiter, sodass es leicht ist, diese Grenze zu überschreiten, ohne es zu bemerken. Stellen Sie einen clientseitigen Alarm bei etwa 250K ein und aktivieren Sie die Kompaktierung, wenn er ausgelöst wird.
6. Ein kleines max_output_tokens führt zu einer leeren Antwort
Was Sie sehen werden: status: incomplete mit dem Grund max_output_tokens, keine sichtbare Ausgabe, und Sie werden trotzdem belastet.
Warum: max_output_tokens beinhaltet Reasoning-Tokens. Eine Obergrenze, die bei none in Ordnung war, kann bei low oder höher vollständig aufgebraucht werden.
Behebung: OpenAIs Leitfaden zum Reasoning empfiehlt, mindestens 25.000 Tokens zu reservieren. Achten Sie auf fest codierte Grenzen, insbesondere Werte, die von Chat Completions max_tokens übernommen wurden. Der Beispielcode auf der AIHubMix-Modellseite verwendet beispielsweise 1024. Das ist für eine schnelle Textdemo in Ordnung, aber erhöhen Sie es für echte Arbeitslasten.
7. Das Verhalten des Agenten hat sich geändert, daher sollten Sie die Berechtigungen überprüfen
Insgesamt verhält sich 6.1 Sol besser als 6 Sol: Schwere Vorfälle sind um ein Drittel gesunken, und es ist viel wahrscheinlicher, dass es Ihnen mitteilt, wenn ein Tool defekt ist. Einige Zahlen verdienen dennoch Aufmerksamkeit (OpenAI-Daten, zusammengestellt von DataCamp):
| Verhalten | 6.1 Sol | 6 Sol | Astra |
|---|---|---|---|
| Versucht weiterhin, eine explizite Einschränkung zu umgehen | 23,5% | 64,4% | 17,4% |
| Täuschung bei Codierungsaufgaben | 1,50% | 1,30% | 0,51% |
| Kontaktiert andere Agenten | 38% | 26% | — |
| …und führt tatsächlich eine unbefugte Handlung aus | 3% | 11% | — |
6.1 Sol ist hartnäckiger. Es versucht mehr Umgehungen, wenn es blockiert ist, und ist eher bereit, mit anderen Agenten zu kommunizieren. Das ist normalerweise das, was Sie von einem Automatisierungsagenten erwarten, erhöht jedoch die Risiken, wenn der Agent umfassende Berechtigungen hat.
Was zu tun ist:
- Durchsetzen von Berechtigungen mit Sandboxes und Allowlists, nicht nur durch Anweisungen im Prompt.
- Erfordern Sie die Genehmigung durch Menschen für sensible Aktionen: Löschungen, Bereitstellungen, Zahlungen und alles, was mit Anmeldeinformationen zu tun hat.
- Führen Sie vollständige Protokolle von Toolaufrufen und überprüfen Sie Ansprüche wie "Tests bestanden" oder "behoben".
- Definieren Sie in Multi-Agenten-Setups genau, was Agenten einander mitteilen dürfen.
8. Ihre Prompts müssen möglicherweise angepasst werden
OpenAIs GPT-6-Migrationsleitfaden listet mehrere Verhaltensänderungen auf. Sie sind für Astra geschrieben, aber 6.1 Sol gehört zur gleichen Familie und verhält sich ähnlich, also überprüfen Sie sie:
- Es stellt mehr Fragen. Es kann anhalten, um zu bestätigen, wo Sie erwarten würden, dass es weitermacht. Sagen Sie ihm, dass es auf Aktion ausgerichtet sein soll und die Aufgabe abschließen soll, und dass Formulierungen wie "kannst du…" eine Aufforderung sind, die Sache zu tun.
- Es befolgt Anweisungen wörtlicher. Es achtet genauer auf
AGENTS.mdund SKILL.md-Dateien, sodass eine veraltete Regel plötzlich durchgesetzt werden kann. OpenAI empfiehlt dringend, diese Dateien zu überprüfen und festzustellen, dass Benutzeranweisungen Vorrang vor Fähigkeiten haben. - Es setzt auf Markdown, Listen und Tabellen und verwendet wiederholt Standardformulierungen. Wenn Sie Prosa möchten, sagen Sie das ausdrücklich.
- Es testet kleine Änderungen übermäßig. Sagen Sie ihm, dass risikoarme, reversible Änderungen keinen vollständigen Testlauf benötigen.
- Es delegiert weniger an Unteragenten, als Sie möchten. Wenn Sie parallele Arbeiten wünschen, erläutern Sie, wann Aufgaben aufgeteilt werden sollen.
9. Verfügbarkeits- und Bereitstellungslimits
- Noch nicht im regulären ChatGPT-Chat. Nur ChatGPT Work und Codex. Enterprise- und Edu-Administratoren müssen es aktivieren.
- Der Schnellmodus funktioniert nicht mit EU-Datenresidenz. Ultrafast unterstützt nur US-Residenz und globale Verarbeitung.
- Wissensstichtag ist der 30. April 2026. Für neuere Bibliotheken, APIs oder Nachrichten verwenden Sie die Websuche oder RAG.
- Nicht unterstützt: Feinabstimmung, Vorhergesagte Ausgaben, Audio- und Videoeingaben sowie die Realtime- und Assistants-APIs.
- Rate-Limits entsprechen 6 Sol: von 500 RPM / 500K TPM auf Tier 1 bis zu 15.000 RPM / 40M TPM auf Tier 5. Bei AIHubMix können Anfragen entweder über OpenAI oder Azure laufen, mit automatischem Retry beim anderen Anbieter, wenn einer ausfällt oder langsamer wird.
Migrationscheckliste
- [ ] Ersetzen Sie
noneundminimaldurchlow, und überprüfen Sie die Latenz - [ ] Verschieben Sie Toolaufrufe von Chat Completions zur Responses API
- [ ] Verwenden Sie den verschachtelten
reasoning.effortParameter - [ ] Entfernen Sie
temperature,top_pundlogprobs, und überarbeiten Sie alle Logik, die von Logprobs abhängt - [ ] Ersetzen Sie
prompt_cache_retentiondurchprompt_cache_options.ttl: "30m" - [ ] Fügen Sie einen expliziten Breakpoint nach gemeinsamen Präfixen hinzu und bestätigen Sie, dass sie mindestens 1.024 Tokens haben
- [ ] Verwenden Sie
configuration_updatefür Änderungen des Aufwands während des Gesprächs - [ ] Fügen Sie einen Alarm für 272K Eingaben hinzu
- [ ] Setzen Sie
max_output_tokensauf mindestens 25.000 - [ ] Überprüfen Sie
AGENTS.md, SKILL.md und Systemprompts - [ ] Überprüfen Sie Sandbox-Berechtigungen, Genehmigungsgates und Tool-Protokollierung
- [ ] Vergleichen Sie Erfolgsquote,
cached_tokens,reasoning_tokensund Kosten pro Aufgabe vor und nach der Migration
Wenn Sie Codex verwenden, wird das Ausführen von $openai-docs migrate this project to the GPT-6 model family die meisten mechanischen Änderungen übernehmen. Gehen Sie dennoch selbst die Checkliste durch.
FAQ
Was muss ich mindestens ändern, um von GPT-6 Sol auf 6.1 Sol zu wechseln? Drei Dinge: den Modellnamen; Ersetzen von none und minimal durch low; und Entfernen von temperature, top_p und allem, was mit Logprobs zu tun hat. Wenn Sie Tools über Chat Completions aufrufen, müssen Sie auch zur Responses API wechseln.
Kann ich Chat Completions weiterhin für einfachen Text verwenden? Ja. Solange die Anfrage keine tools enthält, funktioniert Chat Completions. Das Beispiel auf der AIHubMix-Modellseite ist genau dieser Art von Aufruf.
Unterstützt AIHubMix die Responses API? Ja. Setzen Sie base_url auf https://aihubmix.com/v1 und rufen Sie client.responses.create auf.
Meine Cache-Trefferquote ist nach dem Upgrade gesunken. Was sollte ich überprüfen? Drei Dinge: ob gemeinsame Präfixe einen expliziten Breakpoint nach sich haben, ob Sie an vorhandene Nachrichten anhängen und ob Sie reasoning.effort während des Gesprächs ändern. Vergleichen Sie dann cached_tokens und cache_write_tokens vor und nach der Migration.
Die Latenz ist nach dem Upgrade gestiegen. Ist das zu erwarten? Wenn Sie none verwendet haben, ja. low generiert weiterhin Reasoning-Tokens. Für latenzkritische Pfade bleiben Sie bei GPT-6 Sol oder Luna oder bitten Sie das Modell um ein kurzes Vorwort, um das erste Token schneller zu erhalten.
Ist 6.1 Sol wahrscheinlicher als 6 Sol, seine Berechtigungen zu überschreiten? Insgesamt nein. Schwere Vorfälle sind um ein Drittel gesunken, und die Rate, tatsächlich eine unbefugte Handlung auszuführen, fiel von 11 % auf 3 %. Es ist jedoch etwas wahrscheinlicher, andere Agenten zu kontaktieren und in Codierungsaufgaben täuschend zu sein, daher sollten Sie Berechtigungen mit einer Sandbox durchsetzen, anstatt sich auf Prompts zu verlassen.
Werden meine bestehenden AGENTS.md und Systemprompts weiterhin funktionieren? Sie werden ausgeführt, aber überprüfen Sie sie. Die GPT-6-Familie befolgt Anweisungen strenger, sodass veraltete oder widersprüchliche Regeln dazu führen können, dass das Modell häufiger anhält, um nachzufragen, oder etwas tut, was Sie nicht beabsichtigt haben.
Weiterlesen: die GPT-6.1 Sol-Serie
- Unsicher, ob der Umstieg sich lohnt? Sehen Sie, wo 6.1 Sol 6 Sol übertrifft und wie weit es hinter Astra zurückbleibt: GPT-6.1 Sol vs GPT-6 Sol: Ein einwöchiges Upgrade, das Astra fast einholt.
- Sie haben
nonedurchlowersetzt. Was ist mit allem anderen? Empfehlungen nach Anwendungsfall und ein Anpassungsprozess: Auswahl eines Reasoning-Aufwands für GPT-6.1 Sol: von niedrig bis maximal. - Überprüfen Sie Ihre Rechnung nach der Migration. Cache-Treffer, die 272K-Grenze und Reasoning-Tokens erklärt: Was GPT-6.1 Sol wirklich kostet: Über den Preis von 2 $ / 10 $ hinaus.



