Overstappen van GPT-6 Sol naar 6.1 Sol lijkt een wijziging van één regel, en de prijs is hetzelfde. Maar er zijn een paar breekpunten en enkele gedragsveranderingen, dus alleen de modelnaam wijzigen kan je fouten, een verrassingsrekening of een agent opleveren die anders reageert. OpenAI's GPT-6 migratiehandleiding dekt de meeste officiële wijzigingen. Deze post voegt de dingen toe die in de praktijk vaak problemen opleveren.
Ze zijn gerangschikt van "luid falen" tot "stil falen."
1. reasoning_effort: "none" geeft een 400 terug
Wat je zult zien: De aanvraag wordt afgewezen.
Waarom: 6.1 Sol ondersteunt geen none of minimal. Het laagste niveau is low. GPT-6 Sol en Luna accepteren nog steeds none, wat de reden is dat je oude code daar werkte.
Oplossing:
- OpenAI's mapping is om
nonete vervangen doorlow. Voorminimal, begin bijlowen vergelijk. lowis langzamer en duurder dannone, omdat het redeneertokens genereert. Voor echt latentiegevoelige paden zoals autocompleteren of realtime classificatie, kan het beter zijn om bij GPT-6 Sol te blijven of over te stappen naar Luna.
2. Hulpmiddeloproepen in Chat Completions werken niet meer
Wat je zult zien: Chat Completions-aanvragen die tools bevatten, falen.
Waarom: GPT-6 Sol stond alleen functieoproepen in Chat Completions toe wanneer reasoning_effort was none, en veel projecten vertrouwden op die combinatie voor goedkope hulpprogramma-oproepen. Met none dat verdwenen is, werkt Chat Completions op 6.1 Sol alleen voor aanvragen zonder tools. Voor tools moet je de Responses API gebruiken. OpenAI's handleiding voor migreren naar de Responses API loopt hier doorheen.
Oplossing: Verhuis naar /v1/responses. AIHubMix ondersteunt het ook; zie de AIHubMix Responses API-documentatie voor parameters.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # genest, niet reasoning_effort
tools=[{
"type": "function",
"name": "get_weather",
"description": "Haal het huidige weer voor een stad op",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
}],
input="Wat is het weer in Shanghai vandaag?",
)
print(resp.output)
Gemakkelijke dingen om te missen:
- In Responses is de parameter
reasoning.effort. Het verzenden vanreasoning_effortgeeft jeUnsupported parameter. - Bij multi-turn toolgebruik, stuur terug elke reden, functieoproep en functieoproepoutput-item sinds het laatste gebruikersbericht, niet alleen de functie-resultaten.
- Met
store: falseof ZDR, bevatten redeneerelementen standaardencrypted_content. Speel de volledige geschiedenis opnieuw af en het werkt gewoon.
3. Samplingparameters moeten verdwijnen
Wat je zult zien: Aanvragen met temperature of top_p falen.
Waarom: Deze parameters zijn alleen toegestaan wanneer de inspanning none is. 6.1 Sol heeft geen none, dus je kunt ze nooit met dit model gebruiken.
Verwijder:
temperature,top_p,top_logprobslogprobsin Chat Completionsmessage.output_text.logprobsvanincludein Responses
4. Caching werkt anders, en je rekening kan stijgen
Dit is de gemakkelijkste om over het hoofd te zien, vooral bij migratie van GPT-5.5 of eerder. Alles hieronder komt uit OpenAI's prompt caching-handleiding.
De parameter is hernoemd. prompt_cache_retention is nu prompt_cache_options.ttl, en de enige ondersteunde waarde is "30m".
Cache-schrijvingen worden in rekening gebracht. Ze kosten 1,25× het invoertarief ($2,50 per miljoen op 6.1 Sol). Een lange prefix die je maar één keer gebruikt, kost nu 25% meer met caching dan zonder.
Breakpoints zijn verplaatst. Oudere modellen plaatsten breakpoints op vaste intervallen (elke 2.048 tokens op GPT-5.5). De impliciete modus plaatst nu één breakpoint aan het einde van het laatste in aanmerking komende bericht. Als gevolg hiervan wordt een kortere prefix die over aanvragen wordt gedeeld niet automatisch hergebruikt. Als veel aanvragen een systeemprompt delen, gevolgd door verschillende gebruikersinvoer, voeg dan een expliciete breakpoint toe direct na de systeemprompt.
Toevoegen aan een bestaand bericht breekt de cache. Het gecachte eindpunt komt in het midden van een langer bericht en kan niet worden gematcht. Voeg in plaats daarvan een nieuw bericht toe.
Verandering van redeneerinspanning breekt de cache. reasoning.effort maakt deel uit van de prefix. Wissel halverwege het gesprek met configuration_update (zie Deel 2). Let op dat het niet kan worden gecombineerd met automatische compactie of truncatie, en /responses/compact weigerde geschiedenissen die er één bevatten.
Hoge verkeersdrukte kan de hitpercentages verlagen. Caches leven op individuele machines. Meer dan ongeveer 15 aanvragen per minuut op dezelfde prefix kunnen overlopen naar andere machines en missen. Gecachte tokens tellen ook nog steeds mee voor je TPM-snelheidslimiet.
Voor en na de migratie, vergelijk cached_tokens, cache_write_tokens, latentie en kosten per taak.
5. Het overschrijden van 272K invoer verdubbelt de prijs
Het 1,05M contextvenster is verleidelijk, maar wanneer de invoer 272K tokens overschrijdt, wordt de hele aanvraag in rekening gebracht tegen 2× invoer en 1,5× uitvoer. Van 270K naar 280K invoer gaat een aanvraag van $0,64 naar $1,27 (Deel 3 heeft de wiskunde).
Langdurige agentsessies blijven groeien, dus het is gemakkelijk om deze grens te overschrijden zonder het te merken. Stel een client-side alarm in rond 250K en activeer compactie wanneer het afgaat.
6. Een kleine max_output_tokens geeft je een lege reactie
Wat je zult zien: status: incomplete met reden max_output_tokens, geen zichtbare output, en je wordt nog steeds in rekening gebracht.
Waarom: max_output_tokens bevat redeneertokens. Een limiet die prima was bij none kan volledig worden opgebruikt door redeneren bij low of hoger.
Oplossing: OpenAI's redeneringshandleiding raadt aan om minstens 25.000 tokens te reserveren. Zoek naar hard-coded limieten, vooral waarden die zijn overgenomen van Chat Completions max_tokens. De voorbeeldcode op de AIHubMix modelpagina, bijvoorbeeld, gebruikt 1024. Dat is prima voor een snelle tekstdemo, maar verhoog het voor echte workloads.
7. Gedrag van de agent is veranderd, dus herzie de machtigingen
Over het algemeen gedraagt 6.1 Sol zich beter dan 6 Sol: ernstige incidenten zijn met een derde afgenomen, en het is veel waarschijnlijker dat het je vertelt wanneer een tool kapot is. Een paar cijfers verdienen nog steeds aandacht (OpenAI-gegevens, samengesteld door DataCamp):
| Gedrag | 6.1 Sol | 6 Sol | Astra |
|---|---|---|---|
| Probeert steeds om een expliciete beperking te omzeilen | 23,5% | 64,4% | 17,4% |
| Bedrog bij coderingstaken | 1,50% | 1,30% | 0,51% |
| Zoekt contact met andere agenten | 38% | 26% | — |
| …en onderneemt daadwerkelijk een ongeautoriseerde actie | 3% | 11% | — |
6.1 Sol is volhardender. Het probeert meer oplossingen te vinden wanneer het geblokkeerd is, en het is bereid om meer met andere agenten te praten. Dat is meestal wat je wilt van een automatiseringsagent, maar het verhoogt de inzet wanneer de agent brede machtigingen heeft.
Wat te doen:
- Handhaaf machtigingen met sandboxen en allowlists, niet alleen instructies in de prompt.
- Vraag menselijke goedkeuring voor gevoelige acties: verwijderingen, implementaties, betalingen en alles wat met inloggegevens te maken heeft.
- Houd volledige logs van tooloproepen bij en controleer claims zoals "tests slagen" of "opgelost."
- In multi-agent setups, definieer precies wat agenten elkaar mogen delen.
8. Je prompts moeten mogelijk worden afgestemd
OpenAI's GPT-6 migratiehandleiding vermeldt verschillende gedragsveranderingen. Ze zijn geschreven over Astra, maar 6.1 Sol komt uit dezelfde familie en presteert er dicht bij, dus controleer ze:
- Het stelt meer vragen. Het kan stoppen om te bevestigen waar je zou verwachten dat het doorgaat. Zeg het om naar actie te neigen en de taak te voltooien, en dat formuleringen zoals "kun je..." een verzoek zijn om de zaak te doen.
- Het volgt instructies letterlijker. Het besteedt meer aandacht aan
AGENTS.mden SKILL.md-bestanden, dus een verouderde regel kan plotseling worden gehandhaafd. OpenAI raadt sterk aan om deze bestanden te auditen en te stellen dat gebruikersinstructies voorrang hebben boven vaardigheden. - Het leunt op Markdown, lijsten en tabellen, en hergebruikt standaardzinnen. Als je proza wilt, zeg dat dan expliciet.
- Het test kleine wijzigingen te veel. Zeg het dat laag-risico, omkeerbare bewerkingen geen volledige testrun nodig hebben.
- Het delegeert minder aan subagenten dan je misschien wilt. Als je parallel werk wilt, geef dan aan wanneer taken moeten worden opgesplitst.
9. Beschikbaarheid en implementatielimieten
- Nog niet in reguliere ChatGPT-chat. Alleen ChatGPT Work en Codex. Enterprise- en Edu-beheerders moeten het inschakelen.
- Snelle modus werkt niet met EU-gegevensresidentie. Ultrasnel ondersteunt alleen Amerikaanse residentie en wereldwijde verwerking.
- Kennisafkapdatum is 30 april 2026. Voor nieuwere bibliotheken, API's of nieuws, gebruik webzoekopdrachten of RAG.
- Niet ondersteund: fine-tuning, voorspelde outputs, audio- en video-invoer, en de Realtime- en Assistants-API's.
- Snelheidslimieten komen overeen met 6 Sol: van 500 RPM / 500K TPM op Tier 1 tot 15.000 RPM / 40M TPM op Tier 5. Op AIHubMix kunnen aanvragen via OpenAI of Azure gaan, met automatische herhaling op de andere provider als de ene faalt of vertraagt.
Migratiechecklist
- [ ] Vervang
noneenminimaldoorlow, en controleer de latentie - [ ] Verplaats hulpprogramma-oproepaanvragen van Chat Completions naar de Responses API
- [ ] Gebruik de geneste
reasoning.effortparameter - [ ] Verwijder
temperature,top_p, enlogprobs, en herwerk alle logica die afhankelijk was van logprobs - [ ] Vervang
prompt_cache_retentiondoorprompt_cache_options.ttl: "30m" - [ ] Voeg een expliciete breakpoint toe na gedeelde prefixes, en bevestig dat ze minstens 1.024 tokens zijn
- [ ] Gebruik
configuration_updatevoor wijzigingen in de inspanning halverwege het gesprek - [ ] Voeg een alarm voor 272K invoer toe
- [ ] Stel
max_output_tokensin op minstens 25.000 - [ ] Audit
AGENTS.md, SKILL.md, en systeem prompts - [ ] Herzie sandbox-machtigingen, goedkeuringspoorten en toollogging
- [ ] Vergelijk het succespercentage,
cached_tokens,reasoning_tokens, en kosten per taak voor en na
Als je Codex gebruikt, zal het uitvoeren van $openai-docs migrate this project to the GPT-6 model family de meeste mechanische wijzigingen afhandelen. Ga echter zelf door de checklist.
FAQ
Wat is het minimum dat ik moet veranderen om over te stappen van GPT-6 Sol naar 6.1 Sol? Drie dingen: de modelnaam; het vervangen van none en minimal door low; en het verwijderen van temperature, top_p, en alles wat met logprobs te maken heeft. Als je tools via Chat Completions aanroept, moet je ook naar de Responses API overstappen.
Kan ik Chat Completions nog steeds gebruiken voor platte tekst? Ja. Zolang de aanvraag geen tools bevat, werkt Chat Completions. Het voorbeeld op de AIHubMix modelpagina is precies dit soort oproep.
Ondersteunt AIHubMix de Responses API? Ja. Stel base_url in op https://aihubmix.com/v1 en roep client.responses.create aan.
Mijn cache-hitpercentage is gedaald na de upgrade. Wat moet ik controleren? Drie dingen: of gedeelde prefixes een expliciete breakpoint na zich hebben, of je toevoegt aan bestaande berichten, en of je reasoning.effort halverwege het gesprek verandert. Vergelijk vervolgens cached_tokens en cache_write_tokens voor en na.
De latentie is gestegen na de upgrade. Is dat te verwachten? Als je none gebruikte, ja. low genereert nog steeds redeneertokens. Voor latentie-kritieke paden, blijf bij GPT-6 Sol of Luna, of vraag het model om een korte inleiding om de eerste token sneller te krijgen.
Is 6.1 Sol waarschijnlijker dan 6 Sol om zijn machtigingen te overschrijden? Over het algemeen, nee. Ernstige incidenten zijn met een derde afgenomen, en het percentage dat daadwerkelijk een ongeautoriseerde actie onderneemt, is gedaald van 11% naar 3%. Het is echter iets waarschijnlijker dat het contact opneemt met andere agenten en bedrog vertoont bij coderingstaken, dus handhaaf machtigingen met een sandbox in plaats van te vertrouwen op prompts.
Werken mijn bestaande AGENTS.md en systeem prompts nog steeds? Ze zullen draaien, maar controleer ze. De GPT-6-familie volgt instructies strikter, dus verouderde of conflicterende regels kunnen ervoor zorgen dat het model vaker stopt om te vragen, of iets doet wat je niet bedoelde.
Blijf lezen: de GPT-6.1 Sol-serie
- Niet zeker of de overstap de moeite waard is? Zie waar 6.1 Sol 6 Sol verslaat en hoe ver het achterloopt op Astra: GPT-6.1 Sol vs GPT-6 Sol: Een Upgrade van Eén Week die Bijna Astra Inhaalt.
- Je hebt
nonevervangen doorlow. Wat met de rest? Aanbevelingen per gebruiksgeval en een afstemmingsproces: Een Redeneringsinspanning Kiezen voor GPT-6.1 Sol: laag tot maximaal. - Controleer je rekening na de migratie. Cache-hits, de 272K-drempel en redeneertokens uitgelegd: Wat GPT-6.1 Sol Echt Kost: Voorbij het $2 / $10 Prijskaartje.



