Migreren naar GPT-6.1 Sol: 9 Dingen die Fout Kunnen Gaan

AIHubMix8 min leestijd
Migreren naar GPT-6.1 Sol: 9 Dingen die Fout Kunnen Gaan

Overstappen van GPT-6 Sol naar 6.1 Sol lijkt een wijziging van één regel, en de prijs is hetzelfde. Maar er zijn een paar breekpunten en enkele gedragsveranderingen, dus alleen de modelnaam wijzigen kan je fouten, een verrassingsrekening of een agent opleveren die anders reageert. OpenAI's GPT-6 migratiehandleiding dekt de meeste officiële wijzigingen. Deze post voegt de dingen toe die in de praktijk vaak problemen opleveren.

Ze zijn gerangschikt van "luid falen" tot "stil falen."


1. reasoning_effort: "none" geeft een 400 terug

Wat je zult zien: De aanvraag wordt afgewezen.

Waarom: 6.1 Sol ondersteunt geen none of minimal. Het laagste niveau is low. GPT-6 Sol en Luna accepteren nog steeds none, wat de reden is dat je oude code daar werkte.

Oplossing:

  • OpenAI's mapping is om none te vervangen door low. Voor minimal, begin bij low en vergelijk.
  • low is langzamer en duurder dan none, omdat het redeneertokens genereert. Voor echt latentiegevoelige paden zoals autocompleteren of realtime classificatie, kan het beter zijn om bij GPT-6 Sol te blijven of over te stappen naar Luna.

2. Hulpmiddeloproepen in Chat Completions werken niet meer

Wat je zult zien: Chat Completions-aanvragen die tools bevatten, falen.

Waarom: GPT-6 Sol stond alleen functieoproepen in Chat Completions toe wanneer reasoning_effort was none, en veel projecten vertrouwden op die combinatie voor goedkope hulpprogramma-oproepen. Met none dat verdwenen is, werkt Chat Completions op 6.1 Sol alleen voor aanvragen zonder tools. Voor tools moet je de Responses API gebruiken. OpenAI's handleiding voor migreren naar de Responses API loopt hier doorheen.

Oplossing: Verhuis naar /v1/responses. AIHubMix ondersteunt het ook; zie de AIHubMix Responses API-documentatie voor parameters.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},          # genest, niet reasoning_effort
    tools=[{
        "type": "function",
        "name": "get_weather",
        "description": "Haal het huidige weer voor een stad op",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    }],
    input="Wat is het weer in Shanghai vandaag?",
)
print(resp.output)

Gemakkelijke dingen om te missen:

  • In Responses is de parameter reasoning.effort. Het verzenden van reasoning_effort geeft je Unsupported parameter.
  • Bij multi-turn toolgebruik, stuur terug elke reden, functieoproep en functieoproepoutput-item sinds het laatste gebruikersbericht, niet alleen de functie-resultaten.
  • Met store: false of ZDR, bevatten redeneerelementen standaard encrypted_content. Speel de volledige geschiedenis opnieuw af en het werkt gewoon.

3. Samplingparameters moeten verdwijnen

Wat je zult zien: Aanvragen met temperature of top_p falen.

Waarom: Deze parameters zijn alleen toegestaan wanneer de inspanning none is. 6.1 Sol heeft geen none, dus je kunt ze nooit met dit model gebruiken.

Verwijder:

  • temperature, top_p, top_logprobs
  • logprobs in Chat Completions
  • message.output_text.logprobs van include in Responses
none ondersteunt.


4. Caching werkt anders, en je rekening kan stijgen

Dit is de gemakkelijkste om over het hoofd te zien, vooral bij migratie van GPT-5.5 of eerder. Alles hieronder komt uit OpenAI's prompt caching-handleiding.

De parameter is hernoemd. prompt_cache_retention is nu prompt_cache_options.ttl, en de enige ondersteunde waarde is "30m".

Cache-schrijvingen worden in rekening gebracht. Ze kosten 1,25× het invoertarief ($2,50 per miljoen op 6.1 Sol). Een lange prefix die je maar één keer gebruikt, kost nu 25% meer met caching dan zonder.

Breakpoints zijn verplaatst. Oudere modellen plaatsten breakpoints op vaste intervallen (elke 2.048 tokens op GPT-5.5). De impliciete modus plaatst nu één breakpoint aan het einde van het laatste in aanmerking komende bericht. Als gevolg hiervan wordt een kortere prefix die over aanvragen wordt gedeeld niet automatisch hergebruikt. Als veel aanvragen een systeemprompt delen, gevolgd door verschillende gebruikersinvoer, voeg dan een expliciete breakpoint toe direct na de systeemprompt.

Toevoegen aan een bestaand bericht breekt de cache. Het gecachte eindpunt komt in het midden van een langer bericht en kan niet worden gematcht. Voeg in plaats daarvan een nieuw bericht toe.

Verandering van redeneerinspanning breekt de cache. reasoning.effort maakt deel uit van de prefix. Wissel halverwege het gesprek met configuration_update (zie Deel 2). Let op dat het niet kan worden gecombineerd met automatische compactie of truncatie, en /responses/compact weigerde geschiedenissen die er één bevatten.

Hoge verkeersdrukte kan de hitpercentages verlagen. Caches leven op individuele machines. Meer dan ongeveer 15 aanvragen per minuut op dezelfde prefix kunnen overlopen naar andere machines en missen. Gecachte tokens tellen ook nog steeds mee voor je TPM-snelheidslimiet.

Voor en na de migratie, vergelijk cached_tokens, cache_write_tokens, latentie en kosten per taak.


5. Het overschrijden van 272K invoer verdubbelt de prijs

Het 1,05M contextvenster is verleidelijk, maar wanneer de invoer 272K tokens overschrijdt, wordt de hele aanvraag in rekening gebracht tegen 2× invoer en 1,5× uitvoer. Van 270K naar 280K invoer gaat een aanvraag van $0,64 naar $1,27 (Deel 3 heeft de wiskunde).

Langdurige agentsessies blijven groeien, dus het is gemakkelijk om deze grens te overschrijden zonder het te merken. Stel een client-side alarm in rond 250K en activeer compactie wanneer het afgaat.


6. Een kleine max_output_tokens geeft je een lege reactie

Wat je zult zien: status: incomplete met reden max_output_tokens, geen zichtbare output, en je wordt nog steeds in rekening gebracht.

Waarom: max_output_tokens bevat redeneertokens. Een limiet die prima was bij none kan volledig worden opgebruikt door redeneren bij low of hoger.

Oplossing: OpenAI's redeneringshandleiding raadt aan om minstens 25.000 tokens te reserveren. Zoek naar hard-coded limieten, vooral waarden die zijn overgenomen van Chat Completions max_tokens. De voorbeeldcode op de AIHubMix modelpagina, bijvoorbeeld, gebruikt 1024. Dat is prima voor een snelle tekstdemo, maar verhoog het voor echte workloads.


7. Gedrag van de agent is veranderd, dus herzie de machtigingen

Over het algemeen gedraagt 6.1 Sol zich beter dan 6 Sol: ernstige incidenten zijn met een derde afgenomen, en het is veel waarschijnlijker dat het je vertelt wanneer een tool kapot is. Een paar cijfers verdienen nog steeds aandacht (OpenAI-gegevens, samengesteld door DataCamp):

Gedrag6.1 Sol6 SolAstra
Probeert steeds om een expliciete beperking te omzeilen23,5%64,4%17,4%
Bedrog bij coderingstaken1,50%1,30%0,51%
Zoekt contact met andere agenten38%26%—
…en onderneemt daadwerkelijk een ongeautoriseerde actie3%11%—

6.1 Sol is volhardender. Het probeert meer oplossingen te vinden wanneer het geblokkeerd is, en het is bereid om meer met andere agenten te praten. Dat is meestal wat je wilt van een automatiseringsagent, maar het verhoogt de inzet wanneer de agent brede machtigingen heeft.

Wat te doen:

  • Handhaaf machtigingen met sandboxen en allowlists, niet alleen instructies in de prompt.
  • Vraag menselijke goedkeuring voor gevoelige acties: verwijderingen, implementaties, betalingen en alles wat met inloggegevens te maken heeft.
  • Houd volledige logs van tooloproepen bij en controleer claims zoals "tests slagen" of "opgelost."
  • In multi-agent setups, definieer precies wat agenten elkaar mogen delen.

8. Je prompts moeten mogelijk worden afgestemd

OpenAI's GPT-6 migratiehandleiding vermeldt verschillende gedragsveranderingen. Ze zijn geschreven over Astra, maar 6.1 Sol komt uit dezelfde familie en presteert er dicht bij, dus controleer ze:

  • Het stelt meer vragen. Het kan stoppen om te bevestigen waar je zou verwachten dat het doorgaat. Zeg het om naar actie te neigen en de taak te voltooien, en dat formuleringen zoals "kun je..." een verzoek zijn om de zaak te doen.
  • Het volgt instructies letterlijker. Het besteedt meer aandacht aan AGENTS.md en SKILL.md-bestanden, dus een verouderde regel kan plotseling worden gehandhaafd. OpenAI raadt sterk aan om deze bestanden te auditen en te stellen dat gebruikersinstructies voorrang hebben boven vaardigheden.
  • Het leunt op Markdown, lijsten en tabellen, en hergebruikt standaardzinnen. Als je proza wilt, zeg dat dan expliciet.
  • Het test kleine wijzigingen te veel. Zeg het dat laag-risico, omkeerbare bewerkingen geen volledige testrun nodig hebben.
  • Het delegeert minder aan subagenten dan je misschien wilt. Als je parallel werk wilt, geef dan aan wanneer taken moeten worden opgesplitst.

9. Beschikbaarheid en implementatielimieten

  • Nog niet in reguliere ChatGPT-chat. Alleen ChatGPT Work en Codex. Enterprise- en Edu-beheerders moeten het inschakelen.
  • Snelle modus werkt niet met EU-gegevensresidentie. Ultrasnel ondersteunt alleen Amerikaanse residentie en wereldwijde verwerking.
  • Kennisafkapdatum is 30 april 2026. Voor nieuwere bibliotheken, API's of nieuws, gebruik webzoekopdrachten of RAG.
  • Niet ondersteund: fine-tuning, voorspelde outputs, audio- en video-invoer, en de Realtime- en Assistants-API's.
  • Snelheidslimieten komen overeen met 6 Sol: van 500 RPM / 500K TPM op Tier 1 tot 15.000 RPM / 40M TPM op Tier 5. Op AIHubMix kunnen aanvragen via OpenAI of Azure gaan, met automatische herhaling op de andere provider als de ene faalt of vertraagt.

Migratiechecklist

  • [ ] Vervang none en minimal door low, en controleer de latentie
  • [ ] Verplaats hulpprogramma-oproepaanvragen van Chat Completions naar de Responses API
  • [ ] Gebruik de geneste reasoning.effort parameter
  • [ ] Verwijder temperature, top_p, en logprobs, en herwerk alle logica die afhankelijk was van logprobs
  • [ ] Vervang prompt_cache_retention door prompt_cache_options.ttl: "30m"
  • [ ] Voeg een expliciete breakpoint toe na gedeelde prefixes, en bevestig dat ze minstens 1.024 tokens zijn
  • [ ] Gebruik configuration_update voor wijzigingen in de inspanning halverwege het gesprek
  • [ ] Voeg een alarm voor 272K invoer toe
  • [ ] Stel max_output_tokens in op minstens 25.000
  • [ ] Audit AGENTS.md, SKILL.md, en systeem prompts
  • [ ] Herzie sandbox-machtigingen, goedkeuringspoorten en toollogging
  • [ ] Vergelijk het succespercentage, cached_tokens, reasoning_tokens, en kosten per taak voor en na

Als je Codex gebruikt, zal het uitvoeren van $openai-docs migrate this project to the GPT-6 model family de meeste mechanische wijzigingen afhandelen. Ga echter zelf door de checklist.


FAQ

Wat is het minimum dat ik moet veranderen om over te stappen van GPT-6 Sol naar 6.1 Sol? Drie dingen: de modelnaam; het vervangen van none en minimal door low; en het verwijderen van temperature, top_p, en alles wat met logprobs te maken heeft. Als je tools via Chat Completions aanroept, moet je ook naar de Responses API overstappen.

Kan ik Chat Completions nog steeds gebruiken voor platte tekst? Ja. Zolang de aanvraag geen tools bevat, werkt Chat Completions. Het voorbeeld op de AIHubMix modelpagina is precies dit soort oproep.

Ondersteunt AIHubMix de Responses API? Ja. Stel base_url in op https://aihubmix.com/v1 en roep client.responses.create aan.

Mijn cache-hitpercentage is gedaald na de upgrade. Wat moet ik controleren? Drie dingen: of gedeelde prefixes een expliciete breakpoint na zich hebben, of je toevoegt aan bestaande berichten, en of je reasoning.effort halverwege het gesprek verandert. Vergelijk vervolgens cached_tokens en cache_write_tokens voor en na.

De latentie is gestegen na de upgrade. Is dat te verwachten? Als je none gebruikte, ja. low genereert nog steeds redeneertokens. Voor latentie-kritieke paden, blijf bij GPT-6 Sol of Luna, of vraag het model om een korte inleiding om de eerste token sneller te krijgen.

Is 6.1 Sol waarschijnlijker dan 6 Sol om zijn machtigingen te overschrijden? Over het algemeen, nee. Ernstige incidenten zijn met een derde afgenomen, en het percentage dat daadwerkelijk een ongeautoriseerde actie onderneemt, is gedaald van 11% naar 3%. Het is echter iets waarschijnlijker dat het contact opneemt met andere agenten en bedrog vertoont bij coderingstaken, dus handhaaf machtigingen met een sandbox in plaats van te vertrouwen op prompts.

Werken mijn bestaande AGENTS.md en systeem prompts nog steeds? Ze zullen draaien, maar controleer ze. De GPT-6-familie volgt instructies strikter, dus verouderde of conflicterende regels kunnen ervoor zorgen dat het model vaker stopt om te vragen, of iets doet wat je niet bedoelde.


Blijf lezen: de GPT-6.1 Sol-serie


Bronnen