Kiezen van een redeneerinspanning voor GPT-6.1 Sol: laag tot maximaal

AIHubMix6 min leestijd
Kiezen van een redeneerinspanning voor GPT-6.1 Sol: laag tot maximaal

GPT-6.1 Sol heeft vijf niveaus van redeneerinspanning: laag, gemiddeld (de standaard), hoog, xhoog, en maximaal. De grote verandering ten opzichte van GPT-6 Sol is dat geen en minimaal zijn verdwenen, dus laag is nu de basis.

Deze ene instelling beïnvloedt zowel de latentie als de kosten. Je ziet nooit redeneertokens, maar je betaalt ervoor tegen het outputtarief ($10 per miljoen voor 6.1 Sol op AIHubMix), en ze nemen ruimte in de contextvenster in. Kies het verkeerde niveau en je kunt gemakkelijk meerdere keren meer betalen dan nodig is.


Wat elk niveau is voor

redeningsgids met onze eigen aanbevelingen:

NiveauOpenAI's beschrijvingGoede fitSlechte fit
laagEfficiënt redeneren met een bescheiden toename van latentieTussenstappen in toolloops, zoeken, lichte planning, classificatie, extractie, ondersteunende antwoordenMoeilijk debuggen, refactoren van meerdere bestanden
gemiddeld (standaard)De gebalanceerde standaard voor de meeste werkbelastingenDagelijks coderen, codebeoordeling, schrijven, typische agenttakenLatentie-kritisch interactief gebruik
hoogMoeilijk redeneren, complexe debugging, diepe planningLastige bugs, architectuurwerk, SWE-stijl takenHoge QPS online verkeer
xhoogDiepgaand onderzoek, asynchrone werkzaamheden, lange agentrunsAchtergrondtaken, onderzoeksrapportenAlles wat je evaluaties niet hebben gerechtvaardigd
maximaalMaximale redenering voor de moeilijkste takenComputergebruik, onderzoeksproblemen, offline zware takenBijna alle dagelijkse verzoeken

OpenAI noemt inspanning "een afstelknop, niet de primaire manier om kwaliteit te herstellen." Wanneer de resultaten slecht zijn, kijk dan eerst naar de prompt, de tooldefinities en de context. Verhoog de inspanning pas daarna.


Wat de benchmarks zeggen over elk niveau

Dit zijn de eigen cijfers van OpenAI, verzameld door Vellum en DataCamp. Beschouw ze als een gids, niet als het evangelie.

Voor coderen is hoog meestal voldoende. Op DeepSWE v1.1 scoort 6.1 Sol op hoog 75.2, wat overeenkomt met Astra op hoog (74.8), voor ongeveer $1.50 per taak. De kostencurve bereikt 72% tot 75% voor tussen $0.50 en $1.50 per taak. GPT-6 Sol maxte uit op 68.8 voor ongeveer $2.60.

Hoger dan gemiddeld helpt niet altijd. Op AutomationBench scoort 6.1 Sol 35.4% op gemiddeld en slechts ongeveer 36.0% bij hogere inspanning. Voor bedrijfsautomatisering kochten de extra redeneertokens bijna niets.

Bewaar maximaal voor computergebruik en onderzoek. Op OSWorld 2.0 haalt maximaal 71.4 voor ongeveer $1.30 per taak. Terminal-Bench Science op maximaal kost $5.47 per taak: veel goedkoper dan Astra's $23.80, maar een orde van grootte boven de meeste andere werkbelastingen.

Laag is ook beter geworden. De feitelijke foutpercentage op laag daalde van 11.4% op 6 Sol naar 7.7%. Als je taken op 6 Sol naar gemiddeld verhoogde omdat laag niet nauwkeurig genoeg was, probeer dan laag opnieuw.


Startpunten per gebruikscase

GebruikscaseBegin bijOpmerkingen
Oproepen die geen gebruik maakten van 6 SollaagOpenAI's officiële mapping. Als latentie kritiek is, overweeg dan GPT-6 Luna, dat nog steeds geen ondersteunt
Oproepen die minimaal gebruiktenlaagBegin bij laag en vergelijk de resultaten
Chatbots, klantenservicelaagVraag het model om een eenregelige inleiding om de eerste token sneller te krijgen
RAG Q&Alaag → gemiddeldKwaliteit van ophalen is belangrijker dan inspanning
IDE-coderingsassistentgemiddeldDe standaard werkt
Geautomatiseerd bugfixen, SWE-agentenhoogDeepSWE toont aan dat hoog al overeenkomt met Astra
Computergebruik, browseragentenhoog → maximaalOSWorld piekt op maximaal
Achtergrondonderzoek, lange runsxhoogAlleen wanneer evaluaties een winst tonen. Batch halveert de kosten als je de resultaten niet meteen nodig hebt
De moeilijkste onderzoeksproblemenmaximaal, of gebruik gewoon AstraOpenAI raadt hier ook Astra aan

De geen en minimaal mapping komt uit OpenAI's GPT-6 migratiegids.


Inspanning wijzigen midden in gesprek

Een veelvoorkomend patroon is plannen op hoog, uitvoeren op laag, en terugschakelen naar hoog wanneer er iets misgaat.

De catch: het bewerken van reasoning.effort in het verzoek breekt je promptcache. Inspanning maakt deel uit van het gecachte prefix (zie de prompt caching gids). Op 6.1 Sol kost een cache-leesoperatie $0.10 per miljoen tokens, terwijl het herschrijven van de cache $2.50 kost. Dat is een verschil van 25×.

De GPT-6-familie lost dit op met een configuration_update invoerelement. Laat de verzoekniveau reasoning.effort met rust en voeg een update toe vóór het volgende gebruikersbericht. Hier is hoe dat eruitziet via de AIHubMix Responses API:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Beurt 1: plannen op hoge inspanning
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "hoog"},
    input="Ontdek waarom de tests van deze repo falen en stel een herstelplan voor.",
)

# Beurt 2: verlaag naar laag voor uitvoering, zonder de verzoekniveau inspanning aan te raken
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "hoog"},           # onveranderd, zodat de cache overleeft
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "laag"}},
        {"role": "user", "content": "Voer stap 1 van het plan uit."},
    ],
)
De configuration_update structuur hierboven is illustratief. Controleer OpenAI's redeningsgids voor het exacte schema. De Responses-documentatie van AIHubMix vermeldt momenteel vier niveaus (minimaal tot hoog), dus stuur een kleine testverzoek om te bevestigen dat xhoog, maximaal, en configuration_update doorgegeven worden.

Enkele limieten om te weten:

  • Het werkt alleen in de standaard single-agent modus, en het verandert alleen de inspanning.
  • Twee updates kunnen niet naast elkaar staan.
  • Het mengt zich niet met automatische compactie of afkapping. Expliciete compactie is prima, maar voeg daarna een nieuwe update toe.
  • Het reasoning.effort veld van de respons toont nog steeds de verzoekniveau waarde, dus lees er niet te veel in.

Instellingen die samen met inspanning gaan

Laat ruimte in max_output_tokens. De limiet omvat redeneertokens. Stel het te laag in en het model kan stoppen voordat het zichtbare tekst produceert. Je krijgt status: incomplete en betaalt nog steeds voor input en redenering. OpenAI stelt voor om minimaal 25.000 tokens te reserveren om te beginnen, en meer voor xhoog of maximaal.

Volg redeneertokens. Ze staan in usage.output_tokens_details.reasoning_tokens. Kijken naar de verdeling per inspanningsniveau is beter dan afstemmen op gevoel.

Zet samenvattingen aan als je zichtbaarheid nodig hebt. reasoning.summary: "auto" geeft een samenvatting van de redenering van het model terug (je moet misschien eerst je organisatie verifiëren). De ruwe redenering wordt nooit blootgesteld.

Pro-modus is een aparte schakelaar. Het laat het model meer werk doen, gefactureerd tegen standaardtarieven maar met meer tokens in totaal. Gebruik het voor moeilijke problemen waarbij extra latentie acceptabel is.


Een afstelproces dat je echt kunt uitvoeren

  1. Haal 20 tot 50 echte taken in een evaluatieset.
  2. Voer een baseline uit op gemiddeld. Registreer het succespercentage, gemiddelde redeneertokens en P95-latentie.
  3. Probeer laag. Als het succes nauwelijks daalt, schakel over.
  4. Probeer hoog. Als het succes duidelijk verbetert, gebruik dan hoog alleen voor dat taaktype.
  5. Pak alleen xhoog of maximaal als hoog tekortschiet, en vergelijk met GPT-6 Astra op hoog terwijl je bezig bent. Soms verslaat een groter model meer inspanning. Op AIHubMix is dat gewoon een wijziging van de model parameter, en de modellijst toont wat beschikbaar is.
  6. Routeer op taaktype in plaats van één globale instelling te gebruiken.

De korte versie: begin op gemiddeld, bespaar geld met laag, gebruik hoog voor coderen, en laat xhoog en maximaal zich bewijzen in je evaluaties.

Volgende: wat de $2 / $10 prijs echt betekent zodra caching, lange context en factureringsvermenigvuldigers in het spel komen.


FAQ

Wat is de standaard redeneerinspanning voor GPT-6.1 Sol? gemiddeld. Als je het niet instelt, is dat wat je krijgt.

Waarom geeft geen een foutmelding? 6.1 Sol ondersteunt geen geen of minimaal. OpenAI raadt aan om over te schakelen naar laag. Als je echt geen nodig hebt, blijf dan bij GPT-6 Sol of GPT-6 Luna.

Hoe worden redeneertokens gefactureerd? Tegen het outputtarief ($10 per miljoen voor 6.1 Sol), en ze tellen mee voor de contextvenster. Controleer usage.output_tokens_details.reasoning_tokens voor de werkelijke cijfers.

Is de parameternaam hetzelfde in Chat Completions en Responses? Nee. Chat Completions gebruikt een top-level reasoning_effort. Responses gebruikt een geneste reasoning: {"effort": ...}. Ze verwarren resulteert in Unsupported parameter.

Geeft hogere inspanning altijd betere resultaten? Nee. Op AutomationBench verhoogde het boven gemiddeld de score slechts van 35.4% naar ongeveer 36.0%, terwijl het merkbaar meer kostte. Test op je eigen taken.

Kan ik de inspanning halverwege een gesprek wijzigen? Ja. Gebruik een configuration_update element en laat de verzoekniveau reasoning.effort ongewijzigd zodat de promptcache geldig blijft. Het werkt niet met automatische compactie of afkapping.

Waarom kreeg ik status: incomplete zonder output? Waarschijnlijk was max_output_tokens te laag en gebruikte redenering het allemaal op. OpenAI raadt aan om minimaal 25.000 tokens te reserveren.


Blijf lezen: de GPT-6.1 Sol serie


Bronnen