GPT-6.1 Sol heeft vijf niveaus van redeneerinspanning: laag, gemiddeld (de standaard), hoog, xhoog, en maximaal. De grote verandering ten opzichte van GPT-6 Sol is dat geen en minimaal zijn verdwenen, dus laag is nu de basis.
Deze ene instelling beïnvloedt zowel de latentie als de kosten. Je ziet nooit redeneertokens, maar je betaalt ervoor tegen het outputtarief ($10 per miljoen voor 6.1 Sol op AIHubMix), en ze nemen ruimte in de contextvenster in. Kies het verkeerde niveau en je kunt gemakkelijk meerdere keren meer betalen dan nodig is.
Wat elk niveau is voor
| Niveau | OpenAI's beschrijving | Goede fit | Slechte fit |
|---|---|---|---|
| laag | Efficiënt redeneren met een bescheiden toename van latentie | Tussenstappen in toolloops, zoeken, lichte planning, classificatie, extractie, ondersteunende antwoorden | Moeilijk debuggen, refactoren van meerdere bestanden |
| gemiddeld (standaard) | De gebalanceerde standaard voor de meeste werkbelastingen | Dagelijks coderen, codebeoordeling, schrijven, typische agenttaken | Latentie-kritisch interactief gebruik |
| hoog | Moeilijk redeneren, complexe debugging, diepe planning | Lastige bugs, architectuurwerk, SWE-stijl taken | Hoge QPS online verkeer |
| xhoog | Diepgaand onderzoek, asynchrone werkzaamheden, lange agentruns | Achtergrondtaken, onderzoeksrapporten | Alles wat je evaluaties niet hebben gerechtvaardigd |
| maximaal | Maximale redenering voor de moeilijkste taken | Computergebruik, onderzoeksproblemen, offline zware taken | Bijna alle dagelijkse verzoeken |
OpenAI noemt inspanning "een afstelknop, niet de primaire manier om kwaliteit te herstellen." Wanneer de resultaten slecht zijn, kijk dan eerst naar de prompt, de tooldefinities en de context. Verhoog de inspanning pas daarna.
Wat de benchmarks zeggen over elk niveau
Dit zijn de eigen cijfers van OpenAI, verzameld door Vellum en DataCamp. Beschouw ze als een gids, niet als het evangelie.
Voor coderen is hoog meestal voldoende. Op DeepSWE v1.1 scoort 6.1 Sol op hoog 75.2, wat overeenkomt met Astra op hoog (74.8), voor ongeveer $1.50 per taak. De kostencurve bereikt 72% tot 75% voor tussen $0.50 en $1.50 per taak. GPT-6 Sol maxte uit op 68.8 voor ongeveer $2.60.
Hoger dan gemiddeld helpt niet altijd. Op AutomationBench scoort 6.1 Sol 35.4% op gemiddeld en slechts ongeveer 36.0% bij hogere inspanning. Voor bedrijfsautomatisering kochten de extra redeneertokens bijna niets.
Bewaar maximaal voor computergebruik en onderzoek. Op OSWorld 2.0 haalt maximaal 71.4 voor ongeveer $1.30 per taak. Terminal-Bench Science op maximaal kost $5.47 per taak: veel goedkoper dan Astra's $23.80, maar een orde van grootte boven de meeste andere werkbelastingen.
Laag is ook beter geworden. De feitelijke foutpercentage op laag daalde van 11.4% op 6 Sol naar 7.7%. Als je taken op 6 Sol naar gemiddeld verhoogde omdat laag niet nauwkeurig genoeg was, probeer dan laag opnieuw.
Startpunten per gebruikscase
| Gebruikscase | Begin bij | Opmerkingen |
|---|---|---|
| Oproepen die geen gebruik maakten van 6 Sol | laag | OpenAI's officiële mapping. Als latentie kritiek is, overweeg dan GPT-6 Luna, dat nog steeds geen ondersteunt |
| Oproepen die minimaal gebruikten | laag | Begin bij laag en vergelijk de resultaten |
| Chatbots, klantenservice | laag | Vraag het model om een eenregelige inleiding om de eerste token sneller te krijgen |
| RAG Q&A | laag → gemiddeld | Kwaliteit van ophalen is belangrijker dan inspanning |
| IDE-coderingsassistent | gemiddeld | De standaard werkt |
| Geautomatiseerd bugfixen, SWE-agenten | hoog | DeepSWE toont aan dat hoog al overeenkomt met Astra |
| Computergebruik, browseragenten | hoog → maximaal | OSWorld piekt op maximaal |
| Achtergrondonderzoek, lange runs | xhoog | Alleen wanneer evaluaties een winst tonen. Batch halveert de kosten als je de resultaten niet meteen nodig hebt |
| De moeilijkste onderzoeksproblemen | maximaal, of gebruik gewoon Astra | OpenAI raadt hier ook Astra aan |
De geen en minimaal mapping komt uit OpenAI's GPT-6 migratiegids.
Inspanning wijzigen midden in gesprek
Een veelvoorkomend patroon is plannen op hoog, uitvoeren op laag, en terugschakelen naar hoog wanneer er iets misgaat.
De catch: het bewerken van reasoning.effort in het verzoek breekt je promptcache. Inspanning maakt deel uit van het gecachte prefix (zie de prompt caching gids). Op 6.1 Sol kost een cache-leesoperatie $0.10 per miljoen tokens, terwijl het herschrijven van de cache $2.50 kost. Dat is een verschil van 25×.
De GPT-6-familie lost dit op met een configuration_update invoerelement. Laat de verzoekniveau reasoning.effort met rust en voeg een update toe vóór het volgende gebruikersbericht. Hier is hoe dat eruitziet via de AIHubMix Responses API:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Beurt 1: plannen op hoge inspanning
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "hoog"},
input="Ontdek waarom de tests van deze repo falen en stel een herstelplan voor.",
)
# Beurt 2: verlaag naar laag voor uitvoering, zonder de verzoekniveau inspanning aan te raken
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "hoog"}, # onveranderd, zodat de cache overleeft
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "laag"}},
{"role": "user", "content": "Voer stap 1 van het plan uit."},
],
)
Deconfiguration_updatestructuur hierboven is illustratief. Controleer OpenAI's redeningsgids voor het exacte schema. De Responses-documentatie van AIHubMix vermeldt momenteel vier niveaus (minimaal tot hoog), dus stuur een kleine testverzoek om te bevestigen datxhoog,maximaal, enconfiguration_updatedoorgegeven worden.
Enkele limieten om te weten:
- Het werkt alleen in de standaard single-agent modus, en het verandert alleen de inspanning.
- Twee updates kunnen niet naast elkaar staan.
- Het mengt zich niet met automatische compactie of afkapping. Expliciete compactie is prima, maar voeg daarna een nieuwe update toe.
- Het
reasoning.effortveld van de respons toont nog steeds de verzoekniveau waarde, dus lees er niet te veel in.
Instellingen die samen met inspanning gaan
Laat ruimte in max_output_tokens. De limiet omvat redeneertokens. Stel het te laag in en het model kan stoppen voordat het zichtbare tekst produceert. Je krijgt status: incomplete en betaalt nog steeds voor input en redenering. OpenAI stelt voor om minimaal 25.000 tokens te reserveren om te beginnen, en meer voor xhoog of maximaal.
Volg redeneertokens. Ze staan in usage.output_tokens_details.reasoning_tokens. Kijken naar de verdeling per inspanningsniveau is beter dan afstemmen op gevoel.
Zet samenvattingen aan als je zichtbaarheid nodig hebt. reasoning.summary: "auto" geeft een samenvatting van de redenering van het model terug (je moet misschien eerst je organisatie verifiëren). De ruwe redenering wordt nooit blootgesteld.
Pro-modus is een aparte schakelaar. Het laat het model meer werk doen, gefactureerd tegen standaardtarieven maar met meer tokens in totaal. Gebruik het voor moeilijke problemen waarbij extra latentie acceptabel is.
Een afstelproces dat je echt kunt uitvoeren
- Haal 20 tot 50 echte taken in een evaluatieset.
- Voer een baseline uit op
gemiddeld. Registreer het succespercentage, gemiddelde redeneertokens en P95-latentie. - Probeer
laag. Als het succes nauwelijks daalt, schakel over. - Probeer
hoog. Als het succes duidelijk verbetert, gebruik dan hoog alleen voor dat taaktype. - Pak alleen
xhoogofmaximaalals hoog tekortschiet, en vergelijk met GPT-6 Astra op hoog terwijl je bezig bent. Soms verslaat een groter model meer inspanning. Op AIHubMix is dat gewoon een wijziging van demodelparameter, en de modellijst toont wat beschikbaar is. - Routeer op taaktype in plaats van één globale instelling te gebruiken.
De korte versie: begin op gemiddeld, bespaar geld met laag, gebruik hoog voor coderen, en laat xhoog en maximaal zich bewijzen in je evaluaties.
Volgende: wat de $2 / $10 prijs echt betekent zodra caching, lange context en factureringsvermenigvuldigers in het spel komen.
FAQ
Wat is de standaard redeneerinspanning voor GPT-6.1 Sol? gemiddeld. Als je het niet instelt, is dat wat je krijgt.
Waarom geeft geen een foutmelding? 6.1 Sol ondersteunt geen geen of minimaal. OpenAI raadt aan om over te schakelen naar laag. Als je echt geen nodig hebt, blijf dan bij GPT-6 Sol of GPT-6 Luna.
Hoe worden redeneertokens gefactureerd? Tegen het outputtarief ($10 per miljoen voor 6.1 Sol), en ze tellen mee voor de contextvenster. Controleer usage.output_tokens_details.reasoning_tokens voor de werkelijke cijfers.
Is de parameternaam hetzelfde in Chat Completions en Responses? Nee. Chat Completions gebruikt een top-level reasoning_effort. Responses gebruikt een geneste reasoning: {"effort": ...}. Ze verwarren resulteert in Unsupported parameter.
Geeft hogere inspanning altijd betere resultaten? Nee. Op AutomationBench verhoogde het boven gemiddeld de score slechts van 35.4% naar ongeveer 36.0%, terwijl het merkbaar meer kostte. Test op je eigen taken.
Kan ik de inspanning halverwege een gesprek wijzigen? Ja. Gebruik een configuration_update element en laat de verzoekniveau reasoning.effort ongewijzigd zodat de promptcache geldig blijft. Het werkt niet met automatische compactie of afkapping.
Waarom kreeg ik status: incomplete zonder output? Waarschijnlijk was max_output_tokens te laag en gebruikte redenering het allemaal op. OpenAI raadt aan om minimaal 25.000 tokens te reserveren.
Blijf lezen: de GPT-6.1 Sol serie
- Hoeveel van je rekening is redenering? Inspanning is slechts één hefboom. Caching, de 272K drempel en batchkortingen vormen allemaal het uiteindelijke getal. Zie Wat GPT-6.1 Sol Echt Kost: Voorbij de $2 / $10 Prijs.
- Code die
geengebruikte? Overstappen naarlaagis slechts het begin. Tooloproepen, samplingparameters en cache-instellingen moeten ook worden gewijzigd: Migreren naar GPT-6.1 Sol: 9 Dingen Die Fout Kunnen Gaan. - Hoeveel beter is 6.1 Sol dan 6 Sol en Astra? Specificaties en benchmarks naast elkaar in GPT-6.1 Sol vs GPT-6 Sol: Een Upgrade van Eén Week Die Bijna Astra Inhaalt.



