Scelta di uno sforzo di ragionamento per GPT-6.1 Sol: basso a massimo

AIHubMix6 min di lettura
Scelta di uno sforzo di ragionamento per GPT-6.1 Sol: basso a massimo

GPT-6.1 Sol ha cinque livelli di sforzo di ragionamento: basso, medio (il predefinito), alto, xalto e massimo. La grande novità rispetto a GPT-6 Sol è che nessuno e minimo sono stati rimossi, quindi basso è ora il livello base.

Questa singola impostazione influisce sia sulla latenza che sui costi. Non vedrai mai i token di ragionamento, ma li paghi al tasso di output (10 dollari per milione per 6.1 Sol su AIHubMix), e occupano spazio nella finestra di contesto. Scegliere il livello sbagliato può farti pagare facilmente diverse volte di più di quanto necessario.


Cosa serve ciascun livello

Questa tabella combina le descrizioni di OpenAI dalla guida al ragionamento con le nostre raccomandazioni:

LivelloDescrizione di OpenAIBuona corrispondenzaCattiva corrispondenza
bassoRagionamento efficiente con un modesto aumento della latenzaPassaggi intermedi nei cicli degli strumenti, ricerca, pianificazione leggera, classificazione, estrazione, risposte di supportoDebugging difficile, refactoring multi-file
medio (predefinito)Il predefinito bilanciato per la maggior parte dei carichi di lavoroCodifica quotidiana, revisione del codice, scrittura, compiti tipici degli agentiUtilizzo interattivo critico per la latenza
altoRagionamento difficile, debugging complesso, pianificazione profondaBug complicati, lavoro di architettura, compiti in stile SWETraffico online ad alta QPS
xaltoRicerca profonda, lavoro asincrono, lunghe esecuzioni degli agentiLavori in background, rapporti di ricercaQualsiasi cosa che le tue valutazioni non hanno giustificato
massimoRagionamento massimo per i compiti più difficiliUtilizzo del computer, problemi di livello di ricerca, sollevamento pesante offlineQuasi tutte le richieste quotidiane

OpenAI chiama lo sforzo "una manopola di regolazione, non il modo principale per recuperare qualità." Quando i risultati sono scarsi, guarda prima al prompt, alle definizioni degli strumenti e al contesto. Aumenta lo sforzo solo dopo.


Cosa dicono i benchmark su ogni livello

Questi sono i numeri di OpenAI, compilati da Vellum e DataCamp. Trattali come una guida, non come un dogma.

Per la codifica, alto è di solito sufficiente. Su DeepSWE v1.1, 6.1 Sol a alto ottiene 75.2, corrispondendo ad Astra a alto (74.8), per circa 1,50 dollari per compito. La sua curva dei costi raggiunge il 72% al 75% per tra 0,50 e 1,50 dollari per compito. GPT-6 Sol si è fermato a 68.8 per circa 2,60 dollari.

Andare oltre il medio non aiuta sempre. Su AutomationBench, 6.1 Sol ottiene il 35,4% a medio e solo circa il 36,0% a uno sforzo maggiore. Per l'automazione aziendale, i token di ragionamento extra hanno portato quasi a nulla.

Riserva il massimo per l'uso del computer e la ricerca. Su OSWorld 2.0, il massimo ottiene 71.4 a circa 1,30 dollari per compito. Terminal-Bench Science a massimo costa 5,47 dollari per compito: molto più economico rispetto ai 23,80 dollari di Astra, ma di un ordine di grandezza superiore rispetto alla maggior parte degli altri carichi di lavoro.

Anche il basso è migliorato. Il tasso di errore fattuale a basso è sceso dall'11,4% su 6 Sol al 7,7%. Se hai aumentato i compiti a medio su 6 Sol perché il basso non era abbastanza accurato, prova di nuovo il basso.


Punti di partenza per caso d'uso

Caso d'usoInizia aNote
Chiamate che usavano nessuno su 6 SolbassoMappatura ufficiale di OpenAI. Se la latenza è critica, considera GPT-6 Luna, che supporta ancora nessuno
Chiamate che usavano minimobassoInizia a basso e confronta i risultati
Chatbot, supporto clientibassoChiedi al modello un preambolo di una riga per ottenere il primo token più rapidamente
RAG Q&Abasso → medioLa qualità del recupero conta più dello sforzo
Assistente alla codifica IDEmedioIl predefinito funziona
Correzione automatizzata dei bug, agenti SWEaltoDeepSWE mostra che alto corrisponde già ad Astra
Utilizzo del computer, agenti del browseralto → massimoOSWorld raggiunge il picco a massimo
Ricerca di base, lunghe esecuzionixaltoSolo quando le valutazioni mostrano un guadagno. Il batch dimezza il costo se non hai bisogno dei risultati immediatamente
I problemi di ricerca più difficilimassimo, o usa semplicemente AstraOpenAI raccomanda Astra anche qui

Le mappature nessuno e minimo provengono dalla guida alla migrazione di GPT-6 di OpenAI.


Cambiamento di sforzo a metà conversazione

Un modello comune è pianificare ad alto, eseguire a basso e tornare ad alto quando qualcosa si rompe.

Il problema: modificare reasoning.effort nella richiesta rompe la cache del prompt. Lo sforzo è parte del prefisso memorizzato nella cache (vedi la guida alla cache del prompt). Su 6.1 Sol una lettura della cache costa 0,10 dollari per milione di token, mentre riscrivere la cache costa 2,50 dollari. C'è una differenza di 25×.

La famiglia GPT-6 risolve questo con un elemento di input configuration_update.  Lascia inalterato il reasoning.effort a livello di richiesta e inserisci un aggiornamento prima del prossimo messaggio dell'utente. Ecco come appare attraverso l' API delle Risposte di AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Turno 1: pianifica ad alto sforzo
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},
    input="Scopri perché i test di questo repo stanno fallendo e proponi un piano di correzione.",
)

# Turno 2: scendi a basso per l'esecuzione, senza toccare lo sforzo a livello di richiesta
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "alto"},           # invariato, quindi la cache sopravvive
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "basso"}},
        {"role": "user", "content": "Esegui il passo 1 del piano."},
    ],
)
La forma di configuration_update qui sopra è illustrativa. Controlla la guida al ragionamento di OpenAI per lo schema esatto. La documentazione delle Risposte di AIHubMix attualmente elenca quattro livelli (minimo fino ad alto), quindi invia una piccola richiesta di test per confermare che xalto, massimo e configuration_update passino.

Alcuni limiti da conoscere:

  • Funziona solo in modalità standard a singolo agente e cambia solo lo sforzo.
  • Due aggiornamenti non possono stare uno accanto all'altro.
  • Non si mescola con la compattazione o la troncatura automatica. La compattazione esplicita va bene, ma aggiungi un aggiornamento fresco dopo.
  • Il campo reasoning.effort della risposta mostra ancora il valore a livello di richiesta, quindi non leggerne troppo.

Impostazioni che vanno con lo sforzo

Lascia spazio in max_output_tokens. Il limite include i token di ragionamento. Se lo imposti troppo basso, il modello può fermarsi prima di produrre testo visibile. Ricevi status: incomplete e paghi comunque per input e ragionamento. OpenAI suggerisce di riservare almeno 25.000 token per iniziare, e di più per xalto o massimo.

Monitora i token di ragionamento. Si trovano in usage.output_tokens_details.reasoning_tokens. Controllare la distribuzione per livello di sforzo è meglio che regolare a sentimento.

Attiva i riassunti se hai bisogno di visibilità. reasoning.summary: "auto" restituisce un riassunto del ragionamento del modello (potresti dover verificare prima la tua organizzazione). Il ragionamento grezzo non viene mai esposto.

La modalità pro è un interruttore separato. Fa sì che il modello faccia più lavoro, fatturato a tariffe standard ma con più token in generale. Usala per problemi difficili dove una latenza extra è accettabile.


Un processo di regolazione che puoi effettivamente eseguire

  1. Raccogli 20-50 compiti reali in un set di valutazione.
  2. Esegui una baseline a medio. Registra il tasso di successo, il numero medio di token di ragionamento e la latenza P95.
  3. Prova basso. Se il successo scende appena, cambia.
  4. Prova alto. Se il successo migliora chiaramente, usa alto solo per quel tipo di compito.
  5. Raggiungi solo xalto o massimo quando alto non è sufficiente, e confronta con GPT-6 Astra a alto mentre ci sei. A volte un modello più grande batte più sforzo. Su AIHubMix è solo un cambiamento al parametro model, e l' elenco dei modelli mostra cosa è disponibile.
  6. Dirigi per tipo di compito invece di usare un'impostazione globale.

In breve: inizia a medio, risparmia con basso, usa alto per la codifica e fai dimostrare a xalto e massimo il loro valore nelle tue valutazioni.

Prossimo: cosa significa davvero il prezzo di 2 dollari / 10 dollari una volta che entrano in gioco caching, contesto lungo e moltiplicatori di fatturazione.


FAQ

Qual è lo sforzo di ragionamento predefinito per GPT-6.1 Sol? medio. Se non lo imposti, è quello che ottieni.

Perché nessuno restituisce un errore? 6.1 Sol non supporta nessuno o minimo. OpenAI raccomanda di passare a basso. Se hai davvero bisogno di nessuno, rimani su GPT-6 Sol o GPT-6 Luna.

Come vengono fatturati i token di ragionamento? Al tasso di output (10 dollari per milione per 6.1 Sol), e contano contro la finestra di contesto. Controlla usage.output_tokens_details.reasoning_tokens per i numeri effettivi.

Il nome del parametro è lo stesso in Chat Completions e Responses? No. Chat Completions usa un reasoning_effort a livello superiore. Responses usa un reasoning: {"effort": ...} nested. Mescolarli restituisce Unsupported parameter.

Uno sforzo maggiore dà sempre risultati migliori? No. Su AutomationBench, andare oltre il medio ha spostato il punteggio solo dal 35,4% a circa il 36,0%, mentre costava notevolmente di più. Testa sui tuoi compiti.

Posso cambiare lo sforzo a metà conversazione? Sì. Usa un elemento configuration_update e lascia invariato il reasoning.effort a livello di richiesta in modo che la cache del prompt rimanga valida. Non funziona con la compattazione o la troncatura automatica.

Perché ho ricevuto status: incomplete senza output? Probabilmente max_output_tokens era troppo basso e il ragionamento lo ha esaurito. OpenAI raccomanda di riservare almeno 25.000 token.


Continua a leggere: la serie GPT-6.1 Sol


Fonti