GPT-6.1 Sol ha cinque livelli di sforzo di ragionamento: basso, medio (il predefinito), alto, xalto e massimo. La grande novità rispetto a GPT-6 Sol è che nessuno e minimo sono stati rimossi, quindi basso è ora il livello base.
Questa singola impostazione influisce sia sulla latenza che sui costi. Non vedrai mai i token di ragionamento, ma li paghi al tasso di output (10 dollari per milione per 6.1 Sol su AIHubMix), e occupano spazio nella finestra di contesto. Scegliere il livello sbagliato può farti pagare facilmente diverse volte di più di quanto necessario.
Cosa serve ciascun livello
Questa tabella combina le descrizioni di OpenAI dalla guida al ragionamento con le nostre raccomandazioni:
| Livello | Descrizione di OpenAI | Buona corrispondenza | Cattiva corrispondenza |
|---|---|---|---|
| basso | Ragionamento efficiente con un modesto aumento della latenza | Passaggi intermedi nei cicli degli strumenti, ricerca, pianificazione leggera, classificazione, estrazione, risposte di supporto | Debugging difficile, refactoring multi-file |
| medio (predefinito) | Il predefinito bilanciato per la maggior parte dei carichi di lavoro | Codifica quotidiana, revisione del codice, scrittura, compiti tipici degli agenti | Utilizzo interattivo critico per la latenza |
| alto | Ragionamento difficile, debugging complesso, pianificazione profonda | Bug complicati, lavoro di architettura, compiti in stile SWE | Traffico online ad alta QPS |
| xalto | Ricerca profonda, lavoro asincrono, lunghe esecuzioni degli agenti | Lavori in background, rapporti di ricerca | Qualsiasi cosa che le tue valutazioni non hanno giustificato |
| massimo | Ragionamento massimo per i compiti più difficili | Utilizzo del computer, problemi di livello di ricerca, sollevamento pesante offline | Quasi tutte le richieste quotidiane |
OpenAI chiama lo sforzo "una manopola di regolazione, non il modo principale per recuperare qualità." Quando i risultati sono scarsi, guarda prima al prompt, alle definizioni degli strumenti e al contesto. Aumenta lo sforzo solo dopo.
Cosa dicono i benchmark su ogni livello
Questi sono i numeri di OpenAI, compilati da Vellum e DataCamp. Trattali come una guida, non come un dogma.
Per la codifica, alto è di solito sufficiente. Su DeepSWE v1.1, 6.1 Sol a alto ottiene 75.2, corrispondendo ad Astra a alto (74.8), per circa 1,50 dollari per compito. La sua curva dei costi raggiunge il 72% al 75% per tra 0,50 e 1,50 dollari per compito. GPT-6 Sol si è fermato a 68.8 per circa 2,60 dollari.
Andare oltre il medio non aiuta sempre. Su AutomationBench, 6.1 Sol ottiene il 35,4% a medio e solo circa il 36,0% a uno sforzo maggiore. Per l'automazione aziendale, i token di ragionamento extra hanno portato quasi a nulla.
Riserva il massimo per l'uso del computer e la ricerca. Su OSWorld 2.0, il massimo ottiene 71.4 a circa 1,30 dollari per compito. Terminal-Bench Science a massimo costa 5,47 dollari per compito: molto più economico rispetto ai 23,80 dollari di Astra, ma di un ordine di grandezza superiore rispetto alla maggior parte degli altri carichi di lavoro.
Anche il basso è migliorato. Il tasso di errore fattuale a basso è sceso dall'11,4% su 6 Sol al 7,7%. Se hai aumentato i compiti a medio su 6 Sol perché il basso non era abbastanza accurato, prova di nuovo il basso.
Punti di partenza per caso d'uso
| Caso d'uso | Inizia a | Note |
|---|---|---|
| Chiamate che usavano nessuno su 6 Sol | basso | Mappatura ufficiale di OpenAI. Se la latenza è critica, considera GPT-6 Luna, che supporta ancora nessuno |
| Chiamate che usavano minimo | basso | Inizia a basso e confronta i risultati |
| Chatbot, supporto clienti | basso | Chiedi al modello un preambolo di una riga per ottenere il primo token più rapidamente |
| RAG Q&A | basso → medio | La qualità del recupero conta più dello sforzo |
| Assistente alla codifica IDE | medio | Il predefinito funziona |
| Correzione automatizzata dei bug, agenti SWE | alto | DeepSWE mostra che alto corrisponde già ad Astra |
| Utilizzo del computer, agenti del browser | alto → massimo | OSWorld raggiunge il picco a massimo |
| Ricerca di base, lunghe esecuzioni | xalto | Solo quando le valutazioni mostrano un guadagno. Il batch dimezza il costo se non hai bisogno dei risultati immediatamente |
| I problemi di ricerca più difficili | massimo, o usa semplicemente Astra | OpenAI raccomanda Astra anche qui |
Le mappature nessuno e minimo provengono dalla guida alla migrazione di GPT-6 di OpenAI.
Cambiamento di sforzo a metà conversazione
Un modello comune è pianificare ad alto, eseguire a basso e tornare ad alto quando qualcosa si rompe.
Il problema: modificare reasoning.effort nella richiesta rompe la cache del prompt. Lo sforzo è parte del prefisso memorizzato nella cache (vedi la guida alla cache del prompt). Su 6.1 Sol una lettura della cache costa 0,10 dollari per milione di token, mentre riscrivere la cache costa 2,50 dollari. C'è una differenza di 25×.
La famiglia GPT-6 risolve questo con un elemento di input configuration_update. Lascia inalterato il reasoning.effort a livello di richiesta e inserisci un aggiornamento prima del prossimo messaggio dell'utente. Ecco come appare attraverso l' API delle Risposte di AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Turno 1: pianifica ad alto sforzo
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"},
input="Scopri perché i test di questo repo stanno fallendo e proponi un piano di correzione.",
)
# Turno 2: scendi a basso per l'esecuzione, senza toccare lo sforzo a livello di richiesta
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "alto"}, # invariato, quindi la cache sopravvive
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "basso"}},
{"role": "user", "content": "Esegui il passo 1 del piano."},
],
)
La forma diconfiguration_updatequi sopra è illustrativa. Controlla la guida al ragionamento di OpenAI per lo schema esatto. La documentazione delle Risposte di AIHubMix attualmente elenca quattro livelli (minimo fino ad alto), quindi invia una piccola richiesta di test per confermare chexalto,massimoeconfiguration_updatepassino.
Alcuni limiti da conoscere:
- Funziona solo in modalità standard a singolo agente e cambia solo lo sforzo.
- Due aggiornamenti non possono stare uno accanto all'altro.
- Non si mescola con la compattazione o la troncatura automatica. La compattazione esplicita va bene, ma aggiungi un aggiornamento fresco dopo.
- Il campo
reasoning.effortdella risposta mostra ancora il valore a livello di richiesta, quindi non leggerne troppo.
Impostazioni che vanno con lo sforzo
Lascia spazio in max_output_tokens. Il limite include i token di ragionamento. Se lo imposti troppo basso, il modello può fermarsi prima di produrre testo visibile. Ricevi status: incomplete e paghi comunque per input e ragionamento. OpenAI suggerisce di riservare almeno 25.000 token per iniziare, e di più per xalto o massimo.
Monitora i token di ragionamento. Si trovano in usage.output_tokens_details.reasoning_tokens. Controllare la distribuzione per livello di sforzo è meglio che regolare a sentimento.
Attiva i riassunti se hai bisogno di visibilità. reasoning.summary: "auto" restituisce un riassunto del ragionamento del modello (potresti dover verificare prima la tua organizzazione). Il ragionamento grezzo non viene mai esposto.
La modalità pro è un interruttore separato. Fa sì che il modello faccia più lavoro, fatturato a tariffe standard ma con più token in generale. Usala per problemi difficili dove una latenza extra è accettabile.
Un processo di regolazione che puoi effettivamente eseguire
- Raccogli 20-50 compiti reali in un set di valutazione.
- Esegui una baseline a
medio. Registra il tasso di successo, il numero medio di token di ragionamento e la latenza P95. - Prova
basso. Se il successo scende appena, cambia. - Prova
alto. Se il successo migliora chiaramente, usa alto solo per quel tipo di compito. - Raggiungi solo
xaltoomassimoquando alto non è sufficiente, e confronta con GPT-6 Astra a alto mentre ci sei. A volte un modello più grande batte più sforzo. Su AIHubMix è solo un cambiamento al parametromodel, e l' elenco dei modelli mostra cosa è disponibile. - Dirigi per tipo di compito invece di usare un'impostazione globale.
In breve: inizia a medio, risparmia con basso, usa alto per la codifica e fai dimostrare a xalto e massimo il loro valore nelle tue valutazioni.
Prossimo: cosa significa davvero il prezzo di 2 dollari / 10 dollari una volta che entrano in gioco caching, contesto lungo e moltiplicatori di fatturazione.
FAQ
Qual è lo sforzo di ragionamento predefinito per GPT-6.1 Sol? medio. Se non lo imposti, è quello che ottieni.
Perché nessuno restituisce un errore? 6.1 Sol non supporta nessuno o minimo. OpenAI raccomanda di passare a basso. Se hai davvero bisogno di nessuno, rimani su GPT-6 Sol o GPT-6 Luna.
Come vengono fatturati i token di ragionamento? Al tasso di output (10 dollari per milione per 6.1 Sol), e contano contro la finestra di contesto. Controlla usage.output_tokens_details.reasoning_tokens per i numeri effettivi.
Il nome del parametro è lo stesso in Chat Completions e Responses? No. Chat Completions usa un reasoning_effort a livello superiore. Responses usa un reasoning: {"effort": ...} nested. Mescolarli restituisce Unsupported parameter.
Uno sforzo maggiore dà sempre risultati migliori? No. Su AutomationBench, andare oltre il medio ha spostato il punteggio solo dal 35,4% a circa il 36,0%, mentre costava notevolmente di più. Testa sui tuoi compiti.
Posso cambiare lo sforzo a metà conversazione? Sì. Usa un elemento configuration_update e lascia invariato il reasoning.effort a livello di richiesta in modo che la cache del prompt rimanga valida. Non funziona con la compattazione o la troncatura automatica.
Perché ho ricevuto status: incomplete senza output? Probabilmente max_output_tokens era troppo basso e il ragionamento lo ha esaurito. OpenAI raccomanda di riservare almeno 25.000 token.
Continua a leggere: la serie GPT-6.1 Sol
- Quanto della tua fattura è ragionamento? Lo sforzo è solo una leva. Caching, la soglia di 272K e gli sconti Batch influenzano tutti il numero finale. Vedi Cosa costa davvero GPT-6.1 Sol: oltre il prezzo di 2 dollari / 10 dollari.
- Codice che usava
nessuno? Passare abassoè solo l'inizio. Le chiamate agli strumenti, i parametri di campionamento e le impostazioni della cache necessitano di modifiche anche: Migrazione a GPT-6.1 Sol: 9 cose che possono andare storte. - Quanto è migliore 6.1 Sol rispetto a 6 Sol e Astra? Specifiche e benchmark fianco a fianco in GPT-6.1 Sol vs GPT-6 Sol: un aggiornamento di una settimana che quasi raggiunge Astra.



