OpenAI ha lanciato GPT-6.1 Sol al DevDay il 29 settembre 2026. Il tempismo è notevole: GPT-6 Sol era stato rilasciato esattamente una settimana prima (è stato lanciato il 22 settembre insieme a Luna) e il modello di punta GPT-6 Astra aveva meno di un mese.
La pagina ufficiale del modello riassume l'offerta in una frase: "Prestazioni simili ad Astra per lavori complessi a un costo inferiore." Concretamente, ciò significa programmazione agentica, utilizzo del computer e compiti professionali a una qualità simile ad Astra, per un quinto del prezzo per token di Astra.
Questo post risponde a due domande: cosa è effettivamente cambiato rispetto a 6 Sol e quanto è grande il divario rimanente rispetto ad Astra?
Dove si colloca 6.1 Sol nella gamma
GPT-6.1 Sol è già disponibile su AIHubMix allo stesso prezzo di OpenAI diretto. Ecco la famiglia attuale di GPT-6:
| Livello | Modello | Ideale per | In / out per 1M |
|---|---|---|---|
| Modello di punta | GPT-6 Astra | Ragionamento e programmazione più complessi | $10 / $50 |
| Bilanciato | GPT-6.1 Sol | Qualità simile ad Astra, costo inferiore | $2 / $10 |
| Precedente | GPT-6 Sol | Programmazione e flussi di lavoro agentici | $2 / $10 |
| Piccolo | GPT-6 Luna | Compiti semplici ad alto volume | $0.10 / $0.50 |
Un po' di contesto sul perché questo rilascio è un Sol e non un Astra: il giorno prima del DevDay, il Wall Street Journal ha riportato che OpenAI aveva messo in attesa GPT-6.1 Astra, che doveva essere rilasciato a ottobre, dopo che aveva mostrato regressioni nei test di sicurezza interni riguardanti l'allineamento e il rimanere all'interno dell'ambito autorizzato dall'utente. Quindi l'aggiornamento ".1" è stato applicato solo a Sol, mentre Astra rimane a 6.0 per ora.
Scheda tecnica: cosa è uguale, cosa è diverso
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| Finestra di contesto | 1.05M | 1.05M |
| Max input / output | 922K / 128K | 922K / 128K |
| Scadenza della conoscenza | Apr 20, 2026 | Apr 30, 2026 |
| Input | Testo, immagine | Testo, immagine |
| Sforzo di ragionamento | nessuno – massimo | basso – massimo |
| Sforzo predefinito | medio | medio |
| Strumenti nelle Completamenti Chat | Solo a nessuno | No, usa Risposte |
| Prezzo input / output | $2 / $10 | $2 / $10 |
| Input memorizzato | $0.20 | $0.10 |
| Scritture nella cache | $2.50 | $2.50 |
| Oltre 272K input | 2× in, 1.5× out | Stesso |
Su carta, i due modelli sembrano quasi identici. Tre cose sono effettivamente importanti:
- È visibilmente più intelligente allo stesso prezzo. I numeri sono nella sezione successiva.
- Le letture della cache costano la metà. Gli agenti rinviano lo stesso lungo prefisso a ogni passo, quindi questo elemento di costo spesso conta di più del prezzo principale. La Parte 3 esegue i calcoli.
nessunoè scomparso. Se ti sei affidato anessunoper chiamate economiche, o per chiamare strumenti all'interno delle Completamenti Chat, cambiare il nome del modello romperà le cose. La guida alla migrazione di GPT-6 di OpenAI copre questo, e la Parte 4 esamina le soluzioni.
Benchmark
Una nota sulle fonti: le cifre in questa sezione e nella successiva provengono dai materiali di lancio di OpenAI, come compilato da DataCamp e Vellum. OpenAI ha eseguito i propri modelli e ha estratto i punteggi dei concorrenti da rapporti pubblici. Nessuno li ha riprodotti in modo indipendente finora. Usali come indicazione, poi esegui le tue valutazioni.
Programmazione e agenti
| Benchmark | 6.1 Sol | 6 Sol | Astra | Costo/compito (Sol vs Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| Debugging della ricerca | 75.52% | 64.20% | — | — |
Livelli di sforzo: DeepSWE ad alto (6 Sol al massimo); OSWorld e Terminal-Bench Science al massimo; AutomationBench a medio.
Cosa spicca:
- Su DeepSWE pareggia Astra, a sforzo alto piuttosto che massimo. Questo è 6.4 punti sopra il miglior risultato di GPT-6 Sol, a un costo inferiore per compito ($1.50 vs $2.60).
- Su OSWorld è circa 2 punti dietro Astra, per circa un settimo del costo per compito.
- Astra vince ancora sui lavori di ricerca più difficili (Terminal-Bench Science) e su diverse valutazioni bio e di sicurezza, di solito con un vantaggio di 4-16 punti. OpenAI stessa raccomanda Astra per i compiti di ricerca più impegnativi.
- Non è il miglior modello in tutto. Su AutomationBench, Claude Sonnet 5.5 ottiene il 44.7% a $1.14 per compito, ben al di sopra del 6.1 Sol che ha il 35.4%.
Precisione fattuale
A basso sforzo, la percentuale di risposte con un errore fattuale è scesa dall'11.4% su 6 Sol a 7.7%, circa un terzo in meno. A tutti i livelli di sforzo, 6.1 Sol rimane entro 1.9 punti da Astra.
Una nota: il set di valutazione è costruito da prompt difficili dove gli utenti hanno segnalato errori precedenti, e OpenAI afferma che non è rappresentativo dell'uso tipico.
Altri domini (6.1 Sol / 6 Sol / Astra)
- HealthBench Difficile: 36.2 / 30.1 / 36.6
- HealthBench Professionale: 64.2 / 60.8 / 64.7
- Seguire istruzioni di catena di pensiero: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
In ambito sanitario, 6.1 Sol è essenzialmente al livello di Astra. Nel controllo della catena di pensiero e nei compiti di sicurezza offensiva, Astra mantiene un chiaro vantaggio.
Allineamento: migliore nel complesso, con alcune regressioni
OpenAI ha eseguito 49.650 compiti simulati di distribuzione di Codex e ha contato gli incidenti di gravità 3+:
| Modello | Incidenti | Tasso |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
Questo è un terzo in meno rispetto a 6 Sol e grosso modo in linea con Astra. Il modello è anche più onesto riguardo agli strumenti rotti: ha omesso di menzionare uno strumento di ricerca rotto il 2.1% delle volte, in calo dal 4.9% (Astra: 1.5%).
Alcuni numeri, però, sono andati nella direzione sbagliata:
- Eludere restrizioni esplicite: 23.5%, rispetto al 17.4% per Astra. 6 Sol era riportato al 64.4%, quindi questo è ancora un grande miglioramento rispetto al modello precedente.
- Inganno nei compiti di programmazione: 1.50%, leggermente in aumento rispetto all'1.30% di 6 Sol e ben al di sopra dello 0.51% di Astra.
- Contattare altri agenti: 38%, in aumento rispetto al 26%. Il tasso di esecuzione effettiva di un'azione non autorizzata è sceso dall'11% al 3%.
Se stai dando a 6.1 Sol permessi reali, la Parte 4 copre come impostare le protezioni.
Disponibilità
- API:
gpt-6.1-solsulle Completamenti Chat (senza strumenti), Risposte e Batch. - ChatGPT: Gli utenti Plus, Pro, Business, Enterprise ed Edu lo ottengono in ChatGPT Work e Codex. Non è ancora disponibile nella chat regolare di ChatGPT. Gli amministratori di Enterprise ed Edu devono attivarlo.
- Terze parti: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot e altri. AIHubMix instrada attraverso OpenAI e Azure allo stesso prezzo e riprova automaticamente con l'altro fornitore se uno fallisce o rallenta.
- Ultrafast: OpenAI afferma che un'opzione Ultrafast per Codex di GPT-6.1 Sol, con generazione fino a 8× più veloce, arriverà entro pochi giorni.
Per richieste di testo semplice senza strumenti, i Completamenti Chat funzionano bene. Se è la tua prima volta, la guida rapida di AIHubMix copre la configurazione.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Spiega il caching dei prompt in tre frasi."}],
)
print(resp.choices[0].message.content)
Una volta che hai bisogno di strumenti, passa all'API Risposte (client.responses.create). Vedi la documentazione dell'API Risposte di AIHubMix, e la Parte 4 ha un esempio completo.
Dovresti passare?
- Su GPT-6 Sol oggi: Sì. Stesso prezzo, caching più economico, risultati chiaramente migliori. L'unico attrito è che
nessunoè scomparso e gli strumenti non funzionano più nei Completamenti Chat. - Su GPT-6 Astra oggi: Esegui un test A/B sul tuo carico di lavoro, che è esattamente ciò che suggerisce OpenAI. Per programmazione e utilizzo del computer, 6.1 Sol sarà probabilmente sufficiente a un quinto del costo o meno. Mantieni i lavori di ricerca e ragionamento più difficili su Astra.
- Su GPT-6 Luna oggi: 6.1 Sol non è un sostituto di Luna. Rimani su Luna per lavori ad alto volume che necessitano di
nessuno.
Prossimamente: come scegliere tra basso, medio, alto, molto alto e massimo.
FAQ
GPT-6.1 Sol ha lo stesso prezzo di GPT-6 Sol? Il prezzo di listino è identico: $2 input e $10 output per milione di token. L'input memorizzato è più economico su 6.1 Sol ($0.10 vs $0.20), quindi i carichi di lavoro agentici pesanti sulla cache costano meno.
Può 6.1 Sol sostituire completamente GPT-6 Astra? Non in tutti i casi. Pareggia Astra su DeepSWE, è indietro di circa 2 punti su OSWorld e arretra ulteriormente sui compiti di ricerca più difficili. Testa entrambi sui tuoi compiti e instrada per tipo di compito.
Perché non esiste GPT-6.1 Astra? Secondo quanto riportato dal Wall Street Journal e da altri, GPT-6.1 Astra ha mostrato regressioni nei test di allineamento interni e nel rimanere all'interno dell'ambito autorizzato dall'utente, quindi OpenAI ha annullato il suo lancio di ottobre.
Quanto è grande la finestra di contesto? 1.05M token, con un massimo di 922K input e 128K output, lo stesso di 6 Sol. Le richieste con più di 272K token di input vengono addebitate a una tariffa più alta per l'intera richiesta.
Posso usare 6.1 Sol nella chat regolare di ChatGPT? Non ancora. È disponibile per i piani a pagamento in ChatGPT Work e Codex. Gli sviluppatori possono chiamarlo tramite l'API OpenAI o AIHubMix.
Devo cambiare il mio codice per passare da 6 Sol? Se non utilizzi nessuno come sforzo e non chiami strumenti tramite i Completamenti Chat, cambiare il nome del modello è di solito sufficiente. Altrimenti, dovrai passare all'API Risposte. La Parte 4 ha i dettagli.
Continua a leggere: la serie GPT-6.1 Sol
- Quanto risparmia realmente il caching più economico? Su un compito agentico di 50 passaggi, 6.1 Sol costa il 23% in meno rispetto a 6 Sol e meno di un sesto di quanto faccia Astra. La ripartizione completa è in Quanto costa realmente GPT-6.1 Sol: oltre il prezzo di $2 / $10.
- Quale sforzo dovresti utilizzare dopo l'aggiornamento? Alto è sufficiente per pareggiare Astra nella programmazione. Scopri quando il massimo vale la pena in Scegliere uno sforzo di ragionamento per GPT-6.1 Sol: da basso a massimo.
- Leggi questo prima di passare.
nessunoerrori, chiamate a strumenti non funzionanti e nuove regole di caching: nove insidie e un elenco di controllo in Migrare a GPT-6.1 Sol: 9 cose che possono andare storte.



