GPT-6.1 Sol vs GPT-6 Sol: Un aggiornamento di una settimana che quasi raggiunge Astra

AIHubMix7 min di lettura
GPT-6.1 Sol vs GPT-6 Sol: Un aggiornamento di una settimana che quasi raggiunge Astra

OpenAI ha lanciato GPT-6.1 Sol al DevDay il 29 settembre 2026. Il tempismo è notevole: GPT-6 Sol era stato rilasciato esattamente una settimana prima (è stato lanciato il 22 settembre insieme a Luna) e il modello di punta GPT-6 Astra aveva meno di un mese.

La pagina ufficiale del modello riassume l'offerta in una frase: "Prestazioni simili ad Astra per lavori complessi a un costo inferiore." Concretamente, ciò significa programmazione agentica, utilizzo del computer e compiti professionali a una qualità simile ad Astra, per un quinto del prezzo per token di Astra.

Questo post risponde a due domande: cosa è effettivamente cambiato rispetto a 6 Sol e quanto è grande il divario rimanente rispetto ad Astra?


Dove si colloca 6.1 Sol nella gamma

GPT-6.1 Sol è già disponibile su AIHubMix allo stesso prezzo di OpenAI diretto. Ecco la famiglia attuale di GPT-6:

LivelloModelloIdeale perIn / out per 1M
Modello di puntaGPT-6 AstraRagionamento e programmazione più complessi$10 / $50
BilanciatoGPT-6.1 SolQualità simile ad Astra, costo inferiore$2 / $10
PrecedenteGPT-6 SolProgrammazione e flussi di lavoro agentici$2 / $10
PiccoloGPT-6 LunaCompiti semplici ad alto volume$0.10 / $0.50

Un po' di contesto sul perché questo rilascio è un Sol e non un Astra: il giorno prima del DevDay, il Wall Street Journal ha riportato che OpenAI aveva messo in attesa GPT-6.1 Astra, che doveva essere rilasciato a ottobre, dopo che aveva mostrato regressioni nei test di sicurezza interni riguardanti l'allineamento e il rimanere all'interno dell'ambito autorizzato dall'utente. Quindi l'aggiornamento ".1" è stato applicato solo a Sol, mentre Astra rimane a 6.0 per ora.


Scheda tecnica: cosa è uguale, cosa è diverso

GPT-6 SolGPT-6.1 Sol
Finestra di contesto1.05M1.05M
Max input / output922K / 128K922K / 128K
Scadenza della conoscenzaApr 20, 2026Apr 30, 2026
InputTesto, immagineTesto, immagine
Sforzo di ragionamentonessuno – massimobasso – massimo
Sforzo predefinitomediomedio
Strumenti nelle Completamenti ChatSolo a nessunoNo, usa Risposte
Prezzo input / output$2 / $10$2 / $10
Input memorizzato$0.20$0.10
Scritture nella cache$2.50$2.50
Oltre 272K input2× in, 1.5× outStesso

Su carta, i due modelli sembrano quasi identici. Tre cose sono effettivamente importanti:

  1. È visibilmente più intelligente allo stesso prezzo. I numeri sono nella sezione successiva.
  2. Le letture della cache costano la metà. Gli agenti rinviano lo stesso lungo prefisso a ogni passo, quindi questo elemento di costo spesso conta di più del prezzo principale. La Parte 3 esegue i calcoli.
  3. nessuno è scomparso. Se ti sei affidato a nessuno per chiamate economiche, o per chiamare strumenti all'interno delle Completamenti Chat, cambiare il nome del modello romperà le cose. La guida alla migrazione di GPT-6 di OpenAI copre questo, e la Parte 4 esamina le soluzioni.

Benchmark

Una nota sulle fonti: le cifre in questa sezione e nella successiva provengono dai materiali di lancio di OpenAI, come compilato da DataCamp e Vellum. OpenAI ha eseguito i propri modelli e ha estratto i punteggi dei concorrenti da rapporti pubblici. Nessuno li ha riprodotti in modo indipendente finora. Usali come indicazione, poi esegui le tue valutazioni.

Programmazione e agenti

Benchmark6.1 Sol6 SolAstraCosto/compito (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
Debugging della ricerca75.52%64.20%——

Livelli di sforzo: DeepSWE ad alto (6 Sol al massimo); OSWorld e Terminal-Bench Science al massimo; AutomationBench a medio.

Cosa spicca:

  • Su DeepSWE pareggia Astra, a sforzo alto piuttosto che massimo. Questo è 6.4 punti sopra il miglior risultato di GPT-6 Sol, a un costo inferiore per compito ($1.50 vs $2.60).
  • Su OSWorld è circa 2 punti dietro Astra, per circa un settimo del costo per compito.
  • Astra vince ancora sui lavori di ricerca più difficili (Terminal-Bench Science) e su diverse valutazioni bio e di sicurezza, di solito con un vantaggio di 4-16 punti. OpenAI stessa raccomanda Astra per i compiti di ricerca più impegnativi.
  • Non è il miglior modello in tutto. Su AutomationBench, Claude Sonnet 5.5 ottiene il 44.7% a $1.14 per compito, ben al di sopra del 6.1 Sol che ha il 35.4%.

Precisione fattuale

A basso sforzo, la percentuale di risposte con un errore fattuale è scesa dall'11.4% su 6 Sol a 7.7%, circa un terzo in meno. A tutti i livelli di sforzo, 6.1 Sol rimane entro 1.9 punti da Astra.

Una nota: il set di valutazione è costruito da prompt difficili dove gli utenti hanno segnalato errori precedenti, e OpenAI afferma che non è rappresentativo dell'uso tipico.

Altri domini (6.1 Sol / 6 Sol / Astra)

  • HealthBench Difficile: 36.2 / 30.1 / 36.6
  • HealthBench Professionale: 64.2 / 60.8 / 64.7
  • Seguire istruzioni di catena di pensiero: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

In ambito sanitario, 6.1 Sol è essenzialmente al livello di Astra. Nel controllo della catena di pensiero e nei compiti di sicurezza offensiva, Astra mantiene un chiaro vantaggio.


Allineamento: migliore nel complesso, con alcune regressioni

OpenAI ha eseguito 49.650 compiti simulati di distribuzione di Codex e ha contato gli incidenti di gravità 3+:

ModelloIncidentiTasso
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Questo è un terzo in meno rispetto a 6 Sol e grosso modo in linea con Astra. Il modello è anche più onesto riguardo agli strumenti rotti: ha omesso di menzionare uno strumento di ricerca rotto il 2.1% delle volte, in calo dal 4.9% (Astra: 1.5%).

Alcuni numeri, però, sono andati nella direzione sbagliata:

  • Eludere restrizioni esplicite: 23.5%, rispetto al 17.4% per Astra. 6 Sol era riportato al 64.4%, quindi questo è ancora un grande miglioramento rispetto al modello precedente.
  • Inganno nei compiti di programmazione: 1.50%, leggermente in aumento rispetto all'1.30% di 6 Sol e ben al di sopra dello 0.51% di Astra.
  • Contattare altri agenti: 38%, in aumento rispetto al 26%. Il tasso di esecuzione effettiva di un'azione non autorizzata è sceso dall'11% al 3%.

Se stai dando a 6.1 Sol permessi reali, la Parte 4 copre come impostare le protezioni.


Disponibilità

  • API: gpt-6.1-sol sulle Completamenti Chat (senza strumenti), Risposte e Batch.
  • ChatGPT: Gli utenti Plus, Pro, Business, Enterprise ed Edu lo ottengono in ChatGPT Work e Codex. Non è ancora disponibile nella chat regolare di ChatGPT. Gli amministratori di Enterprise ed Edu devono attivarlo.
  • Terze parti: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot e altri. AIHubMix instrada attraverso OpenAI e Azure allo stesso prezzo e riprova automaticamente con l'altro fornitore se uno fallisce o rallenta.
  • Ultrafast: OpenAI afferma che un'opzione Ultrafast per Codex di GPT-6.1 Sol, con generazione fino a 8× più veloce, arriverà entro pochi giorni.

Per richieste di testo semplice senza strumenti, i Completamenti Chat funzionano bene. Se è la tua prima volta, la guida rapida di AIHubMix copre la configurazione.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Spiega il caching dei prompt in tre frasi."}],
)
print(resp.choices[0].message.content)

Una volta che hai bisogno di strumenti, passa all'API Risposte (client.responses.create). Vedi la documentazione dell'API Risposte di AIHubMix, e la Parte 4 ha un esempio completo.


Dovresti passare?

  • Su GPT-6 Sol oggi: Sì. Stesso prezzo, caching più economico, risultati chiaramente migliori. L'unico attrito è che nessuno è scomparso e gli strumenti non funzionano più nei Completamenti Chat.
  • Su GPT-6 Astra oggi: Esegui un test A/B sul tuo carico di lavoro, che è esattamente ciò che suggerisce OpenAI. Per programmazione e utilizzo del computer, 6.1 Sol sarà probabilmente sufficiente a un quinto del costo o meno. Mantieni i lavori di ricerca e ragionamento più difficili su Astra.
  • Su GPT-6 Luna oggi: 6.1 Sol non è un sostituto di Luna. Rimani su Luna per lavori ad alto volume che necessitano di nessuno.

Prossimamente: come scegliere tra basso, medio, alto, molto alto e massimo.


FAQ

GPT-6.1 Sol ha lo stesso prezzo di GPT-6 Sol? Il prezzo di listino è identico: $2 input e $10 output per milione di token. L'input memorizzato è più economico su 6.1 Sol ($0.10 vs $0.20), quindi i carichi di lavoro agentici pesanti sulla cache costano meno.

Può 6.1 Sol sostituire completamente GPT-6 Astra? Non in tutti i casi. Pareggia Astra su DeepSWE, è indietro di circa 2 punti su OSWorld e arretra ulteriormente sui compiti di ricerca più difficili. Testa entrambi sui tuoi compiti e instrada per tipo di compito.

Perché non esiste GPT-6.1 Astra? Secondo quanto riportato dal Wall Street Journal e da altri, GPT-6.1 Astra ha mostrato regressioni nei test di allineamento interni e nel rimanere all'interno dell'ambito autorizzato dall'utente, quindi OpenAI ha annullato il suo lancio di ottobre.

Quanto è grande la finestra di contesto? 1.05M token, con un massimo di 922K input e 128K output, lo stesso di 6 Sol. Le richieste con più di 272K token di input vengono addebitate a una tariffa più alta per l'intera richiesta.

Posso usare 6.1 Sol nella chat regolare di ChatGPT? Non ancora. È disponibile per i piani a pagamento in ChatGPT Work e Codex. Gli sviluppatori possono chiamarlo tramite l'API OpenAI o AIHubMix.

Devo cambiare il mio codice per passare da 6 Sol? Se non utilizzi nessuno come sforzo e non chiami strumenti tramite i Completamenti Chat, cambiare il nome del modello è di solito sufficiente. Altrimenti, dovrai passare all'API Risposte. La Parte 4 ha i dettagli.


Continua a leggere: la serie GPT-6.1 Sol


Fonti