Quanto costa realmente GPT-6.1 Sol: oltre il prezzo di $2 / $10

AIHubMix6 min di lettura
Quanto costa realmente GPT-6.1 Sol: oltre il prezzo di $2 / $10

GPT-6.1 Sol ha lo stesso prezzo di listino di GPT-6 Sol: $2 per milione di token di input e $10 per milione di token di output. La tua bolletta effettiva dipende da altre quattro cose: quanto spesso accedi alla cache, se superi i 272K token di input, quale livello di servizio utilizzi e quanti token di ragionamento il modello consuma. Questo post esamina ciascuno di questi aspetti.


L'elenco completo dei prezzi

Tariffe standard (per 1M token)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Input$2.00$2.00$10.00$0.10
Input memorizzato in cache$0.10$0.20$1.00—
Scritture in cache$2.50$2.50——
Output (incl. reasoning)$10.00$10.00$50.00$0.50
La tariffa memorizzata di Astra proviene da report di terze parti. La sua tariffa di scrittura in cache dovrebbe essere di $12.50 secondo la regola 1.25× di OpenAI. Per i prezzi della cache di Luna, vedere la pagina dei prezzi di OpenAI.

Moltiplicatori

Queste regole provengono dalla pagina del modello GPT-6.1 Sol:

CondizioneCosa succede
Più di 272K token di inputL' intera richiesta viene addebitata a 2× input e cache, 1.5× output ($4 / $15, letture in cache $0.20, scritture in cache $5)
Batch / FlexMetà della tariffa standard
Modalità veloceIl doppio della tariffa standard (non disponibile con la residenza dei dati nell'UE)
Elaborazione regionale+10%
Chiamate agli strumenti (ricerca, utilizzo del computer, ecc.)Addebitato per chiamata. AIHubMix elenca la ricerca web a $0.01 per richiesta
Ultraveoce (in arrivo su Codex)Non ancora ufficialmente prezzato. Un report dice 6× standard, non confermato

Su AIHubMix, i percorsi OpenAI e Azure costano quanto OpenAI direttamente, e il livello oltre i 272K è già elencato.


Il vero cambiamento: letture in cache al 5% dell'input

Il prezzo di listino non è cambiato. Le letture in cache sì, dal 10% della tariffa di input ($0.20) al 5% ($0.10). La documentazione sul caching dei prompt di OpenAI lo afferma chiaramente: le letture in cache sono 0.1× input nella maggior parte dei modelli e "0.05× su GPT-6.1 Sol."

Questo è importante perché gli agenti rinviano lo stesso materiale a ogni passo: prompt di sistema, definizioni degli strumenti, contesto del repository e cronologia della conversazione. La maggior parte del loro input è contenuto ripetuto. Per questi carichi di lavoro, la tariffa memorizzata è effettivamente il tuo vero prezzo di input.

Esempio pratico: un compito di agente di codifica

Assunzioni:

  • Un prefisso fisso di 200K token (prompt di sistema, strumenti, contesto del repository)
  • 50 passi, ciascuno aggiungendo 2K nuovi token di input e producendo 3K token di output (inclusi i ragionamenti)
  • Per semplificare, il prefisso rimane della stessa dimensione, viene scritto nella cache al passo 1 e viene utilizzato in tutti i 49 passi rimanenti
6.1 Sol, senza cache6 Sol + cache6.1 Sol + cacheAstra + cache
Scrittura iniziale in cache di 200K—$0.50$0.50$2.50
49 letture in cache—$1.96$0.98$9.80
Prefisso addebitato come input regolare$20.00———
100K nuovi input (alla tariffa di scrittura)$0.20$0.25$0.25$1.25
150K output$1.50$1.50$1.50$7.50
Totale$21.70$4.21$3.23$21.05

Tre punti chiave:

  1. Il caching è il fattore più importante. Stesso modello, stesso lavoro, e l'esecuzione senza cache costa quasi 7× di più.
  2. 6.1 Sol è circa il 23% più economico di 6 Sol qui, pur ottenendo punteggi più alti.
  3. Per lavori che richiedono molto caching, Astra costa più di quanto suggerisca il divario di prezzo di 5×. In questo esempio è 6.5×, perché Astra sconta l'input memorizzato in cache del 90% e 6.1 Sol del 95%.

Questo è in linea con i costi per compito riportati da OpenAI (compilati da Vellum e The Next Web): circa $1.50 contro $7.70 su DeepSWE, $1.30 contro $9.30 su OSWorld, e $5.47 contro $23.80 su Terminal-Bench Science.

Una nota: OpenAI afferma che Astra di solito richiede meno token di output per completare lo stesso compito. Confronta i modelli in base al costo per compito, non al costo per token.

Le scritture in cache non sono gratuite

Le scritture in cache su 6.1 Sol costano 1.25× la tariffa di input. Se un prefisso viene utilizzato solo una volta, il caching lo rende il 25% più costoso. Utilizzando la formula della documentazione di OpenAI:

  • Una scrittura più una lettura: 1.35× il costo normale di input (1.3× su 6.1 Sol), rispetto a 2× senza caching
  • Una scrittura più nove letture: circa 2.15× (circa 1.7× su 6.1 Sol), rispetto a 10×

Il prefisso memorizzabile minimo è di 1.024 token. La matematica di pareggio di OpenAI afferma che un prefisso di 102 token o meno non ripaga mai. Se ti aspetti 10 o più riutilizzi, aumentare qualsiasi cosa oltre 221 token fino a 1.024 risulta più economico.

Per chiamate una tantum come classificazione a turno singolo o estrazione in blocco, utilizza la modalità esplicita (prompt_cache_options.mode: "explicit") senza punti di interruzione. Non ti verrà addebitato alcun costo per le scritture.


Il limite dei 272K

6.1 Sol accetta 1.05M token di contesto, ma una volta che l'input supera i 272K, l'intera richiesta passa alla tariffa più alta, non solo i token oltre il limite.

RichiestaInputOutputCosto
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

Diecimila token di input in più raddoppiano quasi la bolletta.

Come rimanere sotto il limite:

  • Conta i token lato client e compatti o riduci prima di raggiungere i 272K
  • Recupera le parti rilevanti di documenti lunghi invece di inviare l'intero documento
  • Quando hai realmente bisogno di un lungo contesto, metti la parte fissa in un prefisso memorizzato in cache

Come si riflette lo sforzo di ragionamento sulla bolletta

I token di ragionamento vengono addebitati alla tariffa di output, $10 per milione. Spostare lo stesso compito da basso a massimo può moltiplicare i token di ragionamento per dieci o più.

I costi per compito riportati da OpenAI danno un'idea della scala (questi sono benchmark diversi, quindi confronta solo le magnitudini):

  • AutomationBench (medio): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (alto): ~$1.50
  • Terminal-Bench Science (massimo): ~$5.47

La parte 2 tratta di come scegliere un livello. Un promemoria qui: cambiare reasoning.effort in mezzo alla conversazione invalida la cache. Utilizza configuration_update invece.


Come si confronta a questo prezzo

ModelloInput / outputInput memorizzato in cache
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol e Claude Sonnet 5.5 condividono un prezzo di listino, e la tariffa memorizzata di 6.1 Sol è la metà di quella di Sonnet. Tuttavia, sono forti in cose diverse. Su AutomationBench, ad esempio, Sonnet 5.5 ottiene punteggi molto più alti. Quando due modelli costano lo stesso per token, quello con il costo più basso per compito sul tuo carico di lavoro è il più economico.

La lista dei modelli AIHubMix mostra i prezzi attuali, e una chiave API funziona per tutti, quindi i test affiancati sono facili.

I prezzi dei concorrenti provengono da fonti di terze parti e possono cambiare. Controlla le pagine ufficiali dei prezzi prima di fare affidamento su di essi.

Lista di controllo dei costi

  1. Metti prima il contenuto stabile. Prompt di sistema, definizioni degli strumenti e materiale di riferimento vanno in cima. Timestamp e dati per utente vanno alla fine.
  2. Appendere, non riscrivere. Riassumere, troncare e compattare riavvia la cache.
  3. Mantieni stabile l'elenco degli strumenti. Non aggiungere o rimuovere strumenti per richiesta. Usa tool_choice o allowed_tools invece.
  4. Cambia sforzo con configuration_update, non il parametro della richiesta.
  5. Rimani sotto i 272K di input.
  6. Invia lavori non urgenti tramite Batch o Flex per metà prezzo.
  7. Dirigi per compito. Luna per lavori semplici ad alto volume, 6.1 Sol per la maggior parte delle cose, Astra per i problemi più difficili.
  8. Fai attenzione a tre numeri: cached_tokens, cache_write_tokens, e reasoning_tokens.

La conclusione: il prezzo di listino non è cambiato, ma le letture in cache sono diventate il 50% più economiche. Per i carichi di lavoro degli agenti, questo rende 6.1 Sol il modello con il miglior rapporto qualità-prezzo nella famiglia GPT-6, purché tu utilizzi bene il caching e rimanga sotto i 272K.

Prossimamente: i problemi che probabilmente incontrerai quando cambi.


FAQ

Quanto costa GPT-6.1 Sol? $2 per milione di token di input, $10 per milione di token di output, $0.10 per input memorizzato in cache e $2.50 per scritture in cache. Le richieste oltre i 272K token di input vengono addebitate a $4 per input e $15 per output per l'intera richiesta.

È più economico tramite AIHubMix o OpenAI direttamente? Stesso prezzo. I percorsi OpenAI e Azure di AIHubMix corrispondono entrambi alle tariffe ufficiali di OpenAI.

Perché la mia bolletta è più alta di quanto stimato? Quattro motivi comuni: i token di ragionamento vengono addebitati alla tariffa di output; hai superato i 272K di input; hai perso la cache o pagato costi di scrittura su prefissi una tantum; o la modalità veloce o l'elaborazione regionale è attivata.

Le scritture in cache costano extra? I token scritti vengono addebitati a 1.25× la tariffa di input. Questo sostituisce il normale costo di input piuttosto che aggiungersi ad esso. Un prefisso si ripaga dopo due utilizzi. Per prefissi una tantum, la modalità esplicita ti consente di saltare completamente le scritture.

Quanto è più economico 6.1 Sol rispetto ad Astra? Cinque volte più economico sul prezzo di listino. Per lavori di agenti che richiedono molto caching, il divario può raggiungere 6 o 7× perché 6.1 Sol sconta l'input memorizzato in cache in modo più ripido. Tuttavia, Astra spesso utilizza meno token di output per compito, quindi confronta il costo per compito.

Può Batch essere combinato con il caching? Batch e Flex costano entrambi la metà. Per come si sovrappongono con il caching, controlla la pagina dei prezzi di OpenAI.


Continua a leggere: la serie GPT-6.1 Sol


Fonti