Wat GPT-6.1 Sol Echt Kost: Voorbij het $2 / $10 Prijskaartje

AIHubMix6 min leestijd
Wat GPT-6.1 Sol Echt Kost: Voorbij het $2 / $10 Prijskaartje

GPT-6.1 Sol heeft dezelfde lijstprijs als GPT-6 Sol: $2 per miljoen invoertokens en $10 per miljoen uitvoertokens. Je daadwerkelijke rekening hangt af van vier andere zaken: hoe vaak je de cache aanroept, of je 272K invoertokens overschrijdt, welke servicelaag je gebruikt en hoeveel redeneertokens het model verbruikt. Deze post behandelt elk van deze punten.


De volledige prijslijst

Standaard tarieven (per 1M tokens)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Invoer$2.00$2.00$10.00$0.10
Gecacheerde invoer$0.10$0.20$1.00—
Cache schrijvingen$2.50$2.50——
Uitvoer (incl. redenering)$10.00$10.00$50.00$0.50
Astra's gecacheerde tarief komt van rapportage door derden. Het tarief voor cache-schrijvingen zou $12.50 moeten zijn volgens OpenAI's 1.25× regel. Voor de prijsstelling van Luna's cache, zie OpenAI's prijs pagina.

Vermenigvuldigers

Deze regels komen van de GPT-6.1 Sol model pagina:

VoorwaardeWat er gebeurt
Meer dan 272K invoertokensDe hele aanvraag wordt gefactureerd tegen 2× invoer en cache, 1.5× uitvoer ($4 / $15, cache leest $0.20, cache schrijft $5)
Batch / FlexDe helft van het standaardtarief
Snelle modusDubbel van het standaardtarief (niet beschikbaar met EU-gegevensresidentie)
Regionale verwerking+10%
Toolaanroepen (zoeken, computergebruik, enz.)Gefactureerd per oproep. AIHubMix vermeldt webzoekopdrachten voor $0.01 per aanvraag
Ultrasnel (komt naar Codex)Nog niet officieel geprijsd. Eén rapport zegt 6× standaard, niet bevestigd

Op AIHubMix kosten de OpenAI- en Azure-routes hetzelfde als OpenAI direct, en de boven-272K laag is al vermeld.


De echte verandering: cache leest tegen 5% van de invoer

De lijstprijs is niet veranderd. Cache leest zijn wel veranderd, van 10% van het invoertarief ($0.20) naar 5% ($0.10). OpenAI's documentatie over prompt caching stelt het duidelijk: cache leest zijn 0.1× invoer op de meeste modellen en "0.05× op GPT-6.1 Sol."

Dit is belangrijk omdat agenten hetzelfde materiaal bij elke stap opnieuw verzenden: systeemprompt, tooldefinities, repo-context en gespreksgeschiedenis. Het grootste deel van hun invoer is herhaald materiaal. Voor deze werkbelastingen is het gecacheerde tarief effectief je echte invoerprijs.

Voorbeeld: één coding-agent taak

Aannames:

  • Een vaste prefix van 200K tokens (systeemprompt, tools, repo-context)
  • 50 stappen, waarbij elke stap 2K nieuwe invoertokens toevoegt en 3K uitvoertokens produceert (inclusief redenering)
  • Om het eenvoudig te houden, blijft de prefix dezelfde grootte, wordt deze in cache geschreven bij stap 1 en wordt deze aangeroepen bij alle 49 resterende stappen
6.1 Sol, geen cache6 Sol + cache6.1 Sol + cacheAstra + cache
Initiële 200K cache schrijving—$0.50$0.50$2.50
49 cache leest—$1.96$0.98$9.80
Prefix gefactureerd als reguliere invoer$20.00———
100K nieuwe invoer (tegen schrijftarief)$0.20$0.25$0.25$1.25
150K uitvoer$1.50$1.50$1.50$7.50
Totaal$21.70$4.21$3.23$21.05

Drie belangrijke punten:

  1. Caching is de grootste hefboom. Zelfde model, zelfde werk, en de ongecacheerde uitvoering kost bijna 7× meer.
  2. 6.1 Sol is ongeveer 23% goedkoper dan 6 Sol hier, terwijl het ook beter presteert.
  3. Voor cache-intensievere werkzaamheden, kost Astra meer dan de 5× lijstprijsverschil suggereert. In dit voorbeeld is het 6.5×, omdat Astra de gecacheerde invoer met 90% korting en 6.1 Sol met 95% korting geeft.

Dat komt overeen met de door OpenAI gerapporteerde kosten per taak (samengesteld door Vellum en The Next Web): ongeveer $1.50 vs $7.70 op DeepSWE, $1.30 vs $9.30 op OSWorld, en $5.47 vs $23.80 op Terminal-Bench Science.

Een kanttekening: OpenAI zegt dat Astra meestal minder uitvoertokens nodig heeft om dezelfde taak te voltooien. Vergelijk modellen op kosten per taak, niet op kosten per token.

Cache schrijvingen zijn niet gratis

Cache schrijvingen op 6.1 Sol kosten 1.25× het invoertarief. Als een prefix slechts één keer wordt gebruikt, maakt caching het 25% duurder. Met de formule uit OpenAI's documentatie:

  • Één schrijving plus één lezing: 1.35× reguliere invoerkosten (1.3× op 6.1 Sol), versus 2× zonder caching
  • Één schrijving plus negen lezingen: ongeveer 2.15× (ongeveer 1.7× op 6.1 Sol), versus 10×

De minimale cachebare prefix is 1.024 tokens. OpenAI's break-even berekeningen zeggen dat een prefix van 102 tokens of minder nooit rendabel is. Als je verwacht 10 of meer hergebruik te hebben, is het goedkoper om alles boven de 221 tokens op te vullen tot 1.024.

Voor eenmalige oproepen zoals een enkele classificatie of bulkextractie, gebruik expliciete modus (prompt_cache_options.mode: "explicit") zonder breekpunten. Je wordt niet gefactureerd voor schrijvingen.


De 272K kloof

6.1 Sol accepteert 1.05M tokens context, maar wanneer de invoer boven de 272K gaat, wordt de hele aanvraag naar het hogere tarief verplaatst, niet alleen de tokens boven de lijn.

AanvraagInvoerUitvoerKosten
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

Tien duizend meer invoertokens verdubbelt bijna de rekening.

Hoe je eronder kunt blijven:

  • Tellen tokens aan de clientzijde en compact of trim voordat je 272K bereikt
  • Haal de relevante delen van lange documenten op in plaats van het hele document te verzenden
  • Wanneer je echt lange context nodig hebt, zet het vaste deel in een gecacheerde prefix

Hoe redeneringsinspanningen op de rekening verschijnen

Redeneertokens worden gefactureerd tegen het uitvoertarief, $10 per miljoen. Het verplaatsen van dezelfde taak van laag naar maximaal kan het aantal redeneertokens met tien of meer vermenigvuldigen.

De door OpenAI gerapporteerde kosten per taak geven een gevoel van schaal (dit zijn verschillende benchmarks, dus vergelijk alleen de grootten):

  • AutomationBench (medium): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (hoog): ~$1.50
  • Terminal-Bench Science (max): ~$5.47

Deel 2 behandelt hoe je een niveau kiest. Een herinnering hier: het wijzigen van reasoning.effort halverwege het gesprek maakt de cache ongeldig. Gebruik in plaats daarvan configuration_update.


Hoe het zich verhoudt op dit prijsniveau

ModelInvoer / uitvoerGecacheerde invoer
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol en Claude Sonnet 5.5 delen een lijstprijs, en het gecacheerde tarief van 6.1 Sol is de helft van dat van Sonnet. Ze zijn sterk in verschillende dingen, hoewel. Op AutomationBench, bijvoorbeeld, scoort Sonnet 5.5 veel beter. Wanneer twee modellen dezelfde prijs per token hebben, is degene met de lagere kosten per taak op jouw werkbelasting de goedkopere.

De AIHubMix modellenlijst toont de huidige prijzen, en één API-sleutel werkt voor allemaal, dus side-by-side tests zijn eenvoudig.

Concurrentprijzen komen van derden en kunnen veranderen. Controleer de officiële prijs pagina's voordat je erop vertrouwt.

Kosten checklist

  1. Plaats stabiele inhoud eerst. Systeemprompt, tooldefinities en referentiemateriaal komen bovenaan. Timestamps en per-gebruiker gegevens komen onderaan.
  2. Voeg toe, herschrijf niet. Samenvatten, inkorten en compact maken start de cache opnieuw.
  3. Houd de lijst met tools stabiel. Voeg geen tools toe of verwijder ze per aanvraag. Gebruik in plaats daarvan tool_choice of allowed_tools.
  4. Wijzig inspanning met configuration_update, niet de aanvraagparameter.
  5. Blijf onder 272K invoer.
  6. Stuur niet-dringende werkzaamheden via Batch of Flex voor de helft van de prijs.
  7. Routeer op taak. Luna voor eenvoudige hoge-volume werkzaamheden, 6.1 Sol voor de meeste dingen, Astra voor de moeilijkste problemen.
  8. Let op drie nummers: cached_tokens, cache_write_tokens, en reasoning_tokens.

De conclusie: de lijstprijs is niet veranderd, maar cache leest zijn 50% goedkoper geworden. Voor agentwerkbelastingen maakt dat 6.1 Sol het model met de beste waarde in de GPT-6-familie, zolang je caching goed gebruikt en onder de 272K blijft.

Volgende: de problemen die je waarschijnlijk tegenkomt wanneer je overschakelt.


FAQ

Hoeveel kost GPT-6.1 Sol? $2 per miljoen invoertokens, $10 per miljoen uitvoertokens, $0.10 voor gecacheerde invoer, en $2.50 voor cache schrijvingen. Aanvragen boven de 272K invoertokens worden gefactureerd tegen $4 invoer en $15 uitvoer voor de hele aanvraag.

Is het goedkoper via AIHubMix of OpenAI direct? Zelfde prijs. De OpenAI- en Azure-routes van AIHubMix komen beide overeen met de officiële tarieven van OpenAI.

Waarom is mijn rekening hoger dan ik had geschat? Vier veelvoorkomende redenen: redeneertokens worden gefactureerd tegen het uitvoertarief; je hebt 272K invoer overschreden; je hebt de cache gemist of betaalde schrijfkosten voor eenmalige prefixes; of de snelle modus of regionale verwerking is ingeschakeld.

Kosten cache schrijvingen extra? Geschreven tokens worden gefactureerd tegen 1.25× het invoertarief. Dat vervangt de normale invoerkosten in plaats van dat het erbij komt. Een prefix betaalt zichzelf terug na twee gebruik. Voor eenmalige prefixes laat expliciete modus je schrijvingen helemaal overslaan.

Hoeveel goedkoper is 6.1 Sol dan Astra? Vijf keer goedkoper op lijstprijs. Voor cache-intensievere agentwerkzaamheden kan de kloof oplopen tot 6 tot 7× omdat 6.1 Sol de gecacheerde invoer steiler korting geeft. Astra gebruikt vaak minder uitvoertokens per taak, dus vergelijk kosten per taak.

Kan Batch worden gecombineerd met caching? Batch en Flex zijn beide voor de helft van de prijs. Voor hoe ze zich verhouden tot caching, zie OpenAI's prijs pagina.


Blijf lezen: de GPT-6.1 Sol serie


Bronnen