Was GPT-6.1 Sol wirklich kostet: Über das Preisschild von 2 $ / 10 $

AIHubMix6 Min. Lesezeit
Was GPT-6.1 Sol wirklich kostet: Über das Preisschild von 2 $ / 10 $

GPT-6.1 Sol hat den gleichen Listenpreis wie GPT-6 Sol: 2 $ pro Million Eingabetokens und 10 $ pro Million Ausgabetokens. Ihre tatsächliche Rechnung hängt von vier weiteren Faktoren ab: wie oft Sie den Cache nutzen, ob Sie 272K Eingabetokens überschreiten, welche Service-Stufe Sie verwenden und wie viele Reasoning-Tokens das Modell verbraucht. Dieser Beitrag behandelt jeden einzelnen Punkt.


Die vollständige Preisliste

Standardpreise (pro 1M Tokens)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Eingabe2,00 $2,00 $10,00 $0,10 $
Zwischengespeicherte Eingabe0,10 $0,20 $1,00 $—
Cache-Schreibvorgänge2,50 $2,50 $——
Ausgabe (inkl. Reasoning)10,00 $10,00 $50,00 $0,50 $
Der zwischengespeicherte Tarif von Astra stammt aus Berichten Dritter. Der Tarif für Cache-Schreibvorgänge sollte unter OpenAI's 1,25× Regel 12,50 $ betragen. Für die Preisgestaltung von Luna im Cache siehe OpenAI's Preisseite.

Multiplikatoren

Diese Regeln stammen von der GPT-6.1 Sol Modellseite:

BedingungWas passiert
Mehr als 272K EingabetokensDie gesamte Anfrage wird mit 2× Eingabe und Cache, 1,5× Ausgabe abgerechnet (4 $ / 15 $, Cache-Lesevorgänge 0,20 $, Cache-Schreibvorgänge 5 $)
Batch / FlexDie Hälfte des Standardtarifs
Schneller ModusDoppelt so hoch wie der Standardtarif (nicht verfügbar mit EU-Datenresidenz)
Regionale Verarbeitung+10%
Toolaufrufe (Suche, Computerbenutzung usw.)Pro Aufruf berechnet. AIHubMix listet die Websuche mit 0,01 $ pro Anfrage
Ultraschnell (kommt zu Codex)Noch nicht offiziell bepreist. Ein Bericht besagt 6× Standard, unbestätigt

Auf AIHubMix kosten die OpenAI- und Azure-Routen gleich viel wie OpenAI direkt, und die über 272K-Stufe ist bereits aufgeführt.


Die echte Veränderung: Cache-Lesevorgänge bei 5 % des Eingabewerts

Der Listenpreis hat sich nicht geändert. Cache-Lesevorgänge haben sich jedoch von 10 % des Eingabewerts (0,20 $) auf 5 % (0,10 $) verringert. OpenAI's Dokumentation zur Prompt-Caching stellt es klar: Cache-Lesevorgänge sind 0,1× Eingabe bei den meisten Modellen und "0,05× bei GPT-6.1 Sol."

Das ist wichtig, weil Agenten dasselbe Material in jedem Schritt erneut senden: Systemaufforderung, Tooldefinitionen, Repo-Kontext und Gesprächsverlauf. Der Großteil ihrer Eingabe besteht aus wiederholtem Inhalt. Für diese Arbeitslasten ist der zwischengespeicherte Tarif effektiv Ihr tatsächlicher Eingabepreis.

Beispiel: Eine Coding-Agent-Aufgabe

Annahmen:

  • Ein fester Präfix von 200K Tokens (Systemaufforderung, Tools, Repo-Kontext)
  • 50 Schritte, wobei jeder 2K neue Eingabetokens hinzufügt und 3K Ausgabetokens (einschließlich Reasoning) produziert
  • Um es einfach zu halten, bleibt der Präfix gleich groß, wird im Schritt 1 in den Cache geschrieben und wird in allen 49 verbleibenden Schritten verwendet
6.1 Sol, kein Cache6 Sol + Cache6.1 Sol + CacheAstra + Cache
Erster 200K Cache-Schreibvorgang—0,50 $0,50 $2,50 $
49 Cache-Lesevorgänge—1,96 $0,98 $9,80 $
Präfix wird als reguläre Eingabe abgerechnet20,00 $———
100K neue Eingabe (zum Schreibsatz)0,20 $0,25 $0,25 $1,25 $
150K Ausgabe1,50 $1,50 $1,50 $7,50 $
Gesamt21,70 $4,21 $3,23 $21,05 $

Drei Erkenntnisse:

  1. Caching ist der größte Hebel. Dasselbe Modell, dieselbe Arbeit, und der nicht zwischengespeicherte Lauf kostet fast 7× mehr.
  2. 6.1 Sol ist hier etwa 23 % günstiger als 6 Sol, während es auch besser abschneidet.
  3. Für cache-intensive Arbeiten kostet Astra mehr, als die 5× Listenpreisdifferenz vermuten lässt. In diesem Beispiel sind es 6,5×, da Astra die zwischengespeicherte Eingabe um 90 % und 6.1 Sol um 95 % rabattiert.

Das stimmt mit den von OpenAI berichteten Kosten pro Aufgabe überein (zusammengestellt von Vellum und The Next Web): etwa 1,50 $ vs. 7,70 $ auf DeepSWE, 1,30 $ vs. 9,30 $ auf OSWorld und 5,47 $ vs. 23,80 $ auf Terminal-Bench Science.

Eine Einschränkung: OpenAI sagt, dass Astra normalerweise weniger Ausgabetokens benötigt, um dieselbe Aufgabe zu beenden. Vergleichen Sie Modelle nach Kosten pro Aufgabe, nicht nach Kosten pro Token.

Cache-Schreibvorgänge sind nicht kostenlos

Cache-Schreibvorgänge bei 6.1 Sol kosten 1,25× den Eingabewert. Wenn ein Präfix nur einmal verwendet wird, macht das Caching es 25 % teurer. Mit der Formel aus OpenAI's Dokumentation:

  • Ein Schreibvorgang plus ein Lesevorgang: 1,35× der regulären Eingabekosten (1,3× bei 6.1 Sol), im Vergleich zu 2× ohne Caching
  • Ein Schreibvorgang plus neun Lesevorgänge: etwa 2,15× (etwa 1,7× bei 6.1 Sol), im Vergleich zu 10×

Der minimale cachebare Präfix beträgt 1.024 Tokens. OpenAI's Break-Even-Mathematik besagt, dass ein Präfix von 102 Tokens oder weniger sich niemals auszahlt. Wenn Sie mit 10 oder mehr Wiederverwendungen rechnen, ist es günstiger, alles über 221 Tokens auf 1.024 aufzufüllen.

Für einmalige Aufrufe wie die Klassifizierung in einer einzigen Runde oder die Massenextraktion verwenden Sie den expliziten Modus (prompt_cache_options.mode: "explicit") ohne Breakpoints. Ihnen werden keine Schreibvorgänge in Rechnung gestellt.


Die 272K-Klippe

6.1 Sol akzeptiert 1,05M Tokens im Kontext, aber sobald die Eingabe 272K überschreitet, wird die gesamte Anfrage zum höheren Tarif abgerechnet, nicht nur die Tokens über der Grenze.

AnfrageEingabeAusgabeKosten
A270K10K0,27 × 2 $ + 0,01 × 10 $ = 0,64 $
B280K10K0,28 × 4 $ + 0,01 × 15 $ = 1,27 $

Zehntausend mehr Eingabetokens verdoppeln fast die Rechnung.

Wie man darunter bleibt:

  • Zählen Sie Tokens clientseitig und komprimieren oder kürzen Sie, bevor Sie 272K erreichen
  • Rufen Sie die relevanten Teile langer Dokumente ab, anstatt das Ganze zu senden
  • Wenn Sie wirklich einen langen Kontext benötigen, legen Sie den festen Teil in einen zwischengespeicherten Präfix

Wie sich der Reasoning-Aufwand auf der Rechnung zeigt

Reasoning-Tokens werden zum Ausgabewert abgerechnet, 10 $ pro Million. Das Verschieben derselben Aufgabe von niedrig auf maximal kann die Reasoning-Tokens um das Zehnfache oder mehr multiplizieren.

Die von OpenAI berichteten Kosten pro Aufgabe geben einen Eindruck von der Größenordnung (es handelt sich um unterschiedliche Benchmarks, daher nur die Größenordnungen vergleichen):

  • AutomationBench (mittel): ~$0,30
  • GDP.pdf: ~$0,38
  • DeepSWE (hoch): ~$1,50
  • Terminal-Bench Science (max): ~$5,47

Teil 2 behandelt, wie man ein Niveau auswählt. Eine Erinnerung hier: Ändern von reasoning.effort mitten im Gespräch macht den Cache ungültig. Verwenden Sie stattdessen configuration_update.


Wie es sich zu diesem Preis verhält

ModellEingabe / AusgabeZwischengespeicherte Eingabe
GPT-6.1 Sol2 $ / 10 $0,10 $
Claude Sonnet 5.52 $ / 10 $0,20 $
GPT-6 Astra10 $ / 50 $1,00 $

6.1 Sol und Claude Sonnet 5.5 teilen sich einen Listenpreis, und der zwischengespeicherte Tarif von 6.1 Sol beträgt die Hälfte von Sonnet. Sie sind jedoch in unterschiedlichen Bereichen stark. Auf AutomationBench beispielsweise schneidet Sonnet 5.5 deutlich besser ab. Wenn zwei Modelle pro Token gleich viel kosten, ist dasjenige, das bei Ihrer Arbeitslast die niedrigeren Kosten pro Aufgabe hat, das günstigere.

Die AIHubMix-Modellübersicht zeigt die aktuellen Preise, und ein API-Schlüssel funktioniert für alle, sodass Tests nebeneinander einfach sind.

Preise von Wettbewerbern stammen aus Drittquellen und können sich ändern. Überprüfen Sie die offiziellen Preisseiten, bevor Sie sich darauf verlassen.

Kosten-Checkliste

  1. Stabile Inhalte zuerst. Systemaufforderung, Tooldefinitionen und Referenzmaterial stehen ganz oben. Zeitstempel und benutzerspezifische Daten kommen ans Ende.
  2. Anhängen, nicht neu schreiben. Zusammenfassen, Truncating und Komprimieren starten den Cache neu.
  3. Halten Sie die Toolliste stabil. Fügen Sie keine Tools pro Anfrage hinzu oder entfernen Sie sie. Verwenden Sie stattdessen tool_choice oder allowed_tools.
  4. Ändern Sie den Aufwand mit configuration_update, nicht dem Anfrageparameter.
  5. Bleiben Sie unter 272K Eingabe.
  6. Versenden Sie nicht dringende Arbeiten über Batch oder Flex zum halben Preis.
  7. Routen Sie nach Aufgabe. Luna für einfache Arbeiten mit hohem Volumen, 6.1 Sol für die meisten Dinge, Astra für die schwierigsten Probleme.
  8. Beobachten Sie drei Zahlen: cached_tokens, cache_write_tokens und reasoning_tokens.

Das Fazit: Der Listenpreis hat sich nicht geändert, aber Cache-Lesevorgänge wurden 50 % günstiger. Für Agentenarbeitslasten macht das 6.1 Sol zum besten Modell im GPT-6-Familie, solange Sie Caching gut nutzen und unter 272K bleiben.

Als Nächstes: die Probleme, auf die Sie wahrscheinlich stoßen werden, wenn Sie wechseln.


Häufig gestellte Fragen

Wie viel kostet GPT-6.1 Sol? 2 $ pro Million Eingabetokens, 10 $ pro Million Ausgabetokens, 0,10 $ für zwischengespeicherte Eingaben und 2,50 $ für Cache-Schreibvorgänge. Anfragen über 272K Eingabetokens werden mit 4 $ Eingabe und 15 $ Ausgabe für die gesamte Anfrage abgerechnet.

Ist es günstiger über AIHubMix oder OpenAI direkt? Gleicher Preis. Die OpenAI- und Azure-Routen von AIHubMix entsprechen beide den offiziellen Tarifen von OpenAI.

Warum ist meine Rechnung höher als geschätzt? Vier häufige Gründe: Reasoning-Tokens werden zum Ausgabewert abgerechnet; Sie haben 272K Eingabe überschritten; Sie haben den Cache verpasst oder Schreibgebühren für einmalige Präfixe bezahlt; oder der schnelle Modus oder die regionale Verarbeitung ist aktiv.

Kosten Cache-Schreibvorgänge extra? Geschriebene Tokens werden mit 1,25× dem Eingabewert abgerechnet. Das ersetzt die normalen Eingabekosten, anstatt sie zu erhöhen. Ein Präfix amortisiert sich nach zwei Verwendungen. Für einmalige Präfixe ermöglicht der explizite Modus, dass Sie Schreibvorgänge vollständig überspringen.

Wie viel günstiger ist 6.1 Sol als Astra? Fünfmal günstiger beim Listenpreis. Für cache-intensive Agentenarbeiten kann die Lücke 6 bis 7× erreichen, da 6.1 Sol die zwischengespeicherte Eingabe steiler rabattiert. Astra benötigt jedoch oft weniger Ausgabetokens pro Aufgabe, also vergleichen Sie die Kosten pro Aufgabe.

Kann Batch mit Caching kombiniert werden? Batch und Flex kosten beide die Hälfte. Wie sie sich mit Caching stapeln, erfahren Sie auf OpenAI's Preisseite.


Weiterlesen: Die GPT-6.1 Sol-Serie


Quellen