Ile naprawdę kosztuje GPT-6.1 Sol: więcej niż tylko cena 2 USD / 10 USD

AIHubMix6 min czytania
Ile naprawdę kosztuje GPT-6.1 Sol: więcej niż tylko cena 2 USD / 10 USD

GPT-6.1 Sol ma tę samą cenę katalogową co GPT-6 Sol: 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych. Twoje rzeczywiste rachunki zależą od czterech innych czynników: jak często korzystasz z pamięci podręcznej, czy przekraczasz 272K tokenów wejściowych, z którego poziomu usługi korzystasz oraz ile tokenów rozumowania model zużywa. Ten post omawia każdy z tych czynników.


Pełna lista cen

Standardowe stawki (za 1M tokenów)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Wejście2,00 USD2,00 USD10,00 USD0,10 USD
Zapisane wejście0,10 USD0,20 USD1,00 USD—
Zapis do pamięci podręcznej2,50 USD2,50 USD——
Wyjście (w tym rozumowanie)10,00 USD10,00 USD50,00 USD0,50 USD
Stawka pamięci podręcznej Astra pochodzi z raportów stron trzecich. Jej stawka zapisu do pamięci podręcznej powinna wynosić 12,50 USD zgodnie z zasadą 1,25× OpenAI. Aby uzyskać informacje o cenach pamięci podręcznej Luna, zobacz stronę cenową OpenAI.

Mnożniki

Te zasady pochodzą z strony modelu GPT-6.1 Sol:

WarunekCo się dzieje
Więcej niż 272K tokenów wejściowychCałe żądanie jest rozliczane w stawce 2× za wejście i pamięć podręczną, 1,5× za wyjście (4 USD / 15 USD, odczyty pamięci podręcznej 0,20 USD, zapisy pamięci podręcznej 5 USD)
Batch / FlexPołowa standardowej stawki
Tryb szybkiPodwójna standardowa stawka (niedostępna w przypadku przetwarzania danych w UE)
Przetwarzanie regionalne+10%
Wywołania narzędzi (wyszukiwanie, użycie komputera itp.)Opłata za każde wywołanie. AIHubMix podaje wyszukiwanie w sieci w cenie 0,01 USD za żądanie
Ultraszybki (wkrótce w Codex)Nie ma jeszcze oficjalnej ceny. Jeden raport mówi o 6× standardowej, niepotwierdzonej

Na AIHubMix trasy OpenAI i Azure kosztują tyle samo, co bezpośrednio przez OpenAI, a poziom powyżej 272K jest już wymieniony.


Prawdziwa zmiana: odczyty pamięci podręcznej za 5% stawki wejściowej

Cena katalogowa nie zmieniła się. Odczyty pamięci podręcznej zmieniły się, z 10% stawki wejściowej (0,20 USD) na 5% (0,10 USD). Dokumentacja OpenAI dotycząca pamięci podręcznej wyraźnie to stwierdza: odczyty pamięci podręcznej to 0,1× stawki wejściowej w większości modeli i "0,05× w GPT-6.1 Sol."

To ma znaczenie, ponieważ agenci wysyłają te same materiały na każdym kroku: systemowy prompt, definicje narzędzi, kontekst repozytoriów i historię rozmów. Większość ich wejścia to powtarzająca się treść. Dla tych obciążeń roboczych stawka pamięci podręcznej jest w rzeczywistości twoją prawdziwą ceną wejściową.

Przykład: jedno zadanie agenta kodującego

Założenia:

  • 200K-tokenowy stały prefiks (systemowy prompt, narzędzia, kontekst repozytoriów)
  • 50 kroków, z których każdy dodaje 2K nowych tokenów wejściowych i produkuje 3K tokenów wyjściowych (w tym rozumowanie)
  • Aby uprościć, prefiks pozostaje tej samej wielkości, jest zapisywany w pamięci podręcznej w kroku 1 i jest używany w pozostałych 49 krokach
6.1 Sol, bez pamięci podręcznej6 Sol + pamięć podręczna6.1 Sol + pamięć podręcznaAstra + pamięć podręczna
Początkowy zapis 200K do pamięci podręcznej—0,50 USD0,50 USD2,50 USD
49 odczytów pamięci podręcznej—1,96 USD0,98 USD9,80 USD
Prefiks rozliczany jako standardowe wejście20,00 USD———
100K nowych tokenów wejściowych (w stawce zapisu)0,20 USD0,25 USD0,25 USD1,25 USD
150K wyjścia1,50 USD1,50 USD1,50 USD7,50 USD
Razem21,70 USD4,21 USD3,23 USD21,05 USD

Trzy wnioski:

  1. Pamięć podręczna to największy dźwignia. Ten sam model, ta sama praca, a uruchomienie bez pamięci podręcznej kosztuje prawie 7× więcej.
  2. 6.1 Sol jest o około 23% tańszy niż 6 Sol w tym przypadku, a jednocześnie osiąga lepsze wyniki.
  3. Dla prac intensywnie korzystających z pamięci podręcznej, Astra kosztuje więcej niż sugeruje luka w cenie 5×. W tym przykładzie to 6,5×, ponieważ Astra obniża koszt zapisanych tokenów o 90%, a 6.1 Sol o 95%.

To zgadza się z raportowanymi przez OpenAI kosztami na zadanie (skompilowanymi przez Vellum i The Next Web): około 1,50 USD w porównaniu do 7,70 USD na DeepSWE, 1,30 USD w porównaniu do 9,30 USD na OSWorld oraz 5,47 USD w porównaniu do 23,80 USD na Terminal-Bench Science.

Jedna uwaga: OpenAI twierdzi, że Astra zwykle potrzebuje mniej tokenów wyjściowych, aby zakończyć to samo zadanie. Porównuj modele pod kątem kosztów na zadanie, a nie kosztów na token.

Zapisy do pamięci podręcznej nie są darmowe

Zapisy do pamięci podręcznej w 6.1 Sol kosztują 1,25× stawki wejściowej. Jeśli prefiks jest używany tylko raz, korzystanie z pamięci podręcznej zwiększa jego koszt o 25%. Używając wzoru z dokumentacji OpenAI:

  • Jedno zapisanie plus jeden odczyt: 1,35× normalny koszt wejścia (1,3× w 6.1 Sol), w porównaniu do 2× bez pamięci podręcznej
  • Jedno zapisanie plus dziewięć odczytów: około 2,15× (około 1,7× w 6.1 Sol), w porównaniu do 10×

Minimalny prefiks do zapisania w pamięci podręcznej to 1 024 tokeny. Matematyka OpenAI dotycząca progu rentowności mówi, że prefiks o długości 102 tokenów lub mniej nigdy się nie opłaca. Jeśli spodziewasz się 10 lub więcej ponownych użyć, lepiej jest zwiększyć wszystko powyżej 221 tokenów do 1 024.

Dla jednorazowych wywołań, takich jak klasyfikacja jednorazowa lub masowe wydobycie, użyj trybu eksplicytnego (prompt_cache_options.mode: "explicit") bez punktów przerwania. Nie będziesz obciążany żadnymi zapisami.


Klif 272K

6.1 Sol akceptuje 1,05M tokenów kontekstu, ale gdy wejście przekroczy 272K, całe żądanie przechodzi na wyższą stawkę, a nie tylko tokeny powyżej tej granicy.

ŻądanieWejścieWyjścieKoszt
A270K10K0,27 × 2 USD + 0,01 × 10 USD = 0,64 USD
B280K10K0,28 × 4 USD + 0,01 × 15 USD = 1,27 USD

Dziesięć tysięcy dodatkowych tokenów wejściowych niemal podwaja rachunek.

Jak pozostać poniżej tej granicy:

  • Liczyć tokeny po stronie klienta i kompresować lub przycinać przed osiągnięciem 272K
  • Pobierać odpowiednie części długich dokumentów zamiast wysyłać całość
  • Kiedy naprawdę potrzebujesz długiego kontekstu, umieść stałą część w zapisanym prefiksie

Jak wysiłek rozumowania wpływa na rachunek

Tokeny rozumowania są rozliczane w stawce wyjściowej, 10 USD za milion. Przeniesienie tego samego zadania z niskiego na maksymalne może pomnożyć tokeny rozumowania dziesięciokrotnie lub więcej.

Raportowane przez OpenAI koszty na zadanie dają poczucie skali (to różne benchmarki, więc porównuj tylko wielkości):

  • AutomationBench (średni): ~$0,30
  • GDP.pdf: ~$0,38
  • DeepSWE (wysoki): ~$1,50
  • Terminal-Bench Science (maks.): ~$5,47

Część 2 omawia, jak wybrać poziom. Jedna przypomnienie tutaj: zmiana reasoning.effort w trakcie rozmowy unieważnia pamięć podręczną. Użyj configuration_update zamiast tego.


Jak to się ma w tej cenie

ModelWejście / wyjścieZapisane wejście
GPT-6.1 Sol2 USD / 10 USD0,10 USD
Claude Sonnet 5.52 USD / 10 USD0,20 USD
GPT-6 Astra10 USD / 50 USD1,00 USD

6.1 Sol i Claude Sonnet 5.5 mają tę samą cenę katalogową, a stawka pamięci podręcznej 6.1 Sol jest połową stawki Sonnet. Są jednak silne w różnych dziedzinach. Na przykład w AutomationBench Sonnet 5.5 osiąga znacznie lepsze wyniki. Kiedy dwa modele kosztują tyle samo za token, ten, który ma niższy koszt na zadanie w twoim obciążeniu roboczym, jest tańszy.

Lista modeli na AIHubMix pokazuje aktualne ceny, a jeden klucz API działa dla wszystkich, więc testy porównawcze są łatwe.

Ceny konkurencji pochodzą z niezależnych źródeł i mogą się zmieniać. Sprawdź oficjalne strony cenowe, zanim na nich polegniesz.

Lista kontrolna kosztów

  1. Najpierw umieść stabilne treści. Systemowy prompt, definicje narzędzi i materiały referencyjne powinny znajdować się na górze. Znaczniki czasowe i dane użytkowników powinny być na końcu.
  2. Dodawaj, nie przepisuj. Podsumowywanie, skracanie i kompresowanie powoduje ponowne uruchomienie pamięci podręcznej.
  3. Utrzymuj stabilną listę narzędzi. Nie dodawaj ani nie usuwaj narzędzi w każdym żądaniu. Zamiast tego użyj tool_choice lub allowed_tools.
  4. Zmieniając wysiłek, użyj configuration_update, a nie parametru żądania.
  5. Pozostań poniżej 272K wejścia.
  6. Wysyłaj niepilne prace przez Batch lub Flex za połowę ceny.
  7. Routuj według zadania. Luna do prostych prac o dużej objętości, 6.1 Sol do większości zadań, Astra do najtrudniejszych problemów.
  8. Obserwuj trzy liczby: cached_tokens, cache_write_tokens, i reasoning_tokens.

Podsumowując: cena katalogowa się nie zmieniła, ale odczyty pamięci podręcznej stały się 50% tańsze. Dla obciążeń roboczych agentów czyni to 6.1 Sol najlepszym modelem pod względem wartości w rodzinie GPT-6, o ile dobrze korzystasz z pamięci podręcznej i pozostajesz poniżej 272K.

Następnie: problemy, na które możesz natrafić podczas przełączania.


FAQ

Ile kosztuje GPT-6.1 Sol? 2 USD za milion tokenów wejściowych, 10 USD za milion tokenów wyjściowych, 0,10 USD za zapisane wejście i 2,50 USD za zapisy do pamięci podręcznej. Żądania powyżej 272K tokenów wejściowych są rozliczane w stawce 4 USD za wejście i 15 USD za wyjście dla całego żądania.

Czy to tańsze przez AIHubMix czy bezpośrednio przez OpenAI? Ta sama cena. Trasy OpenAI i Azure w AIHubMix odpowiadają oficjalnym stawkom OpenAI.

Dlaczego mój rachunek jest wyższy niż oszacowałem? Cztery powszechne powody: tokeny rozumowania są rozliczane w stawce wyjściowej; przekroczyłeś 272K wejścia; nie skorzystałeś z pamięci podręcznej lub zapłaciłeś opłaty za zapisy na jednorazowych prefiksach; lub włączony jest tryb szybki lub przetwarzanie regionalne.

Czy zapisy do pamięci podręcznej kosztują dodatkowo? Zapisane tokeny są rozliczane w stawce 1,25× stawki wejściowej. Zastępuje to normalną opłatę za wejście, a nie dodaje do niej. Prefiks zwraca się po dwóch użyciach. W przypadku jednorazowych prefiksów, tryb eksplicytnego pozwala całkowicie pominąć zapisy.

Jak dużo tańszy jest 6.1 Sol od Astry? Pięć razy tańszy w cenie katalogowej. Dla prac intensywnie korzystających z pamięci podręcznej luka może osiągnąć 6 do 7×, ponieważ 6.1 Sol bardziej stromo obniża koszt zapisanych tokenów. Astra często używa jednak mniej tokenów wyjściowych na zadanie, więc porównuj koszt na zadanie.

Czy Batch można połączyć z pamięcią podręczną? Batch i Flex są obie w połowie ceny. Aby sprawdzić, jak się łączą z pamięcią podręczną, sprawdź stronę cenową OpenAI.


Czytaj dalej: seria GPT-6.1 Sol


Źródła