OpenAI oficjalnie wydało rodzinę GPT-5.6 9 lipca 2026 roku. AIHubMix zakończył integrację wszystkich trzech poziomów: gpt-5.6-sol, gpt-5.6-terra i gpt-5.6-luna są teraz dostępne poprzez Chat Completions i Responses. Wydanie zmienia również mechanizm pamięci podręcznej zapytań oraz jego rozliczenia: zapisy w pamięci podręcznej są teraz rozliczane osobno. Ten post omawia pozycjonowanie trzech poziomów i krok po kroku przedstawia zmiany w pamięci podręcznej.
Jakie zmiany wprowadzają trzy poziomy GPT-5.6
GPT-5.6 zmienia schemat nazewnictwa: liczba oznacza generację modelu, podczas gdy Sol, Terra i Luna to poziomy możliwości, które mogą ewoluować niezależnie. Zgodnie z oficjalnymi definicjami, Sol to model flagowy, Terra to tańszy poziom o wydajności porównywalnej z GPT-5.5, a Luna to najszybszy, najtańszy poziom.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Oficjalne pozycjonowanie | Model flagowy do złożonej pracy profesjonalnej | Zrównoważona inteligencja i koszt | Dla obciążeń wrażliwych na koszty |
| Okno kontekstowe | 1 050 000 | 1 050 000 | 1 050 000 |
| Maksymalny wynik | 128 000 | 128 000 | 128 000 |
| Data zakończenia wiedzy | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Przybliżony odpowiednik w poprzedniej generacji | Poziom bez sufiksu | poziom mini | poziom nano |
Jeśli chodzi o możliwości, oficjalne stanowisko: Sol osiąga wyniki na najwyższym poziomie w zadaniach związanych z kodowaniem, pracą wiedzy, cyberbezpieczeństwem i nauką, jest opisywany przez OpenAI jako najlepszy model kodowania do tej pory i ustanawia nowe rekordy w Terminal-Bench 2.1 i DeepSWE; Terra dorównuje wydajności GPT-5.5 przy połowie ceny. Rodzina dodaje maksymalny poziom rozumowania, a API Responses zyskuje Programmatic Tool Calling i możliwości multi-agent (Beta).
Wyjaśnienie aktualizacji mechanizmu pamięci podręcznej
Przed GPT-5.6 pamięć podręczna zapytań w modelach GPT była całkowicie automatyczna: prefiksy o długości 1 024 tokenów lub więcej były automatycznie zapisywane w pamięci podręcznej, deweloperzy nie mieli kontroli nad tym, co było zapisywane ani na jak długo, a pamięci podręczne były czyszczone po 5–10 minutach braku aktywności. OpenAI podsumowuje zmiany w GPT-5.6 jako "bardziej przewidywalna pamięć podręczna zapytań", z trzema konkretnymi punktami:
- Okres przechowywania zmienia się z "tak krótkiego jak 5 minut" na "co najmniej 30 minut".
prompt_cache_options.ttlobecnie obsługuje tylko"30m"; to jest gwarantowane minimum, a rzeczywisty okres przechowywania może być dłuższy. - Jawne punkty przerwania są nowe. Ustawienie
prompt_cache_breakpointna bloku treści ustawia granicę pamięci podręcznej na końcu stabilnej treści, więc zmiany po punkcie przerwania nie unieważniają zapisanego prefiksu przed nim; przy ustawieniuprompt_cache_options.modena"explicit"używane są tylko ręczne punkty przerwania. prompt_cache_keyprzechodzi z optymalizacji do oficjalnego wymogu. Począwszy od GPT-5.6, parametr powinien być ustawiony, aby umożliwić bardziej niezawodne dopasowanie pamięci podręcznej; OpenAI zaleca utrzymywanie ruchu na klucz na poziomie około 15 zapytań na minutę.
Jak ocenić rozliczenia za zapisy w pamięci podręcznej 1,25x
Począwszy od GPT-5.6, zapisy w pamięci podręcznej są rozliczane w wysokości 1,25x podstawowej stawki wejściowej, a odczyty z pamięci podręcznej w wysokości 0,1x; w wcześniejszych modelach zapisy w pamięci podręcznej nie miały dodatkowej opłaty. Oficjalne sformułowanie (z ogłoszenia GPT-5.6): "Dla modeli GPT-5.6 i późniejszych zapisy w pamięci podręcznej są rozliczane w wysokości 1,25x stawki wejściowej modelu bez pamięci podręcznej, podczas gdy odczyty z pamięci podręcznej nadal otrzymują 90% zniżki na wejście z pamięci podręcznej."
Matematyka punktu równowagi wynika bezpośrednio z oficjalnych stawek: zapisanie prefiksu kosztuje 0,25x stawki wejściowej więcej niż brak pamięci podręcznej, a każdy kolejny hit oszczędza 0,9x stawki wejściowej: prefiks użyty nawet raz przynosi oszczędności netto, a im więcej użyć, tym większe oszczędności.
- Obciążenia, które wyraźnie korzystają: przepływy pracy agentów z długimi systemowymi zapytaniami, RAG, które wielokrotnie zawiera długie materiały referencyjne, aplikacje zawierające duże definicje narzędzi oraz rozmowy wieloturnusowe, które tylko dodają wiadomości. Te obciążenia mają wysokie ponowne użycie prefiksów, więc stawka odczytu 0,1x dominuje.
- Obciążenia do obserwacji: jednorazowe długie zapytania, których prefiks nigdy nie jest ponownie używany. Automatyczna pamięć podręczna jest domyślnie włączona, więc te zapytania ponoszą nieodwracalną opłatę za zapis 1,25x; ustawienie
prompt_cache_options.modena"explicit"bez ustawiania jakichkolwiek punktów przerwania sprawia, że zapytanie całkowicie pomija pamięć podręczną i nie ponosi opłaty za zapis.
Porównanie: pamięć podręczna zapytań w GPT-5.6 i Claude
Projekt pamięci podręcznej GPT-5.6 zbiega się z cache_control Claude w kilku wymiarach, z zasadniczą różnicą w domyślnym zachowaniu: GPT automatycznie zapisuje w pamięci podręcznej bez wymaganych parametrów, podczas gdy Claude wymaga, aby pamięć podręczna była włączona w zapytaniu, albo poprzez pole cache_control na najwyższym poziomie (automatyczny punkt przerwania), albo poprzez jawne punkty przerwania na poziomie bloku treści.
| Wymiar | Rodzina GPT-5.6 | Rodzina Claude (wszystkie aktywne modele) |
|---|---|---|
| Aktywacja | Automatyczna pamięć podręczna, jawne punkty przerwania opcjonalne | Musi być włączona: automatyczny punkt przerwania cache_control na najwyższym poziomie lub jawne punkty przerwania na poziomie bloku treści |
| Parametr punktu przerwania | prompt_cache_breakpoint (poziom bloku treści) |
cache_control (na najwyższym poziomie lub poziomie bloku treści) |
| Limit punktów przerwania | Maksymalnie 4 nowe zapisy w pamięci podręcznej na zapytanie | Maksymalnie 4 punkty przerwania |
| Przechowywanie pamięci podręcznej | Co najmniej 30 minut | 5 minut domyślnie (odświeżane bez kosztów przy każdym trafieniu), opcjonalnie 1 godzina |
| Rozliczenia za zapisy w pamięci podręcznej | 1,25x stawka wejściowa | 1,25x dla poziomu 5-minutowego, 2x dla poziomu 1-godzinnego |
| Rozliczenia za odczyty z pamięci podręcznej | 0,1x stawka wejściowa | 0,1x stawka wejściowa |
| Minimalna długość do zapisania w pamięci podręcznej | 1 024 tokeny | 512–4 096 tokenów w zależności od modelu |
| Wymóg trafienia | Identyczne bajt po bajcie przed punktem przerwania | Identyczne bajt po bajcie przed punktem przerwania |
Kolumna Claude odzwierciedla zasady wspólne dla wszystkich aktywnych modeli Claude: 1,25x zapisy dla poziomu 5-minutowego, 2x dla poziomu 1-godzinnego, a 0,1x odczyty stosują się jednolicie w całej ofercie (dokumentacja pamięci podręcznej Anthropic), przy czym różnice między modelami ograniczają się do minimalnej długości do zapisania w pamięci podręcznej; kolumna GPT-5.6 pochodzi z przewodnika po pamięci podręcznej OpenAI.
Limity punktów przerwania, stawki zapisu (dla odpowiadających poziomów) i stawki odczytu dokładnie odpowiadają sobie w obu dostawcach; w praktyce ta sama strategia strukturyzacji zapytań "statyczna treść najpierw, zmieniająca się treść na końcu" przenosi się między nimi. Koszt migracji koncentruje się na składni parametrów: GPT używa prompt_cache_breakpoint + prompt_cache_key, Claude używa cache_control.
Ten sam wzór pamięci podręcznej w obu protokołach
Dla tego samego scenariusza "zapamiętaj statyczną długą instrukcję" minimalne implementacje w obu protokołach są następujące. Przykłady używają gpt-5.6-sol i claude-opus-4-8. Oba mają tę samą podstawową cenę wejściową (5 USD/M), więc efektywne ceny za tokeny wynikające z zapisów w pamięci podręcznej (1,25x) i odczytów (0,1x) są również identyczne; różni się tylko składnia.
Protokół GPT ustawia prompt_cache_key na najwyższym poziomie (długie prefiksy są automatycznie zapisywane w pamięci podręcznej, nie potrzebny jest znacznik punktu przerwania); protokół Claude ustawia cache_control na najwyższym poziomie, aby włączyć automatyczne zapisywanie w pamięci podręcznej, przechodząc do punktów przerwania na poziomie bloku treści, gdy potrzebna jest precyzyjna kontrola nad granicą pamięci podręcznej:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Statyczne długie instrukcje, >=1024 tokenów]"
},
{
"role": "user",
"content": "Podsumuj kluczowe dane."
}
]
}'
Claude (Wiadomości)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Statyczne długie instrukcje, >=1024 tokenów]",
"messages": [
{
"role": "user",
"content": "Podsumuj kluczowe dane."
}
]
}'
Porównując dwa zapytania, różnice sprowadzają się do: punktu końcowego (/v1/chat/completions vs /v1/messages), nagłówków autoryzacji (Authorization: Bearer vs x-api-key + anthropic-version), parametru pamięci podręcznej (na najwyższym poziomie prompt_cache_key vs na najwyższym poziomie cache_control) oraz Claude wymaga jawnego max_tokens. Oba zapytania zostały zweryfikowane w aihubmix.com (2026-07-10): gpt-5.6-sol zwrócił cached_tokens: 2816 przy drugim wywołaniu; claude-opus-4-8 zwrócił cache_creation_input_tokens: 3632 przy pierwszym wywołaniu i cache_read_input_tokens: 3632 przy drugim.
Poza formatem zapytania pozostają trzy różnice na poziomie mechanizmu:
- Aktywacja: GPT automatycznie zapisuje w pamięci podręcznej nawet bez jakichkolwiek parametrów pamięci podręcznej, a
prompt_cache_keypoprawia niezawodność trafień; Claude wymaga deklaracji: punkt przerwania na poziomie bloku treścicache_controllub automatyczny trybcache_controlna najwyższym poziomie. - Pola użycia: GPT raportuje odczyty z pamięci podręcznej w
prompt_tokens_details.cached_tokens; Claude raportuje zapisy i odczyty osobno jakocache_creation_input_tokensicache_read_input_tokens, co ułatwia niezależne weryfikowanie zapisów i trafień. - Kontrola czasu życia:
ttlw GPT-5.6 obecnie obsługuje tylko"30m"; Claude domyślnie ustawia na 5 minut (odświeżane bez kosztów przy każdym trafieniu), z opcjonalnym"ttl": "1h"(zapisy rozliczane w wysokości 2x).
Co zmienić przy zamianie modeli między protokołami
Brama AIHubMix obsługuje wywołania między protokołami: punkt końcowy zgodny z OpenAI może wywoływać modele Claude (cache_control trafia bezpośrednio do bloków treści w formacie OpenAI; zobacz Praktyki pamięci podręcznej zapytań), a punkt końcowy /v1/messages zgodny z Claude może wywoływać GPT-5.6 (zweryfikowane jako działające). Przy zamianie modeli sprawdź trzy rzeczy:
- Zmiana
modelna identyfikator docelowego modelu; - Przełącz składnię parametru pamięci podręcznej:
prompt_cache_key/ jawne punkty przerwania odpowiadającache_controlClaude; - Przełącz nazwy pól użycia:
cached_tokensodpowiadacache_read_input_tokensClaude.
Zalecane ścieżki dla pamięci podręcznej zapytań: modele GPT przez Chat Completions (ścieżka trafienia weryfikowana w tym poście); modele Claude działają przez dowolny protokół.
Porównanie: GPT-5.6 vs wcześniejsze pamięci podręczne GPT
| Wymiar | Przed GPT-5.6 | GPT-5.6 i późniejsze |
|---|---|---|
| Zapisy w pamięci podręcznej | Brak dodatkowej opłaty | 1,25x stawka wejściowa |
| Przechowywanie pamięci podręcznej | Czyszczone po 5–10 minutach braku aktywności, do 1 godziny | Co najmniej 30 minut |
| Kontrola pamięci podręcznej | Brak | Jawne punkty przerwania, jawny tryb, niezawodne dopasowanie prompt_cache_key |
| Przedłużone przechowywanie przez 24 godziny | prompt_cache_retention w niektórych modelach |
Zastąpione przez prompt_cache_options.ttl (obecnie tylko 30m) |
Zmiany wskazują w jednym kierunku: pamięć podręczna wcześniejszych generacji była wolna od opłat za zapisy, ale niekontrolowana, z niepewnym przechowywaniem; GPT-5.6 pobiera opłaty za zapisy, zapewniając jednocześnie gwarantowane minimum przechowywania i precyzyjne kontrole pamięci podręcznej. Zgodnie z stawkami, prefiks użyty więcej niż raz średnio oszczędza więcej niż dodatkowy koszt zapisu; 30-minutowe minimum przechowywania i kontrolowane punkty przerwania sprawiają, że osiągnięcie tego wskaźnika ponownego użycia jest bardziej przewidywalne.
Jak zacząć korzystać z AIHubMix
Wszystkie trzy poziomy są dostępne, z identyfikatorami modeli gpt-5.6-sol, gpt-5.6-terra i gpt-5.6-luna. Pamięć podręczna nie wymaga dodatkowej konfiguracji; kolejne zapytania z tym samym długim prefiksem trafiają do pamięci podręcznej:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Jesteś skrupulatnym asystentem do analizy kwartalnych raportów finansowych... [Statyczne długie instrukcje, >=1024 tokenów]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Podsumuj kluczowe dane w jednym zdaniu."},
],
)
print(completion.usage.prompt_tokens_details)
Wartość usage.prompt_tokens_details.cached_tokens większa niż 0 przy drugim wywołaniu wskazuje na trafienie (zmierzony przykład: cached_tokens: 2816). Aby uzyskać szczegóły dotyczące parametrów, specyfikacji rozliczeń i rozwiązywania problemów z trafieniami, zobacz dokumentację pamięci podręcznej zapytań GPT.
FAQ
Które API mogą wywoływać GPT-5.6 na AIHubMix?
Chat Completions (/v1/chat/completions), Responses (/v1/responses) oraz zgodne z Claude API wiadomości (/v1/messages) mogą wywoływać modele, a wszystkie trzy poziomy są dostępne. Dla pamięci podręcznej zapytań obecnie zalecana jest ścieżka Chat Completions.
Jeśli mój klient nic nie zmienia, co zmienia się w rozliczeniach po aktualizacji do GPT-5.6?
Pamięć podręczna zapytań stosuje się automatycznie domyślnie: zapytania, których prefiks osiąga 1 024 tokeny, ponoszą koszt zapisu w pamięci podręcznej rozliczany w wysokości 1,25x stawki wejściowej, a ponownie użyte prefiksy są rozliczane w wysokości 0,1x stawki odczytu. Aplikacje z wysokim ponownym użyciem prefiksów zazwyczaj mają niższe całkowite koszty; jednorazowe długie zapytania, które nigdy nie ponownie używają prefiksu, mogą wyłączyć pamięć podręczną w trybie jawnym.
Używałem pamięci podręcznej zapytań Claude. Co muszę zmienić, aby przejść na GPT-5.6?
Strategia strukturyzacji zapytań pozostaje taka sama: statyczna treść najpierw, zmieniająca się treść na końcu. Parametry zmieniają się z cache_control na prompt_cache_breakpoint, plus prompt_cache_key; przechowywanie zmienia się z poziomów 5-minutowego/1-godzinnego na gwarantowane minimum 30 minut.
Jak wybrać spośród trzech poziomów GPT-5.6?
Zgodnie z oficjalnym pozycjonowaniem: wybierz Sol do złożonej pracy profesjonalnej i zadań kodowania; wybierz Terra do codziennych obciążeń (wydajność na poziomie GPT-5.5 za połowę ceny); wybierz Lunę do scenariuszy wrażliwych na koszty i o dużej objętości. Wszystkie trzy poziomy mają to samo okno kontekstowe i maksymalny wynik, więc możesz kierować się złożonością zadania.
Oficjalne źródła
Specyfikacje modeli, mechanizmy pamięci podręcznej i stawki rozliczeniowe w tym poście pochodzą z tych oficjalnych źródeł:
- Ogłoszenie GPT-5.6 (OpenAI, 2026-07-09)
- Przewodnik po pamięci podręcznej zapytań OpenAI
- Cennik OpenAI
- Dokumentacja pamięci podręcznej zapytań Anthropic
Powiązana dokumentacja na tej stronie: Pamięć podręczna zapytań GPT · Pamięć podręczna zapytań Claude · Praktyki pamięci podręcznej zapytań
Odwiedź galerię modeli w celu uzyskania informacji o cenach GPT-5.6 lub odkryj więcej opcji integracji w centrum dokumentacji.
Ostatnia aktualizacja: 2026-07-10