OpenAI официално пусна семейството на GPT-5.6 на 9 юли 2026 г. AIHubMix завърши интеграцията на трите нива: gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna вече са налични чрез Chat Completions и Responses. Пускането също така променя механизма за кеширане на запитвания и неговото таксуване: записите в кеша сега се таксуват отделно. Тази публикация обхваща позиционирането на трите нива и разглежда промените в кеширането точка по точка.
Какви промени настъпват с трите нива на GPT-5.6
GPT-5.6 преразглежда схемата за именуване: числото обозначава поколението на модела, докато Sol, Terra и Luna са нива на способности, които могат да се развиват независимо. Според официалните определения, Sol е флагманският модел, Terra е по-нискобюджетно ниво с производителност, сравнима с GPT-5.5, а Luna е най-бързото и най-евтино ниво.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Официално позициониране | Флагмански модел за сложна професионална работа | Баланс между интелигентност и цена | За чувствителни на цена работни натоварвания |
| Контекстен прозорец | 1,050,000 | 1,050,000 | 1,050,000 |
| Максимален изход | 128,000 | 128,000 | 128,000 |
| Краен срок на знание | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Грубо еквивалентен в предишното поколение | Ниво без суфикс | мини ниво | нано ниво |
По отношение на способностите, официалната позиция: Sol постига най-добри резултати в кодиране, интелектуална работа, киберсигурност и научни задачи, описан от OpenAI като най-добрият им модел за кодиране до момента, и поставя нови рекорди на Terminal-Bench 2.1 и DeepSWE; Terra съответства на производителността на GPT-5.5 на половин цена. Семейството добавя максимално ниво на разсъждение, а API за отговори получава програмируемо извикване на инструменти и многоагентни (бета) възможности.
Обяснение на обновлението на механизма за кеширане
Преди GPT-5.6, кеширането на запитвания в моделите GPT беше напълно автоматично: префиксите от 1,024 токена или повече се кешираха автоматично, разработчиците нямаха контрол върху това какво се кешира или за колко дълго, а кешовете се изчистват след 5–10 минути неактивност. OpenAI обобщава промените в GPT-5.6 като "по-предсказуемо кеширане на запитвания", с три конкретни точки:
- Запазването преминава от "възможно най-кратко 5 минути" до "поне 30 минути".
prompt_cache_options.ttlв момента поддържа само"30m"; това е гарантирано минимално време, а действителното запазване може да бъде по-дълго. - Явните точки на прекъсване са нови. Настройването на
prompt_cache_breakpointна блок съдържание фиксира границата на кеша в края на стабилното съдържание, така че промените след точката на прекъсване не анулират кеширания префикс преди нея; сprompt_cache_options.modeзададено на"explicit", се използват само ръчни точки на прекъсване. prompt_cache_keyпреминава от оптимизация към официално изискване. Започвайки с GPT-5.6, параметърът трябва да бъде зададен, за да се осигури по-надеждно съвпадение на кеша; OpenAI препоръчва да се поддържа трафик на ключа около 15 заявки на минута.
Как да оценим таксуването на записите в кеша 1.25x
Започвайки с GPT-5.6, записите в кеша се таксуват на 1.25x от основната входна ставка, а четенето от кеша на 0.1x; при по-ранни модели записите в кеша нямат допълнителна такса. Официалният текст (от анонса на GPT-5.6): "За GPT-5.6 и по-късни модели, записите в кеша се таксуват на 1.25x от некешираната входна ставка на модела, докато четенето от кеша продължава да получава 90% отстъпка за кеширания вход."
Математиката на точката на равновесие следва директно от официалните ставки: записването на префикс струва 0.25x повече от входната ставка, отколкото ако не се кешира, а всяко последващо попадение спестява 0.9x от входната ставка: префикс, използван дори веднъж, произвежда нетна икономия, а колкото повече повторения, толкова по-голяма е икономията.
- Работни натоварвания, които очевидно печелят: работни потоци на агенти с дълги системни запитвания, RAG, което многократно включва дълги референтни материали, приложения, носещи големи определения на инструменти, и многопосочни разговори, които само добавят съобщения. Тези работни натоварвания имат високо повторение на префиксите, така че ставката за четене от 0.1x доминира.
- Работни натоварвания, на които да се внимава: единични дълги заявки, чийто префикс никога не се използва повторно. Автоматичното кеширане е включено по подразбиране, така че тези заявки носят невъзстановима такса за запис от 1.25x; настройването на
prompt_cache_options.modeна"explicit"без задаване на точки на прекъсване прави заявката да пропусне кеша напълно и да не носи такса за запис.
Сравнение: кеширане на запитвания на GPT-5.6 и Claude
Дизайнът на кеширането на GPT-5.6 съвпада с cache_control на Claude в няколко измерения, с основна разлика в поведението по подразбиране: GPT кешира автоматично без необходимост от параметри, докато Claude изисква кеширането да бъде активирано в заявката, или чрез полето на най-високо ниво cache_control (автоматична точка на прекъсване), или чрез явни точки на прекъсване на ниво блок съдържание.
| Измерение | Семейство GPT-5.6 | Семейство Claude (всички активни модели) |
|---|---|---|
| Активиране | Автоматично кеширане, явни точки на прекъсване по избор | Трябва да бъде активирано: автоматична точка на прекъсване на най-високо ниво cache_control или явни точки на прекъсване на ниво блок съдържание |
| Параметър за точка на прекъсване | prompt_cache_breakpoint (ниво на блок съдържание) |
cache_control (на най-високо ниво или на ниво блок съдържание) |
| Ограничение на точките на прекъсване | Максимум 4 нови записи в кеша на заявка | Максимум 4 точки на прекъсване |
| Запазване на кеша | Поне 30 минути | 5 минути по подразбиране (освежава се безплатно при всяко попадение), опционално 1 час |
| Таксуване на записи в кеша | 1.25x входна ставка | 1.25x за 5-минутното ниво, 2x за 1-часовото ниво |
| Таксуване на четене от кеша | 0.1x входна ставка | 0.1x входна ставка |
| Минимална дължина за кеширане | 1,024 токена | 512–4,096 токена в зависимост от модела |
| Изискване за попадение | Идентични байт по байт преди точката на прекъсване | Идентични байт по байт преди точката на прекъсване |
Колоната на Claude отразява правилата, споделени от всички активни модели на Claude: 1.25x записи за 5-минутното ниво, 2x за 1-часовото ниво и 0.1x четения се прилагат равномерно в целия асортимент (Документация за кеширане на запитвания на Anthropic), с разлики на ниво модел, ограничени до минималната дължина за кеширане; колоната на GPT-5.6 идва от Ръководство за кеширане на запитвания на OpenAI.
Ограниченията на точките на прекъсване, ставките за запис (за съответстващите нива) и ставките за четене съвпадат точно между двата доставчика; в практически термини, същата стратегия за структуриране на запитвания "статично съдържание първо, променящо се съдържание последно" се пренася между тях. Разходите за миграция са концентрирани в синтаксиса на параметрите: GPT използва prompt_cache_breakpoint + prompt_cache_key, Claude използва cache_control.
Същият модел на кеширане в двата протокола
За същия сценарий "кеширане на статични дълги инструкции" минималните реализации в двата протокола следват. Примерите използват gpt-5.6-sol и claude-opus-4-8. И двата споделят същата основна входна цена ($5/M), така че ефективните цени на токените, произтичащи от записите в кеша (1.25x) и четенето от кеша (0.1x), също са идентични; само синтаксисът се различава.
Протоколът на GPT задава prompt_cache_key на най-високо ниво (дългите префикси се кешират автоматично, без необходимост от маркер за точка на прекъсване); протоколът на Claude задава cache_control на най-високо ниво, за да активира автоматичното кеширане, преминавайки към точки на прекъсване на ниво блок съдържание, когато е необходима прецизна контрол над границата на кеша:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Статични дълги инструкции, >=1024 токена]"
},
{
"role": "user",
"content": "Обобщете ключовите цифри."
}
]
}'
Claude (Messages)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Статични дълги инструкции, >=1024 токена]",
"messages": [
{
"role": "user",
"content": "Обобщете ключовите цифри."
}
]
}'
Сравнявайки двете заявки, разликите се свеждат до: крайна точка (/v1/chat/completions срещу /v1/messages), заглавия за удостоверяване (Authorization: Bearer срещу x-api-key + anthropic-version), параметър за кеширане (на най-високо ниво prompt_cache_key срещу на най-високо ниво cache_control), и Claude изисква явен max_tokens. И двете заявки бяха проверени срещу aihubmix.com (2026-07-10): gpt-5.6-sol върна cached_tokens: 2816 при второто извикване; claude-opus-4-8 върна cache_creation_input_tokens: 3632 при първото извикване и cache_read_input_tokens: 3632 при второто.
Освен формата на заявката, остават три разлики на ниво механизъм:
- Активиране: GPT кешира автоматично дори без никакви параметри за кеширане, с
prompt_cache_key, подобряваща надеждността на попаденията; Claude изисква декларация: точка на прекъсване на ниво блок съдържаниеcache_controlили автоматичен режим наcache_controlна най-високо ниво. - Полета за употреба: GPT отчита четенето от кеша в
prompt_tokens_details.cached_tokens; Claude отчита записите и четенето отделно катоcache_creation_input_tokensиcache_read_input_tokens, което улеснява независимата проверка на записите и попаденията. - Контрол на продължителността:
ttlна GPT-5.6 в момента поддържа само"30m"; Claude по подразбиране е 5 минути (освежава се безплатно при всяко попадение), с опционално"ttl": "1h"(записите се таксуват на 2x).
Какво да промените при смяна на модели между протоколите
Gateway на AIHubMix поддържа междупротоколните извиквания: съвместимата с OpenAI крайна точка може да извиква модели на Claude (cache_control влиза директно в блоковете на съдържанието в OpenAI формат; вижте Практики за кеширане на запитвания), а съвместимата с Claude крайна точка /v1/messages може да извиква GPT-5.6 (проверено работещо). При смяна на модели, проверете три неща:
- Променете
modelна идентификатора на целевия модел; - Сменете синтаксиса на параметъра за кеширане:
prompt_cache_key/ явни точки на прекъсване съответстват наcache_controlна Claude; - Сменете имената на полетата за употреба:
cached_tokensсъответства наcache_read_input_tokensна Claude.
Препоръчителни пътища за кеширане на запитвания: Модели GPT чрез Chat Completions (пътят за попадение в кеша, проверен в тази публикация); Модели на Claude работят чрез всеки протокол.
Сравнение: GPT-5.6 срещу по-ранно кеширане на GPT
| Измерение | Преди GPT-5.6 | GPT-5.6 и по-късно |
|---|---|---|
| Записи в кеша | Без допълнителна такса | 1.25x входна ставка |
| Запазване на кеша | Изчистване след 5–10 минути неактивност, до 1 час | Поне 30 минути |
| Контрол на кеша | Няма | Явни точки на прекъсване, явен режим, надеждно съвпадение на prompt_cache_key |
| Разширено запазване за 24 часа | prompt_cache_retention на някои модели |
Заменено с prompt_cache_options.ttl (в момента само 30m) |
Промените сочат в една посока: кеширането от предишното поколение беше без такси за запис, но неконтролируемо, с несигурно запазване; GPT-5.6 таксува за записи, като предоставя гарантирано минимално време за запазване и прецизни контроли на кеша. Според ставките, префикс, използван повече от веднъж средно, спестява повече от добавената цена за запис; минималното време за запазване от 30 минути и контролируемите точки на прекъсване правят достигането на този процент на повторение по-предсказуемо.
Започване с AIHubMix
Всички три нива са налични, с идентификатори на модели gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna. Кеширането не изисква допълнителна конфигурация; последователни заявки с един и същ дълъг префикс удрят кеша:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Вие сте внимателен асистент за анализ на тримесечни финансови отчети... [Статични дълги инструкции, >=1024 токена]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Обобщете ключовите цифри в едно изречение."},
],
)
print(completion.usage.prompt_tokens_details)
Стойност greater than 0 на usage.prompt_tokens_details.cached_tokens при второто извикване показва попадение (измерен пример: cached_tokens: 2816). За подробности относно параметрите, спецификите на таксуването и отстраняването на проблеми с попаденията, вижте документацията за кеширане на запитвания на GPT.
Често задавани въпроси
Кои API могат да извикват GPT-5.6 на AIHubMix?
Chat Completions (/v1/chat/completions), Responses (/v1/responses) и съвместимият с Claude API за съобщения (/v1/messages) могат да извикват моделите, и трите нива са налични. За кеширане на запитвания, Chat Completions в момента е препоръчителният път.
Ако моят клиент не променя нищо, какво се променя в таксуването след обновяване до GPT-5.6?
Кеширането на запитвания се прилага автоматично по подразбиране: заявки, чийто префикс достига 1,024 токена, носят елемент за запис в кеша, таксуван на 1.25x от входната ставка, а повторно използваните префикси се таксуват на ставката за четене от 0.1x. Приложения с високо повторение на префиксите обикновено виждат по-ниски общи разходи; единични дълги заявки, които никога не използват повторно префикс, могат да деактивират кеширането с явен режим.
Използвал съм кеширане на запитвания на Claude. Какво трябва да променя, за да мигрирам към GPT-5.6?
Стратегията за структуриране на запитвания остава същата: статично съдържание първо, променящо се съдържание последно. Параметрите се променят от cache_control на prompt_cache_breakpoint, плюс prompt_cache_key; запазването се променя от 5-минутните/1-часовите нива на гарантирано минимално време от 30 минути.
Как да избера между трите нива на GPT-5.6?
Според официалното позициониране: изберете Sol за сложна професионална работа и кодиране; изберете Terra за ежедневни работни натоварвания (производителност на ниво GPT-5.5 на половин цена); изберете Luna за чувствителни на цена, високообемни сценарии. Всички три нива споделят същия контекстен прозорец и максимален изход, така че можете да насочвате по сложност на задачата.
Официални източници
Спецификации на модели, механизми за кеширане и ставки за таксуване в тази публикация идват от тези официални източници:
- Анонс на GPT-5.6 (OpenAI, 2026-07-09)
- Ръководство за кеширане на запитвания на OpenAI
- Ценообразуване на OpenAI
- Документация за кеширане на запитвания на Anthropic
Свързана документация на този сайт: Кеширане на запитвания на GPT · Кеширане на запитвания на Claude · Практики за кеширане на запитвания
Посетете галерията на модели за цени на GPT-5.6 или разгледайте повече опции за интеграция в центъра за документация.
Последно обновление: 2026-07-10