GPT-5.6 е наличен: Обяснение на промените в таксуването на кеширането на запитвания

31.07.2026 г. · AIHubMix · 8 min read · Мнение

GPT-5.6 е наличен: Обяснение на промените в таксуването на кеширането на запитвания

OpenAI официално пусна семейството на GPT-5.6 на 9 юли 2026 г. AIHubMix завърши интеграцията на трите нива: gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna вече са налични чрез Chat Completions и Responses. Пускането също така променя механизма за кеширане на запитвания и неговото таксуване: записите в кеша сега се таксуват отделно. Тази публикация обхваща позиционирането на трите нива и разглежда промените в кеширането точка по точка.

Какви промени настъпват с трите нива на GPT-5.6

GPT-5.6 преразглежда схемата за именуване: числото обозначава поколението на модела, докато Sol, Terra и Luna са нива на способности, които могат да се развиват независимо. Според официалните определения, Sol е флагманският модел, Terra е по-нискобюджетно ниво с производителност, сравнима с GPT-5.5, а Luna е най-бързото и най-евтино ниво.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
Официално позициониране Флагмански модел за сложна професионална работа Баланс между интелигентност и цена За чувствителни на цена работни натоварвания
Контекстен прозорец 1,050,000 1,050,000 1,050,000
Максимален изход 128,000 128,000 128,000
Краен срок на знание 2026-02-16 2026-02-16 2026-02-16
Грубо еквивалентен в предишното поколение Ниво без суфикс мини ниво нано ниво

По отношение на способностите, официалната позиция: Sol постига най-добри резултати в кодиране, интелектуална работа, киберсигурност и научни задачи, описан от OpenAI като най-добрият им модел за кодиране до момента, и поставя нови рекорди на Terminal-Bench 2.1 и DeepSWE; Terra съответства на производителността на GPT-5.5 на половин цена. Семейството добавя максимално ниво на разсъждение, а API за отговори получава програмируемо извикване на инструменти и многоагентни (бета) възможности.

Обяснение на обновлението на механизма за кеширане

Преди GPT-5.6, кеширането на запитвания в моделите GPT беше напълно автоматично: префиксите от 1,024 токена или повече се кешираха автоматично, разработчиците нямаха контрол върху това какво се кешира или за колко дълго, а кешовете се изчистват след 5–10 минути неактивност. OpenAI обобщава промените в GPT-5.6 като "по-предсказуемо кеширане на запитвания", с три конкретни точки:

  1. Запазването преминава от "възможно най-кратко 5 минути" до "поне 30 минути". prompt_cache_options.ttl в момента поддържа само "30m"; това е гарантирано минимално време, а действителното запазване може да бъде по-дълго.
  2. Явните точки на прекъсване са нови. Настройването на prompt_cache_breakpoint на блок съдържание фиксира границата на кеша в края на стабилното съдържание, така че промените след точката на прекъсване не анулират кеширания префикс преди нея; с prompt_cache_options.mode зададено на "explicit", се използват само ръчни точки на прекъсване.
  3. prompt_cache_key преминава от оптимизация към официално изискване. Започвайки с GPT-5.6, параметърът трябва да бъде зададен, за да се осигури по-надеждно съвпадение на кеша; OpenAI препоръчва да се поддържа трафик на ключа около 15 заявки на минута.

Как да оценим таксуването на записите в кеша 1.25x

Започвайки с GPT-5.6, записите в кеша се таксуват на 1.25x от основната входна ставка, а четенето от кеша на 0.1x; при по-ранни модели записите в кеша нямат допълнителна такса. Официалният текст (от анонса на GPT-5.6): "За GPT-5.6 и по-късни модели, записите в кеша се таксуват на 1.25x от некешираната входна ставка на модела, докато четенето от кеша продължава да получава 90% отстъпка за кеширания вход."

Математиката на точката на равновесие следва директно от официалните ставки: записването на префикс струва 0.25x повече от входната ставка, отколкото ако не се кешира, а всяко последващо попадение спестява 0.9x от входната ставка: префикс, използван дори веднъж, произвежда нетна икономия, а колкото повече повторения, толкова по-голяма е икономията.

  • Работни натоварвания, които очевидно печелят: работни потоци на агенти с дълги системни запитвания, RAG, което многократно включва дълги референтни материали, приложения, носещи големи определения на инструменти, и многопосочни разговори, които само добавят съобщения. Тези работни натоварвания имат високо повторение на префиксите, така че ставката за четене от 0.1x доминира.
  • Работни натоварвания, на които да се внимава: единични дълги заявки, чийто префикс никога не се използва повторно. Автоматичното кеширане е включено по подразбиране, така че тези заявки носят невъзстановима такса за запис от 1.25x; настройването на prompt_cache_options.mode на "explicit" без задаване на точки на прекъсване прави заявката да пропусне кеша напълно и да не носи такса за запис.

Сравнение: кеширане на запитвания на GPT-5.6 и Claude

Дизайнът на кеширането на GPT-5.6 съвпада с cache_control на Claude в няколко измерения, с основна разлика в поведението по подразбиране: GPT кешира автоматично без необходимост от параметри, докато Claude изисква кеширането да бъде активирано в заявката, или чрез полето на най-високо ниво cache_control (автоматична точка на прекъсване), или чрез явни точки на прекъсване на ниво блок съдържание.

Измерение Семейство GPT-5.6 Семейство Claude (всички активни модели)
Активиране Автоматично кеширане, явни точки на прекъсване по избор Трябва да бъде активирано: автоматична точка на прекъсване на най-високо ниво cache_control или явни точки на прекъсване на ниво блок съдържание
Параметър за точка на прекъсване prompt_cache_breakpoint (ниво на блок съдържание) cache_control (на най-високо ниво или на ниво блок съдържание)
Ограничение на точките на прекъсване Максимум 4 нови записи в кеша на заявка Максимум 4 точки на прекъсване
Запазване на кеша Поне 30 минути 5 минути по подразбиране (освежава се безплатно при всяко попадение), опционално 1 час
Таксуване на записи в кеша 1.25x входна ставка 1.25x за 5-минутното ниво, 2x за 1-часовото ниво
Таксуване на четене от кеша 0.1x входна ставка 0.1x входна ставка
Минимална дължина за кеширане 1,024 токена 512–4,096 токена в зависимост от модела
Изискване за попадение Идентични байт по байт преди точката на прекъсване Идентични байт по байт преди точката на прекъсване

Колоната на Claude отразява правилата, споделени от всички активни модели на Claude: 1.25x записи за 5-минутното ниво, 2x за 1-часовото ниво и 0.1x четения се прилагат равномерно в целия асортимент (Документация за кеширане на запитвания на Anthropic), с разлики на ниво модел, ограничени до минималната дължина за кеширане; колоната на GPT-5.6 идва от Ръководство за кеширане на запитвания на OpenAI.

Ограниченията на точките на прекъсване, ставките за запис (за съответстващите нива) и ставките за четене съвпадат точно между двата доставчика; в практически термини, същата стратегия за структуриране на запитвания "статично съдържание първо, променящо се съдържание последно" се пренася между тях. Разходите за миграция са концентрирани в синтаксиса на параметрите: GPT използва prompt_cache_breakpoint + prompt_cache_key, Claude използва cache_control.

Същият модел на кеширане в двата протокола

За същия сценарий "кеширане на статични дълги инструкции" минималните реализации в двата протокола следват. Примерите използват gpt-5.6-sol и claude-opus-4-8. И двата споделят същата основна входна цена ($5/M), така че ефективните цени на токените, произтичащи от записите в кеша (1.25x) и четенето от кеша (0.1x), също са идентични; само синтаксисът се различава.

Протоколът на GPT задава prompt_cache_key на най-високо ниво (дългите префикси се кешират автоматично, без необходимост от маркер за точка на прекъсване); протоколът на Claude задава cache_control на най-високо ниво, за да активира автоматичното кеширане, преминавайки към точки на прекъсване на ниво блок съдържание, когато е необходима прецизна контрол над границата на кеша:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[Статични дълги инструкции, >=1024 токена]"
      },
      {
        "role": "user",
        "content": "Обобщете ключовите цифри."
      }
    ]
  }'

Claude (Messages)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[Статични дълги инструкции, >=1024 токена]",
    "messages": [
      {
        "role": "user",
        "content": "Обобщете ключовите цифри."
      }
    ]
  }'

Сравнявайки двете заявки, разликите се свеждат до: крайна точка (/v1/chat/completions срещу /v1/messages), заглавия за удостоверяване (Authorization: Bearer срещу x-api-key + anthropic-version), параметър за кеширане (на най-високо ниво prompt_cache_key срещу на най-високо ниво cache_control), и Claude изисква явен max_tokens. И двете заявки бяха проверени срещу aihubmix.com (2026-07-10): gpt-5.6-sol върна cached_tokens: 2816 при второто извикване; claude-opus-4-8 върна cache_creation_input_tokens: 3632 при първото извикване и cache_read_input_tokens: 3632 при второто.

Освен формата на заявката, остават три разлики на ниво механизъм:

  1. Активиране: GPT кешира автоматично дори без никакви параметри за кеширане, с prompt_cache_key, подобряваща надеждността на попаденията; Claude изисква декларация: точка на прекъсване на ниво блок съдържание cache_control или автоматичен режим на cache_control на най-високо ниво.
  2. Полета за употреба: GPT отчита четенето от кеша в prompt_tokens_details.cached_tokens; Claude отчита записите и четенето отделно като cache_creation_input_tokens и cache_read_input_tokens, което улеснява независимата проверка на записите и попаденията.
  3. Контрол на продължителността: ttl на GPT-5.6 в момента поддържа само "30m"; Claude по подразбиране е 5 минути (освежава се безплатно при всяко попадение), с опционално "ttl": "1h" (записите се таксуват на 2x).

Какво да промените при смяна на модели между протоколите

Gateway на AIHubMix поддържа междупротоколните извиквания: съвместимата с OpenAI крайна точка може да извиква модели на Claude (cache_control влиза директно в блоковете на съдържанието в OpenAI формат; вижте Практики за кеширане на запитвания), а съвместимата с Claude крайна точка /v1/messages може да извиква GPT-5.6 (проверено работещо). При смяна на модели, проверете три неща:

  • Променете model на идентификатора на целевия модел;
  • Сменете синтаксиса на параметъра за кеширане: prompt_cache_key / явни точки на прекъсване съответстват на cache_control на Claude;
  • Сменете имената на полетата за употреба: cached_tokens съответства на cache_read_input_tokens на Claude.

Препоръчителни пътища за кеширане на запитвания: Модели GPT чрез Chat Completions (пътят за попадение в кеша, проверен в тази публикация); Модели на Claude работят чрез всеки протокол.

Сравнение: GPT-5.6 срещу по-ранно кеширане на GPT

Измерение Преди GPT-5.6 GPT-5.6 и по-късно
Записи в кеша Без допълнителна такса 1.25x входна ставка
Запазване на кеша Изчистване след 5–10 минути неактивност, до 1 час Поне 30 минути
Контрол на кеша Няма Явни точки на прекъсване, явен режим, надеждно съвпадение на prompt_cache_key
Разширено запазване за 24 часа prompt_cache_retention на някои модели Заменено с prompt_cache_options.ttl (в момента само 30m)

Промените сочат в една посока: кеширането от предишното поколение беше без такси за запис, но неконтролируемо, с несигурно запазване; GPT-5.6 таксува за записи, като предоставя гарантирано минимално време за запазване и прецизни контроли на кеша. Според ставките, префикс, използван повече от веднъж средно, спестява повече от добавената цена за запис; минималното време за запазване от 30 минути и контролируемите точки на прекъсване правят достигането на този процент на повторение по-предсказуемо.

Започване с AIHubMix

Всички три нива са налични, с идентификатори на модели gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna. Кеширането не изисква допълнителна конфигурация; последователни заявки с един и същ дълъг префикс удрят кеша:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "Вие сте внимателен асистент за анализ на тримесечни финансови отчети... [Статични дълги инструкции, >=1024 токена]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "Обобщете ключовите цифри в едно изречение."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

Стойност greater than 0 на usage.prompt_tokens_details.cached_tokens при второто извикване показва попадение (измерен пример: cached_tokens: 2816). За подробности относно параметрите, спецификите на таксуването и отстраняването на проблеми с попаденията, вижте документацията за кеширане на запитвания на GPT.

Често задавани въпроси

Кои API могат да извикват GPT-5.6 на AIHubMix?

Chat Completions (/v1/chat/completions), Responses (/v1/responses) и съвместимият с Claude API за съобщения (/v1/messages) могат да извикват моделите, и трите нива са налични. За кеширане на запитвания, Chat Completions в момента е препоръчителният път.

Ако моят клиент не променя нищо, какво се променя в таксуването след обновяване до GPT-5.6?

Кеширането на запитвания се прилага автоматично по подразбиране: заявки, чийто префикс достига 1,024 токена, носят елемент за запис в кеша, таксуван на 1.25x от входната ставка, а повторно използваните префикси се таксуват на ставката за четене от 0.1x. Приложения с високо повторение на префиксите обикновено виждат по-ниски общи разходи; единични дълги заявки, които никога не използват повторно префикс, могат да деактивират кеширането с явен режим.

Използвал съм кеширане на запитвания на Claude. Какво трябва да променя, за да мигрирам към GPT-5.6?

Стратегията за структуриране на запитвания остава същата: статично съдържание първо, променящо се съдържание последно. Параметрите се променят от cache_control на prompt_cache_breakpoint, плюс prompt_cache_key; запазването се променя от 5-минутните/1-часовите нива на гарантирано минимално време от 30 минути.

Как да избера между трите нива на GPT-5.6?

Според официалното позициониране: изберете Sol за сложна професионална работа и кодиране; изберете Terra за ежедневни работни натоварвания (производителност на ниво GPT-5.5 на половин цена); изберете Luna за чувствителни на цена, високообемни сценарии. Всички три нива споделят същия контекстен прозорец и максимален изход, така че можете да насочвате по сложност на задачата.

Официални източници

Спецификации на модели, механизми за кеширане и ставки за таксуване в тази публикация идват от тези официални източници:

Свързана документация на този сайт: Кеширане на запитвания на GPT · Кеширане на запитвания на Claude · Практики за кеширане на запитвания


Посетете галерията на модели за цени на GPT-5.6 или разгледайте повече опции за интеграция в центъра за документация.


Последно обновление: 2026-07-10

More from the blog