GPT-5.6 запущен: изменения в биллинге кэширования подсказок

31 июл. 2026 г. · AIHubMix · 8 min read · Мнение

GPT-5.6 запущен: изменения в биллинге кэширования подсказок

OpenAI официально выпустила семью GPT-5.6 9 июля 2026 года. AIHubMix завершил интеграцию всех трех уровней: gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna теперь доступны через Chat Completions и Responses. Выпуск также изменяет механизм кэширования подсказок и его биллинг: записи в кэш теперь выставляются отдельно. В этом посте рассматривается позиционирование трех уровней и подробно описываются изменения в кэшировании.

Что изменяется с тремя уровнями GPT-5.6

GPT-5.6 пересматривает схему наименования: число обозначает поколение модели, в то время как Sol, Terra и Luna — это уровни возможностей, которые могут развиваться независимо. Согласно официальным определениям, Sol является флагманской моделью, Terra — это более доступный уровень с производительностью, сопоставимой с GPT-5.5, а Luna — самый быстрый и самый дешевый уровень.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
Официальное позиционирование Флагманская модель для сложной профессиональной работы Сбалансированная интеллектуальность и стоимость Для чувствительных к стоимости рабочих нагрузок
Контекстное окно 1,050,000 1,050,000 1,050,000
Максимальный вывод 128,000 128,000 128,000
Дата окончания знаний 2026-02-16 2026-02-16 2026-02-16
Приблизительный эквивалент в предыдущем поколении Уровень без суффикса мини-уровень нано-уровень

Что касается возможностей, официальная позиция: Sol достигает передовых результатов в кодировании, интеллектуальной работе, кибербезопасности и научных задачах, описывается OpenAI как лучшая модель для кодирования на сегодняшний день и устанавливает новые рекорды на Terminal-Bench 2.1 и DeepSWE; Terra соответствует производительности GPT-5.5 за половину цены. Семья добавляет максимальный уровень рассуждений, а API Responses получает возможности программного вызова инструментов и многопользовательские (бета) возможности.

Объяснение обновления механизма кэширования

До GPT-5.6 кэширование подсказок в моделях GPT было полностью автоматическим: префиксы длиной 1,024 токена или более кэшировались автоматически, разработчики не имели контроля над тем, что кэшируется и на сколько долго, а кэши очищались через 5–10 минут бездействия. OpenAI обобщает изменения GPT-5.6 как "более предсказуемое кэширование подсказок", с тремя конкретными пунктами:

  1. Срок хранения изменяется с "как минимум 5 минут" на "как минимум 30 минут". prompt_cache_options.ttl в настоящее время поддерживает только "30m"; это гарантированный минимум, а фактический срок хранения может быть больше.
  2. Явные контрольные точки кэша — это новшество. Установка prompt_cache_breakpoint на блок контента фиксирует границу кэша в конце стабильного контента, так что изменения после контрольной точки не аннулируют кэшированный префикс до нее; при установке prompt_cache_options.mode на "explicit" используются только ручные контрольные точки.
  3. prompt_cache_key переходит из оптимизации в официальное требование. Начиная с GPT-5.6, параметр должен быть установлен для обеспечения более надежного соответствия кэша; OpenAI рекомендует поддерживать трафик на ключе примерно 15 запросов в минуту.

Как оценить биллинг записи кэша 1.25x

Начиная с GPT-5.6, записи в кэш выставляются по ставке 1.25x от базовой входной ставки, а чтения из кэша — по ставке 0.1x; в предыдущих моделях записи в кэш не имели дополнительной платы. Официальная формулировка (из объявления GPT-5.6): "Для GPT-5.6 и более поздних моделей записи в кэш выставляются по ставке 1.25x от некэшированной входной ставки модели, в то время как чтения из кэша продолжают получать 90% скидку на входные данные кэша."

Математика безубыточности напрямую вытекает из официальных ставок: запись префикса стоит на 0.25x больше, чем отсутствие кэширования, и каждое последующее попадание экономит 0.9x входной ставки: префикс, использованный даже один раз, дает чистую экономию, и чем больше повторное использование, тем больше экономия.

  • Рабочие нагрузки, которые явно выигрывают: рабочие процессы агентов с длинными системными подсказками, RAG, который многократно включает длинные справочные материалы, приложения с большими определениями инструментов и многопроцессные разговоры, которые только добавляют сообщения. Эти рабочие нагрузки имеют высокое повторное использование префиксов, поэтому ставка чтения 0.1x доминирует.
  • Рабочие нагрузки, за которыми стоит следить: разовые длинные запросы, префикс которых никогда не используется повторно. Автоматическое кэширование включено по умолчанию, поэтому эти запросы несут невозвратную плату за запись 1.25x; установка prompt_cache_options.mode на "explicit" без установки контрольных точек делает запрос полностью пропускающим кэш и не несущим платы за запись.

Сравнение: кэширование подсказок на GPT-5.6 и Claude

Дизайн кэширования GPT-5.6 совпадает с cache_control Claude по нескольким параметрам, с основной разницей в поведении по умолчанию: GPT кэширует автоматически без необходимости в параметрах, в то время как Claude требует, чтобы кэширование было включено в запрос, либо через верхний уровень cache_control (автоматическая контрольная точка), либо через явные контрольные точки на уровне блока контента.

Измерение Семья GPT-5.6 Семья Claude (все активные модели)
Активация Автоматическое кэширование, явные контрольные точки по желанию Должно быть включено: верхний уровень cache_control автоматическая контрольная точка или явные контрольные точки на уровне блока контента
Параметр контрольной точки prompt_cache_breakpoint (уровень блока контента) cache_control (верхний уровень или уровень блока контента)
Лимит контрольной точки Не более 4 новых записей в кэш за запрос Не более 4 контрольных точек
Сохранение кэша Как минимум 30 минут 5 минут по умолчанию (обновляется без затрат на каждом попадании), опционально 1 час
Биллинг записи кэша 1.25x входной ставки 1.25x для 5-минутного уровня, 2x для 1-часового уровня
Биллинг чтения кэша 0.1x входной ставки 0.1x входной ставки
Минимальная длина, подлежащая кэшированию 1,024 токена 512–4,096 токенов в зависимости от модели
Требование к попаданию Байтово-идентичные до контрольной точки Байтово-идентичные до контрольной точки

Столбец Claude отражает правила, общие для всех активных моделей Claude: 1.25x записи для 5-минутного уровня, 2x для 1-часового уровня и 0.1x чтения применяются единообразно по всей линейке (документация по кэшированию подсказок Anthropic), при этом различия между моделями ограничены минимальной длиной, подлежащей кэшированию; столбец GPT-5.6 взят из руководства по кэшированию подсказок OpenAI.

Лимиты контрольных точек, ставки записи (для соответствующих уровней) и ставки чтения совпадают точно между двумя провайдерами; в практическом плане та же стратегия структурирования подсказок "статический контент сначала, изменяющийся контент в конце" переносится между ними. Стоимость миграции сосредоточена в синтаксисе параметров: GPT использует prompt_cache_breakpoint + prompt_cache_key, Claude использует cache_control.

Одинаковый шаблон кэширования в обоих протоколах

Для одного и того же сценария "кэшировать статическую длинную инструкцию" минимальные реализации в двух протоколах следуют. Примеры используют gpt-5.6-sol и claude-opus-4-8. Оба имеют одинаковую базовую цену входа ($5/M), поэтому эффективные цены за токен, полученные из записей кэша (1.25x) и чтений (0.1x), также идентичны; только синтаксис различается.

Протокол GPT устанавливает prompt_cache_key на верхнем уровне (длинные префиксы кэшируются автоматически, контрольная точка не требуется); протокол Claude устанавливает cache_control на верхнем уровне для включения автоматического кэширования, переключаясь на контрольные точки на уровне блока контента, когда требуется точный контроль над границей кэша:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[Статические длинные инструкции, >=1024 токенов]"
      },
      {
        "role": "user",
        "content": "Суммируйте ключевые цифры."
      }
    ]
  }'

Claude (Сообщения)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[Статические длинные инструкции, >=1024 токенов]",
    "messages": [
      {
        "role": "user",
        "content": "Суммируйте ключевые цифры."
      }
    ]
  }'

Сравнивая два запроса, различия сводятся к: конечной точке (/v1/chat/completions против /v1/messages), заголовкам авторизации (Authorization: Bearer против x-api-key + anthropic-version), параметру кэширования (верхний уровень prompt_cache_key против верхнего уровня cache_control), и Claude требует явный max_tokens. Оба запроса были проверены на aihubmix.com (2026-07-10): gpt-5.6-sol вернул cached_tokens: 2816 при втором вызове; claude-opus-4-8 вернул cache_creation_input_tokens: 3632 при первом вызове и cache_read_input_tokens: 3632 при втором.

Помимо формата запроса, остаются три различия на уровне механизма:

  1. Активация: GPT кэширует автоматически даже без каких-либо параметров кэширования, при этом prompt_cache_key улучшает надежность попадания; Claude требует декларации: контрольная точка на уровне блока контента cache_control или автоматический режим верхнего уровня cache_control.
  2. Поля использования: GPT сообщает о чтениях из кэша в prompt_tokens_details.cached_tokens; Claude сообщает о записях и чтениях отдельно как cache_creation_input_tokens и cache_read_input_tokens, что облегчает независимую проверку записей и попаданий.
  3. Контроль срока службы: ttl GPT-5.6 в настоящее время поддерживает только "30m"; Claude по умолчанию составляет 5 минут (обновляется без затрат на каждом попадании), с опциональным "ttl": "1h" (записи выставляются по 2x).

Что изменить при переключении моделей между протоколами

Шлюз AIHubMix поддерживает кросс-протокольные вызовы: конечная точка, совместимая с OpenAI, может вызывать модели Claude (cache_control попадает непосредственно в блоки контента формата OpenAI; см. Практика кэширования подсказок), а конечная точка, совместимая с Claude, /v1/messages, может вызывать GPT-5.6 (проверено). При переключении моделей проверьте три вещи:

  • Измените model на идентификатор целевой модели;
  • Переключите синтаксис параметров кэширования: prompt_cache_key / явные контрольные точки соответствуют cache_control Claude;
  • Переключите имена полей использования: cached_tokens соответствует cache_read_input_tokens Claude.

Рекомендуемые пути для кэширования подсказок: модели GPT через Chat Completions (путь с проверкой попаданий в этом посте); модели Claude работают через любой протокол.

Сравнение: GPT-5.6 против более раннего кэширования GPT

Измерение До GPT-5.6 GPT-5.6 и позже
Записи в кэш Без дополнительной платы 1.25x входной ставки
Сохранение кэша Очищается через 5–10 минут бездействия, до 1 часа Как минимум 30 минут
Контроль кэша Нет Явные контрольные точки, явный режим, надежное соответствие prompt_cache_key
Расширенное сохранение на 24 часа prompt_cache_retention на некоторых моделях Заменено на prompt_cache_options.ttl (в настоящее время только 30m)

Изменения направлены в одном направлении: кэширование предыдущих поколений было бесплатным, но неконтролируемым, с неопределенным сроком хранения; GPT-5.6 взимает плату за записи, обеспечивая гарантированный минимум хранения и точный контроль кэша. По ставкам, префикс, использованный более одного раза в среднем, экономит больше, чем добавленная стоимость записи; гарантированный минимум хранения в 30 минут и управляемые контрольные точки делают достижение этого уровня повторного использования более предсказуемым.

Начало работы с AIHubMix

Все три уровня активны, с идентификаторами моделей gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna. Кэширование не требует дополнительной настройки; последовательные запросы с одним и тем же длинным префиксом попадают в кэш:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "Вы — тщательный помощник по анализу квартальных финансовых отчетов... [Статические длинные инструкции, >=1024 токенов]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "Суммируйте ключевые цифры в одном предложении."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

Значение usage.prompt_tokens_details.cached_tokens, превышающее 0 при втором вызове, указывает на попадание (измеренный пример: cached_tokens: 2816). Для деталей параметров, специфики биллинга и устранения неполадок попаданий смотрите документацию по кэшированию подсказок GPT.

Часто задаваемые вопросы

Какие API могут вызывать GPT-5.6 на AIHubMix?

Chat Completions (/v1/chat/completions), Responses (/v1/responses) и совместимый с Claude API сообщений (/v1/messages) могут вызывать модели, и все три уровня активны. Для кэширования подсказок в настоящее время рекомендуется использовать Chat Completions.

Если мой клиент ничего не меняет, что изменится в биллинге после обновления до GPT-5.6?

Кэширование подсказок применяется автоматически по умолчанию: запросы, префикс которых достигает 1,024 токенов, несут плату за запись в кэш, выставляемую по ставке 1.25x от входной ставки, а повторно используемые префиксы выставляются по ставке 0.1x. Приложения с высоким повторным использованием префиксов обычно имеют более низкие общие затраты; разовые длинные запросы, которые никогда не используют префикс повторно, могут отключить кэширование с помощью явного режима.

Я использовал кэширование подсказок Claude. Что мне изменить, чтобы перейти на GPT-5.6?

Стратегия структурирования подсказок остается прежней: статический контент сначала, изменяющийся контент в конце. Параметры изменяются с cache_control на prompt_cache_breakpoint, плюс prompt_cache_key; срок хранения изменяется с 5-минутного/1-часового уровней на гарантированный минимум в 30 минут.

Как мне выбрать среди трех уровней GPT-5.6?

Согласно официальному позиционированию: выбирайте Sol для сложной профессиональной работы и задач кодирования; выбирайте Terra для повседневных рабочих нагрузок (производительность на уровне GPT-5.5 за половину цены); выбирайте Luna для чувствительных к стоимости сценариев с высоким объемом. Все три уровня имеют одинаковое контекстное окно и максимальный вывод, поэтому вы можете направлять по сложности задачи.

Официальные ссылки

Спецификации моделей, механизмы кэширования и тарифы на биллинг в этом посте взяты из следующих официальных источников:

Связанная документация на этом сайте: Кэширование подсказок GPT · Кэширование подсказок Claude · Практика кэширования подсказок


Посетите галерею моделей для получения информации о ценах на GPT-5.6 или изучите другие варианты интеграции в центре документации.


Последнее обновление: 2026-07-10

More from the blog