OpenAI официально выпустила семью GPT-5.6 9 июля 2026 года. AIHubMix завершил интеграцию всех трех уровней: gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna теперь доступны через Chat Completions и Responses. Выпуск также изменяет механизм кэширования подсказок и его биллинг: записи в кэш теперь выставляются отдельно. В этом посте рассматривается позиционирование трех уровней и подробно описываются изменения в кэшировании.
Что изменяется с тремя уровнями GPT-5.6
GPT-5.6 пересматривает схему наименования: число обозначает поколение модели, в то время как Sol, Terra и Luna — это уровни возможностей, которые могут развиваться независимо. Согласно официальным определениям, Sol является флагманской моделью, Terra — это более доступный уровень с производительностью, сопоставимой с GPT-5.5, а Luna — самый быстрый и самый дешевый уровень.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Официальное позиционирование | Флагманская модель для сложной профессиональной работы | Сбалансированная интеллектуальность и стоимость | Для чувствительных к стоимости рабочих нагрузок |
| Контекстное окно | 1,050,000 | 1,050,000 | 1,050,000 |
| Максимальный вывод | 128,000 | 128,000 | 128,000 |
| Дата окончания знаний | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Приблизительный эквивалент в предыдущем поколении | Уровень без суффикса | мини-уровень | нано-уровень |
Что касается возможностей, официальная позиция: Sol достигает передовых результатов в кодировании, интеллектуальной работе, кибербезопасности и научных задачах, описывается OpenAI как лучшая модель для кодирования на сегодняшний день и устанавливает новые рекорды на Terminal-Bench 2.1 и DeepSWE; Terra соответствует производительности GPT-5.5 за половину цены. Семья добавляет максимальный уровень рассуждений, а API Responses получает возможности программного вызова инструментов и многопользовательские (бета) возможности.
Объяснение обновления механизма кэширования
До GPT-5.6 кэширование подсказок в моделях GPT было полностью автоматическим: префиксы длиной 1,024 токена или более кэшировались автоматически, разработчики не имели контроля над тем, что кэшируется и на сколько долго, а кэши очищались через 5–10 минут бездействия. OpenAI обобщает изменения GPT-5.6 как "более предсказуемое кэширование подсказок", с тремя конкретными пунктами:
- Срок хранения изменяется с "как минимум 5 минут" на "как минимум 30 минут".
prompt_cache_options.ttlв настоящее время поддерживает только"30m"; это гарантированный минимум, а фактический срок хранения может быть больше. - Явные контрольные точки кэша — это новшество. Установка
prompt_cache_breakpointна блок контента фиксирует границу кэша в конце стабильного контента, так что изменения после контрольной точки не аннулируют кэшированный префикс до нее; при установкеprompt_cache_options.modeна"explicit"используются только ручные контрольные точки. prompt_cache_keyпереходит из оптимизации в официальное требование. Начиная с GPT-5.6, параметр должен быть установлен для обеспечения более надежного соответствия кэша; OpenAI рекомендует поддерживать трафик на ключе примерно 15 запросов в минуту.
Как оценить биллинг записи кэша 1.25x
Начиная с GPT-5.6, записи в кэш выставляются по ставке 1.25x от базовой входной ставки, а чтения из кэша — по ставке 0.1x; в предыдущих моделях записи в кэш не имели дополнительной платы. Официальная формулировка (из объявления GPT-5.6): "Для GPT-5.6 и более поздних моделей записи в кэш выставляются по ставке 1.25x от некэшированной входной ставки модели, в то время как чтения из кэша продолжают получать 90% скидку на входные данные кэша."
Математика безубыточности напрямую вытекает из официальных ставок: запись префикса стоит на 0.25x больше, чем отсутствие кэширования, и каждое последующее попадание экономит 0.9x входной ставки: префикс, использованный даже один раз, дает чистую экономию, и чем больше повторное использование, тем больше экономия.
- Рабочие нагрузки, которые явно выигрывают: рабочие процессы агентов с длинными системными подсказками, RAG, который многократно включает длинные справочные материалы, приложения с большими определениями инструментов и многопроцессные разговоры, которые только добавляют сообщения. Эти рабочие нагрузки имеют высокое повторное использование префиксов, поэтому ставка чтения 0.1x доминирует.
- Рабочие нагрузки, за которыми стоит следить: разовые длинные запросы, префикс которых никогда не используется повторно. Автоматическое кэширование включено по умолчанию, поэтому эти запросы несут невозвратную плату за запись 1.25x; установка
prompt_cache_options.modeна"explicit"без установки контрольных точек делает запрос полностью пропускающим кэш и не несущим платы за запись.
Сравнение: кэширование подсказок на GPT-5.6 и Claude
Дизайн кэширования GPT-5.6 совпадает с cache_control Claude по нескольким параметрам, с основной разницей в поведении по умолчанию: GPT кэширует автоматически без необходимости в параметрах, в то время как Claude требует, чтобы кэширование было включено в запрос, либо через верхний уровень cache_control (автоматическая контрольная точка), либо через явные контрольные точки на уровне блока контента.
| Измерение | Семья GPT-5.6 | Семья Claude (все активные модели) |
|---|---|---|
| Активация | Автоматическое кэширование, явные контрольные точки по желанию | Должно быть включено: верхний уровень cache_control автоматическая контрольная точка или явные контрольные точки на уровне блока контента |
| Параметр контрольной точки | prompt_cache_breakpoint (уровень блока контента) |
cache_control (верхний уровень или уровень блока контента) |
| Лимит контрольной точки | Не более 4 новых записей в кэш за запрос | Не более 4 контрольных точек |
| Сохранение кэша | Как минимум 30 минут | 5 минут по умолчанию (обновляется без затрат на каждом попадании), опционально 1 час |
| Биллинг записи кэша | 1.25x входной ставки | 1.25x для 5-минутного уровня, 2x для 1-часового уровня |
| Биллинг чтения кэша | 0.1x входной ставки | 0.1x входной ставки |
| Минимальная длина, подлежащая кэшированию | 1,024 токена | 512–4,096 токенов в зависимости от модели |
| Требование к попаданию | Байтово-идентичные до контрольной точки | Байтово-идентичные до контрольной точки |
Столбец Claude отражает правила, общие для всех активных моделей Claude: 1.25x записи для 5-минутного уровня, 2x для 1-часового уровня и 0.1x чтения применяются единообразно по всей линейке (документация по кэшированию подсказок Anthropic), при этом различия между моделями ограничены минимальной длиной, подлежащей кэшированию; столбец GPT-5.6 взят из руководства по кэшированию подсказок OpenAI.
Лимиты контрольных точек, ставки записи (для соответствующих уровней) и ставки чтения совпадают точно между двумя провайдерами; в практическом плане та же стратегия структурирования подсказок "статический контент сначала, изменяющийся контент в конце" переносится между ними. Стоимость миграции сосредоточена в синтаксисе параметров: GPT использует prompt_cache_breakpoint + prompt_cache_key, Claude использует cache_control.
Одинаковый шаблон кэширования в обоих протоколах
Для одного и того же сценария "кэшировать статическую длинную инструкцию" минимальные реализации в двух протоколах следуют. Примеры используют gpt-5.6-sol и claude-opus-4-8. Оба имеют одинаковую базовую цену входа ($5/M), поэтому эффективные цены за токен, полученные из записей кэша (1.25x) и чтений (0.1x), также идентичны; только синтаксис различается.
Протокол GPT устанавливает prompt_cache_key на верхнем уровне (длинные префиксы кэшируются автоматически, контрольная точка не требуется); протокол Claude устанавливает cache_control на верхнем уровне для включения автоматического кэширования, переключаясь на контрольные точки на уровне блока контента, когда требуется точный контроль над границей кэша:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Статические длинные инструкции, >=1024 токенов]"
},
{
"role": "user",
"content": "Суммируйте ключевые цифры."
}
]
}'
Claude (Сообщения)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Статические длинные инструкции, >=1024 токенов]",
"messages": [
{
"role": "user",
"content": "Суммируйте ключевые цифры."
}
]
}'
Сравнивая два запроса, различия сводятся к: конечной точке (/v1/chat/completions против /v1/messages), заголовкам авторизации (Authorization: Bearer против x-api-key + anthropic-version), параметру кэширования (верхний уровень prompt_cache_key против верхнего уровня cache_control), и Claude требует явный max_tokens. Оба запроса были проверены на aihubmix.com (2026-07-10): gpt-5.6-sol вернул cached_tokens: 2816 при втором вызове; claude-opus-4-8 вернул cache_creation_input_tokens: 3632 при первом вызове и cache_read_input_tokens: 3632 при втором.
Помимо формата запроса, остаются три различия на уровне механизма:
- Активация: GPT кэширует автоматически даже без каких-либо параметров кэширования, при этом
prompt_cache_keyулучшает надежность попадания; Claude требует декларации: контрольная точка на уровне блока контентаcache_controlили автоматический режим верхнего уровняcache_control. - Поля использования: GPT сообщает о чтениях из кэша в
prompt_tokens_details.cached_tokens; Claude сообщает о записях и чтениях отдельно какcache_creation_input_tokensиcache_read_input_tokens, что облегчает независимую проверку записей и попаданий. - Контроль срока службы:
ttlGPT-5.6 в настоящее время поддерживает только"30m"; Claude по умолчанию составляет 5 минут (обновляется без затрат на каждом попадании), с опциональным"ttl": "1h"(записи выставляются по 2x).
Что изменить при переключении моделей между протоколами
Шлюз AIHubMix поддерживает кросс-протокольные вызовы: конечная точка, совместимая с OpenAI, может вызывать модели Claude (cache_control попадает непосредственно в блоки контента формата OpenAI; см. Практика кэширования подсказок), а конечная точка, совместимая с Claude, /v1/messages, может вызывать GPT-5.6 (проверено). При переключении моделей проверьте три вещи:
- Измените
modelна идентификатор целевой модели; - Переключите синтаксис параметров кэширования:
prompt_cache_key/ явные контрольные точки соответствуютcache_controlClaude; - Переключите имена полей использования:
cached_tokensсоответствуетcache_read_input_tokensClaude.
Рекомендуемые пути для кэширования подсказок: модели GPT через Chat Completions (путь с проверкой попаданий в этом посте); модели Claude работают через любой протокол.
Сравнение: GPT-5.6 против более раннего кэширования GPT
| Измерение | До GPT-5.6 | GPT-5.6 и позже |
|---|---|---|
| Записи в кэш | Без дополнительной платы | 1.25x входной ставки |
| Сохранение кэша | Очищается через 5–10 минут бездействия, до 1 часа | Как минимум 30 минут |
| Контроль кэша | Нет | Явные контрольные точки, явный режим, надежное соответствие prompt_cache_key |
| Расширенное сохранение на 24 часа | prompt_cache_retention на некоторых моделях |
Заменено на prompt_cache_options.ttl (в настоящее время только 30m) |
Изменения направлены в одном направлении: кэширование предыдущих поколений было бесплатным, но неконтролируемым, с неопределенным сроком хранения; GPT-5.6 взимает плату за записи, обеспечивая гарантированный минимум хранения и точный контроль кэша. По ставкам, префикс, использованный более одного раза в среднем, экономит больше, чем добавленная стоимость записи; гарантированный минимум хранения в 30 минут и управляемые контрольные точки делают достижение этого уровня повторного использования более предсказуемым.
Начало работы с AIHubMix
Все три уровня активны, с идентификаторами моделей gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna. Кэширование не требует дополнительной настройки; последовательные запросы с одним и тем же длинным префиксом попадают в кэш:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Вы — тщательный помощник по анализу квартальных финансовых отчетов... [Статические длинные инструкции, >=1024 токенов]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Суммируйте ключевые цифры в одном предложении."},
],
)
print(completion.usage.prompt_tokens_details)
Значение usage.prompt_tokens_details.cached_tokens, превышающее 0 при втором вызове, указывает на попадание (измеренный пример: cached_tokens: 2816). Для деталей параметров, специфики биллинга и устранения неполадок попаданий смотрите документацию по кэшированию подсказок GPT.
Часто задаваемые вопросы
Какие API могут вызывать GPT-5.6 на AIHubMix?
Chat Completions (/v1/chat/completions), Responses (/v1/responses) и совместимый с Claude API сообщений (/v1/messages) могут вызывать модели, и все три уровня активны. Для кэширования подсказок в настоящее время рекомендуется использовать Chat Completions.
Если мой клиент ничего не меняет, что изменится в биллинге после обновления до GPT-5.6?
Кэширование подсказок применяется автоматически по умолчанию: запросы, префикс которых достигает 1,024 токенов, несут плату за запись в кэш, выставляемую по ставке 1.25x от входной ставки, а повторно используемые префиксы выставляются по ставке 0.1x. Приложения с высоким повторным использованием префиксов обычно имеют более низкие общие затраты; разовые длинные запросы, которые никогда не используют префикс повторно, могут отключить кэширование с помощью явного режима.
Я использовал кэширование подсказок Claude. Что мне изменить, чтобы перейти на GPT-5.6?
Стратегия структурирования подсказок остается прежней: статический контент сначала, изменяющийся контент в конце. Параметры изменяются с cache_control на prompt_cache_breakpoint, плюс prompt_cache_key; срок хранения изменяется с 5-минутного/1-часового уровней на гарантированный минимум в 30 минут.
Как мне выбрать среди трех уровней GPT-5.6?
Согласно официальному позиционированию: выбирайте Sol для сложной профессиональной работы и задач кодирования; выбирайте Terra для повседневных рабочих нагрузок (производительность на уровне GPT-5.5 за половину цены); выбирайте Luna для чувствительных к стоимости сценариев с высоким объемом. Все три уровня имеют одинаковое контекстное окно и максимальный вывод, поэтому вы можете направлять по сложности задачи.
Официальные ссылки
Спецификации моделей, механизмы кэширования и тарифы на биллинг в этом посте взяты из следующих официальных источников:
- Объявление GPT-5.6 (OpenAI, 2026-07-09)
- Руководство по кэшированию подсказок OpenAI
- Цены OpenAI
- Документация по кэшированию подсказок Anthropic
Связанная документация на этом сайте: Кэширование подсказок GPT · Кэширование подсказок Claude · Практика кэширования подсказок
Посетите галерею моделей для получения информации о ценах на GPT-5.6 или изучите другие варианты интеграции в центре документации.
Последнее обновление: 2026-07-10