GPT-5.6 Запущено: Пояснення змін у білінгу кешування запитів

31 лип. 2026 р. · AIHubMix · 8 min read · Думка

GPT-5.6 Запущено: Пояснення змін у білінгу кешування запитів

OpenAI офіційно випустила сімейство GPT-5.6 9 липня 2026 року. AIHubMix завершив інтеграцію всіх трьох рівнів: gpt-5.6-sol, gpt-5.6-terra та gpt-5.6-luna тепер доступні через Chat Completions та Responses. Випуск також змінює механізм кешування запитів та його білінг: записи кешу тепер оплачуються окремо. У цьому пості розглядається позиціонування трьох рівнів та поетапно описуються зміни в кешуванні.

Які зміни в трьох рівнях GPT-5.6

GPT-5.6 переглядає схему найменувань: число позначає покоління моделі, тоді як Sol, Terra та Luna є рівнями можливостей, які можуть розвиватися незалежно. Згідно з офіційними визначеннями, Sol є флагманською моделлю, Terra - це рівень з нижчою ціною з продуктивністю, що порівнюється з GPT-5.5, а Luna - це найшвидший, найнижчий за ціною рівень.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
Офіційне позиціонування Флагманська модель для складної професійної роботи Збалансований інтелект і вартість Для чутливих до вартості навантажень
Вікно контексту 1,050,000 1,050,000 1,050,000
Максимальний вихід 128,000 128,000 128,000
Кінцева дата знань 2026-02-16 2026-02-16 2026-02-16
Грубе еквівалент попереднього покоління Рівень без суфікса Рівень mini Рівень nano

Щодо можливостей, офіційна позиція: Sol досягає найсучасніших результатів у кодуванні, знаннєвій роботі, кібербезпеці та наукових завданнях, OpenAI описує його як найкращу модель кодування на сьогодні, і встановлює нові рекорди на Terminal-Bench 2.1 та DeepSWE; Terra відповідає продуктивності GPT-5.5 за половину ціни. Сімейство додає максимальний рівень міркування, а API Responses отримує можливості програмного виклику інструментів та багатокористувацькі (Beta) можливості.

Оновлення механізму кешування, пояснено

Перед GPT-5.6 кешування запитів на моделях GPT було повністю автоматичним: префікси з 1,024 токенів або більше кешувалися автоматично, розробники не мали контролю над тим, що кешується або на який термін, а кеші очищалися після 5–10 хвилин бездіяльності. OpenAI підсумовує зміни GPT-5.6 як "більш передбачуване кешування запитів", з трьома конкретними пунктами:

  1. Тривалість з "як коротко, як 5 хвилин" до "принаймні 30 хвилин". prompt_cache_options.ttl наразі підтримує лише "30m"; це гарантований мінімум, а фактична тривалість може бути довшою.
  2. Явні контрольні точки кешу нові. Встановлення prompt_cache_breakpoint на блок контенту фіксує межу кешу в кінці стабільного контенту, тому зміни після контрольної точки не анулюють кешований префікс перед нею; з prompt_cache_options.mode, встановленим на "explicit", використовуються лише ручні контрольні точки.
  3. prompt_cache_key переходить з оптимізації в офіційну вимогу. Починаючи з GPT-5.6, параметр повинен бути встановлений для забезпечення більш надійного відповідності кешу; OpenAI рекомендує зберігати трафік на ключ приблизно 15 запитів на хвилину.

Як оцінити білінг записів кешу 1.25x

Починаючи з GPT-5.6, записи кешу оплачуються за ставкою 1.25x базової ставки вводу, а читання кешу - за 0.1x; на попередніх моделях записи кешу не мали додаткової плати. Офіційна формулювання (з оголошення GPT-5.6): "Для GPT-5.6 та пізніших моделей записи кешу оплачуються за ставкою 1.25x невикористаної ставки вводу моделі, тоді як читання кешу продовжують отримувати знижку 90% на кешований ввід."

Математика беззбитковості безпосередньо випливає з офіційних ставок: запис префікса коштує на 0.25x більше, ніж не кешування, а кожен наступний хіт економить 0.9x ставки вводу: префікс, що повторно використовується навіть один раз, забезпечує чисту економію, і чим більше повторного використання, тим більша економія.

  • Навантаження, які явно виграють: робочі процеси агентів з довгими системними запитами, RAG, що повторно включає довгі довідкові матеріали, програми, що містять великі визначення інструментів, та багатоповторні розмови, які лише додають повідомлення. Ці навантаження мають високе повторне використання префіксів, тому ставка читання 0.1x домінує.
  • Навантаження, за якими слід спостерігати: одноразові довгі запити, префікс яких ніколи не повторно використовується. Автоматичне кешування включено за замовчуванням, тому ці запити несуть невідшкодовувану плату за запис 1.25x; встановлення prompt_cache_options.mode на "explicit" без встановлення контрольних точок повністю пропускає кеш і не несе плати за запис.

Порівняння: кешування запитів на GPT-5.6 та Claude

Дизайн кешування GPT-5.6 збігається з cache_control Claude за кількома параметрами, з основною різницею в поведінці за замовчуванням: GPT кешує автоматично без необхідності в параметрах, тоді як Claude вимагає, щоб кешування було увімкнено в запиті, або через верхній рівень cache_control (автоматична контрольна точка), або явні контрольні точки на рівні блоку контенту.

Вимірювання Сімейство GPT-5.6 Сімейство Claude (всі активні моделі)
Активація Автоматичне кешування, явні контрольні точки необов'язкові Потрібно увімкнути: верхній рівень cache_control автоматична контрольна точка або явні контрольні точки на рівні блоку контенту
Параметр контрольної точки prompt_cache_breakpoint (рівень блоку контенту) cache_control (верхній рівень або рівень блоку контенту)
Обмеження контрольних точок Не більше 4 нових записів кешу на запит Не більше 4 контрольних точок
Тривалість кешу Принаймні 30 хвилин 5 хвилин за замовчуванням (оновлюється безкоштовно на кожному хіті), необов'язкова 1 година
Білінг записів кешу 1.25x ставка вводу 1.25x для 5-хвилинного рівня, 2x для 1-годинного рівня
Білінг читання кешу 0.1x ставка вводу 0.1x ставка вводу
Мінімальна довжина, що кешується 1,024 токени 512–4,096 токенів в залежності від моделі
Вимога до хіта Байт за байтом ідентичні перед контрольною точкою Байт за байтом ідентичні перед контрольною точкою

Стовпець Claude відображає правила, що діють для всіх активних моделей Claude: 1.25x записи для 5-хвилинного рівня, 2x для 1-годинного рівня, а 0.1x читання застосовуються рівномірно по всьому асортименту (Документація з кешування запитів Anthropic), з відмінностями між моделями, обмеженими лише мінімальною довжиною, що кешується; стовпець GPT-5.6 походить з Посібника з кешування запитів OpenAI.

Обмеження контрольних точок, ставки записів (для відповідних рівнів) та ставки читання точно збігаються між двома постачальниками; в практичному плані та сама стратегія структурування запитів "статичний контент спочатку, змінний контент останнім" переноситься між ними. Вартість міграції зосереджена на синтаксисі параметрів: GPT використовує prompt_cache_breakpoint + prompt_cache_key, Claude використовує cache_control.

Той самий шаблон кешування в обох протоколах

Для одного й того ж сценарію "кешувати статичну довгу інструкцію" мінімальні реалізації в двох протоколах виглядають так. Приклади використовують gpt-5.6-sol та claude-opus-4-8. Обидва мають однакову базову ціну вводу ($5/M), тому ефективні ціни за токен, отримані з записів кешу (1.25x) та читання (0.1x), також ідентичні; лише синтаксис відрізняється.

Протокол GPT встановлює prompt_cache_key на верхньому рівні (довгі префікси кешуються автоматично, контрольна точка не потрібна); протокол Claude встановлює cache_control на верхньому рівні для увімкнення автоматичного кешування, переходячи на контрольні точки на рівні блоку контенту, коли потрібен точний контроль над межею кешу:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[Статичні довгі інструкції, >=1024 токенів]"
      },
      {
        "role": "user",
        "content": "Підсумуйте ключові цифри."
      }
    ]
  }'

Claude (Messages)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[Статичні довгі інструкції, >=1024 токенів]",
    "messages": [
      {
        "role": "user",
        "content": "Підсумуйте ключові цифри."
      }
    ]
  }'

Порівнюючи два запити, відмінності зводяться до: кінцевої точки (/v1/chat/completions проти /v1/messages), заголовків авторизації (Authorization: Bearer проти x-api-key + anthropic-version), параметра кешування (верхній рівень prompt_cache_key проти верхнього рівня cache_control), і Claude вимагає явний max_tokens. Обидва запити були перевірені на aihubmix.com (2026-07-10): gpt-5.6-sol повернув cached_tokens: 2816 на другому виклику; claude-opus-4-8 повернув cache_creation_input_tokens: 3632 на першому виклику та cache_read_input_tokens: 3632 на другому.

Окрім формату запиту, залишаються три механізмові відмінності:

  1. Активація: GPT кешує автоматично навіть без будь-яких параметрів кешування, з prompt_cache_key для покращення надійності хіта; Claude вимагає декларації: контрольна точка на рівні блоку контенту cache_control, або автоматичний режим верхнього рівня cache_control.
  2. Поля використання: GPT звітує про читання кешу в prompt_tokens_details.cached_tokens; Claude звітує про записи та читання окремо як cache_creation_input_tokens та cache_read_input_tokens, що полегшує перевірку записів та хітів незалежно.
  3. Контроль тривалості: ttl GPT-5.6 наразі підтримує лише "30m"; Claude за замовчуванням становить 5 хвилин (оновлюється безкоштовно на кожному хіті), з необов'язковим "ttl": "1h" (записи оплачуються за 2x).

Що змінити при заміні моделей між протоколами

Шлюз AIHubMix підтримує крос-протокольні виклики: кінцева точка, сумісна з OpenAI, може викликати моделі Claude (cache_control безпосередньо переходить у блоки контенту формату OpenAI; див. Практики кешування запитів), а кінцева точка /v1/messages, сумісна з Claude, може викликати GPT-5.6 (перевірено). При заміні моделей перевірте три речі:

  • Змініть model на ID цільової моделі;
  • Переключіть синтаксис параметра кешування: prompt_cache_key / явні контрольні точки відповідають cache_control Claude;
  • Переключіть назви полів використання: cached_tokens відповідає cache_read_input_tokens Claude.

Рекомендовані шляхи для кешування запитів: моделі GPT через Chat Completions (шлях хіта кешу, перевірений у цьому пості); моделі Claude працюють через будь-який протокол.

Порівняння: GPT-5.6 проти попереднього кешування GPT

Вимірювання Перед GPT-5.6 GPT-5.6 та пізніше
Записи кешу Без додаткової плати 1.25x ставка вводу
Тривалість кешу Очищено після 5–10 хвилин бездіяльності, до 1 години Принаймні 30 хвилин
Контроль кешу Відсутній Явні контрольні точки, явний режим, надійне відповідність prompt_cache_key
Подовжена тривалість 24 години prompt_cache_retention на деяких моделях Замінено на prompt_cache_options.ttl (наразі лише 30m)

Зміни вказують в один бік: кешування попереднього покоління було безкоштовним, але неконтрольованим, з невизначеною тривалістю; GPT-5.6 стягує плату за записи, забезпечуючи гарантований мінімум тривалості та точний контроль кешу. За ставками, префікс, що повторно використовується більше одного разу в середньому, економить більше, ніж додаткова вартість запису; гарантований мінімум тривалості 30 хвилин та контрольовані контрольні точки роблять досягнення цього рівня повторного використання більш передбачуваним.

Початок роботи з AIHubMix

Усі три рівні активні, з ID моделей gpt-5.6-sol, gpt-5.6-terra та gpt-5.6-luna. Кешування не вимагає додаткової конфігурації; послідовні запити з однаковим довгим префіксом потрапляють у кеш:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "Ви - ретельний асистент для аналізу квартальних фінансових звітів... [Статичні довгі інструкції, >=1024 токенів]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "Підсумуйте ключові цифри в одному реченні."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

Значення usage.prompt_tokens_details.cached_tokens, що перевищує 0 на другому виклику, вказує на хіт (виміряний приклад: cached_tokens: 2816). Для деталей параметрів, специфіки білінгу та усунення неполадок хітів дивіться документацію з кешування запитів GPT.

Часті запитання

Які API можуть викликати GPT-5.6 на AIHubMix?

Chat Completions (/v1/chat/completions), Responses (/v1/responses) та API Messages, сумісний з Claude (/v1/messages), можуть викликати моделі, і всі три рівні активні. Для кешування запитів наразі рекомендований шлях - Chat Completions.

Якщо мій клієнт нічого не змінює, що зміниться в білінгу після оновлення до GPT-5.6?

Кешування запитів застосовується автоматично за замовчуванням: запити, префікс яких досягає 1,024 токенів, несуть плату за запис кешу, що стягується за 1.25x ставки вводу, а повторно використовувані префікси стягуються за ставкою 0.1x. Застосунки з високим повторним використанням префіксів зазвичай бачать нижчі загальні витрати; одноразові довгі запити, які ніколи не повторно використовують префікс, можуть вимкнути кешування з явним режимом.

Я використовував кешування запитів Claude. Що мені змінити, щоб мігрувати до GPT-5.6?

Стратегія структурування запитів залишається такою ж: спочатку статичний контент, потім змінний контент. Параметри змінюються з cache_control на prompt_cache_breakpoint, плюс prompt_cache_key; тривалість змінюється з 5-хвилинних/1-годинних рівнів на гарантований мінімум 30 хвилин.

Як мені вибрати між трьома рівнями GPT-5.6?

Згідно з офіційним позиціонуванням: виберіть Sol для складної професійної роботи та завдань кодування; виберіть Terra для повсякденних навантажень (продуктивність на рівні GPT-5.5 за половину ціни); виберіть Luna для чутливих до вартості, високих обсягів сценаріїв. Усі три рівні мають однакове вікно контексту та максимальний вихід, тому ви можете маршрутизувати за складністю завдання.

Офіційні посилання

Специфікації моделей, механізми кешування та ставки білінгу в цьому пості походять з цих офіційних джерел:

Супутня документація на цьому сайті: Кешування запитів GPT · Кешування запитів Claude · Практики кешування запитів


Відвідайте галерею моделей для цін на GPT-5.6 або досліджуйте більше варіантів інтеграції в центрі документації.


Останнє оновлення: 2026-07-10

More from the blog