GPT-5.6が登場:プロンプトキャッシングの請求変更について解説

2026年7月31日 · AIHubMix · 8 min read · 意見

GPT-5.6が登場:プロンプトキャッシングの請求変更について解説

OpenAIは2026年7月9日にGPT-5.6ファミリーを正式にリリースしました。AIHubMixは、すべての3つのティアの統合を完了しました:gpt-5.6-solgpt-5.6-terra、およびgpt-5.6-lunaは、チャット完了および応答を通じて利用可能です。このリリースでは、プロンプトキャッシングメカニズムとその請求も変更され、キャッシュ書き込みは別途請求されるようになりました。この投稿では、3つのティアの位置付けを説明し、キャッシングの変更点をポイントごとに解説します。

3つのGPT-5.6ティアでの変更点

GPT-5.6は命名スキームを改訂しました:数字はモデルの世代を示し、Sol、Terra、Lunaは独立して進化できる能力ティアです。公式の定義によれば、Solはフラッグシップモデルで、TerraはGPT-5.5に匹敵するパフォーマンスを持つ低価格ティア、Lunaは最も速く、最も低価格のティアです。

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
公式の位置付け 複雑な専門作業のためのフラッグシップモデル バランスの取れた知性とコスト コストに敏感なワークロード向け
コンテキストウィンドウ 1,050,000 1,050,000 1,050,000
最大出力 128,000 128,000 128,000
知識のカットオフ 2026-02-16 2026-02-16 2026-02-16
前世代での大まかな相当 ノーサフィックスティア ミニティア ナノティア

能力に関して、公式の位置付けは次の通りです:Solはコーディング、知識作業、サイバーセキュリティ、科学タスクで最先端の結果を達成し、OpenAIによってこれまでの最良のコーディングモデルと説明され、Terminal-Bench 2.1およびDeepSWEで新記録を樹立しています;TerraはGPT-5.5のパフォーマンスを半額で提供します。このファミリーは最大推論レベルを追加し、Responses APIはプログラム的ツール呼び出しおよびマルチエージェント(ベータ)機能を獲得します。

キャッシングメカニズムのアップグレードについて

GPT-5.6以前は、GPTモデルのプロンプトキャッシングは完全に自動でした:1,024トークン以上のプレフィックスは自動的にキャッシュされ、開発者はキャッシュされる内容やその期間を制御できず、キャッシュは5〜10分の非活動後にクリアされました。OpenAIはGPT-5.6の変更を「より予測可能なプロンプトキャッシング」と要約しており、具体的なポイントは次の3つです:

  1. 保持期間が「最短5分」から「少なくとも30分」に移行prompt_cache_options.ttlは現在"30m"のみをサポートしており、これは保証された最小値であり、実際の保持期間はそれ以上になる可能性があります。
  2. 明示的なキャッシュブレークポイントが新たに追加。コンテンツブロックにprompt_cache_breakpointを設定すると、安定したコンテンツの終わりでキャッシュ境界が固定されるため、ブレークポイント以降の変更はそれ以前のキャッシュされたプレフィックスを無効にしません;prompt_cache_options.mode"explicit"に設定されている場合、手動ブレークポイントのみが使用されます。
  3. prompt_cache_keyが最適化から公式要件に移行。GPT-5.6以降、このパラメータはより信頼性の高いキャッシュマッチングを有効にするために設定する必要があります;OpenAIは、キーごとのトラフィックを約15リクエスト/分に保つことを推奨しています。

1.25倍のキャッシュ書き込み請求を評価する方法

GPT-5.6以降、キャッシュ書き込みは基本入力レートの1.25倍で請求され、キャッシュ読み取りは0.1倍です;以前のモデルでは、キャッシュ書き込みに追加料金はありませんでした。公式の文言(GPT-5.6発表から):「GPT-5.6およびそれ以降のモデルでは、キャッシュ書き込みはモデルの未キャッシュ入力レートの1.25倍で請求され、キャッシュ読み取りは90%のキャッシュ入力割引を引き続き受けます。」

損益分岐の計算は公式レートから直接導き出されます:プレフィックスを書き込むコストは、キャッシュしない場合よりも0.25倍高く、以降のヒットは0.9倍の入力レートを節約します:プレフィックスを一度でも再利用すると純粋な節約が生まれ、再利用が多いほど節約が大きくなります。

  • 明らかに利益を得るワークロード:長いシステムプロンプトを持つエージェントワークフロー、長い参照資料を繰り返し含むRAG、大きなツール定義を持つアプリケーション、メッセージを追加するだけのマルチターン会話。これらのワークロードはプレフィックスの再利用が高いため、0.1倍の読み取りレートが支配的です。
  • 注意が必要なワークロード:プレフィックスが再利用されない一回限りの長いリクエスト。自動キャッシングはデフォルトでオンになっているため、これらのリクエストは回収不可能な1.25倍の書き込み料金が発生します;prompt_cache_options.mode"explicit"に設定し、ブレークポイントを設定しないと、リクエストはキャッシュを完全にスキップし、書き込み料金は発生しません。

比較:GPT-5.6とClaudeのプロンプトキャッシング

GPT-5.6のキャッシング設計は、いくつかの次元でClaudeのcache_controlと収束しており、コアの違いはデフォルトの動作にあります:GPTはパラメータなしで自動的にキャッシュし、Claudeはリクエスト内でキャッシングを有効にする必要があります。これは、トップレベルのcache_controlフィールド(自動ブレークポイント)またはコンテンツブロックレベルの明示的ブレークポイントです。

次元 GPT-5.6ファミリー Claudeファミリー(すべてのアクティブモデル)
アクティベーション 自動キャッシング、明示的ブレークポイントはオプション 有効にする必要あり:トップレベルのcache_control自動ブレークポイント、またはコンテンツブロックレベルの明示的ブレークポイント
ブレークポイントパラメータ prompt_cache_breakpoint(コンテンツブロックレベル) cache_control(トップレベルまたはコンテンツブロックレベル)
ブレークポイント制限 リクエストごとに最大4つの新しいキャッシュ書き込み 最大4つのブレークポイント
キャッシュ保持 少なくとも30分 デフォルトで5分(毎回のヒットでコストなしで更新)、オプションで1時間
キャッシュ書き込み請求 入力レートの1.25倍 5分ティアで1.25倍、1時間ティアで2倍
キャッシュ読み取り請求 入力レートの0.1倍 入力レートの0.1倍
最小キャッシュ可能長 1,024トークン モデルに応じて512〜4,096トークン
ヒット要件 ブレークポイント前でバイト単位で同一 ブレークポイント前でバイト単位で同一

Claudeの列は、すべてのアクティブなClaudeモデルに共通するルールを反映しています:5分ティアでの1.25倍の書き込み、1時間ティアでの2倍、0.1倍の読み取りがラインアップ全体に均一に適用されます(Anthropicプロンプトキャッシングドキュメント)、モデルごとの違いは最小キャッシュ可能長に限られています;GPT-5.6の列は、OpenAIプロンプトキャッシングガイドからのものです。

ブレークポイント制限、書き込みレート(対応するティア用)、および読み取りレートは、2つのプロバイダー間で正確に一致します;実際のところ、同じ「静的コンテンツを最初に、変更するコンテンツを最後に」というプロンプト構造戦略が両者間で引き継がれます。移行コストはパラメータ構文に集中しています:GPTはprompt_cache_breakpoint + prompt_cache_keyを使用し、Claudeはcache_controlを使用します。

両方のプロトコルで同じキャッシングパターン

同じ「静的な長い指示をキャッシュする」シナリオに対して、2つのプロトコルの最小実装は次のようになります。例ではgpt-5.6-solclaude-opus-4-8を使用しています。両者は同じ基本入力価格($5/M)を共有しているため、キャッシュ書き込み(1.25倍)および読み取り(0.1倍)から導出される実効トークン単価も同じです;唯一の違いは構文です。

GPTプロトコルは、prompt_cache_keyをトップレベルで設定します(長いプレフィックスは自動的にキャッシュされ、ブレークポイントマーカーは必要ありません);Claudeプロトコルは、キャッシュを自動的に有効にするためにトップレベルでcache_controlを設定し、キャッシュ境界を正確に制御する必要がある場合はコンテンツブロックレベルのブレークポイントに切り替えます:

GPT-5.6(チャット完了)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[静的な長い指示、>=1024トークン]"
      },
      {
        "role": "user",
        "content": "重要な数値を要約してください。"
      }
    ]
  }'

Claude(メッセージ)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[静的な長い指示、>=1024トークン]",
    "messages": [
      {
        "role": "user",
        "content": "重要な数値を要約してください。"
      }
    ]
  }'

2つのリクエストを比較すると、違いは次の点に集約されます:エンドポイント(/v1/chat/completions/v1/messages)、認証ヘッダー(Authorization: Bearerx-api-key + anthropic-version)、キャッシングパラメータ(トップレベルのprompt_cache_key対トップレベルのcache_control)、およびClaudeが明示的なmax_tokensを必要とすることです。両方のリクエストはaihubmix.com(2026-07-10)に対して確認されました:gpt-5.6-solは2回目の呼び出しでcached_tokens: 2816を返し、claude-opus-4-8は最初の呼び出しでcache_creation_input_tokens: 3632を返し、2回目の呼び出しでcache_read_input_tokens: 3632を返しました。

リクエスト形式を超えて、メカニズムレベルの3つの違いが残ります:

  1. アクティベーション:GPTはキャッシングパラメータなしでも自動的にキャッシュし、prompt_cache_keyがヒットの信頼性を向上させます;Claudeは宣言を必要とします:コンテンツブロックレベルのcache_controlブレークポイント、またはトップレベルのcache_control自動モード。
  2. 使用フィールド:GPTはキャッシュ読み取りをprompt_tokens_details.cached_tokensで報告します;Claudeは書き込みと読み取りをそれぞれcache_creation_input_tokensおよびcache_read_input_tokensとして報告し、書き込みとヒットを独立して確認しやすくします。
  3. ライフタイム制御:GPT-5.6のttlは現在"30m"のみをサポートしています;Claudeはデフォルトで5分(毎回のヒットでコストなしで更新)、オプションで"ttl": "1h"(書き込みは2倍で請求)です。

プロトコル間でモデルを切り替えるときに変更すること

AIHubMixゲートウェイはクロスプロトコル呼び出しをサポートしています:OpenAI互換のエンドポイントはClaudeモデルを呼び出すことができ(cache_controlはOpenAI形式のメッセージコンテンツブロックに直接入ります;詳細はプロンプトキャッシングの実践を参照)、Claude互換の/v1/messagesエンドポイントはGPT-5.6を呼び出すことができます(動作確認済み)。モデルを切り替える際は、次の3つを確認してください:

  • modelをターゲットモデルIDに変更;
  • キャッシングパラメータ構文を切り替え:prompt_cache_key / 明示的ブレークポイントはClaudeのcache_controlに対応;
  • 使用フィールド名を切り替え:cached_tokensはClaudeのcache_read_input_tokensに対応します。

プロンプトキャッシングの推奨パス:チャット完了を通じてGPTモデル(この投稿で確認されたキャッシュヒットパス);Claudeモデルはどちらのプロトコルでも機能します。

比較:GPT-5.6と以前のGPTキャッシング

次元 GPT-5.6以前 GPT-5.6以降
キャッシュ書き込み 追加料金なし 入力レートの1.25倍
キャッシュ保持 非活動後5〜10分でクリア、最大1時間 少なくとも30分
キャッシュ制御 なし 明示的ブレークポイント、明示的モード、prompt_cache_keyによる信頼性の高いマッチング
24時間延長保持 prompt_cache_retentionが一部モデルに適用 prompt_cache_options.ttlに置き換えられました(現在は30mのみ)

変更点は一方向に指し示しています:以前の世代のキャッシングは書き込み料金が無料でしたが、制御が効かず、保持が不確実でした;GPT-5.6は書き込みに対して料金を請求しながら、保証された保持の最低限と正確なキャッシュ制御を提供します。レートによれば、平均して一度以上再利用されたプレフィックスは追加の書き込みコストよりも多くを節約します;30分の保持の最低限と制御可能なブレークポイントにより、その再利用率に達することがより予測可能になります。

AIHubMixの始め方

すべての3つのティアが稼働中で、モデルIDはgpt-5.6-solgpt-5.6-terra、およびgpt-5.6-lunaです。キャッシングには追加の設定は必要ありません;同じ長いプレフィックスを持つ連続リクエストはキャッシュにヒットします:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "あなたは四半期の財務報告を分析するための細心の注意を払うアシスタントです... [静的な長い指示、>=1024トークン]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "重要な数値を一文で要約してください。"},
        ],
    )
    print(completion.usage.prompt_tokens_details)

2回目の呼び出しでusage.prompt_tokens_details.cached_tokensの値が0より大きい場合、ヒットを示します(測定例:cached_tokens: 2816)。パラメータの詳細、請求の具体的な内容、ヒットのトラブルシューティングについては、GPTプロンプトキャッシングのドキュメントを参照してください。

FAQ

AIHubMixでどのAPIがGPT-5.6を呼び出せますか?

チャット完了(/v1/chat/completions)、応答(/v1/responses)、およびClaude互換のメッセージAPI(/v1/messages)はすべてモデルを呼び出すことができ、すべての3つのティアが稼働中です。プロンプトキャッシングについては、現在チャット完了が推奨されるパスです。

クライアントが何も変更しない場合、GPT-5.6にアップグレード後の請求に何が変わりますか?

プロンプトキャッシングはデフォルトで自動的に適用されます:プレフィックスが1,024トークンに達するリクエストは、1.25倍の入力レートで請求されるキャッシュ書き込みアイテムが発生し、再利用されたプレフィックスは0.1倍の読み取りレートで請求されます。プレフィックスの再利用が高いアプリケーションは通常、総コストが低くなります;一回限りの長いリクエストでプレフィックスが再利用されない場合は、明示的モードでキャッシングを無効にできます。

Claudeプロンプトキャッシングを使用していました。GPT-5.6に移行するために何を変更すればよいですか?

プロンプトの構造戦略は同じままです:静的コンテンツを最初に、変更するコンテンツを最後にします。パラメータはcache_controlからprompt_cache_breakpoint、およびprompt_cache_keyに変更され、保持は5分/1時間ティアから30分の保証された最低限に変更されます。

3つのGPT-5.6ティアの中からどのように選択しますか?

公式の位置付けによれば:複雑な専門作業やコーディングタスクにはSolを選択;日常的なワークロードにはTerraを選択(GPT-5.5レベルのパフォーマンスを半額で);コストに敏感な高ボリュームシナリオにはLunaを選択します。すべての3つのティアは同じコンテキストウィンドウと最大出力を共有しているため、タスクの複雑さに応じてルーティングできます。

公式リファレンス

この投稿におけるモデル仕様、キャッシングメカニズム、および請求レートは、以下の公式ソースからのものです:

このサイトに関する関連ドキュメント:GPTプロンプトキャッシング · Claudeプロンプトキャッシング · プロンプトキャッシングの実践


GPT-5.6の価格についてはモデルギャラリーを訪問するか、ドキュメントセンターでさらに多くの統合オプションを探ってください。


最終更新日:2026-07-10

More from the blog