GPT-5.6 現已上線:提示快取計費變更解釋

2026年7月31日 · AIHubMix · 8 min read · 意見

GPT-5.6 現已上線:提示快取計費變更解釋

OpenAI 在 2026 年 7 月 9 日正式發布了 GPT-5.6 系列。AIHubMix 已完成所有三個層級的整合:gpt-5.6-solgpt-5.6-terragpt-5.6-luna 現在可以通過聊天完成和回應使用。此次發布還改變了提示快取機制及其計費:快取寫入現在單獨計費。本文涵蓋了三個層級的定位,並逐點介紹了快取變更。

三個 GPT-5.6 層級的變更

GPT-5.6 修訂了命名方案:數字表示模型世代,而 Sol、Terra 和 Luna 是可以獨立演變的能力層級。根據官方定義,Sol 是旗艦模型,Terra 是性能與 GPT-5.5 相當的低價層級,而 Luna 是最快、最低價的層級。

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
官方定位 複雜專業工作的旗艦模型 智能與成本的平衡 適用於對成本敏感的工作負載
上下文窗口 1,050,000 1,050,000 1,050,000
最大輸出 128,000 128,000 128,000
知識截止日期 2026-02-16 2026-02-16 2026-02-16
前一代的粗略對應 無後綴層級 迷你層級 納米層級

在能力方面,官方立場是:Sol 在編碼、知識工作、網絡安全和科學任務上實現了最先進的結果,被 OpenAI 描述為迄今為止最佳的編碼模型,並在 Terminal-Bench 2.1 和 DeepSWE 上創下新紀錄;Terra 的性能與 GPT-5.5 相當,但價格僅為其一半。該系列增加了最大推理級別,回應 API 獲得了程序化工具調用和多代理(Beta)功能。

快取機制升級解釋

在 GPT-5.6 之前,GPT 模型的提示快取是完全自動的:1,024 個標記或更多的前綴會自動快取,開發者無法控制快取的內容或持續時間,且在 5–10 分鐘不活動後會清除快取。OpenAI 將 GPT-5.6 的變更總結為「更可預測的提示快取」,具體有三個要點:

  1. 保留時間從「最短 5 分鐘」變為「至少 30 分鐘」prompt_cache_options.ttl 目前僅支持 "30m";這是保證的最小值,實際保留時間可能更長。
  2. 明確的快取斷點是新的。在內容塊上設置 prompt_cache_breakpoint 將快取邊界固定在穩定內容的結尾,因此斷點之後的變更不會使之前的快取前綴失效;當 prompt_cache_options.mode 設置為 "explicit" 時,僅使用手動斷點。
  3. prompt_cache_key 從優化變為官方要求。從 GPT-5.6 開始,應設置該參數以實現更可靠的快取匹配;OpenAI 建議每個鍵的流量保持在每分鐘約 15 次請求。

如何評估 1.25 倍快取寫入計費

從 GPT-5.6 開始,快取寫入按 1.25 倍的基本輸入費率計費,快取讀取按 0.1 倍計費;在早期模型中,快取寫入沒有額外費用。官方措辭(來自 GPT-5.6 公告):「對於 GPT-5.6 及以後的模型,快取寫入按 1.25 倍的模型未快取輸入費率計費,而快取讀取則繼續享受 90% 的快取輸入折扣。」

盈虧平衡的計算直接來自官方費率:寫入前綴的成本比不快取多 0.25 倍的輸入費率,每次後續命中節省 0.9 倍的輸入費率:即使重複使用一次前綴也會產生淨節省,重複使用越多,節省越大。

  • 明顯受益的工作負載:具有長系統提示的代理工作流程,RAG 重複包含長參考材料,攜帶大型工具定義的應用程序,以及僅附加消息的多輪對話。這些工作負載具有高前綴重複使用,因此 0.1 倍的讀取費率佔主導地位。
  • 需要注意的工作負載:一次性長請求,其前綴從未重複使用。自動快取默認開啟,因此這些請求會產生無法回收的 1.25 倍寫入費用;將 prompt_cache_options.mode 設置為 "explicit" 而不設置任何斷點會使請求完全跳過快取,並不產生寫入費用。

比較:GPT-5.6 和 Claude 的提示快取

GPT-5.6 的快取設計在幾個方面與 Claude 的 cache_control 收斂,核心區別在於默認行為:GPT 自動快取,無需參數,而 Claude 需要在請求中啟用快取,無論是頂層的 cache_control 字段(自動斷點)還是內容塊級別的明確斷點。

維度 GPT-5.6 系列 Claude 系列(所有活躍模型)
啟用 自動快取,明確斷點可選 必須啟用:頂層 cache_control 自動斷點,或內容塊級別的明確斷點
斷點參數 prompt_cache_breakpoint(內容塊級別) cache_control(頂層或內容塊級別)
斷點限制 每個請求最多 4 個新的快取寫入 最多 4 個斷點
快取保留 至少 30 分鐘 默認 5 分鐘(每次命中免費刷新),可選 1 小時
快取寫入計費 1.25 倍輸入費率 5 分鐘層級 1.25 倍,1 小時層級 2 倍
快取讀取計費 0.1 倍輸入費率 0.1 倍輸入費率
最小可快取長度 1,024 個標記 根據模型 512–4,096 個標記
命中要求 在斷點之前逐字相同 在斷點之前逐字相同

Claude 列反映了所有活躍 Claude 模型共享的規則:5 分鐘層級的寫入 1.25 倍,1 小時層級的寫入 2 倍,0.1 倍的讀取在整個系列中均適用(Anthropic 提示快取文檔),每個模型的差異僅限於最小可快取長度;GPT-5.6 列來自 OpenAI 提示快取指南

斷點限制、寫入費率(對應層級)和讀取費率在兩個提供者之間完全匹配;在實際操作中,相同的「靜態內容優先,變更內容最後」的提示結構策略在兩者之間延續。遷移成本集中在參數語法上:GPT 使用 prompt_cache_breakpoint + prompt_cache_key,Claude 使用 cache_control

兩個協議中的相同快取模式

對於相同的「快取靜態長指令」場景,兩個協議中的最小實現如下。示例使用 gpt-5.6-solclaude-opus-4-8。兩者共享相同的基本輸入價格($5/M),因此從快取寫入(1.25 倍)和讀取(0.1 倍)衍生的每個標記的有效價格也相同;只有語法不同。

GPT 協議在頂層設置 prompt_cache_key(長前綴自動快取,無需斷點標記);Claude 協議在頂層設置 cache_control 以啟用自動快取,當需要精確控制快取邊界時切換到內容塊級別的斷點:

GPT-5.6(聊天完成)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[靜態長指令,>=1024 個標記]"
      },
      {
        "role": "user",
        "content": "總結關鍵數據。"
      }
    ]
  }'

Claude(消息)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[靜態長指令,>=1024 個標記]",
    "messages": [
      {
        "role": "user",
        "content": "總結關鍵數據。"
      }
    ]
  }'

比較這兩個請求,差異在於:端點(/v1/chat/completions/v1/messages)、授權標頭(Authorization: Bearerx-api-key + anthropic-version)、快取參數(頂層 prompt_cache_key 與頂層 cache_control)以及 Claude 需要明確的 max_tokens。兩個請求均已在 aihubmix.com 上驗證(2026-07-10):gpt-5.6-sol 在第二次調用時返回 cached_tokens: 2816claude-opus-4-8 在第一次調用時返回 cache_creation_input_tokens: 3632,在第二次調用時返回 cache_read_input_tokens: 3632

除了請求格式外,還有三個機制級別的差異:

  1. 啟用:GPT 即使在沒有任何快取參數的情況下也會自動快取,prompt_cache_key 提高命中可靠性;Claude 需要聲明:內容塊級別的 cache_control 斷點,或頂層 cache_control 自動模式。
  2. 使用字段:GPT 在 prompt_tokens_details.cached_tokens 中報告快取讀取;Claude 分別報告寫入和讀取為 cache_creation_input_tokenscache_read_input_tokens,使得獨立驗證寫入和命中變得容易。
  3. 壽命控制:GPT-5.6 的 ttl 目前僅支持 "30m";Claude 默認為 5 分鐘(每次命中免費刷新),可選 "ttl": "1h"(寫入按 2 倍計費)。

在跨協議切換模型時需要更改什麼

AIHubMix 閘道支持跨協議調用:OpenAI 兼容的端點可以調用 Claude 模型(cache_control 直接進入 OpenAI 格式的消息內容塊;請參見 提示快取實踐),而 Claude 兼容的 /v1/messages 端點可以調用 GPT-5.6(已驗證可用)。在切換模型時,檢查三件事:

  • model 更改為目標模型 ID;
  • 切換快取參數語法:prompt_cache_key / 明確斷點對應於 Claude 的 cache_control
  • 切換使用字段名稱:cached_tokens 對應於 Claude 的 cache_read_input_tokens

提示快取的推薦路徑:通過聊天完成使用 GPT 模型(本文中驗證的快取命中路徑);Claude 模型可以通過任一協議工作。

比較:GPT-5.6 與早期 GPT 快取

維度 在 GPT-5.6 之前 GPT-5.6 及以後
快取寫入 無額外費用 1.25 倍輸入費率
快取保留 在 5–10 分鐘不活動後清除,最多 1 小時 至少 30 分鐘
快取控制 明確斷點、明確模式、prompt_cache_key 可靠匹配
24 小時延長保留 prompt_cache_retention 在某些模型上 prompt_cache_options.ttl 取代(目前僅 30m)

變更的方向是明確的:早期世代的快取沒有寫入費用,但無法控制,保留時間不確定;GPT-5.6 對寫入收費,同時提供保留的最低保障和精確的快取控制。根據費率,平均重複使用多於一次的前綴節省的費用超過了增加的寫入成本;30 分鐘的保留底線和可控的斷點使得達到該重複使用率變得更可預測。

在 AIHubMix 上開始使用

所有三個層級均已上線,模型 ID 為 gpt-5.6-solgpt-5.6-terragpt-5.6-luna。快取不需要額外配置;具有相同長前綴的連續請求會命中快取:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "您是分析季度財務報告的細心助手... [靜態長指令,>=1024 個標記]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "用一句話總結關鍵數據。"},
        ],
    )
    print(completion.usage.prompt_tokens_details)

在第二次調用時,usage.prompt_tokens_details.cached_tokens 的值大於 0 表示命中(測量示例:cached_tokens: 2816)。有關參數詳細信息、計費細節和命中故障排除,請參見 GPT 提示快取 文檔。

常見問題

哪些 API 可以在 AIHubMix 上調用 GPT-5.6?

聊天完成(/v1/chat/completions)、回應(/v1/responses)和 Claude 兼容的消息 API(/v1/messages)都可以調用這些模型,所有三個層級均已上線。對於提示快取,目前推薦的路徑是聊天完成。

如果我的客戶端沒有任何變更,升級到 GPT-5.6 後計費會有什麼變化?

提示快取默認自動應用:前綴達到 1,024 個標記的請求會產生按 1.25 倍輸入費率計費的快取寫入項,重複使用的前綴按 0.1 倍讀取費率計費。具有高前綴重複使用的應用程序通常會看到較低的總成本;一次性長請求如果從未重複使用前綴,可以通過明確模式禁用快取。

我已經使用了 Claude 提示快取。要遷移到 GPT-5.6,我需要更改什麼?

提示結構策略保持不變:靜態內容優先,變更內容最後。參數從 cache_control 變更為 prompt_cache_breakpoint,加上 prompt_cache_key;保留時間從 5 分鐘/1 小時層級變更為 30 分鐘的保證底線。

我該如何在三個 GPT-5.6 層級中進行選擇?

根據官方定位:選擇 Sol 用於複雜的專業工作和編碼任務;選擇 Terra 用於日常工作負載(GPT-5.5 級別的性能,價格僅為一半);選擇 Luna 用於對成本敏感的大量場景。所有三個層級共享相同的上下文窗口和最大輸出,因此可以根據任務的複雜性進行路由。

官方參考

本文中的模型規格、快取機制和計費率來自以下官方來源:

本網站的相關文檔:GPT 提示快取 · Claude 提示快取 · 提示快取實踐


訪問 模型畫廊 獲取 GPT-5.6 價格,或在 文檔中心 探索更多整合選項。


最後更新:2026-07-10

More from the blog