OpenAI 在 2026 年 7 月 9 日正式發布了 GPT-5.6 系列。AIHubMix 已完成所有三個層級的整合:gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna 現在可以通過聊天完成和回應使用。此次發布還改變了提示快取機制及其計費:快取寫入現在單獨計費。本文涵蓋了三個層級的定位,並逐點介紹了快取變更。
三個 GPT-5.6 層級的變更
GPT-5.6 修訂了命名方案:數字表示模型世代,而 Sol、Terra 和 Luna 是可以獨立演變的能力層級。根據官方定義,Sol 是旗艦模型,Terra 是性能與 GPT-5.5 相當的低價層級,而 Luna 是最快、最低價的層級。
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| 官方定位 | 複雜專業工作的旗艦模型 | 智能與成本的平衡 | 適用於對成本敏感的工作負載 |
| 上下文窗口 | 1,050,000 | 1,050,000 | 1,050,000 |
| 最大輸出 | 128,000 | 128,000 | 128,000 |
| 知識截止日期 | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| 前一代的粗略對應 | 無後綴層級 | 迷你層級 | 納米層級 |
在能力方面,官方立場是:Sol 在編碼、知識工作、網絡安全和科學任務上實現了最先進的結果,被 OpenAI 描述為迄今為止最佳的編碼模型,並在 Terminal-Bench 2.1 和 DeepSWE 上創下新紀錄;Terra 的性能與 GPT-5.5 相當,但價格僅為其一半。該系列增加了最大推理級別,回應 API 獲得了程序化工具調用和多代理(Beta)功能。
快取機制升級解釋
在 GPT-5.6 之前,GPT 模型的提示快取是完全自動的:1,024 個標記或更多的前綴會自動快取,開發者無法控制快取的內容或持續時間,且在 5–10 分鐘不活動後會清除快取。OpenAI 將 GPT-5.6 的變更總結為「更可預測的提示快取」,具體有三個要點:
- 保留時間從「最短 5 分鐘」變為「至少 30 分鐘」。
prompt_cache_options.ttl目前僅支持"30m";這是保證的最小值,實際保留時間可能更長。 - 明確的快取斷點是新的。在內容塊上設置
prompt_cache_breakpoint將快取邊界固定在穩定內容的結尾,因此斷點之後的變更不會使之前的快取前綴失效;當prompt_cache_options.mode設置為"explicit"時,僅使用手動斷點。 prompt_cache_key從優化變為官方要求。從 GPT-5.6 開始,應設置該參數以實現更可靠的快取匹配;OpenAI 建議每個鍵的流量保持在每分鐘約 15 次請求。
如何評估 1.25 倍快取寫入計費
從 GPT-5.6 開始,快取寫入按 1.25 倍的基本輸入費率計費,快取讀取按 0.1 倍計費;在早期模型中,快取寫入沒有額外費用。官方措辭(來自 GPT-5.6 公告):「對於 GPT-5.6 及以後的模型,快取寫入按 1.25 倍的模型未快取輸入費率計費,而快取讀取則繼續享受 90% 的快取輸入折扣。」
盈虧平衡的計算直接來自官方費率:寫入前綴的成本比不快取多 0.25 倍的輸入費率,每次後續命中節省 0.9 倍的輸入費率:即使重複使用一次前綴也會產生淨節省,重複使用越多,節省越大。
- 明顯受益的工作負載:具有長系統提示的代理工作流程,RAG 重複包含長參考材料,攜帶大型工具定義的應用程序,以及僅附加消息的多輪對話。這些工作負載具有高前綴重複使用,因此 0.1 倍的讀取費率佔主導地位。
- 需要注意的工作負載:一次性長請求,其前綴從未重複使用。自動快取默認開啟,因此這些請求會產生無法回收的 1.25 倍寫入費用;將
prompt_cache_options.mode設置為"explicit"而不設置任何斷點會使請求完全跳過快取,並不產生寫入費用。
比較:GPT-5.6 和 Claude 的提示快取
GPT-5.6 的快取設計在幾個方面與 Claude 的 cache_control 收斂,核心區別在於默認行為:GPT 自動快取,無需參數,而 Claude 需要在請求中啟用快取,無論是頂層的 cache_control 字段(自動斷點)還是內容塊級別的明確斷點。
| 維度 | GPT-5.6 系列 | Claude 系列(所有活躍模型) |
|---|---|---|
| 啟用 | 自動快取,明確斷點可選 | 必須啟用:頂層 cache_control 自動斷點,或內容塊級別的明確斷點 |
| 斷點參數 | prompt_cache_breakpoint(內容塊級別) |
cache_control(頂層或內容塊級別) |
| 斷點限制 | 每個請求最多 4 個新的快取寫入 | 最多 4 個斷點 |
| 快取保留 | 至少 30 分鐘 | 默認 5 分鐘(每次命中免費刷新),可選 1 小時 |
| 快取寫入計費 | 1.25 倍輸入費率 | 5 分鐘層級 1.25 倍,1 小時層級 2 倍 |
| 快取讀取計費 | 0.1 倍輸入費率 | 0.1 倍輸入費率 |
| 最小可快取長度 | 1,024 個標記 | 根據模型 512–4,096 個標記 |
| 命中要求 | 在斷點之前逐字相同 | 在斷點之前逐字相同 |
Claude 列反映了所有活躍 Claude 模型共享的規則:5 分鐘層級的寫入 1.25 倍,1 小時層級的寫入 2 倍,0.1 倍的讀取在整個系列中均適用(Anthropic 提示快取文檔),每個模型的差異僅限於最小可快取長度;GPT-5.6 列來自 OpenAI 提示快取指南。
斷點限制、寫入費率(對應層級)和讀取費率在兩個提供者之間完全匹配;在實際操作中,相同的「靜態內容優先,變更內容最後」的提示結構策略在兩者之間延續。遷移成本集中在參數語法上:GPT 使用 prompt_cache_breakpoint + prompt_cache_key,Claude 使用 cache_control。
兩個協議中的相同快取模式
對於相同的「快取靜態長指令」場景,兩個協議中的最小實現如下。示例使用 gpt-5.6-sol 和 claude-opus-4-8。兩者共享相同的基本輸入價格($5/M),因此從快取寫入(1.25 倍)和讀取(0.1 倍)衍生的每個標記的有效價格也相同;只有語法不同。
GPT 協議在頂層設置 prompt_cache_key(長前綴自動快取,無需斷點標記);Claude 協議在頂層設置 cache_control 以啟用自動快取,當需要精確控制快取邊界時切換到內容塊級別的斷點:
GPT-5.6(聊天完成)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[靜態長指令,>=1024 個標記]"
},
{
"role": "user",
"content": "總結關鍵數據。"
}
]
}'
Claude(消息)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[靜態長指令,>=1024 個標記]",
"messages": [
{
"role": "user",
"content": "總結關鍵數據。"
}
]
}'
比較這兩個請求,差異在於:端點(/v1/chat/completions 與 /v1/messages)、授權標頭(Authorization: Bearer 與 x-api-key + anthropic-version)、快取參數(頂層 prompt_cache_key 與頂層 cache_control)以及 Claude 需要明確的 max_tokens。兩個請求均已在 aihubmix.com 上驗證(2026-07-10):gpt-5.6-sol 在第二次調用時返回 cached_tokens: 2816;claude-opus-4-8 在第一次調用時返回 cache_creation_input_tokens: 3632,在第二次調用時返回 cache_read_input_tokens: 3632。
除了請求格式外,還有三個機制級別的差異:
- 啟用:GPT 即使在沒有任何快取參數的情況下也會自動快取,
prompt_cache_key提高命中可靠性;Claude 需要聲明:內容塊級別的cache_control斷點,或頂層cache_control自動模式。 - 使用字段:GPT 在
prompt_tokens_details.cached_tokens中報告快取讀取;Claude 分別報告寫入和讀取為cache_creation_input_tokens和cache_read_input_tokens,使得獨立驗證寫入和命中變得容易。 - 壽命控制:GPT-5.6 的
ttl目前僅支持"30m";Claude 默認為 5 分鐘(每次命中免費刷新),可選"ttl": "1h"(寫入按 2 倍計費)。
在跨協議切換模型時需要更改什麼
AIHubMix 閘道支持跨協議調用:OpenAI 兼容的端點可以調用 Claude 模型(cache_control 直接進入 OpenAI 格式的消息內容塊;請參見 提示快取實踐),而 Claude 兼容的 /v1/messages 端點可以調用 GPT-5.6(已驗證可用)。在切換模型時,檢查三件事:
- 將
model更改為目標模型 ID; - 切換快取參數語法:
prompt_cache_key/ 明確斷點對應於 Claude 的cache_control; - 切換使用字段名稱:
cached_tokens對應於 Claude 的cache_read_input_tokens。
提示快取的推薦路徑:通過聊天完成使用 GPT 模型(本文中驗證的快取命中路徑);Claude 模型可以通過任一協議工作。
比較:GPT-5.6 與早期 GPT 快取
| 維度 | 在 GPT-5.6 之前 | GPT-5.6 及以後 |
|---|---|---|
| 快取寫入 | 無額外費用 | 1.25 倍輸入費率 |
| 快取保留 | 在 5–10 分鐘不活動後清除,最多 1 小時 | 至少 30 分鐘 |
| 快取控制 | 無 | 明確斷點、明確模式、prompt_cache_key 可靠匹配 |
| 24 小時延長保留 | prompt_cache_retention 在某些模型上 |
被 prompt_cache_options.ttl 取代(目前僅 30m) |
變更的方向是明確的:早期世代的快取沒有寫入費用,但無法控制,保留時間不確定;GPT-5.6 對寫入收費,同時提供保留的最低保障和精確的快取控制。根據費率,平均重複使用多於一次的前綴節省的費用超過了增加的寫入成本;30 分鐘的保留底線和可控的斷點使得達到該重複使用率變得更可預測。
在 AIHubMix 上開始使用
所有三個層級均已上線,模型 ID 為 gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna。快取不需要額外配置;具有相同長前綴的連續請求會命中快取:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "您是分析季度財務報告的細心助手... [靜態長指令,>=1024 個標記]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "用一句話總結關鍵數據。"},
],
)
print(completion.usage.prompt_tokens_details)
在第二次調用時,usage.prompt_tokens_details.cached_tokens 的值大於 0 表示命中(測量示例:cached_tokens: 2816)。有關參數詳細信息、計費細節和命中故障排除,請參見 GPT 提示快取 文檔。
常見問題
哪些 API 可以在 AIHubMix 上調用 GPT-5.6?
聊天完成(/v1/chat/completions)、回應(/v1/responses)和 Claude 兼容的消息 API(/v1/messages)都可以調用這些模型,所有三個層級均已上線。對於提示快取,目前推薦的路徑是聊天完成。
如果我的客戶端沒有任何變更,升級到 GPT-5.6 後計費會有什麼變化?
提示快取默認自動應用:前綴達到 1,024 個標記的請求會產生按 1.25 倍輸入費率計費的快取寫入項,重複使用的前綴按 0.1 倍讀取費率計費。具有高前綴重複使用的應用程序通常會看到較低的總成本;一次性長請求如果從未重複使用前綴,可以通過明確模式禁用快取。
我已經使用了 Claude 提示快取。要遷移到 GPT-5.6,我需要更改什麼?
提示結構策略保持不變:靜態內容優先,變更內容最後。參數從 cache_control 變更為 prompt_cache_breakpoint,加上 prompt_cache_key;保留時間從 5 分鐘/1 小時層級變更為 30 分鐘的保證底線。
我該如何在三個 GPT-5.6 層級中進行選擇?
根據官方定位:選擇 Sol 用於複雜的專業工作和編碼任務;選擇 Terra 用於日常工作負載(GPT-5.5 級別的性能,價格僅為一半);選擇 Luna 用於對成本敏感的大量場景。所有三個層級共享相同的上下文窗口和最大輸出,因此可以根據任務的複雜性進行路由。
官方參考
本文中的模型規格、快取機制和計費率來自以下官方來源:
- GPT-5.6 公告(OpenAI,2026-07-09)
- OpenAI 提示快取指南
- OpenAI 價格
- Anthropic 提示快取文檔
本網站的相關文檔:GPT 提示快取 · Claude 提示快取 · 提示快取實踐
訪問 模型畫廊 獲取 GPT-5.6 價格,或在 文檔中心 探索更多整合選項。
最後更新:2026-07-10