GPT-5.6 正式上线:提示缓存计费变更解析

2026年7月31日 · AIHubMix · 8 min read · 观点

GPT-5.6 正式上线:提示缓存计费变更解析

OpenAI 于 2026 年 7 月 9 日正式发布了 GPT-5.6 系列。AIHubMix 已完成对三个层级的集成:gpt-5.6-solgpt-5.6-terragpt-5.6-luna 现在可以通过聊天完成和响应使用。此次发布还更改了提示缓存机制及其计费方式:缓存写入现在单独计费。本文将介绍这三个层级的定位,并逐点讲解缓存的变化。

三个 GPT-5.6 层级的变化

GPT-5.6 修订了命名方案:数字表示模型代数,而 Sol、Terra 和 Luna 是可以独立发展的能力层级。根据官方定义,Sol 是旗舰模型,Terra 是性能与 GPT-5.5 相当的低价层级,Luna 是速度最快、价格最低的层级。

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
官方定位 复杂专业工作的旗舰模型 智能与成本的平衡 适用于对成本敏感的工作负载
上下文窗口 1,050,000 1,050,000 1,050,000
最大输出 128,000 128,000 128,000
知识截止日期 2026-02-16 2026-02-16 2026-02-16
与前一代的粗略等效 无后缀层级 迷你层级 纳米层级

在能力方面,官方定位为:Sol 在编码、知识工作、网络安全和科学任务上实现了最先进的结果,被 OpenAI 描述为迄今为止最佳的编码模型,并在 Terminal-Bench 2.1 和 DeepSWE 上创下新纪录;Terra 的性能与 GPT-5.5 相当,价格仅为其一半。该系列增加了最大推理级别,Responses API 获得了程序化工具调用和多代理(Beta)能力。

缓存机制升级解析

在 GPT-5.6 之前,GPT 模型的提示缓存是完全自动的:1,024 个标记或更多的前缀会自动缓存,开发者无法控制缓存的内容或持续时间,且在 5-10 分钟的不活动后缓存会被清除。OpenAI 将 GPT-5.6 的变化总结为“更可预测的提示缓存”,具体有三点:

  1. 保留时间从“短至 5 分钟”变为“至少 30 分钟”prompt_cache_options.ttl 目前仅支持 "30m";这是一个保证的最低值,实际保留时间可能更长。
  2. 显式缓存断点是新的。在内容块上设置 prompt_cache_breakpoint 会将缓存边界固定在稳定内容的末尾,因此在断点之后的更改不会使之前的缓存前缀失效;当 prompt_cache_options.mode 设置为 "explicit" 时,仅使用手动断点。
  3. prompt_cache_key 从优化变为正式要求。从 GPT-5.6 开始,该参数应设置以启用更可靠的缓存匹配;OpenAI 建议每个键的流量保持在每分钟大约 15 个请求。

如何评估 1.25 倍缓存写入计费

从 GPT-5.6 开始,缓存写入按基础输入费率的 1.25 倍计费,缓存读取按 0.1 倍计费;在早期模型中,缓存写入没有额外费用。官方措辞(来自 GPT-5.6 公告):“对于 GPT-5.6 及后续模型,缓存写入按模型未缓存输入费率的 1.25 倍计费,而缓存读取继续享受 90% 的缓存输入折扣。”

盈亏平衡的数学直接来自官方费率:写入前缀的成本比不缓存多 0.25 倍,而每次后续命中节省 0.9 倍的输入费率:即使只重用一次前缀也会产生净节省,重用越多,节省越大。

  • 明显受益的工作负载:具有长系统提示的代理工作流,重复包含长参考材料的 RAG,携带大型工具定义的应用程序,以及仅附加消息的多轮对话。这些工作负载具有高前缀重用,因此 0.1 倍的读取费率占主导。
  • 需要关注的工作负载:一次性长请求,其前缀从未重用。自动缓存默认开启,因此这些请求会产生不可恢复的 1.25 倍写入费用;将 prompt_cache_options.mode 设置为 "explicit" 而不设置任何断点会使请求完全跳过缓存,从而不产生写入费用。

比较:GPT-5.6 和 Claude 的提示缓存

GPT-5.6 的缓存设计在多个维度上与 Claude 的 cache_control 收敛,核心区别在于默认行为:GPT 自动缓存,无需参数,而 Claude 需要在请求中启用缓存,使用顶层 cache_control 字段(自动断点)或内容块级别的显式断点。

维度 GPT-5.6 系列 Claude 系列(所有活跃模型)
激活 自动缓存,显式断点可选 必须启用:顶层 cache_control 自动断点,或内容块级别显式断点
断点参数 prompt_cache_breakpoint(内容块级别) cache_control(顶层或内容块级别)
断点限制 每个请求最多 4 个新缓存写入 最多 4 个断点
缓存保留 至少 30 分钟 默认 5 分钟(每次命中时无成本刷新),可选 1 小时
缓存写入计费 1.25 倍输入费率 5 分钟层级 1.25 倍,1 小时层级 2 倍
缓存读取计费 0.1 倍输入费率 0.1 倍输入费率
最小可缓存长度 1,024 个标记 根据模型为 512-4,096 个标记
命中要求 在断点之前逐字相同 在断点之前逐字相同

Claude 列反映了所有活跃 Claude 模型共享的规则:5 分钟层级的写入 1.25 倍,1 小时层级的写入 2 倍,读取统一为 0.1 倍(Anthropic 提示缓存文档),每个模型的差异仅限于最小可缓存长度;GPT-5.6 列来自 OpenAI 提示缓存指南

断点限制、写入费率(对应层级)和读取费率在两个提供商之间完全匹配;在实际操作中,相同的“静态内容优先,变化内容最后”的提示结构策略在两者之间延续。迁移成本集中在参数语法上:GPT 使用 prompt_cache_breakpoint + prompt_cache_key,Claude 使用 cache_control

两个协议中的相同缓存模式

对于相同的“缓存静态长指令”场景,两个协议中的最小实现如下。示例使用 gpt-5.6-solclaude-opus-4-8。两者共享相同的基础输入价格($5/M),因此从缓存写入(1.25 倍)和读取(0.1 倍)得出的每个标记的有效价格也相同;只有语法不同。

GPT 协议在顶层设置 prompt_cache_key(长前缀会自动缓存,无需断点标记);Claude 协议在顶层设置 cache_control 以启用自动缓存,当需要精确控制缓存边界时切换到内容块级别的断点:

GPT-5.6(聊天完成)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[静态长指令,>=1024 个标记]"
      },
      {
        "role": "user",
        "content": "总结关键数字。"
      }
    ]
  }'

Claude(消息)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[静态长指令,>=1024 个标记]",
    "messages": [
      {
        "role": "user",
        "content": "总结关键数字。"
      }
    ]
  }'

比较这两个请求,差异在于:端点(/v1/chat/completions/v1/messages)、身份验证头(Authorization: Bearerx-api-key + anthropic-version)、缓存参数(顶层 prompt_cache_key 与顶层 cache_control)以及 Claude 需要显式的 max_tokens。两个请求均已通过 aihubmix.com 验证(2026-07-10):gpt-5.6-sol 在第二次调用时返回 cached_tokens: 2816claude-opus-4-8 在第一次调用时返回 cache_creation_input_tokens: 3632,在第二次调用时返回 cache_read_input_tokens: 3632

除了请求格式外,仍然存在三个机制级别的差异:

  1. 激活:GPT 即使没有任何缓存参数也会自动缓存,prompt_cache_key 提高命中可靠性;Claude 需要声明:内容块级别的 cache_control 断点,或顶层 cache_control 自动模式。
  2. 使用字段:GPT 在 prompt_tokens_details.cached_tokens 中报告缓存读取;Claude 分别报告写入和读取为 cache_creation_input_tokenscache_read_input_tokens,使得独立验证写入和命中变得容易。
  3. 生命周期控制:GPT-5.6 的 ttl 目前仅支持 "30m";Claude 默认 5 分钟(每次命中时无成本刷新),可选 "ttl": "1h"(写入按 2 倍计费)。

在跨协议切换模型时需要更改什么

AIHubMix 网关支持跨协议调用:OpenAI 兼容的端点可以调用 Claude 模型(cache_control 直接进入 OpenAI 格式的消息内容块;参见 提示缓存实践),而 Claude 兼容的 /v1/messages 端点可以调用 GPT-5.6(已验证可用)。在切换模型时,请检查三件事:

  • model 更改为目标模型 ID;
  • 切换缓存参数语法:prompt_cache_key / 显式断点对应于 Claude 的 cache_control
  • 切换使用字段名称:cached_tokens 对应于 Claude 的 cache_read_input_tokens

推荐的提示缓存路径:通过聊天完成使用 GPT 模型(本文验证的缓存命中路径);Claude 模型可以通过任一协议工作。

比较:GPT-5.6 与早期 GPT 缓存

维度 GPT-5.6 之前 GPT-5.6 及之后
缓存写入 没有额外费用 1.25 倍输入费率
缓存保留 在 5-10 分钟的不活动后清除,最长可达 1 小时 至少 30 分钟
缓存控制 显式断点、显式模式、prompt_cache_key 可靠匹配
24 小时延长保留 prompt_cache_retention 在某些模型上 prompt_cache_options.ttl 替代(目前仅 30m)

变化的方向是明确的:早期代的缓存没有写入费用,但不可控,保留时间不确定;GPT-5.6 收取写入费用,同时提供保证的保留底线和精确的缓存控制。根据费率,平均重用超过一次的前缀节省的费用超过了增加的写入成本;30 分钟的保留底线和可控的断点使得达到该重用率变得更加可预测。

在 AIHubMix 上入门

所有三个层级均已上线,模型 ID 为 gpt-5.6-solgpt-5.6-terragpt-5.6-luna。缓存无需额外配置;连续请求相同的长前缀会命中缓存:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "您是分析季度财务报告的细致助手... [静态长指令,>=1024 个标记]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "用一句话总结关键数字。"},
        ],
    )
    print(completion.usage.prompt_tokens_details)

第二次调用时 usage.prompt_tokens_details.cached_tokens 的值大于 0 表示命中(测量示例:cached_tokens: 2816)。有关参数详细信息、计费细节和命中故障排除,请参见 GPT 提示缓存 文档。

常见问题

哪些 API 可以在 AIHubMix 上调用 GPT-5.6?

聊天完成(/v1/chat/completions)、响应(/v1/responses)和 Claude 兼容的消息 API(/v1/messages)都可以调用这些模型,所有三个层级均已上线。对于提示缓存,目前推荐的路径是聊天完成。

如果我的客户端没有任何更改,升级到 GPT-5.6 后计费会有什么变化?

提示缓存默认自动应用:前缀达到 1,024 个标记的请求会产生 1.25 倍输入费率的缓存写入项,重用的前缀按 0.1 倍读取费率计费。具有高前缀重用的应用程序通常会看到较低的总成本;一次性长请求如果从未重用前缀,可以通过显式模式禁用缓存。

我使用过 Claude 提示缓存。迁移到 GPT-5.6 时我需要更改什么?

提示结构策略保持不变:静态内容优先,变化内容最后。参数从 cache_control 更改为 prompt_cache_breakpoint,加上 prompt_cache_key;保留时间从 5 分钟/1 小时层级更改为 30 分钟的保证底线。

我如何在三个 GPT-5.6 层级中选择?

根据官方定位:选择 Sol 进行复杂专业工作和编码任务;选择 Terra 进行日常工作负载(GPT-5.5 级别的性能,价格仅为一半);选择 Luna 进行对成本敏感的高容量场景。所有三个层级共享相同的上下文窗口和最大输出,因此可以根据任务复杂性进行路由。

官方参考

本文中的模型规格、缓存机制和计费率来自以下官方来源:

本网站相关文档:GPT 提示缓存 · Claude 提示缓存 · 提示缓存实践


访问 模型库 查看 GPT-5.6 定价,或在 文档中心 探索更多集成选项。


最后更新:2026-07-10

More from the blog