GPT-6.1 Sol 的真实成本:超越 $2 / $10 的价格标签

推理时代阅读约 6 分钟
GPT-6.1 Sol 的真实成本:超越 $2 / $10 的价格标签

GPT-6.1 Sol 的标价与 GPT-6 Sol 相同: 每百万输入令牌 $2,每百万输出令牌 $10。您的实际账单取决于其他四个因素:您多频繁命中缓存、是否超过 272K 输入令牌、使用哪个服务等级,以及模型消耗了多少推理令牌。本文将逐一介绍这些因素。


完整的价格列表

标准费率(每百万令牌)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
输入$2.00$2.00$10.00$0.10
缓存输入$0.10$0.20$1.00—
缓存写入$2.50$2.50——
输出(包括推理)$10.00$10.00$50.00$0.50
Astra 的缓存费率来自第三方报告。根据 OpenAI 的 1.25× 规则,其缓存写入费率应为 $12.50。有关 Luna 的缓存定价,请参见 OpenAI 的定价页面。

乘数

这些规则来自于 GPT-6.1 Sol 模型页面:

条件发生了什么
超过 272K 输入令牌整个请求按 2× 输入和缓存计费,1.5× 输出($4 / $15,缓存读取 $0.20,缓存写入 $5)
批处理 / 灵活标准费率的一半
快速模式标准费率的两倍(在欧盟数据驻留下不可用)
区域处理+10%
工具调用(搜索、计算机使用等)按调用收费。AIHubMix 将网络搜索列为每次请求 $0.01
超快速(即将推出 Codex)尚未正式定价。一份报告称为标准的 6×,未经确认

在 AIHubMix 上,OpenAI 和 Azure 的路线与 OpenAI 直接的费用相同,超过 272K 的等级已经列出。


真正的变化:缓存读取为输入的 5%

标价没有变化。 缓存读取的费用从输入费率的 10%($0.20)降至 5%($0.10)。 OpenAI 的 提示缓存文档 明确指出:在大多数模型中,缓存读取为输入的 0.1×,而“在 GPT-6.1 Sol 中为 0.05×。”

这很重要,因为代理在每一步都会重新发送相同的内容:系统提示、工具定义、代码库上下文和对话历史。它们的大部分输入都是重复的内容。对于这些工作负载,缓存费率实际上就是您的真实输入价格。

示例:一个编码代理任务

假设:

  • 一个 200K 令牌的固定前缀(系统提示、工具、代码库上下文)
  • 50 步,每步增加 2K 新输入令牌并产生 3K 输出令牌(包括推理)
  • 为了简单起见,前缀保持相同大小,在第 1 步写入缓存,并在剩余的 49 步中命中
6.1 Sol,无缓存6 Sol + 缓存6.1 Sol + 缓存Astra + 缓存
初始 200K 缓存写入—$0.50$0.50$2.50
49 次缓存读取—$1.96$0.98$9.80
前缀按常规输入计费$20.00———
100K 新输入(按写入费率)$0.20$0.25$0.25$1.25
150K 输出$1.50$1.50$1.50$7.50
总计$21.70$4.21$3.23$21.05

三点总结:

  1. 缓存是最大的杠杆。 相同的模型,相同的工作,未缓存的运行成本几乎高出 7 倍。
  2. 6.1 Sol 比 6 Sol 便宜约 23% ,同时得分更高。
  3. 对于缓存密集型工作,Astra 的成本比 5× 的标价差距更高。 在这个例子中是 6.5×,因为 Astra 将缓存输入折扣 90%,而 6.1 Sol 将其折扣 95%。

这与 OpenAI 报告的每个任务成本一致(由 Vellum 和 The Next Web 编制):在 DeepSWE 上约 $1.50 对比 $7.70,在 OSWorld 上 $1.30 对比 $9.30,在 Terminal-Bench Science 上 $5.47 对比 $23.80。

一个警告:OpenAI 表示 Astra 通常需要更少的输出令牌来完成相同的任务。比较模型时,请关注每个任务的成本,而不是每个令牌的成本。

缓存写入不是免费的

在 6.1 Sol 上,缓存写入的费用是输入费率的 1.25×。 如果前缀只使用一次,缓存会使其成本增加 25%。 使用 OpenAI 文档中的公式:

  • 一次写入加一次读取:常规输入成本的 1.35×(在 6.1 Sol 上为 1.3×),而不使用缓存则为 2×
  • 一次写入加九次读取:约 2.15×(在 6.1 Sol 上约 1.7×),而不使用缓存则为 10×

最小可缓存前缀为 1,024 令牌。 OpenAI 的盈亏平衡计算表明,前缀为 102 令牌或更少时永远不会盈利。如果您预计会重用 10 次或更多,将超过 221 令牌的任何内容填充到 1,024 令牌会更便宜。

对于一次性调用,例如单轮分类或批量提取,使用显式模式(prompt_cache_options.mode: "explicit")且没有断点。您将不会被收取任何写入费用。


272K 陡坡

6.1 Sol 接受 1.05M 令牌的上下文,但 一旦输入超过 272K,整个请求将转到更高的费率,而不仅仅是超过限制的令牌。

请求输入输出成本
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

多出一万输入令牌几乎使账单翻倍。

如何保持在此限制之下:

  • 在客户端计算令牌,并在达到 272K 之前进行压缩或修剪
  • 检索长文档的相关部分,而不是发送整个文档
  • 当您确实需要长上下文时,将固定部分放在缓存前缀中

推理工作如何在账单中体现

推理令牌按输出费率计费,每百万 $10。将相同的任务从低到高可能会使推理令牌增加十倍或更多。

OpenAI 报告的每个任务成本提供了规模的感觉(这些是不同的基准,因此仅比较数量级):

  • AutomationBench(中):约 $0.30
  • GDP.pdf:约 $0.38
  • DeepSWE(高):约 $1.50
  • Terminal-Bench Science(最大):约 $5.47

第二部分涵盖如何选择级别。这里有一个提醒: 在对话中更改 reasoning.effort 会使缓存失效。 请使用 configuration_update 代替。


在这个价格点的比较

模型输入 / 输出缓存输入
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol 和 Claude Sonnet 5.5 共享相同的标价,而 6.1 Sol 的缓存费率是 Sonnet 的一半。不过,它们在不同的领域表现出色。例如,在 AutomationBench 上,Sonnet 5.5 的得分远远领先。 当两个模型每个令牌的费用相同时,工作负载中每个任务的费用较低的模型就是更便宜的选择。

 AIHubMix 模型列表 显示当前价格,并且一个 API 密钥适用于所有模型,因此并排测试非常简单。

竞争对手的价格来自第三方来源,可能会发生变化。在依赖它们之前,请检查官方定价页面。

成本清单

  1. 将稳定内容放在首位。 系统提示、工具定义和参考材料放在顶部。时间戳和每用户数据放在最后。
  2. 追加,而不是重写。 总结、截断和压缩都会重新启动缓存。
  3. 保持工具列表稳定。 不要在每个请求中添加或删除工具。请使用 tool_choice 或 allowed_tools 。
  4. 使用 configuration_update 切换努力,而不是请求参数。
  5. 保持在 272K 输入之下。
  6. 通过批处理或灵活方式发送非紧急工作 以获得半价。
  7. 按任务路由。 Luna 适用于简单的高容量工作,6.1 Sol 适用于大多数任务,Astra 适用于最困难的问题。
  8. 关注三个数字: cached_tokens、 cache_write_tokens 和 reasoning_tokens。

底线: 标价没有变化,但缓存读取费用降低了 50%。 对于代理工作负载,只要您合理使用缓存并保持在 272K 之下,6.1 Sol 就是 GPT-6 系列中性价比最高的模型。

接下来:切换时可能遇到的问题。


常见问题

GPT-6.1 Sol 的费用是多少? 每百万输入令牌 $2,每百万输出令牌 $10,缓存输入 $0.10,缓存写入 $2.50。超过 272K 输入令牌的请求按整个请求 $4 输入和 $15 输出计费。

通过 AIHubMix 或 OpenAI 直接购买更便宜吗? 价格相同。AIHubMix 的 OpenAI 和 Azure 路线均与 OpenAI 的官方费率相匹配。

为什么我的账单比我估计的要高? 四个常见原因:推理令牌按输出费率计费;您超过了 272K 输入;您错过了缓存或在一次性前缀上支付了写入费用;或者启用了快速模式或区域处理。

缓存写入是否需要额外费用? 写入的令牌按输入费率的 1.25× 计费。这替代了正常的输入费用,而不是增加费用。前缀在使用两次后自给自足。对于一次性前缀,显式模式允许您完全跳过写入。

6.1 Sol 比 Astra 便宜多少? 在标价上便宜五倍。对于缓存密集型代理工作,差距可以达到 6 到 7 倍,因为 6.1 Sol 对缓存输入的折扣更大。然而,Astra 通常在每个任务中使用更少的输出令牌,因此请比较每个任务的成本。

批处理可以与缓存结合使用吗? 批处理和灵活方式均为半价。有关它们与缓存的叠加情况,请查看 OpenAI 的定价页面。


继续阅读:GPT-6.1 Sol 系列


来源