GPT-6.1 Sol 的标价与 GPT-6 Sol 相同: 每百万输入令牌 $2,每百万输出令牌 $10。您的实际账单取决于其他四个因素:您多频繁命中缓存、是否超过 272K 输入令牌、使用哪个服务等级,以及模型消耗了多少推理令牌。本文将逐一介绍这些因素。
完整的价格列表
标准费率(每百万令牌)
| GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra | GPT-6 Luna | |
|---|---|---|---|---|
| 输入 | $2.00 | $2.00 | $10.00 | $0.10 |
| 缓存输入 | $0.10 | $0.20 | $1.00 | — |
| 缓存写入 | $2.50 | $2.50 | — | — |
| 输出(包括推理) | $10.00 | $10.00 | $50.00 | $0.50 |
Astra 的缓存费率来自第三方报告。根据 OpenAI 的 1.25× 规则,其缓存写入费率应为 $12.50。有关 Luna 的缓存定价,请参见 OpenAI 的定价页面。
乘数
这些规则来自于 GPT-6.1 Sol 模型页面:
| 条件 | 发生了什么 |
|---|---|
| 超过 272K 输入令牌 | 整个请求按 2× 输入和缓存计费,1.5× 输出($4 / $15,缓存读取 $0.20,缓存写入 $5) |
| 批处理 / 灵活 | 标准费率的一半 |
| 快速模式 | 标准费率的两倍(在欧盟数据驻留下不可用) |
| 区域处理 | +10% |
| 工具调用(搜索、计算机使用等) | 按调用收费。AIHubMix 将网络搜索列为每次请求 $0.01 |
| 超快速(即将推出 Codex) | 尚未正式定价。一份报告称为标准的 6×,未经确认 |
在 AIHubMix 上,OpenAI 和 Azure 的路线与 OpenAI 直接的费用相同,超过 272K 的等级已经列出。
真正的变化:缓存读取为输入的 5%
标价没有变化。 缓存读取的费用从输入费率的 10%($0.20)降至 5%($0.10)。 OpenAI 的 提示缓存文档 明确指出:在大多数模型中,缓存读取为输入的 0.1×,而“在 GPT-6.1 Sol 中为 0.05×。”
这很重要,因为代理在每一步都会重新发送相同的内容:系统提示、工具定义、代码库上下文和对话历史。它们的大部分输入都是重复的内容。对于这些工作负载,缓存费率实际上就是您的真实输入价格。
示例:一个编码代理任务
假设:
- 一个 200K 令牌的固定前缀(系统提示、工具、代码库上下文)
- 50 步,每步增加 2K 新输入令牌并产生 3K 输出令牌(包括推理)
- 为了简单起见,前缀保持相同大小,在第 1 步写入缓存,并在剩余的 49 步中命中
| 6.1 Sol,无缓存 | 6 Sol + 缓存 | 6.1 Sol + 缓存 | Astra + 缓存 | |
|---|---|---|---|---|
| 初始 200K 缓存写入 | — | $0.50 | $0.50 | $2.50 |
| 49 次缓存读取 | — | $1.96 | $0.98 | $9.80 |
| 前缀按常规输入计费 | $20.00 | — | — | — |
| 100K 新输入(按写入费率) | $0.20 | $0.25 | $0.25 | $1.25 |
| 150K 输出 | $1.50 | $1.50 | $1.50 | $7.50 |
| 总计 | $21.70 | $4.21 | $3.23 | $21.05 |
三点总结:
- 缓存是最大的杠杆。 相同的模型,相同的工作,未缓存的运行成本几乎高出 7 倍。
- 6.1 Sol 比 6 Sol 便宜约 23% ,同时得分更高。
- 对于缓存密集型工作,Astra 的成本比 5× 的标价差距更高。 在这个例子中是 6.5×,因为 Astra 将缓存输入折扣 90%,而 6.1 Sol 将其折扣 95%。
这与 OpenAI 报告的每个任务成本一致(由 Vellum 和 The Next Web 编制):在 DeepSWE 上约 $1.50 对比 $7.70,在 OSWorld 上 $1.30 对比 $9.30,在 Terminal-Bench Science 上 $5.47 对比 $23.80。
一个警告:OpenAI 表示 Astra 通常需要更少的输出令牌来完成相同的任务。比较模型时,请关注每个任务的成本,而不是每个令牌的成本。
缓存写入不是免费的
在 6.1 Sol 上,缓存写入的费用是输入费率的 1.25×。 如果前缀只使用一次,缓存会使其成本增加 25%。 使用 OpenAI 文档中的公式:
- 一次写入加一次读取:常规输入成本的 1.35×(在 6.1 Sol 上为 1.3×),而不使用缓存则为 2×
- 一次写入加九次读取:约 2.15×(在 6.1 Sol 上约 1.7×),而不使用缓存则为 10×
最小可缓存前缀为 1,024 令牌。 OpenAI 的盈亏平衡计算表明,前缀为 102 令牌或更少时永远不会盈利。如果您预计会重用 10 次或更多,将超过 221 令牌的任何内容填充到 1,024 令牌会更便宜。
对于一次性调用,例如单轮分类或批量提取,使用显式模式(prompt_cache_options.mode: "explicit")且没有断点。您将不会被收取任何写入费用。
272K 陡坡
6.1 Sol 接受 1.05M 令牌的上下文,但 一旦输入超过 272K,整个请求将转到更高的费率,而不仅仅是超过限制的令牌。
| 请求 | 输入 | 输出 | 成本 |
|---|---|---|---|
| A | 270K | 10K | 0.27 × $2 + 0.01 × $10 = $0.64 |
| B | 280K | 10K | 0.28 × $4 + 0.01 × $15 = $1.27 |
多出一万输入令牌几乎使账单翻倍。
如何保持在此限制之下:
- 在客户端计算令牌,并在达到 272K 之前进行压缩或修剪
- 检索长文档的相关部分,而不是发送整个文档
- 当您确实需要长上下文时,将固定部分放在缓存前缀中
推理工作如何在账单中体现
推理令牌按输出费率计费,每百万 $10。将相同的任务从低到高可能会使推理令牌增加十倍或更多。
OpenAI 报告的每个任务成本提供了规模的感觉(这些是不同的基准,因此仅比较数量级):
- AutomationBench(中):约 $0.30
- GDP.pdf:约 $0.38
- DeepSWE(高):约 $1.50
- Terminal-Bench Science(最大):约 $5.47
第二部分涵盖如何选择级别。这里有一个提醒: 在对话中更改 reasoning.effort 会使缓存失效。 请使用 configuration_update 代替。
在这个价格点的比较
| 模型 | 输入 / 输出 | 缓存输入 |
|---|---|---|
| GPT-6.1 Sol | $2 / $10 | $0.10 |
| Claude Sonnet 5.5 | $2 / $10 | $0.20 |
| GPT-6 Astra | $10 / $50 | $1.00 |
6.1 Sol 和 Claude Sonnet 5.5 共享相同的标价,而 6.1 Sol 的缓存费率是 Sonnet 的一半。不过,它们在不同的领域表现出色。例如,在 AutomationBench 上,Sonnet 5.5 的得分远远领先。 当两个模型每个令牌的费用相同时,工作负载中每个任务的费用较低的模型就是更便宜的选择。
AIHubMix 模型列表 显示当前价格,并且一个 API 密钥适用于所有模型,因此并排测试非常简单。
竞争对手的价格来自第三方来源,可能会发生变化。在依赖它们之前,请检查官方定价页面。
成本清单
- 将稳定内容放在首位。 系统提示、工具定义和参考材料放在顶部。时间戳和每用户数据放在最后。
- 追加,而不是重写。 总结、截断和压缩都会重新启动缓存。
- 保持工具列表稳定。 不要在每个请求中添加或删除工具。请使用
tool_choice或allowed_tools。 - 使用
configuration_update切换努力,而不是请求参数。 - 保持在 272K 输入之下。
- 通过批处理或灵活方式发送非紧急工作 以获得半价。
- 按任务路由。 Luna 适用于简单的高容量工作,6.1 Sol 适用于大多数任务,Astra 适用于最困难的问题。
- 关注三个数字:
cached_tokens、cache_write_tokens和reasoning_tokens。
底线: 标价没有变化,但缓存读取费用降低了 50%。 对于代理工作负载,只要您合理使用缓存并保持在 272K 之下,6.1 Sol 就是 GPT-6 系列中性价比最高的模型。
接下来:切换时可能遇到的问题。
常见问题
GPT-6.1 Sol 的费用是多少? 每百万输入令牌 $2,每百万输出令牌 $10,缓存输入 $0.10,缓存写入 $2.50。超过 272K 输入令牌的请求按整个请求 $4 输入和 $15 输出计费。
通过 AIHubMix 或 OpenAI 直接购买更便宜吗? 价格相同。AIHubMix 的 OpenAI 和 Azure 路线均与 OpenAI 的官方费率相匹配。
为什么我的账单比我估计的要高? 四个常见原因:推理令牌按输出费率计费;您超过了 272K 输入;您错过了缓存或在一次性前缀上支付了写入费用;或者启用了快速模式或区域处理。
缓存写入是否需要额外费用? 写入的令牌按输入费率的 1.25× 计费。这替代了正常的输入费用,而不是增加费用。前缀在使用两次后自给自足。对于一次性前缀,显式模式允许您完全跳过写入。
6.1 Sol 比 Astra 便宜多少? 在标价上便宜五倍。对于缓存密集型代理工作,差距可以达到 6 到 7 倍,因为 6.1 Sol 对缓存输入的折扣更大。然而,Astra 通常在每个任务中使用更少的输出令牌,因此请比较每个任务的成本。
批处理可以与缓存结合使用吗? 批处理和灵活方式均为半价。有关它们与缓存的叠加情况,请查看 OpenAI 的定价页面。
继续阅读:GPT-6.1 Sol 系列
- 推理令牌是最容易失去追踪的成本。 哪些任务在低水平下可以正常进行,以及何时最大化收益: 为 GPT-6.1 Sol 选择推理努力:从低到高。
- 新的缓存规则在迁移后可能会增加您的账单。 断点、写入计费、TTL 和其他八个陷阱: 迁移到 GPT-6.1 Sol:9 个可能出错的事情。
- 更便宜,但够好吗? 6.1 Sol 在编码和计算机使用方面与 Astra 的接近程度: GPT-6.1 Sol 与 GPT-6 Sol:一个几乎赶上 Astra 的一周升级。



