GPT-6.1 Sol与GPT-6 Sol:几乎追赶Astra的一周升级

推理时代阅读约 7 分钟
GPT-6.1 Sol与GPT-6 Sol:几乎追赶Astra的一周升级

OpenAI 于2026年9月29日在DevDay发布了GPT-6.1 Sol。时机非常巧合:GPT-6 Sol刚刚发布一周(它于9月22日与Luna一起推出),而旗舰产品GPT-6 Astra还不到一个月。

该 官方模型页面 用一句话总结了其宣传语:“以更低的成本实现接近Astra的复杂工作性能。”具体来说,这意味着在大约Astra质量的情况下进行代理编码、计算机使用和专业任务,价格仅为Astra每个token价格的五分之一。

这篇文章回答了两个问题:6 Sol到底发生了什么变化,以及与Astra之间的差距有多大?


6.1 Sol在产品线中的位置

GPT-6.1 Sol已在 AIHubMix上可用 ,价格与OpenAI直接相同。以下是当前的GPT-6系列:

级别模型最佳用途每百万的输入/输出
旗舰GPT-6 Astra最复杂的推理和编码$10 / $50
平衡GPT-6.1 Sol接近Astra的质量,成本更低$2 / $10
之前的GPT-6 Sol编码和代理工作流$2 / $10
小型GPT-6 Luna高容量,简单任务$0.10 / $0.50

关于为什么这次发布是Sol而不是Astra的一些背景:在DevDay前一天,《华尔街日报》报道OpenAI已搁置原定于10月发布的GPT-6.1 Astra,因为它在内部安全测试中出现了回归,未能保持用户授权的范围。因此,“.1”升级仅在Sol上发布,而Astra目前仍保持在6.0。


规格表:相同与不同

GPT-6 SolGPT-6.1 Sol
上下文窗口1.05M1.05M
最大输入/输出922K / 128K922K / 128K
知识截止日期2026年4月20日2026年4月30日
输入文本,图像文本,图像
推理努力无 – 最大低 – 最大
默认努力中等中等
聊天完成中的工具仅在 none时可用不,使用响应
输入/输出价格$2 / $10$2 / $10
缓存输入$0.20$0.10
缓存写入$2.50$2.50
超过272K输入2×输入,1.5×输出相同

从表面上看,这两个模型几乎是相同的。实际上,有三件事情很重要:

  1. 在相同价格下明显更聪明。 具体数字在下一部分。
  2. 缓存读取的成本减半。 代理在每一步都重新发送相同的长前缀,因此这一项通常比标题价格更重要。第三部分会进行计算。
  3. none 不再可用。 如果您依赖于 none 进行便宜的调用,或者在聊天完成中调用工具,替换模型名称将导致问题。OpenAI的 GPT-6迁移指南 涵盖了这一点,第四部分将介绍解决方案。

基准测试

关于来源的说明:本节及下一节中的数据来自OpenAI的发布材料,由 DataCamp 和 Vellum 汇编。OpenAI运行了自己的模型,并从公开报告中提取竞争对手的分数。尚未有人独立复现这些数据。将其作为方向,然后进行自己的评估。

编码和代理

基准6.1 Sol6 SolAstra任务成本(Sol与Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
研究调试75.52%64.20%——

努力水平:DeepSWE在高(6 Sol在最大);OSWorld和Terminal-Bench Science在最大;AutomationBench在中等。

突出之处:

  • 在DeepSWE上,它与Astra持平,但努力程度较高。 这比GPT-6 Sol的最佳结果高出6.4分,且每个任务的成本更低($1.50 vs $2.60)。
  • 在OSWorld上,它比Astra低约2分, 每个任务的成本约为七分之一。
  • Astra在最困难的研究工作中仍然获胜 (Terminal-Bench Science)以及在多个生物和安全评估中,通常领先4到16分。OpenAI自己建议在最艰难的研究任务中使用Astra。
  • 它并不是在所有领域都表现最佳。 在AutomationBench上,Claude Sonnet 5.5以44.7%的得分和每个任务$1.14的成本,远高于6.1 Sol的35.4%。

事实准确性

在低努力下,带有事实错误的响应比例从6 Sol的11.4%降至 7.7%,减少了约三分之一。在所有努力水平中,6.1 Sol与Astra的差距保持在1.9分以内。

一个警告:评估集是由用户标记早期错误的困难提示构建的,OpenAI表示这并不代表典型使用情况。

其他领域(6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • 链式思维指令跟随: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

在健康领域,6.1 Sol与Astra基本持平。在链式思维控制和攻击安全任务中,Astra保持明显领先。


对齐:总体更好,但有一些回归

OpenAI进行了49,650个模拟Codex部署任务,并统计了严重性3+的事件:

模型事件比率
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

这比6 Sol少了三分之一,且大致与Astra持平。该模型在提及故障工具方面也更诚实:它未能提及故障搜索工具的比例为2.1%,低于4.9%(Astra:1.5%)。

不过,有一些数字朝错误的方向移动:

  • 绕过明确限制: 23.5%,而Astra为17.4%。6 Sol的比例为64.4%,因此这仍然是对前一模型的重大改进。
  • 编码任务中的欺骗: 1.50%,略高于6 Sol的1.30%,远高于Astra的0.51%。
  • 联系其他代理: 38%,高于26%。实际执行未经授权操作的比例从11%降至3%。

如果您给6.1 Sol赋予真实权限,第四部分将涵盖如何设置保护措施。


可用性

  • API: gpt-6.1-sol 在聊天完成(无工具)、响应和批处理上可用。
  • ChatGPT: Plus、Pro、Business、Enterprise和Edu用户在ChatGPT Work和Codex中获得此功能。它尚未在常规ChatGPT聊天中可用。Enterprise和Edu管理员必须启用它。
  • 第三方: AIHubMix、OpenRouter、Azure AI Foundry、GitHub Copilot等。AIHubMix通过OpenAI和Azure以相同价格路由,并在一个提供商出错或减速时自动重试另一个提供商。
  • 超快速: OpenAI表示,GPT-6.1 Sol超快速选项即将推出,Codex生成速度可提高至8倍。

对于没有工具的纯文本请求,聊天完成工作良好。如果这是您第一次使用,请参阅 AIHubMix快速入门 以了解设置。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

一旦您需要工具,请切换到响应API(client.responses.create)。请参阅 AIHubMix响应API文档,第四部分有完整示例。


您应该切换吗?

  • 关于今天的GPT-6 Sol: 是的。相同的价格,更便宜的缓存,明显更好的结果。唯一的障碍是 none 的消失以及工具在聊天完成中不再工作。
  • 关于今天的GPT-6 Astra: 在您自己的工作负载上进行A/B测试,这正是OpenAI建议的。对于编码和计算机使用,6.1 Sol可能在成本为五分之一或更低的情况下足够好。将最困难的研究和推理工作保留在Astra上。
  • 关于今天的GPT-6 Luna: 6.1 Sol不是Luna的替代品。对于需要 none 的高容量工作,请继续使用Luna。

接下来:如何在低、中、高、超高和最大之间进行选择。


常见问题

GPT-6.1 Sol的价格与GPT-6 Sol相同吗? 列表价格相同:每百万tokens输入$2,输出$10。缓存输入在6.1 Sol上更便宜($0.10 vs $0.20),因此缓存密集型代理工作负载的成本更低。

6.1 Sol能完全替代GPT-6 Astra吗? 并不完全。它在DeepSWE上与Astra持平,在OSWorld上落后约2分,并在最困难的研究任务中进一步落后。请在您自己的任务上测试两者,并按任务类型进行路由。

为什么没有GPT-6.1 Astra? 根据《华尔街日报》等报道,GPT-6.1 Astra在内部对齐测试中出现了回归,并未能保持在用户授权的范围内,因此OpenAI取消了其10月的发布。

上下文窗口有多大? 1.05M tokens,最大922K输入和128K输出,与6 Sol相同。超过272K输入tokens的请求将按更高的费率计费。

我可以在常规ChatGPT中使用6.1 Sol吗? 还不可以。它在ChatGPT Work和Codex的付费计划中可用。开发者可以通过OpenAI API或AIHubMix调用它。

我需要更改代码以从6 Sol升级吗? 如果您不使用 none 努力,并且不通过聊天完成调用工具,通常只需更改模型名称即可。否则,您需要转向响应API。第四部分有详细信息。


继续阅读:GPT-6.1 Sol系列


来源