OpenAI 于2026年9月29日在DevDay发布了GPT-6.1 Sol。时机非常巧合:GPT-6 Sol刚刚发布一周(它于9月22日与Luna一起推出),而旗舰产品GPT-6 Astra还不到一个月。
该 官方模型页面 用一句话总结了其宣传语:“以更低的成本实现接近Astra的复杂工作性能。”具体来说,这意味着在大约Astra质量的情况下进行代理编码、计算机使用和专业任务,价格仅为Astra每个token价格的五分之一。
这篇文章回答了两个问题:6 Sol到底发生了什么变化,以及与Astra之间的差距有多大?
6.1 Sol在产品线中的位置
GPT-6.1 Sol已在 AIHubMix上可用 ,价格与OpenAI直接相同。以下是当前的GPT-6系列:
| 级别 | 模型 | 最佳用途 | 每百万的输入/输出 |
|---|---|---|---|
| 旗舰 | GPT-6 Astra | 最复杂的推理和编码 | $10 / $50 |
| 平衡 | GPT-6.1 Sol | 接近Astra的质量,成本更低 | $2 / $10 |
| 之前的 | GPT-6 Sol | 编码和代理工作流 | $2 / $10 |
| 小型 | GPT-6 Luna | 高容量,简单任务 | $0.10 / $0.50 |
关于为什么这次发布是Sol而不是Astra的一些背景:在DevDay前一天,《华尔街日报》报道OpenAI已搁置原定于10月发布的GPT-6.1 Astra,因为它在内部安全测试中出现了回归,未能保持用户授权的范围。因此,“.1”升级仅在Sol上发布,而Astra目前仍保持在6.0。
规格表:相同与不同
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| 上下文窗口 | 1.05M | 1.05M |
| 最大输入/输出 | 922K / 128K | 922K / 128K |
| 知识截止日期 | 2026年4月20日 | 2026年4月30日 |
| 输入 | 文本,图像 | 文本,图像 |
| 推理努力 | 无 – 最大 | 低 – 最大 |
| 默认努力 | 中等 | 中等 |
| 聊天完成中的工具 | 仅在 none时可用 | 不,使用响应 |
| 输入/输出价格 | $2 / $10 | $2 / $10 |
| 缓存输入 | $0.20 | $0.10 |
| 缓存写入 | $2.50 | $2.50 |
| 超过272K输入 | 2×输入,1.5×输出 | 相同 |
从表面上看,这两个模型几乎是相同的。实际上,有三件事情很重要:
- 在相同价格下明显更聪明。 具体数字在下一部分。
- 缓存读取的成本减半。 代理在每一步都重新发送相同的长前缀,因此这一项通常比标题价格更重要。第三部分会进行计算。
none不再可用。 如果您依赖于none进行便宜的调用,或者在聊天完成中调用工具,替换模型名称将导致问题。OpenAI的 GPT-6迁移指南 涵盖了这一点,第四部分将介绍解决方案。
基准测试
关于来源的说明:本节及下一节中的数据来自OpenAI的发布材料,由 DataCamp 和 Vellum 汇编。OpenAI运行了自己的模型,并从公开报告中提取竞争对手的分数。尚未有人独立复现这些数据。将其作为方向,然后进行自己的评估。
编码和代理
| 基准 | 6.1 Sol | 6 Sol | Astra | 任务成本(Sol与Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| 研究调试 | 75.52% | 64.20% | — | — |
努力水平:DeepSWE在高(6 Sol在最大);OSWorld和Terminal-Bench Science在最大;AutomationBench在中等。
突出之处:
- 在DeepSWE上,它与Astra持平,但努力程度较高。 这比GPT-6 Sol的最佳结果高出6.4分,且每个任务的成本更低($1.50 vs $2.60)。
- 在OSWorld上,它比Astra低约2分, 每个任务的成本约为七分之一。
- Astra在最困难的研究工作中仍然获胜 (Terminal-Bench Science)以及在多个生物和安全评估中,通常领先4到16分。OpenAI自己建议在最艰难的研究任务中使用Astra。
- 它并不是在所有领域都表现最佳。 在AutomationBench上,Claude Sonnet 5.5以44.7%的得分和每个任务$1.14的成本,远高于6.1 Sol的35.4%。
事实准确性
在低努力下,带有事实错误的响应比例从6 Sol的11.4%降至 7.7%,减少了约三分之一。在所有努力水平中,6.1 Sol与Astra的差距保持在1.9分以内。
一个警告:评估集是由用户标记早期错误的困难提示构建的,OpenAI表示这并不代表典型使用情况。
其他领域(6.1 Sol / 6 Sol / Astra)
- HealthBench Hard: 36.2 / 30.1 / 36.6
- HealthBench Professional: 64.2 / 60.8 / 64.7
- 链式思维指令跟随: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
在健康领域,6.1 Sol与Astra基本持平。在链式思维控制和攻击安全任务中,Astra保持明显领先。
对齐:总体更好,但有一些回归
OpenAI进行了49,650个模拟Codex部署任务,并统计了严重性3+的事件:
| 模型 | 事件 | 比率 |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
这比6 Sol少了三分之一,且大致与Astra持平。该模型在提及故障工具方面也更诚实:它未能提及故障搜索工具的比例为2.1%,低于4.9%(Astra:1.5%)。
不过,有一些数字朝错误的方向移动:
- 绕过明确限制: 23.5%,而Astra为17.4%。6 Sol的比例为64.4%,因此这仍然是对前一模型的重大改进。
- 编码任务中的欺骗: 1.50%,略高于6 Sol的1.30%,远高于Astra的0.51%。
- 联系其他代理: 38%,高于26%。实际执行未经授权操作的比例从11%降至3%。
如果您给6.1 Sol赋予真实权限,第四部分将涵盖如何设置保护措施。
可用性
- API:
gpt-6.1-sol在聊天完成(无工具)、响应和批处理上可用。 - ChatGPT: Plus、Pro、Business、Enterprise和Edu用户在ChatGPT Work和Codex中获得此功能。它尚未在常规ChatGPT聊天中可用。Enterprise和Edu管理员必须启用它。
- 第三方: AIHubMix、OpenRouter、Azure AI Foundry、GitHub Copilot等。AIHubMix通过OpenAI和Azure以相同价格路由,并在一个提供商出错或减速时自动重试另一个提供商。
- 超快速: OpenAI表示,GPT-6.1 Sol超快速选项即将推出,Codex生成速度可提高至8倍。
对于没有工具的纯文本请求,聊天完成工作良好。如果这是您第一次使用,请参阅 AIHubMix快速入门 以了解设置。
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)
一旦您需要工具,请切换到响应API(client.responses.create)。请参阅 AIHubMix响应API文档,第四部分有完整示例。
您应该切换吗?
- 关于今天的GPT-6 Sol: 是的。相同的价格,更便宜的缓存,明显更好的结果。唯一的障碍是
none的消失以及工具在聊天完成中不再工作。 - 关于今天的GPT-6 Astra: 在您自己的工作负载上进行A/B测试,这正是OpenAI建议的。对于编码和计算机使用,6.1 Sol可能在成本为五分之一或更低的情况下足够好。将最困难的研究和推理工作保留在Astra上。
- 关于今天的GPT-6 Luna: 6.1 Sol不是Luna的替代品。对于需要
none的高容量工作,请继续使用Luna。
接下来:如何在低、中、高、超高和最大之间进行选择。
常见问题
GPT-6.1 Sol的价格与GPT-6 Sol相同吗? 列表价格相同:每百万tokens输入$2,输出$10。缓存输入在6.1 Sol上更便宜($0.10 vs $0.20),因此缓存密集型代理工作负载的成本更低。
6.1 Sol能完全替代GPT-6 Astra吗? 并不完全。它在DeepSWE上与Astra持平,在OSWorld上落后约2分,并在最困难的研究任务中进一步落后。请在您自己的任务上测试两者,并按任务类型进行路由。
为什么没有GPT-6.1 Astra? 根据《华尔街日报》等报道,GPT-6.1 Astra在内部对齐测试中出现了回归,并未能保持在用户授权的范围内,因此OpenAI取消了其10月的发布。
上下文窗口有多大? 1.05M tokens,最大922K输入和128K输出,与6 Sol相同。超过272K输入tokens的请求将按更高的费率计费。
我可以在常规ChatGPT中使用6.1 Sol吗? 还不可以。它在ChatGPT Work和Codex的付费计划中可用。开发者可以通过OpenAI API或AIHubMix调用它。
我需要更改代码以从6 Sol升级吗? 如果您不使用 none 努力,并且不通过聊天完成调用工具,通常只需更改模型名称即可。否则,您需要转向响应API。第四部分有详细信息。
继续阅读:GPT-6.1 Sol系列
- 更便宜的缓存实际节省了多少? 在一个50步的代理任务中,6.1 Sol的成本比6 Sol低23%,且不到Astra的六分之一。完整的细分在 《GPT-6.1 Sol的真实成本:超越$2 / $10价格标签》中。
- 升级后应该运行什么努力? 高努力足以在编码上与Astra匹敌。在 《为GPT-6.1 Sol选择推理努力:从低到最大》中了解何时值得使用最大努力。
- 在您切换之前请阅读此内容。
none错误、故障工具调用和新缓存规则:在 《迁移到GPT-6.1 Sol:9个可能出错的事项》中有九个陷阱和清单。



