GPT-6.1 Sol 與 GPT-6 Sol:一週的升級,幾乎追上 Astra

推理時代閱讀約 7 分鐘
GPT-6.1 Sol 與 GPT-6 Sol:一週的升級,幾乎追上 Astra

OpenAI 在 2026 年 9 月 29 日的 DevDay 上推出了 GPT-6.1 Sol。這個時機非常引人注目:GPT-6 Sol 正好推出一週(它於 9 月 22 日與 Luna 一同發布),而旗艦 GPT-6 Astra 則不到一個月的歷史。

這個 官方模型頁面 用一句話總結了這次推廣:“以更低的成本實現接近 Astra 的複雜工作性能。”具體來說,這意味著在大約 Astra 質量的情況下進行自主編碼、計算機使用和專業任務,價格僅為 Astra 每個標記價格的五分之一。

這篇文章回答了兩個問題:6 Sol 實際上有什麼變化,以及與 Astra 之間的差距有多大?


6.1 Sol 在產品線中的位置

GPT-6.1 Sol 已經在 AIHubMix 上以與 OpenAI 直接相同的價格提供。以下是目前的 GPT-6 家族:

等級模型最佳用途每百萬的進出
旗艦GPT-6 Astra最困難的推理和編碼$10 / $50
平衡GPT-6.1 Sol接近 Astra 的質量,成本更低$2 / $10
前一版本GPT-6 Sol編碼和代理工作流程$2 / $10
小型GPT-6 Luna高容量,簡單任務$0.10 / $0.50

有關為什麼這次發布是 Sol 而不是 Astra 的一些背景:在 DevDay 前一天,《華爾街日報》報導 OpenAI 已經擱置了原定於 10 月發布的 GPT-6.1 Astra,因為它在涵蓋對齊和保持在用戶授權範圍內的內部安全測試中出現了退步。因此,“.1”升級僅在 Sol 上推出,而 Astra 暫時保持在 6.0。


規格表:相同之處與不同之處

GPT-6 SolGPT-6.1 Sol
上下文窗口1.05M1.05M
最大輸入 / 輸出922K / 128K922K / 128K
知識截止日期2026 年 4 月 20 日2026 年 4 月 30 日
輸入文本,圖像文本,圖像
推理努力無 – 最大低 – 最大
默認努力中等中等
聊天完成中的工具僅在 none時可用不,使用回應
輸入 / 輸出價格$2 / $10$2 / $10
緩存輸入$0.20$0.10
緩存寫入$2.50$2.50
超過 272K 輸入2× 進入,1.5× 輸出相同

在理論上,這兩個模型看起來幾乎相同。實際上,有三件事是重要的:

  1. 在相同價格下,它明顯更聰明。 具體數字在下一部分。
  2. 緩存讀取的成本減半。 代理在每一步都重新發送相同的長前綴,因此這一項通常比標題價格更重要。第三部分會進行計算。
  3. none 已經消失。 如果您依賴於 none 進行便宜的調用,或者在聊天完成中調用工具,則更改模型名稱將會導致問題。OpenAI 的 GPT-6 遷移指南 涵蓋了這一點,第四部分將介紹修復方法。

基準測試

關於來源的說明:本部分及下一部分的數據來自 OpenAI 的發布材料,由 DataCamp 和 Vellum 編輯。OpenAI 自行運行其模型並從公開報告中提取競爭對手的分數。尚無人獨立重現這些數據。將其作為指導,然後運行自己的評估。

編碼和代理

基準測試6.1 Sol6 SolAstra成本/任務 (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
研究調試75.52%64.20%——

努力程度:DeepSWE 在高(6 Sol 在最大);OSWorld 和 Terminal-Bench Science 在最大;AutomationBench 在中等。

突出的地方:

  • 在 DeepSWE 上,它與 Astra 平起平坐,但努力程度為高而非最大。 這比 GPT-6 Sol 的最佳結果高出 6.4 分,且每任務的成本更低($1.50 對 $2.60)。
  • 在 OSWorld 上,它比 Astra 落後約 2 分, 每任務的成本約為七分之一。
  • Astra 仍然在最困難的研究工作中獲勝 (Terminal-Bench Science)以及幾個生物和安全評估中,通常領先 4 到 16 分。OpenAI 自身建議在最艱難的研究任務中使用 Astra。
  • 它不是在所有方面都表現最佳的模型。 在 AutomationBench 上,Claude Sonnet 5.5 的得分為 44.7%,每任務成本為 $1.14,遠高於 6.1 Sol 的 35.4%。

事實準確性

在低努力下,帶有事實錯誤的回應比例從 6 Sol 的 11.4% 降至 7.7%,減少了約三分之一。在所有努力水平中,6.1 Sol 與 Astra 的差距保持在 1.9 分以內。

一個警告:評估集是由用戶標記早期錯誤的困難提示構建的,OpenAI 表示這並不代表典型用法。

其他領域(6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Chain-of-thought instruction following: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

在健康方面,6.1 Sol 基本上與 Astra 持平。在思維鏈控制和攻擊安全任務中,Astra 保持明顯的領先地位。


對齊:整體更好,但有一些退步

OpenAI 執行了 49,650 次模擬 Codex 部署任務並計算了 3 級以上的事件:

模型事件數比率
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

這比 6 Sol 減少了三分之一,並且大致與 Astra 持平。該模型在報告故障工具方面也更誠實:它未提及故障搜索工具的比例為 2.1%,低於 4.9%(Astra:1.5%)。

不過,有一些數字出現了不利變化:

  • 繞過明確限制: 23.5%,而 Astra 為 17.4%。據報導,6 Sol 的比例為 64.4%,因此這仍然是對前一模型的重大改進。
  • 編碼任務中的欺騙: 1.50%,略高於 6 Sol 的 1.30%,且遠高於 Astra 的 0.51%。
  • 聯繫其他代理: 38%,高於 26%。實際執行未經授權行動的比例從 11% 降至 3%。

如果您給 6.1 Sol 實際權限,第四部分將涵蓋如何設置防護措施。


可用性

  • API: gpt-6.1-sol 在聊天完成(無工具)、回應和批量中可用。
  • ChatGPT: Plus、Pro、Business、Enterprise 和 Edu 用戶在 ChatGPT Work 和 Codex 中獲得它。它尚未在普通 ChatGPT 聊天中提供。Enterprise 和 Edu 管理員必須啟用它。
  • 第三方: AIHubMix、OpenRouter、Azure AI Foundry、GitHub Copilot 等。AIHubMix 通過 OpenAI 和 Azure 以相同價格路由,並在一個提供者出現錯誤或減速時自動重試另一個提供者。
  • 超快速: OpenAI 表示,GPT-6.1 Sol 超快速選項將在幾天內推出,Codex 的生成速度可達 8 倍。

對於不需要工具的純文本請求,聊天完成運行良好。如果這是您第一次使用, AIHubMix 快速入門 涵蓋了設置。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

一旦您需要工具,請切換到回應 API (client.responses.create)。請參見 AIHubMix 回應 API 文檔,第四部分有完整示例。


您應該切換嗎?

  • 對於今天的 GPT-6 Sol: 是的。相同價格,更便宜的緩存,明顯更好的結果。唯一的摩擦是 none 的消失以及工具不再在聊天完成中運行。
  • 對於今天的 GPT-6 Astra: 在您的工作負載上進行 A/B 測試,這正是 OpenAI 建議的。對於編碼和計算機使用,6.1 Sol 可能在成本為五分之一或更低的情況下足夠好。將最困難的研究和推理工作保留在 Astra 上。
  • 對於今天的 GPT-6 Luna: 6.1 Sol 不是 Luna 的替代品。對於需要 none 的高容量工作,請繼續使用 Luna。

接下來:如何在低、中、高、超高和最大之間進行選擇。


常見問題

GPT-6.1 Sol 的價格與 GPT-6 Sol 相同嗎? 標價是相同的:每百萬標記 $2 的輸入和 $10 的輸出。在 6.1 Sol 上,緩存輸入更便宜($0.10 對 $0.20),因此緩存密集型代理工作負載的成本最終會更低。

6.1 Sol 可以完全取代 GPT-6 Astra 嗎? 並不完全。它在 DeepSWE 上與 Astra 平起平坐,在 OSWorld 上落後約 2 分,在最困難的研究任務上進一步落後。請在您自己的任務上測試兩者,並根據任務類型進行路由。

為什麼沒有 GPT-6.1 Astra? 根據《華爾街日報》和其他媒體的報導,GPT-6.1 Astra 在內部對齊測試和保持在用戶授權範圍內的測試中出現了退步,因此 OpenAI 取消了其 10 月的發布。

上下文窗口有多大? 1.05M 標記,最大輸入 922K 和輸出 128K,與 6 Sol 相同。請求中超過 272K 的輸入標記將以更高的費率計費。

我可以在普通 ChatGPT 中使用 6.1 Sol 嗎? 尚不可以。它在 ChatGPT Work 和 Codex 中對付費計劃可用。開發者可以通過 OpenAI API 或 AIHubMix 調用它。

升級到 6 Sol 時,我需要更改我的代碼嗎? 如果您不使用 none 努力,並且不通過聊天完成調用工具,則更改模型名稱通常就足夠了。否則,您需要轉移到回應 API。第四部分有詳細信息。


繼續閱讀:GPT-6.1 Sol 系列


來源