GPT-6.1 Sol 的實際成本:超越 $2 / $10 的標籤

推理時代閱讀約 6 分鐘
GPT-6.1 Sol 的實際成本:超越 $2 / $10 的標籤

GPT-6.1 Sol 的標價與 GPT-6 Sol 相同: 每百萬個輸入標記 $2,每百萬個輸出標記 $10。您的實際帳單取決於其他四個因素:您多常命中快取、是否超過 272K 輸入標記、使用的服務層級以及模型消耗的推理標記數量。這篇文章將逐一介紹這些因素。


完整的價格清單

標準費率(每百萬標記)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
輸入$2.00$2.00$10.00$0.10
快取輸入$0.10$0.20$1.00—
快取寫入$2.50$2.50——
輸出(包括推理)$10.00$10.00$50.00$0.50
Astra 的快取費率來自第三方報告。根據 OpenAI 的 1.25× 規則,其快取寫入費率應為 $12.50。關於 Luna 的快取定價,請參見 OpenAI 的定價頁面。

乘數

這些規則來自於 GPT-6.1 Sol 模型頁面:

條件會發生什麼
超過 272K 輸入標記整個請求以 2× 輸入和快取、1.5× 輸出計費($4 / $15,快取讀取 $0.20,快取寫入 $5)
批次 / 彈性標準費率的一半
快速模式標準費率的兩倍(在歐盟數據駐留下不可用)
區域處理+10%
工具調用(搜索、計算使用等)按調用收費。AIHubMix 將網頁搜索列為每次請求 $0.01
超快速(即將推出 Codex)尚未正式定價。一份報告稱為標準的 6 倍,尚未確認

在 AIHubMix 上,OpenAI 和 Azure 路徑的費用與 OpenAI 直接相同,超過 272K 的層級已經列出。


真正的變化:快取讀取為輸入的 5%

標價沒有變動。 快取讀取的費用從輸入費率的 10%($0.20)降至 5%($0.10)。 OpenAI 的 提示快取文檔 明確指出:快取讀取在大多數模型中為 0.1× 輸入,而在 GPT-6.1 Sol 中為 "0.05×"。

這很重要,因為代理在每一步都會重新發送相同的材料:系統提示、工具定義、庫上下文和對話歷史。它們的大部分輸入都是重複的內容。對於這些工作負載,快取費率實際上是您的真實輸入價格。

實例:一個編碼代理任務

假設:

  • 一個 200K 標記的固定前綴(系統提示、工具、庫上下文)
  • 50 步,每步增加 2K 新輸入標記並產生 3K 輸出標記(包括推理)
  • 為了簡化,前綴保持相同大小,在第 1 步寫入快取,並在剩下的 49 步中命中
6.1 Sol,無快取6 Sol + 快取6.1 Sol + 快取Astra + 快取
初始 200K 快取寫入—$0.50$0.50$2.50
49 次快取讀取—$1.96$0.98$9.80
前綴按常規輸入計費$20.00———
100K 新輸入(按寫入費率計)$0.20$0.25$0.25$1.25
150K 輸出$1.50$1.50$1.50$7.50
總計$21.70$4.21$3.23$21.05

三個要點:

  1. 快取是最大的槓桿。 相同模型,相同工作,未快取的運行成本幾乎高出 7 倍。
  2. 6.1 Sol 比 6 Sol 便宜約 23% ,同時得分更高。
  3. 對於快取密集的工作,Astra 的成本超過了 5 倍的標價差距所暗示的。 在這個例子中是 6.5 倍,因為 Astra 對快取輸入的折扣為 90%,而 6.1 Sol 的折扣為 95%。

這與 OpenAI 報告的每個任務成本相符(由 Vellum 和 The Next Web 編輯):在 DeepSWE 上約 $1.50 對 $7.70,在 OSWorld 上 $1.30 對 $9.30,以及在 Terminal-Bench Science 上 $5.47 對 $23.80。

一個警告:OpenAI 表示,Astra 通常需要更少的輸出標記來完成相同的任務。比較模型時,請根據每個任務的成本,而不是每個標記的成本。

快取寫入不是免費的

在 6.1 Sol 上,快取寫入的費用為輸入費率的 1.25 倍。 如果前綴僅使用一次,快取會使其成本增加 25%。 使用 OpenAI 文檔中的公式:

  • 一次寫入加一次讀取:常規輸入成本的 1.35 倍(在 6.1 Sol 上為 1.3 倍),而不使用快取則為 2 倍
  • 一次寫入加九次讀取:約 2.15 倍(在 6.1 Sol 上約 1.7 倍),而不使用快取則為 10 倍

可快取的最小前綴為 1,024 個標記。 OpenAI 的盈虧平衡數學表示,102 個標記或更少的前綴永遠無法獲利。如果您預期會重複使用 10 次或更多,將超過 221 個標記的任何內容填充到 1,024 會更便宜。

對於一次性調用,例如單回合分類或批量提取,使用明確模式(prompt_cache_options.mode: "explicit")且不設置斷點。您將不會被收取任何寫入費用。


272K 懸崖

6.1 Sol 接受 1.05M 的上下文標記,但 一旦輸入超過 272K,整個請求將轉到更高的費率,而不僅僅是超過該線的標記。

請求輸入輸出成本
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

多出一萬個輸入標記幾乎使帳單翻倍。

如何保持在此範圍內:

  • 在客戶端計算標記,並在達到 272K 之前進行壓縮或修剪
  • 檢索長文檔的相關部分,而不是發送整個文檔
  • 當您確實需要長上下文時,將固定部分放入快取前綴中

推理努力如何在帳單上顯示

推理標記按輸出費率計費,每百萬 $10。將相同任務從低轉到高可以使推理標記增加十倍或更多。

OpenAI 報告的每個任務成本提供了一個規模感(這些是不同的基準,因此僅比較數量級):

  • AutomationBench(中):約 $0.30
  • GDP.pdf:約 $0.38
  • DeepSWE(高):約 $1.50
  • Terminal-Bench Science(最高):約 $5.47

第二部分涵蓋如何選擇級別。這裡有一個提醒: 在對話中更改 reasoning.effort 會使快取失效。 請改用 configuration_update。


在此價格點的比較

模型輸入 / 輸出快取輸入
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol 和 Claude Sonnet 5.5 的標價相同,而 6.1 Sol 的快取費率是 Sonnet 的一半。不過,它們在不同的方面表現出色。例如,在 AutomationBench 上,Sonnet 5.5 的表現遠超過 6.1 Sol。 當兩個模型每個標記的成本相同時,對於您的工作負載,成本較低的模型就是更便宜的選擇。

目前的價格顯示在 AIHubMix 模型列表 中,並且一個 API 金鑰可以用於所有模型,因此進行並排測試非常簡單。

競爭對手的價格來自第三方來源,可能會變動。在依賴它們之前,請檢查官方定價頁面。

成本檢查清單

  1. 將穩定內容放在首位。 系統提示、工具定義和參考材料放在最上面。時間戳和每用戶數據放在最後。
  2. 附加,而不是重寫。 總結、截斷和壓縮都會重新啟動快取。
  3. 保持工具列表穩定。 不要根據請求添加或刪除工具。改用 tool_choice 或 allowed_tools。
  4. 使用 configuration_update 切換努力, 而不是請求參數。
  5. 保持在 272K 輸入以下。
  6. 將非緊急工作通過批次或彈性發送 以獲得半價。
  7. 按任務路由。 Luna 用於簡單的高容量工作,6.1 Sol 用於大多數任務,Astra 用於最困難的問題。
  8. 關注三個數字: cached_tokens、 cache_write_tokens 和 reasoning_tokens。

結論: 標價沒有變化,但快取讀取的成本降低了 50%。 對於代理工作負載,這使得 6.1 Sol 成為 GPT-6 系列中性價比最高的模型,只要您善用快取並保持在 272K 以下。

接下來:當您切換時可能遇到的問題。


常見問題

GPT-6.1 Sol 的成本是多少? 每百萬個輸入標記 $2,每百萬個輸出標記 $10,快取輸入 $0.10,快取寫入 $2.50。超過 272K 輸入標記的請求整體計費為 $4 輸入和 $15 輸出。

通過 AIHubMix 或 OpenAI 直接更便宜嗎? 價格相同。AIHubMix 的 OpenAI 和 Azure 路徑均符合 OpenAI 的官方費率。

為什麼我的帳單比我預估的高? 四個常見原因:推理標記按輸出費率計費;您超過了 272K 輸入;您未命中快取或在一次性前綴上支付了寫入費用;或快速模式或區域處理已開啟。

快取寫入是否需要額外費用? 寫入的標記按輸入費率的 1.25 倍計費。這替代了正常的輸入費用,而不是額外增加。前綴在使用兩次後會自我支付。對於一次性前綴,明確模式允許您完全跳過寫入。

6.1 Sol 比 Astra 便宜多少? 在標價上便宜五倍。對於快取密集的代理工作,差距可以達到 6 到 7 倍,因為 6.1 Sol 對快取輸入的折扣更大。不過,Astra 通常每個任務使用更少的輸出標記,因此請比較每個任務的成本。

批次可以與快取結合使用嗎? 批次和彈性均為半價。關於它們與快取的堆疊,請檢查 OpenAI 的定價頁面。


繼續閱讀:GPT-6.1 Sol 系列


來源