GPT-6.1 Solの実際のコスト: $2 / $10の価格以上

AIHubMix約 6 分で読めます
GPT-6.1 Solの実際のコスト: $2 / $10の価格以上

GPT-6.1 Sol は、GPT-6 Solと同じリスト価格で、 入力トークンが百万あたり$2、出力トークンが百万あたり$10です。実際の請求額は、キャッシュにヒットする頻度、272K入力トークンを超えるかどうか、使用するサービスティア、モデルが消費する推論トークンの数の4つの要素によって異なります。この投稿では、それぞれについて詳しく説明します。


完全な価格リスト

標準料金(百万トークンあたり)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
入力$2.00$2.00$10.00$0.10
キャッシュ入力$0.10$0.20$1.00—
キャッシュ書き込み$2.50$2.50——
出力(推論を含む)$10.00$10.00$50.00$0.50
Astraのキャッシュレートは第三者の報告に基づいています。キャッシュ書き込みレートは、OpenAIの1.25×ルールに基づいて$12.50になるはずです。Lunaのキャッシュ価格については、 OpenAIの価格ページを参照してください。

乗数

これらのルールは、 GPT-6.1 Solモデルページからのものです:

条件何が起こるか
272K入力トークンを超えるリクエスト全体が2×の入力とキャッシュ、1.5×の出力で請求されます($4 / $15、キャッシュ読み込み$0.20、キャッシュ書き込み$5)
バッチ / フレックス標準料金の半分
ファストモード標準料金の2倍(EUデータ居住地では利用不可)
地域処理+10%
ツール呼び出し(検索、コンピュータ使用など)呼び出しごとに請求されます。AIHubMixは、ウェブ検索をリクエストごとに$0.01としています。
ウルトラファスト(Codexに登場予定)公式な価格はまだ設定されていません。ある報告では、標準の6倍とされていますが、未確認です。

AIHubMixでは、OpenAIとAzureのルートはOpenAIの直接と同じ価格で、272Kを超えるティアもすでにリストされています。


実際の変更: キャッシュ読み込みが入力の5%

リスト価格は変わりませんでした。 キャッシュ読み込みは、入力レートの10%($0.20)から5%($0.10)に下がりました。 OpenAIの プロンプトキャッシングのドキュメント は明確に述べています: キャッシュ読み込みはほとんどのモデルで0.1×の入力であり、「GPT-6.1 Solでは0.05×です。」

これは、エージェントがすべてのステップで同じ素材を再送信するため重要です: システムプロンプト、ツール定義、リポジトリコンテキスト、会話履歴。彼らの入力のほとんどは繰り返しのコンテンツです。これらのワークロードに対して、キャッシュされたレートは実質的にあなたの実際の入力価格です。

実例: コーディングエージェントタスクの例

前提条件:

  • 200Kトークンの固定プレフィックス(システムプロンプト、ツール、リポジトリコンテキスト)
  • 50ステップ、各ステップで2Kの新しい入力トークンを追加し、3Kの出力トークンを生成(推論を含む)
  • シンプルにするために、プレフィックスは同じサイズのままで、ステップ1でキャッシュに書き込まれ、残りの49ステップでヒットします。
6.1 Sol、キャッシュなし6 Sol + キャッシュ6.1 Sol + キャッシュAstra + キャッシュ
初期200Kキャッシュ書き込み—$0.50$0.50$2.50
49キャッシュ読み込み—$1.96$0.98$9.80
プレフィックスは通常の入力として請求される$20.00———
100K新しい入力(書き込みレートで)$0.20$0.25$0.25$1.25
150K出力$1.50$1.50$1.50$7.50
合計$21.70$4.21$3.23$21.05

三つのポイント:

  1. キャッシングが最大のレバーです。 同じモデル、同じ作業で、キャッシュなしの実行はほぼ7倍のコストがかかります。
  2. 6.1 Solは6 Solより約23%安い ですが、スコアも高いです。
  3. キャッシュが多い作業では、Astraはリスト価格のギャップが示すよりも高くつきます。 この例では6.5倍で、Astraはキャッシュ入力を90%割引し、6.1 Solは95%割引します。

これは、OpenAIが報告したタスクごとのコスト( Vellum と The Next Web によってまとめられた)と一致します: DeepSWEで約$1.50対$7.70、OSWorldで$1.30対$9.30、Terminal-Bench Scienceで$5.47対$23.80です。

一つの注意点: OpenAIは、Astraは通常、同じタスクを完了するために必要な出力トークンが少ないと言っています。タスクごとのコストでモデルを比較してください。

キャッシュ書き込みは無料ではありません

6.1 Solのキャッシュ書き込みは入力レートの1.25倍のコストがかかります。 プレフィックスが一度だけ使用される場合、キャッシングは25%高くつきます。 OpenAIのドキュメントからの公式な計算式を使用すると:

  • 1回の書き込みと1回の読み込み: 通常の入力コストの1.35倍(6.1 Solでは1.3倍)、キャッシングなしでは2倍
  • 1回の書き込みと9回の読み込み: 約2.15倍(6.1 Solでは約1.7倍)、キャッシングなしでは10倍

キャッシュ可能なプレフィックスの最小は1,024トークンです。 OpenAIの損益分岐点の計算によれば、102トークン以下のプレフィックスは決して元が取れません。10回以上再利用する場合は、221トークンを超えるものを1,024までパディングする方が安くなります。

単発の呼び出し(単一ターンの分類やバルク抽出など)には、明示モード(prompt_cache_options.mode: "explicit")を使用し、ブレークポイントを設けないでください。書き込みに対して請求されることはありません。


272Kの崖

6.1 Solは1.05Mトークンのコンテキストを受け入れますが、 入力が272Kを超えると、リクエスト全体が高いレートに移行します、超えたトークンだけではありません。

リクエスト入力出力コスト
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

10,000トークンの追加は請求額をほぼ倍増させます。

これを回避する方法:

  • クライアント側でトークンをカウントし、272Kに達する前に圧縮またはトリミングする
  • 長いドキュメントの関連部分を取得し、全体を送信しない
  • 本当に長いコンテキストが必要な場合は、固定部分をキャッシュプレフィックスに入れる

推論の努力が請求書にどのように現れるか

推論トークンは出力レートで請求され、百万あたり$10です。同じタスクを低から最大に移動すると、推論トークンが10倍以上になることがあります。

OpenAIの報告されたタスクごとのコストはスケール感を与えます(これらは異なるベンチマークであるため、規模を比較するだけにしてください):

  • AutomationBench(中):約$0.30
  • GDP.pdf:約$0.38
  • DeepSWE(高):約$1.50
  • Terminal-Bench Science(最大):約$5.47

パート2ではレベルの選び方をカバーします。ここでの一つの注意点: 会話中に reasoning.effort を変更するとキャッシュが無効になります。 代わりに configuration_update を使用してください。


この価格帯での比較

モデル入力 / 出力キャッシュ入力
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 SolとClaude Sonnet 5.5はリスト価格を共有しており、6.1 SolのキャッシュレートはSonnetの半分です。ただし、異なる点で強みがあります。たとえば、AutomationBenchではSonnet 5.5が大きくリードしています。 トークンごとのコストが同じモデルの場合、あなたのワークロードにおけるタスクごとのコストが低い方が安いモデルです。

現在の価格は AIHubMixモデルリスト で確認でき、1つのAPIキーで全てのモデルが利用できるため、並行テストが容易です。

競合他社の価格は第三者の情報源に基づいており、変更される可能性があります。依存する前に公式の価格ページを確認してください。

コストチェックリスト

  1. 安定したコンテンツを最初に配置します。 システムプロンプト、ツール定義、参照資料は上部に配置し、タイムスタンプやユーザーデータは最後に配置します。
  2. 追加する際は、書き換えないでください。 要約、短縮、圧縮はすべてキャッシュを再起動します。
  3. ツールリストを安定させてください。 リクエストごとにツールを追加または削除しないでください。代わりに tool_choice または allowed_tools を使用してください。
  4. 努力を configuration_update で切り替え、リクエストパラメータではなくしてください。
  5. 272K入力を超えないようにしてください。
  6. 緊急でない作業はバッチまたはフレックスを通じて送信し、半額にしてください。
  7. タスクによってルーティングしてください。 シンプルな高ボリューム作業にはLuna、ほとんどの作業には6.1 Sol、最も難しい問題にはAstraを使用してください。
  8. 3つの数値に注意してください: cached_tokens, cache_write_tokens, reasoning_tokens。

結論: リスト価格は変わりませんでしたが、キャッシュ読み込みが50%安くなりました。 エージェントのワークロードにとって、キャッシュをうまく利用し、272Kを下回る限り、6.1 SolはGPT-6ファミリーの中で最もコストパフォーマンスの良いモデルです。

次回は、切り替え時に直面する可能性のある問題についてです。


FAQ

GPT-6.1 Solのコストはいくらですか? 入力トークンが百万あたり$2、出力トークンが百万あたり$10、キャッシュ入力が$0.10、キャッシュ書き込みが$2.50です。272K入力トークンを超えるリクエストは、全体のリクエストに対して$4の入力と$15の出力が請求されます。

AIHubMix経由とOpenAI直接ではどちらが安いですか? 同じ価格です。AIHubMixのOpenAIとAzureのルートは、どちらもOpenAIの公式料金に一致しています。

請求額が予想より高いのはなぜですか? 4つの一般的な理由: 推論トークンは出力レートで請求される; 272K入力を超えた; キャッシュを逃したか、一度きりのプレフィックスに対して書き込み料金を支払った; またはファストモードや地域処理がオンになっている。

キャッシュ書き込みは追加料金がかかりますか? 書き込まれたトークンは入力レートの1.25倍で請求されます。これは通常の入力料金を置き換えるもので、追加されるわけではありません。プレフィックスは2回の使用で元が取れます。単発のプレフィックスの場合、明示モードを使用すると書き込みを完全にスキップできます。

6.1 SolはAstraよりどれくらい安いですか? リスト価格では5倍安いです。キャッシュが多いエージェント作業では、6.1 Solがキャッシュ入力をより急激に割引するため、ギャップは6倍から7倍に達することがあります。ただし、Astraはタスクごとに出力トークンを少なく使用することが多いため、タスクごとのコストを比較してください。

バッチはキャッシングと組み合わせることができますか? バッチとフレックスはどちらも半額です。キャッシングとの組み合わせについては、OpenAIの価格ページを確認してください。


読み続ける: GPT-6.1 Solシリーズ


出典