GPT-6.1 Solの推論努力の選択: 低から最大まで

AIHubMix約 6 分で読めます
GPT-6.1 Solの推論努力の選択: 低から最大まで

GPT-6.1 Solには、5つの推論努力レベルがあります: low, medium (デフォルト), high, xhigh, および max。GPT-6 Solからの大きな変更点は、 none と minimal がなくなり、 low が現在の最低レベルになったことです。

この1つの設定が、レイテンシとコストの両方に影響を与えます。推論トークンは目に見えませんが、出力レート(AIHubMixでの6.1 Solは100万トークンあたり10ドル)で支払う必要があり、コンテキストウィンドウ内のスペースを占有します。間違ったレベルを選択すると、必要以上に何倍も支払うことになります。


各レベルの目的

この表は、OpenAIの 推論ガイド からの説明と、私たち自身の推奨を組み合わせたものです:

レベルOpenAIの説明適切な用途不適切な用途
low適度なレイテンシの増加で効率的な推論ツールループの中間ステップ、検索、軽い計画、分類、抽出、サポート応答難しいデバッグ、複数ファイルのリファクタリング
medium (デフォルト)ほとんどの作業負荷に対するバランスの取れたデフォルト日常的なコーディング、コードレビュー、執筆、典型的なエージェントタスクレイテンシが重要なインタラクティブな使用
high難しい推論、複雑なデバッグ、深い計画厄介なバグ、アーキテクチャ作業、SWEスタイルのタスク高QPSのオンライントラフィック
xhigh深い研究、非同期作業、長時間のエージェント実行バックグラウンドジョブ、研究報告あなたの評価が正当化していないもの
max最も難しいタスクに対する最大の推論コンピュータ使用、研究グレードの問題、オフラインの重作業ほとんどの日常的なリクエスト

OpenAIは努力を「品質を回復するための主要な方法ではなく、調整ノブ」と呼んでいます。結果が悪い場合は、まずプロンプト、ツールの定義、およびコンテキストを確認してください。その後で努力を上げてください。


各レベルに関するベンチマークの結果

これらはOpenAI自身の数値であり、 Vellum と DataCamp によってまとめられています。ガイドとして扱い、絶対的なものとは考えないでください。

コーディングには、高が通常十分です。 DeepSWE v1.1では、6.1 Solの高は75.2をスコアし、Astraの高(74.8)と一致し、タスクあたり約1.50ドルです。そのコスト曲線は、タスクあたり0.50ドルから1.50ドルの間で72%から75%に達します。GPT-6 Solは約2.60ドルで68.8に達しました。

中以上に上げても必ずしも助けにはなりません。 AutomationBenchでは、6.1 Solは中で35.4%をスコアし、高い努力では約36.0%にしかなりません。ビジネス自動化では、追加の推論トークンはほとんど意味がありませんでした。

コンピュータ使用と研究にはmaxを取っておきましょう。 OSWorld 2.0では、maxはタスクあたり約1.30ドルで71.4を取得します。Terminal-Bench Scienceでのmaxはタスクあたり5.47ドルで、Astraの23.80ドルよりはるかに安価ですが、他のほとんどの作業負荷よりも桁違いに高いです。

低も改善されました。 低での事実誤り率は、6 Solの11.4%から7.7%に減少しました。低が十分に正確でなかったためにタスクを中に上げた場合は、再度低を試してみてください。


使用ケースごとの開始点

使用ケース開始レベルノート
6 Solでnoneを使用した呼び出しlowOpenAIの公式マッピング。レイテンシが重要な場合は、noneをサポートしているGPT-6 Lunaを検討してください。
minimalを使用した呼び出しlowlowから始めて結果を比較してください。
チャットボット、カスタマーサポートlowモデルに1行の前置きを求めて、最初のトークンを早く出すようにします。
RAG Q&Alow → medium取得の質が努力よりも重要です。
IDEコーディングアシスタントmediumデフォルトで機能します。
自動バグ修正、SWEエージェントhighDeepSWEは高がすでにAstraと一致することを示しています。
コンピュータ使用、ブラウザエージェントhigh → maxOSWorldはmaxでピークに達します。
バックグラウンド研究、長時間の実行xhigh評価が利益を示す場合のみ。バッチ処理は、すぐに結果が必要でない場合にコストを半分にします。
最も難しい研究問題max、または単にAstraを使用OpenAIはここでもAstraを推奨しています。

 none と minimal のマッピングは、OpenAIの GPT-6移行ガイド から来ています。


会話の途中での努力の変更

一般的なパターンは、高で計画し、低で実行し、何かが壊れたときに再び高に戻ることです。

注意: リクエストで reasoning.effort を編集すると、プロンプトキャッシュが壊れます。 努力はキャッシュされたプレフィックスの一部です( プロンプトキャッシングガイド を参照)。6.1 Solでは、キャッシュの読み取りは100万トークンあたり0.10ドルのコストがかかり、キャッシュの書き換えは2.50ドルのコストがかかります。これは25倍の違いです。

GPT-6ファミリーは、 configuration_update 入力項目でこれを修正します。 リクエストレベルの reasoning.effort はそのままにしておき、次のユーザーメッセージの前に更新を挿入してください。 以下は、 AIHubMix Responses API を通じての例です:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# ターン1: 高努力で計画
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="このリポジトリのテストが失敗している理由を見つけて、修正計画を提案してください。",
)

# ターン2: 実行のために低に落とすが、リクエストレベルの努力には触れない
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # 変更なし、キャッシュが生き残る
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "計画のステップ1を実行してください。"},
    ],
)
上記の configuration_update の形は例示的です。正確なスキーマについてはOpenAIの推論ガイドを確認してください。AIHubMixのResponsesドキュメントでは現在4つのレベル(minimalからhigh)がリストされているため、 xhigh 、 max 、および configuration_update が通過することを確認するために小さなテストリクエストを送信してください。

知っておくべきいくつかの制限:

  • 標準の単一エージェントモードでのみ機能し、努力のみを変更します。
  • 2つの更新を隣接させることはできません。
  • 自動圧縮や切り捨てとは混合できません。明示的な圧縮は問題ありませんが、その後に新しい更新を追加してください。
  • レスポンスの reasoning.effort フィールドはリクエストレベルの値を示すため、あまり深く読み取らないでください。

努力に伴う設定

 max_output_tokens に余裕を持たせてください。 上限には推論トークンが含まれます。これを低く設定しすぎると、モデルは目に見えるテキストを生成する前に停止する可能性があります。 status: incomplete が返され、入力と推論に対して支払うことになります。OpenAIは、最初に 少なくとも25,000トークン を予約することを推奨し、xhighまたはmaxの場合はさらに多くを推奨します。

推論トークンを追跡してください。 それらは usage.output_tokens_details.reasoning_tokens にあります。努力レベルごとの分布を確認することは、感覚で調整するよりも優れています。

可視性が必要な場合は要約をオンにしてください。 reasoning.summary: "auto" はモデルの推論の要約を返します(最初に組織を確認する必要があるかもしれません)。生の推論は決して公開されません。

プロモードは別のスイッチです。 これにより、モデルはより多くの作業を行い、標準料金で請求されますが、全体的にトークンが増えます。追加のレイテンシが許容される難しい問題に使用してください。


実際に実行できる調整プロセス

  1. 20から50の実際のタスクを評価セットに取り込みます。
  2.  medium でベースラインを実行します。成功率、平均推論トークン、P95レイテンシを記録します。
  3.  low を試します。成功率がほとんど下がらない場合は、切り替えます。
  4.  high を試します。成功率が明らかに改善される場合は、そのタスクタイプに対してのみ高を使用します。
  5.  xhigh または max に手を伸ばすのは、高が不足している場合のみで、同時に高でのGPT-6 Astraと比較します。時には、より大きなモデルがより多くの努力に勝ることがあります。AIHubMixでは、これは単に model パラメータの変更であり、 モデルリスト で利用可能なものを確認できます。
  6. 1つのグローバル設定を使用するのではなく、タスクタイプごとにルーティングします。

短く言えば: mediumから始め、lowでお金を節約し、コーディングにはhighを使用し、xhighとmaxは評価で証明させます。

次は、キャッシング、長いコンテキスト、および請求の乗数が影響を与えるときに、$2 / $10の価格タグが本当に意味することです。


FAQ

GPT-6.1 Solのデフォルトの推論努力は何ですか? medium です。設定しない場合、それが適用されます。

 none がエラーを返すのはなぜですか? 6.1 Solは none または minimal をサポートしていません。OpenAIは low への切り替えを推奨しています。もし本当に none が必要な場合は、GPT-6 SolまたはGPT-6 Lunaに留まってください。

推論トークンはどのように請求されますか? 出力レート(6.1 Solの場合100万トークンあたり10ドル)で請求され、コンテキストウィンドウに対してカウントされます。実際の数値については usage.output_tokens_details.reasoning_tokens を確認してください。

パラメータ名はチャットコンプリーションとレスポンスで同じですか? いいえ。チャットコンプリーションはトップレベルの reasoning_effort を使用します。レスポンスはネストされた reasoning: {"effort": ...} を使用します。混同すると Unsupported parameter が返されます。

高い努力は常により良い結果をもたらしますか? いいえ。AutomationBenchでは、中を超えるとスコアが35.4%から約36.0%にしか移動せず、コストも明らかに増加しました。自分のタスクでテストしてください。

会話の途中で努力を変更できますか? はい。 configuration_update アイテムを使用し、リクエストレベルの reasoning.effort を変更せずにプロンプトキャッシュを有効に保ちます。自動圧縮や切り捨てとは機能しません。

 status: incomplete で出力がないのはなぜですか? おそらく max_output_tokens が低すぎて、推論がすべて使い果たされたためです。OpenAIは少なくとも25,000トークンを予約することを推奨しています。


引き続き読む: GPT-6.1 Solシリーズ


出典