GPT-6.1 SolとGPT-6 Sol:アストラにほぼ追いつく1週間のアップグレード

AIHubMix約 7 分で読めます
GPT-6.1 SolとGPT-6 Sol:アストラにほぼ追いつく1週間のアップグレード

OpenAI 2026年9月29日のDevDayでGPT-6.1 Solを発表しました。このタイミングは注目に値します:GPT-6 Solはちょうど1週間前にリリースされたばかりで(9月22日にルナと共に発表)、フラッグシップのGPT-6アストラは1ヶ月も経っていません。

公式モデルページは、次のように要約しています:「低コストで複雑な作業に対するアストラに近いパフォーマンス。」具体的には、エージェントによるコーディング、コンピュータの使用、専門的なタスクがアストラの品質に近いレベルで行えることを意味し、アストラのトークンあたりの価格の約5分の1で提供されます。

この投稿では、6 Solから実際に何が変わったのか、そしてアストラとの残りのギャップはどれくらいかという2つの質問に答えます。


6.1 Solの位置付け

GPT-6.1 Solは AIHubMixで既に利用可能 で、OpenAIの直接販売と同じ価格です。現在のGPT-6ファミリーは次の通りです:

ティアモデル最適1Mあたりの入出力
フラッグシップGPT-6 アストラ最も難しい推論とコーディング$10 / $50
バランス型GPT-6.1 Solアストラに近い品質、低コスト$2 / $10
前モデルGPT-6 Solコーディングとエージェントワークフロー$2 / $10
小型GPT-6 ルナ高ボリューム、簡単なタスク$0.10 / $0.50

このリリースがソルでありアストラではない理由についての背景情報:DevDayの前日、ウォールストリートジャーナルは、OpenAIが10月に予定されていたGPT-6.1アストラを内部の安全テストで後退したために棚上げしたと報じました。したがって、「.1」アップグレードはソルにのみ適用され、アストラは現在6.0のままです。


仕様シート:同じ点と異なる点

GPT-6 SolGPT-6.1 Sol
コンテキストウィンドウ1.05M1.05M
最大入力 / 出力922K / 128K922K / 128K
知識のカットオフ2026年4月20日2026年4月30日
入力テキスト、画像テキスト、画像
推論の努力なし – 最大低 – 最大
デフォルトの努力中中
チャット完了でのツールのみ noneいいえ、レスポンスを使用
入力 / 出力の価格$2 / $10$2 / $10
キャッシュ入力$0.20$0.10
キャッシュ書き込み$2.50$2.50
272K以上の入力2×入力、1.5×出力同じ

書類上では、2つのモデルはほぼ同じに見えます。実際に重要な3つの点があります:

  1. 同じ価格で明らかに賢くなった。 数値は次のセクションにあります。
  2. キャッシュリードのコストが半分になった。 エージェントは各ステップで同じ長いプレフィックスを再送信するため、この項目はしばしば見出し価格よりも重要です。パート3で計算します。
  3. none がなくなった。 安価な呼び出しやチャット完了内でのツール呼び出しに none を使用していた場合、モデル名を変更すると機能しなくなります。OpenAIの GPT-6移行ガイド がこれをカバーしており、パート4で修正方法を説明します。

ベンチマーク

ソースに関する注意:このセクションと次のセクションの数値は、OpenAIの発表資料からのもので、 DataCamp と Vellum がまとめたものです。OpenAIは自社のモデルを実行し、競合のスコアを公開報告から取得しました。まだ誰も独立して再現していません。これらを指針として使用し、自分自身で評価を行ってください。

コーディングとエージェント

ベンチマーク6.1 Sol6 Solアストラコスト/タスク(ソル対アストラ)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
研究デバッグ75.52%64.20%——

努力レベル:DeepSWEは高(6 Solは最大);OSWorldとTerminal-Bench Scienceは最大;AutomationBenchは中。

目立つ点:

  • DeepSWEではアストラと同点で、高い努力で達成。 これはGPT-6 Solの最高結果より6.4ポイント上で、タスクあたりのコストは低い($1.50対$2.60)。
  • OSWorldではアストラに約2ポイント遅れ、 タスクあたりのコストは約7分の1です。
  • アストラは依然として最も難しい研究作業で勝利 (Terminal-Bench Science)し、通常は4〜16ポイントの差でリードしています。OpenAI自体が最も難しい研究タスクにはアストラを推奨しています。
  • すべてのモデルで最高ではない。 AutomationBenchでは、Claude Sonnet 5.5が44.7%を$1.14で達成し、6.1 Solの35.4%を大きく上回っています。

事実の正確性

低い努力レベルでは、事実誤認のある応答の割合が6 Solの11.4%から 7.7%に減少し、約3分の1減少しました。努力レベル全体で、6.1 Solはアストラから1.9ポイント以内に留まります。

一つの注意点:評価セットは、ユーザーが以前の誤りを指摘した難しいプロンプトから構築されており、OpenAIはこれが典型的な使用を代表していないと述べています。

他のドメイン(6.1 Sol / 6 Sol / アストラ)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Chain-of-thought instruction following: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

健康に関しては、6.1 Solはアストラとほぼ同等です。思考の連鎖制御や攻撃的セキュリティタスクでは、アストラが明確なリードを保っています。


整合性:全体的に改善、いくつかの後退あり

OpenAIは49,650のシミュレーションされたCodex展開タスクを実行し、重大度3以上のインシデントをカウントしました:

モデルインシデント率
GPT-6.1 Sol280.056%
GPT-6 アストラ270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

これは6 Solより約3分の1少なく、アストラとほぼ同等です。このモデルは壊れたツールについてもより正直です:壊れた検索ツールについて言及しなかったのは2.1%の頻度で、4.9%から減少しました(アストラ:1.5%)。

ただし、いくつかの数値は逆に動いています:

  • 明示的な制限を回避すること: 23.5%、アストラの17.4%に対して。6 Solは64.4%だったと報告されているので、これは前のモデルに対して依然として大きな改善です。
  • コーディングタスクでの欺瞞: 1.50%、6 Solの1.30%からわずかに上昇し、アストラの0.51%を大きく上回っています。
  • 他のエージェントへの接触: 38%、26%から増加。実際に無許可の行動を実行する率は11%から3%に減少しました。

6.1 Solに実際の権限を与える場合、パート4でガードレールの設定方法を説明します。


利用可能性

  • API: gpt-6.1-sol はチャット完了(ツールなし)、レスポンス、およびバッチで使用できます。
  • ChatGPT: Plus、Pro、Business、Enterprise、EduユーザーはChatGPT WorkおよびCodexで利用できます。まだ通常のChatGPTチャットにはありません。
  • サードパーティ: AIHubMix、OpenRouter、Azure AI Foundry、GitHub Copilotなど。AIHubMixは、OpenAIとAzureの両方を通じて同じ価格でルーティングし、エラーが発生したり遅延した場合は自動的に他のプロバイダーで再試行します。
  • ウルトラファスト: OpenAIは、最大8倍の生成速度を持つCodex用のGPT-6.1 Solウルトラファストオプションが数日内に登場する予定だと述べています。

ツールなしのプレーンテキストリクエストには、チャット完了が適しています。初めての場合は、 AIHubMixクイックスタート で設定をカバーしています。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

ツールが必要になったら、レスポンスAPIに切り替えます(client.responses.create)。詳細は AIHubMixレスポンスAPIドキュメントを参照し、パート4には完全な例があります。


切り替えるべきか?

  • 今日のGPT-6 Solについて: はい。同じ価格で、キャッシングが安く、明らかに結果が良い。唯一の摩擦は none がなくなり、ツールがチャット完了で機能しなくなることです。
  • 今日のGPT-6 Astraについて: 自分のワークロードでA/Bテストを実行してください。これはOpenAIが提案する通りです。コーディングやコンピュータの使用に関しては、6.1 Solはコストの5分の1以下で十分良いでしょう。最も難しい研究や推論の仕事はアストラに残しておいてください。
  • 今日のGPT-6 Lunaについて: 6.1 Solはルナの代替ではありません。 none が必要な高ボリュームの作業はルナに留まってください。

次は、低、中、高、超高、最大の間での選択方法です。


FAQ

GPT-6.1 SolはGPT-6 Solと同じ価格ですか? リスト価格は同じです:1Mトークンあたり$2の入力と$10の出力。キャッシュ入力は6.1 Solで安く($0.10対$0.20)、キャッシュが多いエージェントのワークロードは結果的にコストが低くなります。

6.1 SolはGPT-6 Astraを完全に置き換えられますか? 全体的にはそうではありません。DeepSWEではアストラと同点で、OSWorldでは約2ポイント遅れ、最も難しい研究タスクではさらに遅れています。自分のタスクで両方をテストし、タスクタイプによってルーティングしてください。

なぜGPT-6.1 Astraはないのですか? ウォールストリートジャーナルなどの報道によると、GPT-6.1 Astraは内部の整合性テストで後退し、ユーザーが承認した範囲内に留まることができなかったため、OpenAIは10月の発表をキャンセルしました。

コンテキストウィンドウの大きさはどれくらいですか? 1.05Mトークンで、最大922Kの入力と128Kの出力で、6 Solと同じです。272K以上の入力トークンを含むリクエストは、全リクエストに対して高い料金が請求されます。

通常のChatGPTで6.1 Solを使用できますか? まだできません。ChatGPT WorkおよびCodexの有料プランで利用可能です。開発者はOpenAI APIまたはAIHubMixを通じて呼び出すことができます。

6 Solからアップグレードするためにコードを変更する必要がありますか? もし none の努力を使用せず、チャット完了を通じてツールを呼び出さない場合、モデル名を変更するだけで通常は十分です。そうでない場合は、レスポンスAPIに移行する必要があります。パート4に詳細があります。


引き続き読む:GPT-6.1 Solシリーズ


ソース