Mistral Large 4はMistral AIの新しいフラッグシップモデルです。約1兆のパラメータを持ち、ヨーロッパでゼロからトレーニングされ、オープンウェイトは2026年10月末に公開される予定です。最も賢いモデルではありませんが、注目すべき点は、クローズドフラッグシップが拒否するか、遅れをとるいくつかの分野でリードしていることです:防御的セキュリティ作業、画像内の物体の特定、法的リサーチエージェントです。
Mistralは2026年10月6日にパブリックプレビューとしてリリースしました。ニックネームは「Le Chonk」です。この投稿では、モデルが何であるか、何が得意で、どこが不足しているか、そしてAIHubMixを通じてどのように試すことができるかを説明します。
概要
| Mistral Large 4 | |
|---|---|
| 開発者 | Mistral AI(フランス) |
| リリース日 | 2026年10月6日 |
| ステータス | パブリックプレビュー |
| API ID | mistral-large-4 |
| パラメータ | 合計1.05T、アクティブ約50B |
| コンテキストウィンドウ | 1Mトークン |
| 入力 / 出力 | テキストと画像を入力し、テキストを出力 |
| 推論 | デフォルトでオン、オフにすることも可能 |
| 1Mトークンあたりの価格 | $1.36 入力、$4.18 出力 |
| オープンウェイト | 10月末に予定 |
AIHubMixではモデルIDはmistral-large-4-0で、Mistralもエイリアスとして受け入れています。ここでの仕様はMistralのモデルカードに従っています。Mistralはアクティブパラメータ数として49Bと52Bの両方を示しています。オープンウェイトのライセンスはまだ発表されていません。
これはエキスパートの混合モデルであり、各トークンに対してアクティブなパラメータの割合は小さいです。1.6Bパラメータのビジョンエンコーダーを持ち、リクエストごとに最大100枚の画像を受け入れ、160以上の言語をカバーしています。Mistralは、他社のベースモデルの上に構築するのではなく、独自のヨーロッパのデータセンターで3,800台のNVIDIA Grace Blackwell GPUを使用してトレーニングしました。
得意なこと
以下の数値はMistralの発表記事や、Artificial AnalysisおよびVals AIによる独立した実行から得たものです。Mistral自身の数値は自己報告であり、すべてプレビュー中にトレーニングが行われている間に測定されました。
| 分野 | ベンチマーク | Large 4 | 比較用 |
|---|---|---|---|
| セキュリティ | CyberGym-E2E | 82% | MiMo-V2.6-Pro 79% |
| セキュリティ | Cybench(40 CTFs) | 93% | 比較なし |
| ビジョン | DIOR-RSVG | 73% | GPT-6 Astra 68% |
| ビジョン | Dense200 | 42% | GPT-6 Astra 41% |
| 法務 | Harvey Legal Agent | 15.8% | Kimi K3 12.9% |
| 金融 | Finch | 67% | DeepSeek V4 Pro 67% |
防御的セキュリティ。 CyberGym-E2Eはモデルに実際の脆弱性を再現し、それを修正するように求めます。Large 4はArtificial Analysisの実行で最高得点を獲得しました。Mistralによると、Claude Opus 5.5とGPT-6 Astraはこのタスクを拒否するため、ほぼゼロのスコアを記録しています。ただし、すべてに「はい」と言うわけではありません。Mistralは、他のオープンモデルよりも有害なサイバーリクエストを拒否することが多く、LakeraのB3プロンプトインジェクションベンチマークで93.3%の攻撃をブロックしたと報告しています。
画像内の物体の特定。 Large 4は視覚的グラウンディングが可能で、物体の位置をマークすることができます。DIOR-RSVGはこれを衛星画像や空中画像でテストし、Dense200は混雑したシーンでテストします。Mistralのデモには、ギガピクセルの衛星画像をスキャンしたり、工学図面の部品をチェックしたりするものが含まれています。
法務および金融業務。 Harveyの法務エージェントベンチマークでは、Vals AIは76モデル中6位、オープンモデル中1位にランク付けしています。Finchという金融ベンチマークでは、MistralのチャートはDeepSeek V4 Proと同等の結果を示しています。
Artificial Analysisはリリースを次のように要約しました。「フランスは、米国と中国以外で最も知的なモデルを持つ国に戻りました。」
不足している点
Large 4はオールラウンドな最前線モデルではありません:
- 一般的な知性。 Artificial Analysisの知性指数で38点を獲得しています。これはGPT-6 Lunaと同点で、オープンモデルのGLM-5.3(45)やKimi K3(44)には及びません。
- ターミナル重視のコーディング。 Vals AIの実行でTerminal-Bench 4で22.7%のスコアを記録し、45モデル中21位です。Claude Opus 5.5は65.2%を記録しています。
- 数学的証明と長いPDFレポート。 ProofBenchで10%、GDP.pdfで19%のスコアを記録しています。GPT-6 AstraはGDP.pdfで約32%のスコアを記録しています。
- タスクあたりのコスト。 Artificial Analysisによると、1つの知性指数タスクのコストは定価で$1.13です。同様の能力を持つオープンモデルであるGLM-5.3-Flashは約$0.25です。
Large 3との比較
| Large 3 | Large 4 | |
|---|---|---|
| パラメータ | 合計675B、アクティブ41B | 合計1.05T、アクティブ約50B |
| コンテキスト | 256K | 1M |
| リクエストごとの画像数 | 8 | 100 |
| 1Mトークンあたりの価格 | $0.50 / $1.50 | $1.36 / $4.18 |
| ウェイト | Apache 2.0、現在利用可能 | 10月末予定 |
Large 4はLarge 3の約2.7倍のトークンあたりのコストがかかります。Large 3がすでに得意とするシンプルで高ボリュームのテキスト作業に対して、アップグレードが自らのコストを回収できるかは疑問です。
呼ぶ前に知っておくべき2つのこと
思考はデフォルトでオンです。 MistralのAPIでは、reasoning_effortは"none"または"high"を取ります。AIHubMixを通じて、10月9日のテストでは、モデルはreasoning_effortが何であれ思考を行い、"none"も含まれ、思考トークンは出力として請求されます。思考をオフにするには、リクエストボディに"reasoning": {"effort": "none"}を送信します。思考がオンのとき、Mistralの推論ガイドによれば、次のターンでそれを返すように指示されています。AIHubMixを通じて、それは別のreasoning_detailsフィールドに到着し、次のリクエストはそれをアシスタントメッセージの一部として受け入れます。
これはプレビューです。 Mistralのライフサイクルポリシーでは、プレビューモデルに対して静かな更新を許可し、1か月前にモデルの引退を通知します。小さなテストプロンプトのセットを保持し、時々再実行してください。
AIHubMixを通じて試す
AIHubMixはOpenAI互換のチャットコンプリーションエンドポイントを通じてLarge 4を提供します。まだキーを設定していない場合は、クイックスタートに数分かかります。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
response = client.chat.completions.create(
model="mistral-large-4-0",
messages=[{
"role": "user",
"content": "PowerShellをOfficeアプリから起動するSigmaルールを書き、"
"各条件を1行で説明してください。",
}],
extra_body={"reasoning": {"effort": "none"}}, # 思考をオフにする
)
print(response.choices[0].message.content)
回答は常にcontent内のプレーンな文字列です。reasoningフィールドを省略すると、モデルは最初に思考します。思考はmessage.model_extra["reasoning_details"]のリストとして到着し、そのトークンは出力としてカウントされます。思考がオンのときは、max_tokensに十分な余裕を持たせてください。テストでは、300トークンの制限が思考によって使い果たされ、空の回答が返されました。
誰が試すべきか
- 脆弱性再現、パッチ適用、マルウェア分析、またはクローズドモデルが拒否する検出ルールを行うセキュリティチーム。
- 衛星や空中検査、工学図面、密集したシーンなど、ボックスがキャプションよりも重要な画像を扱うチーム。
- エージェントベンチマークの上位に近いオープンモデルを求める法務および金融ビルダー。
- アメリカや中国ではないモデルが必要なヨーロッパの組織で、EUホスティングの展開と自己ホスティングへの道を持つ。
一般的なコーディングエージェントやコストに敏感な日常業務には、他のモデルと比較してから試してください。AIHubMixモデルリストを使用すると、同じプロンプトをLarge 4とその代替モデルに対して1つのキーで実行できます。
FAQ
Mistral Large 4とは何ですか?
Mistral AIのフラッグシップモデルで、2026年10月6日にパブリックプレビューとしてリリースされました。これはエキスパートの混合モデルで、1.05兆のパラメータを持ち、テキストと画像を入力し、テキストを返します。
Mistral Large 4はオープンソースですか?
まだではありません。Mistralは2026年10月末にウェイトを公開する予定ですが、ライセンスは発表されていません。Large 3のApache 2.0ライセンスは自動的には引き継がれません。
コストはいくらですか?
リスト価格は、入力トークンあたり$1.36、キャッシュされた入力トークンあたり$0.14、出力トークンあたり$4.18です。
コンテキストウィンドウの長さはどれくらいですか?
Mistralのモデルカードによれば1Mトークンです。これはLarge 3の256Kの4倍です。
GPT-6やClaudeより優れていますか?
特定の分野でのみ:クローズドモデルが拒否する防御的セキュリティタスク、視覚的グラウンディング、Harveyの法務エージェントベンチマークです。広範な知性やエージェントコーディングにおいては、クローズドフラッグシップが依然として優位です。
推論をサポートしていますか?
はい、デフォルトでオンです。AIHubMixを通じて、思考は別のreasoning_detailsフィールドに戻ります。オフにするには、リクエストボディに努力をnoneに設定した推論オブジェクトを送信します。reasoning_effortをnoneに設定しても、AIHubMixではオフにはなりません。
画像を読み取ることができますか?
はい。リクエストごとに最大100枚の画像を受け入れ、それらの中の物体の位置をマークできます。画像を生成することはできません。
出典
- Mistral Large 4の紹介(Mistral AI)
- Mistral Large 4モデルカード(Mistral Docs)
- AIHubMixのMistral Large 4.0
- Mistral Large 4:フランスは米国と中国以外で最も知的なモデルの本拠地(Artificial Analysis)
- Mistral Large 4ベンチマーク(Vals AI)



