Mistral Large 4とは?ヨーロッパのトリリオンパラメータ専門モデル

AIHubMix約 6 分で読めます
Mistral Large 4とは?ヨーロッパのトリリオンパラメータ専門モデル

Mistral Large 4はMistral AIの新しいフラッグシップモデルです。約1兆のパラメータを持ち、ヨーロッパでゼロからトレーニングされ、オープンウェイトは2026年10月末に公開される予定です。最も賢いモデルではありませんが、注目すべき点は、クローズドフラッグシップが拒否するか、遅れをとるいくつかの分野でリードしていることです:防御的セキュリティ作業、画像内の物体の特定、法的リサーチエージェントです。

Mistralは2026年10月6日にパブリックプレビューとしてリリースしました。ニックネームは「Le Chonk」です。この投稿では、モデルが何であるか、何が得意で、どこが不足しているか、そしてAIHubMixを通じてどのように試すことができるかを説明します。

概要

Mistral Large 4
開発者 Mistral AI(フランス)
リリース日 2026年10月6日
ステータス パブリックプレビュー
API ID mistral-large-4
パラメータ 合計1.05T、アクティブ約50B
コンテキストウィンドウ 1Mトークン
入力 / 出力 テキストと画像を入力し、テキストを出力
推論 デフォルトでオン、オフにすることも可能
1Mトークンあたりの価格 $1.36 入力、$4.18 出力
オープンウェイト 10月末に予定

AIHubMixではモデルIDはmistral-large-4-0で、Mistralもエイリアスとして受け入れています。ここでの仕様はMistralのモデルカードに従っています。Mistralはアクティブパラメータ数として49Bと52Bの両方を示しています。オープンウェイトのライセンスはまだ発表されていません。

これはエキスパートの混合モデルであり、各トークンに対してアクティブなパラメータの割合は小さいです。1.6Bパラメータのビジョンエンコーダーを持ち、リクエストごとに最大100枚の画像を受け入れ、160以上の言語をカバーしています。Mistralは、他社のベースモデルの上に構築するのではなく、独自のヨーロッパのデータセンターで3,800台のNVIDIA Grace Blackwell GPUを使用してトレーニングしました。

得意なこと

以下の数値はMistralの発表記事や、Artificial AnalysisおよびVals AIによる独立した実行から得たものです。Mistral自身の数値は自己報告であり、すべてプレビュー中にトレーニングが行われている間に測定されました。

分野 ベンチマーク Large 4 比較用
セキュリティ CyberGym-E2E 82% MiMo-V2.6-Pro 79%
セキュリティ Cybench(40 CTFs) 93% 比較なし
ビジョン DIOR-RSVG 73% GPT-6 Astra 68%
ビジョン Dense200 42% GPT-6 Astra 41%
法務 Harvey Legal Agent 15.8% Kimi K3 12.9%
金融 Finch 67% DeepSeek V4 Pro 67%

防御的セキュリティ。 CyberGym-E2Eはモデルに実際の脆弱性を再現し、それを修正するように求めます。Large 4はArtificial Analysisの実行で最高得点を獲得しました。Mistralによると、Claude Opus 5.5とGPT-6 Astraはこのタスクを拒否するため、ほぼゼロのスコアを記録しています。ただし、すべてに「はい」と言うわけではありません。Mistralは、他のオープンモデルよりも有害なサイバーリクエストを拒否することが多く、LakeraのB3プロンプトインジェクションベンチマークで93.3%の攻撃をブロックしたと報告しています。

画像内の物体の特定。 Large 4は視覚的グラウンディングが可能で、物体の位置をマークすることができます。DIOR-RSVGはこれを衛星画像や空中画像でテストし、Dense200は混雑したシーンでテストします。Mistralのデモには、ギガピクセルの衛星画像をスキャンしたり、工学図面の部品をチェックしたりするものが含まれています。

法務および金融業務。 Harveyの法務エージェントベンチマークでは、Vals AIは76モデル中6位、オープンモデル中1位にランク付けしています。Finchという金融ベンチマークでは、MistralのチャートはDeepSeek V4 Proと同等の結果を示しています。

Artificial Analysisはリリースを次のように要約しました。「フランスは、米国と中国以外で最も知的なモデルを持つ国に戻りました。」

不足している点

Large 4はオールラウンドな最前線モデルではありません:

  • 一般的な知性。 Artificial Analysisの知性指数で38点を獲得しています。これはGPT-6 Lunaと同点で、オープンモデルのGLM-5.3(45)やKimi K3(44)には及びません。
  • ターミナル重視のコーディング。 Vals AIの実行でTerminal-Bench 4で22.7%のスコアを記録し、45モデル中21位です。Claude Opus 5.5は65.2%を記録しています。
  • 数学的証明と長いPDFレポート。 ProofBenchで10%、GDP.pdfで19%のスコアを記録しています。GPT-6 AstraはGDP.pdfで約32%のスコアを記録しています。
  • タスクあたりのコスト。 Artificial Analysisによると、1つの知性指数タスクのコストは定価で$1.13です。同様の能力を持つオープンモデルであるGLM-5.3-Flashは約$0.25です。

Large 3との比較

Large 3 Large 4
パラメータ 合計675B、アクティブ41B 合計1.05T、アクティブ約50B
コンテキスト 256K 1M
リクエストごとの画像数 8 100
1Mトークンあたりの価格 $0.50 / $1.50 $1.36 / $4.18
ウェイト Apache 2.0、現在利用可能 10月末予定

Large 4はLarge 3の約2.7倍のトークンあたりのコストがかかります。Large 3がすでに得意とするシンプルで高ボリュームのテキスト作業に対して、アップグレードが自らのコストを回収できるかは疑問です。

呼ぶ前に知っておくべき2つのこと

思考はデフォルトでオンです。 MistralのAPIでは、reasoning_effortは"none"または"high"を取ります。AIHubMixを通じて、10月9日のテストでは、モデルはreasoning_effortが何であれ思考を行い、"none"も含まれ、思考トークンは出力として請求されます。思考をオフにするには、リクエストボディに"reasoning": {"effort": "none"}を送信します。思考がオンのとき、Mistralの推論ガイドによれば、次のターンでそれを返すように指示されています。AIHubMixを通じて、それは別のreasoning_detailsフィールドに到着し、次のリクエストはそれをアシスタントメッセージの一部として受け入れます。

これはプレビューです。 Mistralのライフサイクルポリシーでは、プレビューモデルに対して静かな更新を許可し、1か月前にモデルの引退を通知します。小さなテストプロンプトのセットを保持し、時々再実行してください。

AIHubMixを通じて試す

AIHubMixはOpenAI互換のチャットコンプリーションエンドポイントを通じてLarge 4を提供します。まだキーを設定していない場合は、クイックスタートに数分かかります。

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

response = client.chat.completions.create(
    model="mistral-large-4-0",
    messages=[{
        "role": "user",
        "content": "PowerShellをOfficeアプリから起動するSigmaルールを書き、"
                   "各条件を1行で説明してください。",
    }],
    extra_body={"reasoning": {"effort": "none"}},  # 思考をオフにする
)
print(response.choices[0].message.content)

回答は常にcontent内のプレーンな文字列です。reasoningフィールドを省略すると、モデルは最初に思考します。思考はmessage.model_extra["reasoning_details"]のリストとして到着し、そのトークンは出力としてカウントされます。思考がオンのときは、max_tokensに十分な余裕を持たせてください。テストでは、300トークンの制限が思考によって使い果たされ、空の回答が返されました。

誰が試すべきか

  • 脆弱性再現、パッチ適用、マルウェア分析、またはクローズドモデルが拒否する検出ルールを行うセキュリティチーム。
  • 衛星や空中検査、工学図面、密集したシーンなど、ボックスがキャプションよりも重要な画像を扱うチーム。
  • エージェントベンチマークの上位に近いオープンモデルを求める法務および金融ビルダー。
  • アメリカや中国ではないモデルが必要なヨーロッパの組織で、EUホスティングの展開と自己ホスティングへの道を持つ。

一般的なコーディングエージェントやコストに敏感な日常業務には、他のモデルと比較してから試してください。AIHubMixモデルリストを使用すると、同じプロンプトをLarge 4とその代替モデルに対して1つのキーで実行できます。

FAQ

Mistral Large 4とは何ですか?
Mistral AIのフラッグシップモデルで、2026年10月6日にパブリックプレビューとしてリリースされました。これはエキスパートの混合モデルで、1.05兆のパラメータを持ち、テキストと画像を入力し、テキストを返します。

Mistral Large 4はオープンソースですか?
まだではありません。Mistralは2026年10月末にウェイトを公開する予定ですが、ライセンスは発表されていません。Large 3のApache 2.0ライセンスは自動的には引き継がれません。

コストはいくらですか?
リスト価格は、入力トークンあたり$1.36、キャッシュされた入力トークンあたり$0.14、出力トークンあたり$4.18です。

コンテキストウィンドウの長さはどれくらいですか?
Mistralのモデルカードによれば1Mトークンです。これはLarge 3の256Kの4倍です。

GPT-6やClaudeより優れていますか?
特定の分野でのみ:クローズドモデルが拒否する防御的セキュリティタスク、視覚的グラウンディング、Harveyの法務エージェントベンチマークです。広範な知性やエージェントコーディングにおいては、クローズドフラッグシップが依然として優位です。

推論をサポートしていますか?
はい、デフォルトでオンです。AIHubMixを通じて、思考は別のreasoning_detailsフィールドに戻ります。オフにするには、リクエストボディに努力をnoneに設定した推論オブジェクトを送信します。reasoning_effortをnoneに設定しても、AIHubMixではオフにはなりません。

画像を読み取ることができますか?
はい。リクエストごとに最大100枚の画像を受け入れ、それらの中の物体の位置をマークできます。画像を生成することはできません。

出典