什么是 Mistral Large 4?来自欧洲的万亿参数专家

推理时代阅读约 6 分钟
什么是 Mistral Large 4?来自欧洲的万亿参数专家

Mistral Large 4 是 Mistral AI 的新旗舰。它拥有大约一万亿个参数,在欧洲从零开始训练,其开放权重预计将在 2026 年 10 月底发布。它并不是可用的最智能模型。它的显著之处在于它在一些领域领先于那些不愿意或落后的封闭旗舰:防御安全工作、图像中的物体定位和法律研究代理。

Mistral 于 2026 年 10 月 6 日发布了它的公共预览。它的昵称是“Le Chonk”。这篇文章涵盖了该模型是什么、它的优势、短板以及如何通过 AIHubMix 尝试它。

一览

Mistral Large 4
开发者 Mistral AI(法国)
发布 2026 年 10 月 6 日
状态 公共预览
API ID mistral-large-4
参数 总计 1.05T,约 50B 活跃
上下文窗口 1M 令牌
输入 / 输出 文本和图像输入,文本输出
推理 默认开启,可以关闭
每百万令牌价格 输入 $1.36,输出 $4.18
开放权重 计划于 10 月底发布

在 AIHubMix 上,模型 ID 是 mistral-large-4-0,Mistral 也接受该别名。这里的规格遵循 Mistral 的 模型卡。Mistral 提供了 49B 和 52B 作为活跃参数计数。开放权重的许可证尚未公布。

它是一个专家混合模型,因此每个令牌仅激活一小部分参数。它有一个 16 亿参数的视觉编码器,每个请求最多接受 100 张图像,并支持超过 160 种语言。Mistral 在其自己的欧洲数据中心使用 3800 台 NVIDIA Grace Blackwell GPU 进行训练,而不是在其他公司的基础模型上进行训练。

它的优势

以下数据来自 Mistral 的 发布文章,以及 Artificial Analysis 和 Vals AI 的独立测试。Mistral 自己的数据是自我报告的,所有数据都是在预览期间测量的,而训练仍在进行中。

领域 基准 Large 4 对比
安全 CyberGym-E2E 82% MiMo-V2.6-Pro 79%
安全 Cybench(40 个 CTF) 93% 未比较
视觉 DIOR-RSVG 73% GPT-6 Astra 68%
视觉 Dense200 42% GPT-6 Astra 41%
法律 Harvey 法律代理 15.8% Kimi K3 12.9%
金融 Finch 67% DeepSeek V4 Pro 67%

防御安全。 CyberGym-E2E 要求模型重现真实漏洞并进行修补。Large 4 在 Artificial Analysis 的测试中得分最高。根据 Mistral 的说法,Claude Opus 5.5 和 GPT-6 Astra 的得分接近零,因为它们拒绝执行该任务。不过,它并不是对所有事情都说“是”。Mistral 报告称,它比其他开放模型更频繁地拒绝真正有害的网络请求,并且在 Lakera 的 B3 提示注入基准测试中阻止了 93.3% 的攻击。

在图像中查找事物。 Large 4 可以进行视觉定位:它可以标记物体的位置,而不仅仅是描述它。DIOR-RSVG 在卫星和航空图像上测试这一点,而 Dense200 在拥挤场景中进行测试。Mistral 的演示包括扫描千兆像素的卫星图像和检查工程图纸上的部件。

法律和金融工作。 在 Harvey 的法律代理基准测试中,Vals AI 将其排名为 76 个模型中的第六位,并在开放模型中排名第一。在 Finch 的金融基准测试中,Mistral 的图表显示它与 DeepSeek V4 Pro 平起平坐。

Artificial Analysis 总结了发布情况:“法国再次拥有来自美国和中国以外的最智能模型。”

短板

Large 4 并不是一个全面的前沿模型:

  • 通用智能。 它在 Artificial Analysis 的智能指数中得分为 38。这与 GPT-6 Luna 持平,落后于开放模型 GLM-5.3(45)和 Kimi K3(44)。
  • 终端重编码。 在 Vals AI 的测试中,它在 Terminal-Bench 4 中得分为 22.7%,在 45 个模型中排名第 21。Claude Opus 5.5 得分为 65.2%。
  • 数学证明和长 PDF 报告。 它在 ProofBench 中得分为 10%,在 GDP.pdf 中得分为 19%。GPT-6 Astra 在 GDP.pdf 中得分约为 32%。
  • 每个任务的成本。 根据 Artificial Analysis 的统计,一个智能指数任务的成本为 $1.13。类似能力的开放模型如 GLM-5.3-Flash 的成本约为 $0.25。

与 Large 3 的比较

Large 3 Large 4
参数 总计 675B,41B 活跃 总计 1.05T,约 50B 活跃
上下文 256K 1M
每个请求的图像数量 8 100
每百万令牌价格 $0.50 / $1.50 $1.36 / $4.18
权重 Apache 2.0,现已可用 预计于 10 月底发布

Large 4 每个令牌的成本约为 Large 3 的 2.7 倍。对于 Large 3 已经处理得很好的简单高容量文本工作,升级可能不会带来回报。

在你称呼它之前需要知道的两件事

思考默认开启。 在 Mistral 自己的 API 中,reasoning_effort 取值为 "none" 或 "high"。通过 AIHubMix,10 月 9 日的测试发现,无论 reasoning_effort 的设置如何,包括 "none",模型都会进行思考,思考令牌会被计入输出。要关闭思考,请在请求体中发送 "reasoning": {"effort": "none"},如下示例所示。当思考开启时,Mistral 的 推理指南 建议在下一轮中将其返回。通过 AIHubMix,它会在单独的 reasoning_details 字段中返回,下一次请求将其作为助手消息的一部分接受。

这是一个预览。 Mistral 的生命周期政策允许对预览模型进行静默更新,并在退役前提前一个月通知。请保留一小组测试提示,并不时重新运行它们。

通过 AIHubMix 尝试它

AIHubMix 通过其与 OpenAI 兼容的聊天完成端点提供 Large 4。如果你还没有设置密钥,快速入门 只需几分钟。

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

response = client.chat.completions.create(
    model="mistral-large-4-0",
    messages=[{
        "role": "user",
        "content": "写一个 Sigma 规则,标记由 Office 应用程序启动的 PowerShell,并用一行解释每个条件。",
    }],
    extra_body={"reasoning": {"effort": "none"}},  # 关闭思考
)
print(response.choices[0].message.content)

答案始终是 content 中的普通字符串。省略 reasoning 字段,模型会先进行思考。思考结果作为列表返回在 message.model_extra["reasoning_details"] 中,其令牌计入输出。开启思考时,给 max_tokens 留出足够的空间。在测试中,300 令牌的上限被思考用尽,返回了空答案。

谁应该尝试它

  • 安全团队 进行漏洞重现、修补、恶意软件分析或封闭模型拒绝的检测规则。
  • 处理图像的团队,例如卫星和航空检查、工程图纸和拥挤场景,其中框比说明更重要。
  • 法律和金融开发者,希望获得接近代理基准顶端的开放模型。
  • 需要非美国或中国模型的欧洲组织,具有欧盟托管的部署和自托管的路径。

对于一般编码代理或对成本敏感的日常工作,首先与其他模型进行比较。AIHubMix 模型列表 让你可以使用一个密钥对 Large 4 及其替代品运行相同的提示。

常见问题

Mistral Large 4 是什么?
它是 Mistral AI 的旗舰模型,于 2026 年 10 月 6 日发布公共预览。它是一个专家混合模型,拥有 1.05 万亿个参数,接受文本和图像输入,并返回文本。

Mistral Large 4 是开源的吗?
还不是。Mistral 计划在 2026 年 10 月底发布权重,但尚未宣布许可证。Large 3 的 Apache 2.0 许可证并不自动适用。

它的费用是多少?
列表价格为每百万输入令牌 $1.36,每百万缓存输入令牌 $0.14,以及每百万输出令牌 $4.18。

上下文窗口有多长?
根据 Mistral 的模型卡,1M 令牌。这是 Large 3 的 256K 的四倍。

它比 GPT-6 或 Claude 更好吗?
仅在特定领域:防御安全任务、封闭模型拒绝的视觉定位,以及 Harvey 的法律代理基准。在广泛的智能和代理编码方面,封闭旗舰仍然遥遥领先。

它支持推理吗?
是的,并且默认开启。通过 AIHubMix,思考结果会在单独的 reasoning_details 字段中返回。要关闭它,请在请求体中发送一个推理对象,努力设置为 none。在 AIHubMix 上将 reasoning_effort 设置为 none 并不会关闭它。

它能读取图像吗?
是的。它每个请求最多接受 100 张图像,并可以标记物体在图像中的位置。它无法生成图像。

来源