Mistral AI 由前 DeepMind 研究员 Arthur Mensch、前 Meta AI 研究员 Guillaume Lample 和 Timothée Lacroix 于2023年5月在法国巴黎创立,以“开放权重+企业主权AI”为核心定位,是欧洲最具代表性的大模型公司。截至2026年,Mistral AI 估值达117亿欧元,员工约1000人,2026年营收目标为10亿欧元或以上。

Mistral AI 的版本命名体系清晰:以 “Ministral” 覆盖端侧极小模型,“Small” 覆盖轻量级企业模型,“Medium” 覆盖中端旗舰,“Large” 覆盖前沿旗舰,“Magistral” 覆盖推理专项,“Devstral” 覆盖编程Agent,“Voxtral” 覆盖语音与音频,“Codestral” 覆盖代码补全。每个层级代表不同的智能、速度和成本平衡点。
从版本谱系来看,Mistral AI 已发展出以下主要版本线:
早期开源系列(Mistral 7B → Mixtral) :Mistral 7B(2023年9月)→ Mixtral 8x7B(2023年12月,47B总参/13B激活)→ Mixtral 8x22B(2024年4月,141B总参)。这一阶段确立了Mistral在稀疏MoE架构上的技术路线,Mistral 7B的滑动窗口注意力成为后续所有版本的基础设计。
Large/Small/Nemo 产品线:Mistral Large(2024年2月)→ Mistral Large 2(2024年7月)→ Mistral Small 3(2025年1月,24B)→ Mistral Small 3.1(2025年3月)→ Mistral Small 3.2(2025年6月)→ Mistral Small 4(2026年3月16日)。
推理专项系列(Magistral) :Magistral Small 1.2 / Magistral Medium 1.2(2025年9月)→ Magistral Small 2509 → Magistral Small 2506。Magistral 系列是Mistral的推理特化线,通过监督微调与强化学习在Mistral Small基础上增强推理能力。
编程Agent系列(Devstral) :Devstral Small 1.0(2025年5月)→ Devstral Small 1.1(2025年7月)→ Devstral Medium 2507。Devstral 是Mistral AI与All Hands AI合作开发的开源编程Agent模型,专为软件工程工作流设计。
Mistral 3 开源旗舰系列(2025年12月) :Mistral Large 3(675B MoE)+ Ministral 3(3B/8B/14B端侧套件),采用Apache 2.0开源协议,是Mistral迄今最大规模的开源动作。
2026年新版本:Mistral Medium 3.5(2026年4月,128B Dense,统一指令/推理/编程/视觉)、Mistral Small 4(2026年3月,119B MoE,统一Magistral/Pixtral/Devstral三大能力)、Voxtral TTS(2026年3月,4B参数语音合成)、Mistral 3 系列(2026年2月)。
第二部分:各版本详细对比与拆解
一、Mistral Large 3:旗舰开源标杆
维度 Mistral Large 3 Mistral Medium 3.5 Mistral Small 4
发布时间 2025年12月1日 2026年4月29日 2026年3月16日
架构 精细化MoE + 视觉编码器 Dense 128B MoE 119B/6B激活
总参数 675B 128B 119B
激活参数 41B 128B 6B
上下文 256K 256K 256K
输入定价 $0.50/百万Token $1.50/百万Token $0.15/百万Token
输出定价 $1.50/百万Token $7.50/百万Token $0.60/百万Token
开源协议 Apache 2.0 Modified MIT Apache 2.0
SWE-bench Verified — 77.6% —
Mistral Large 3 是 Mistral 系列中具有里程碑意义的旗舰模型。它采用“精细化混合专家”架构,总参数量6750亿,激活参数量410亿(39B语言模型 + 2.5B视觉编码器),在3000台NVIDIA H200 GPU上从头训练,支持256K Token上下文窗口。通过与NVIDIA合作,Mistral Large 3 针对稀疏MoE架构进行了全栈优化,包括宽专家并行、NVFP4低精度推理、Dynamo分布式推理框架等,在GB200 NVL72系统上相比前代H200实现了10倍的性能提升。
Mistral Large 3 的定价策略是其最具竞争力的武器。输入定价仅为0.50美元/百万Token,输出1.50美元/百万Token,较前代Mistral Large 2411的2.00/6.00美元大幅降低75%。这一价格使其成为企业级复杂推理、指令遵循和多语言任务的首选开源模型。
二、Mistral Medium 3.5:首个旗舰合并模型
Mistral Medium 3.5 于2026年4月29日发布,是 Mistral 首个旗舰“合并模型”——将指令遵循、推理和编码能力合并到单一128B Dense模型中,取代了Le Chat中的Mistral Medium 3.1和Magistral,以及Vibe编码Agent中的Devstral 2。
其最突出的技术特性是“可配置推理努力”(reasoning_effort参数),开发者可以根据任务复杂度动态调整模型的推理深度,在质量、成本和延迟之间找到平衡点。在SWE-Bench Verified上取得77.6%的成绩,仅次于Gemini 3.1 Pro Preview的78.8%。仅需4张GPU即可自托管,API定价为1.50/7.50美元/百万Token,显著低于Claude Sonnet 4.6。
三、Mistral Small 4:三合一综合模型
Mistral Small 4 于2026年3月16日发布,是Mistral首款将旗舰推理模型、多模态模型和编程模型优势整合到单一LLM的综合性版本。采用MoE架构,总参数119B,激活参数6B,128个专家中激活4个,支持256K上下文窗口,以Apache 2.0协议开源。
Mistral Small 4 统一了此前三条独立产品线的能力:推理(原Magistral)、视觉(原Pixtral)和编程(原Devstral),用户无需在多种各有优势的模型中进行选择。相比Mistral Small 3,完成时间减少40%,吞吐量提升3倍。FP8权重约111GB,可在2卡H200上运行,API定价仅为0.15/0.60美元/百万Token。
四、推理专项线:Magistral 系列
Magistral Small 1.2 是Mistral的推理专项模型,基于Mistral Small 3.2(2506)构建,通过从Magistral Medium蒸馏的监督微调数据和强化学习训练,拥有24B参数。支持40K Token上下文窗口,输入定价0.50美元/百万Token,输出1.50美元/百万Token,支持函数调用和推理能力。
五、编程Agent线:Devstral 系列
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源编程Agent模型。Devstral Small 1.0 基于Mistral Small 3.1微调,拥有24B参数和128K上下文窗口,在SWE-Bench Verified上取得46.8%的成绩,超过此前开源SOTA 6个百分点。其最突出的优势是轻量化——仅24B参数,可在单张RTX 4090或32GB内存的Mac上运行,适合本地部署和端侧使用。Devstral 经过微调后移除了视觉编码器,是纯文本模型,专为代码库探索、多文件编辑和软件工程Agent设计。
六、语音与端侧线:Voxtral 与 Ministral 3
Voxtral TTS 于2026年3月26日发布,是Mistral首个文本转语音模型,参数量仅4B,可在消费级设备运行。支持英法德西等9种语言,仅需3秒音频即可实现声音克隆,能准确表达情感和语调变化,被评价为对ElevenLabs的直接挑战。
Ministral 3 套件 于2025年12月随Mistral 3系列一同发布,包含3B、8B、14B三个端侧模型规格,针对NVIDIA Spark、RTX桌面和笔记本以及Jetson设备优化,可在边缘端通过Llama.cpp和Ollama运行。Ministral 3 使用级联蒸馏技术从Mistral Small 3.1压缩而来,使小模型在保持能力的同时大幅降低部署门槛。
第三部分:为什么分这么多版本?
一、场景适配:从端侧到云端的全尺寸覆盖
Mistral AI 的版本分化遵循一套清晰的“尺寸-场景”匹配逻辑。Ministral 3(3B/8B/14B)管边缘设备和端侧部署,Small 4(119B MoE/6B激活)管高吞吐量企业任务,Medium 3.5(128B Dense)管中端旗舰与编程Agent,Large 3(675B MoE/41B激活)管前沿复杂推理与多语言任务,Magistral 管深度推理,Devstral 管软件工程Agent,Voxtral 管语音交互。
这一分层的核心价值在于部署灵活性。一家企业可以在边缘设备上运行Ministral 3做本地推理,在单节点4卡上运行Medium 3.5做编程Agent,在8卡H200上运行Large 3做复杂多语言任务。不需要更换技术栈,只需要更换权重文件。Mistral CEO Mensch 明确表示:“现在的AI虽然很擅长帮知识工作者和软件工程师自动化处理日常工作,但传统工程师的需求却被严重忽略了。”版本分化的本质是AI能力在不同场景和不同用户群体中的逐步深化。
二、开源分层:以开放构建企业信任
Mistral 最核心的差异化在于其开源策略的精细分层。Mistral Large 3 以Apache 2.0协议开源,允许免费商用和任意修改,无需联系Mistral获取商业许可。Mistral Small 4 同样以Apache 2.0开源,Mistral Medium 3.5 以Modified MIT许可开源(对大型营收企业有例外条款)。
这一策略的精妙之处在于:开源版本作为技术标杆吸引开发者构建应用生态,而旗舰商业线通过 API 服务和 Mistral AI Studio 实现商业变现。更重要的是,开源权重使企业能够将敏感数据保持在自有基础设施内,不发送到外部API端点。Mistral CEO Mensch 在首届官方大会上明确表示,许多企业拒绝将最敏感的数据拱手让给美国云巨头,而 Mistral 希望成为这些企业心中值得信赖的首选企业级 AI 服务商。
三、主权AI战略:以欧洲合规优势构建壁垒
Mistral AI 的版本分化还服务于其“主权AI”战略。Microsoft 与 Mistral 扩大合作,将 Mistral 的欧洲前沿模型纳入 Microsoft 主权云服务组合,使其可在公有云、云端连接及完全隔离环境中运行。汇丰银行以自托管方式运行 Mistral 系列大模型,将其自身技术实力与Mistral的大模型构建能力相结合。Naver Cloud 与 Mistral AI 签署全面合作协议,面向欧洲和亚洲制造业场景推进主权AI解决方案落地。
这一战略的核心价值在于:对于金融、医疗、国防等对数据主权和合规要求严格的行业,Mistral 提供了“欧洲制造+开源权重+自托管部署”的三重保障,这是 OpenAI 和 Anthropic 等美国闭源厂商难以复制的差异化优势。
第四部分:最著名版本——Mistral Large 3 本地部署实战
Mistral Large 3 是 Mistral 系列中具有里程碑意义的开源旗舰,675B总参数/41B激活的MoE架构以Apache 2.0协议开源,是当前开源模型中性价比最高的前沿级选择之一。以下为完整的本地部署步骤。
步骤一:环境准备与硬件规划
精度格式与硬件匹配:
FP8生产环境:8×H200(80GB each),单节点部署,推荐用于生产环境,支持最高256K上下文
FP8(Blackwell加速) :8×B200,在Blackwell架构上速度显著提升
NVFP4量化版:8×A100(80GB each),单节点,适合上下文<64K的场景
NVFP4(H100) :8×H100(80GB each),单节点,同上的上下文限制
BF16完整精度:多节点配置,不推荐除非有特定后训练需求
软件环境清单:
操作系统:Ubuntu 22.04 LTS
CUDA 12.1+,PyTorch 2.5+
Python 3.10+
vLLM 0.17.0+
步骤二:安装vLLM推理框架
bash
# 创建虚拟环境
uv venv
source .venv/bin/activate
# 安装vLLM
uv pip install -U vllm --torch-backend=auto
步骤三:下载模型权重
bash
# 从Hugging Face下载Mistral Large 3 FP8权重
huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-FP8 \
--local-dir ./Mistral-Large-3-FP8 \
--resume-download
# NVFP4量化版(A100/H100用户)
huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4 \
--local-dir ./Mistral-Large-3-NVFP4
步骤四:启动Mistral Large 3推理服务
FP8单节点8×H200配置:
bash
VLLM_DISABLE_COMPILE_CACHE=1 vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512-FP8 \
--tensor-parallel-size 8 \
--max-model-len 262144 \
--enable-auto-tool-choice \
--tool-call-parser mistral \
--limit-mm-per-prompt '{"image": 10}'
其中 --tensor-parallel-size 8 表示张量并行度为8,--max-model-len 262144 设置最大上下文长度为256K Token,--tool-call-parser mistral 启用Mistral原生的工具调用解析器。
纯文本部署(跳过视觉编码器) :
bash
VLLM_DISABLE_COMPILE_CACHE=1 vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512-FP8 \
--tensor-parallel-size 8 \
--max-model-len 262144 \
--limit-mm-per-prompt '{"image": 0}'
跳过视觉编码器可释放KV缓存空间,适合纯文本工作负载。
步骤五:API调用与测试
python
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY"
)
response = client.chat.completions.create(
model="mistralai/Mistral-Large-3-675B-Instruct-2512-FP8",
messages=[
{"role": "user", "content": "请分析这份多语言合同中各条款的法律风险"}
],
temperature=0.6,
max_tokens=4096
)
print(response.choices[0].message.content)
步骤六:启用工具调用与多模态
python
# 多模态图像理解
response = client.chat.completions.create(
model="mistralai/Mistral-Large-3-675B-Instruct-2512-FP8",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "请分析这张工程图纸中的结构设计"},
{"type": "image_url", "image_url": {"url": "https://example.com/blueprint.png"}}
]
}]
)
# 工具调用
response = client.chat.completions.create(
model="mistralai/Mistral-Large-3-675B-Instruct-2512-FP8",
messages=[{"role": "user", "content": "查询北京今天的天气并给出出行建议"}],
tools=[{
"type": "function",
"function": {
"name": "get_weather",
"description": "获取指定城市的实时天气",
"parameters": {
"type": "object",
"properties": {
"city": {"type": "string", "description": "城市名称"}
},
"required": ["city"]
}
}
}],
tool_choice="auto"
)
步骤七:监控与调优
关键指标监控:
GPU利用率:目标>80%
显存占用:FP8版本约670GB(8×H200合计)
吞吐量:~44 tokens/s(FP8单节点)
首Token延迟:受上下文长度影响,256K上下文下约2-5秒
降本策略:对端侧和轻量任务,使用Ministral 3(3B/8B/14B);对通用企业任务,使用Mistral Small 4或Mistral Medium 3.5;对复杂推理和Agent工作流,使用Mistral Large 3;对推理专项任务,使用Magistral Small;对编程Agent,使用Devstral Small 1.1。
第五部分:不同版本的实践成果
案例一:空中客车全业务领域AI部署(基于Mistral Large 3 + Mistral for Industrial Engineering)
2026年5月28日,空中客车公司宣布选择 Mistral AI 为其在民用和国防项目的研发、测试和制造活动提供AI支持。这一合作将扩大人工智能在空中客车商用飞机、直升机、国防及太空部门的部署范围。
实践成效:空中客车的工程团队将 Mistral 的语言模型与 Emmi AI 的物理模拟技术深度结合,应用于飞机机翼气流的物理方程式计算。传统模拟每改一次设计变体需要等待数天甚至数周,而Mistral的物理AI直接通过求解器输出数据训练,过去需要数小时的物理行为预测现在只需在单个GPU上运行几秒钟即可完成。这一合作代表了Mistral在航空航天领域的标杆落地——AI从“辅助工具”升级为“工程加速器”,使工程师能够进行快速的迭代设计。
案例二:BMW集团碰撞模拟与工业AI模型共建(基于Mistral Large 3 + 物理AI)
2026年5月,Mistral AI 成为 BMW 集团大型工业模型计划的核心合作伙伴,双方将联手开发专门用于碰撞模拟等复杂工程的多模态推理模型。
实践成效:BMW 与 Mistral 的合作聚焦于碰撞模拟和工业数据集训练。Mistral 将为 BMW 构建特定的模型,这些模型能够“理解车辆物理”,旨在优化碰撞测试流程。这一合作的核心价值在于:碰撞模拟是汽车工业中最复杂的工程计算之一,传统方法需要大量的物理求解器计算资源。Mistral 的物理AI方法通过数据驱动模型直接学习求解器输出,将模拟时间从数小时压缩至秒级,使BMW工程师能够在设计阶段快速迭代多个安全方案,大幅加速了新车型的安全验证流程。
案例三:汇丰银行全行部署Mistral生成式AI(基于Mistral Large 3 + Mistral Medium 3.5)
2025年12月,汇丰银行与 Mistral AI 建立战略合作伙伴关系,将在全行范围内部署生成式人工智能工具,以加速流程自动化、提升运营效率并升级客户服务体验。汇丰将以自托管方式运行 Mistral 已商用的系列大模型及其后续迭代版本。
实践成效:双方合作开发覆盖多类任务的AI解决方案,包括金融分析、多语言翻译、风险评估以及个性化客户沟通等,以减少员工在日常重复性工作上花费的时间。这一案例的核心价值在于验证了Mistral在受监管金融行业中的主权AI部署能力——汇丰选择自托管方式运行Mistral模型,确保客户金融数据不离开自有基础设施,同时利用Mistral的开源权重和欧洲合规背景满足金融监管的严格要求。汇丰的选择代表了全球大型银行对“开源权重+自托管+欧洲制造”这一Mistral差异化价值的认可。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。