第一部分:MiniMax 版本全景概览
MiniMax(稀宇科技)成立于2022年初,是国内率先完成文本、语音、视频、图像、音乐五大模态全线自研的大模型公司。公司于2024年1月上线国内首个MoE大模型abab6,此后围绕全模态模型持续进行技术研发,形成了覆盖模型层与应用层的完整产品体系。

大语言模型 MiniMax各个版本对比
从版本谱系来看,MiniMax 已发展出以下主要版本线:


早期基座系列(abab系列) :abab6(2024年1月,国内首个MoE大模型)→ abab 6.5系列(2024年4月)。这是MiniMax在大语言模型领域的早期探索阶段,确立了MoE架构的技术路线。


推理模型系列(M1系列) :MiniMax-M1-40k / M1-80k(2025年6月17日),是MiniMax首个开源的大规模混合注意力推理模型,支持100万上下文输入和8万Token推理输出,应用于代码等生产力场景。M1采用混合MoE + Lightning Attention设计,参数量为456B-A46B,推理速度比Qwen235B-A22B还要快。


开源编程与Agent系列(M2系列) :M2(2025年10月,230B总参数/10B激活)→ M2.1(2025年,强大多语言编程能力)→ M2.5(2026年2月,顶尖性能与极致性价比)→ M2.7(2026年3月,开启模型自我迭代)→ M2.7-highspeed。M2系列是MiniMax从推理模型向Agent工作流全面转型的标志性产品线。


旗舰全模态系列(M3) :MiniMax-M3(2026年6月),总参数428B、激活参数23B,是国内首个同时具备“前沿Coding能力、1M超长上下文、原生多模态”三项核心能力的大模型。


视频生成系列:MiniMax H3(2026年8月开源),通用型全模态生成系统,在Artificial Analysis视频模型榜单中斩获“视频编辑能力全球第一”。海螺2.3和海螺02系列覆盖商业级视频创作场景。


语音系列(Speech) :Speech-02-HD / Turbo → Speech-2.6-HD / Turbo(2025年10月)→ Speech-2.8-HD / Turbo(2026年1月),已迭代至2.8版本,支持40种语言及方言。


音乐系列(Music) :Music 2.0(2024年)→ Music 3.0(2026年8月),新一代开放权重、生产级全能音乐模型。


第二部分:各版本详细对比与拆解
一、M1到M3语言模型核心对比
维度 MiniMax-M1 MiniMax-M2 MiniMax-M2.5 MiniMax-M2.7 MiniMax-M3
发布时间 2025年6月 2025年10月 2026年2月 2026年3月 2026年6月
总参数 456B 230B 230B 230B 428B
激活参数 45.9B 10B 10B 10B 23B
架构 混合MoE + Lightning Attention 全注意力MoE 全注意力MoE 全注意力MoE 全新MSA注意力架构
上下文 131K(训练支持1M) 197K 204.8K 204.8K 1M
核心定位 推理模型 高效编码与Agent 生产力SOTA 自进化Agent 前沿Coding+多模态
开源协议 Apache 2.0 MIT 开源权重 开源权重 开源权重
SWE-Bench Verified 55.6%(40k)/56.0%(80k) 69.4% 80.2% — —
M1 是MiniMax首个开源的大规模推理模型。采用混合MoE + Lightning Attention的架构设计,参数量456B-A46B,采用1:7的标准注意力与线性注意力比例。M1还提出了CISPO技术,通过剪裁重要性采样权重而非Token更新,解决了传统算法在长思维链训练中丢弃关键Token的问题,提升了强化学习的效率和稳定性。在SWE-bench验证基准上,M1-40k和M1-80k分别取得55.6%和56.0%的优异成绩,显著超越其他开源权重模型。


M2 是MiniMax的架构分水岭。M2放弃了M1的线性注意力,转而采用全注意力架构,参数量缩减至230B-A10B。这一转变背后是MiniMax在实际测试中的深刻体会:在某些超长上下文多跳推理场景下,线性注意力的效果始终不理想,即使降低线性注意力的占比也无法达到全注意力的性能。此外,线性注意力对数值精度的敏感度远高于全注意力,且与Prefix Caching、推测解码等推理加速技术的兼容性也不如全注意力。M2在推理速度上比M1提升约50%,定价从约$0.03/1K tokens降至约$0.01/1K tokens。


M2.5 实现了编程能力的飞跃。经过数十万个真实复杂环境中的大规模强化学习训练,M2.5在SWE-Bench Verified得分80.2%、Multi-SWE-Bench得分51.3%、BrowseComp得分76.3%,较上一代显著提升。从M2到M2.5,SWE-Bench Verified成绩从69.4提升至80.2,进步曲线在同业中尤为陡峭。


M2.7 是首个深度参与自身迭代的模型。M2.7能够自主构建复杂的Agent Harness和Skills、更新自身Memory,并通过强化学习驱动自身迭代,形成“模型驱动模型进化”的闭环。在SWE-Pro基准上达到56.22%,追平GPT-5.3-Codex。在GDPval-AA评测中ELO得分1495,为开源最高。其内部版本曾自主优化编程脚手架超过100轮,通过分析失败轨迹、修改代码、运行评估并决定保留或回退,实现了30%的性能提升。


M3 是MiniMax的最新旗舰模型,采用全新MSA注意力架构。M3是国内首个同时具备“前沿Coding能力、1M超长上下文、原生多模态”三项核心能力的大模型。在SWE-Bench Pro评测中得分59.0%,在Terminal Bench 2.1中得分66.0%,支持图片和视频输入,并能操作电脑桌面。


二、H3视频生成模型
MiniMax H3于2026年8月正式开源,是一套通用型全模态生成系统,可统一理解文本、图像、视频和音频构成的多模态上下文,生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。H3系统由三个核心模块组成:H3-Context-IR负责理解并提炼用户输入的多模态指令,H3-Base根据中间表示生成768p分辨率音视频内容,H3-Regenerate-2K将结果以2K分辨率重新生成更高画质视频。H3-Base采用330亿参数的H3-Omni-Transformer架构,支持包括中文、英语、日语、韩语在内的11种语言对话。


三、Speech系列语音模型
MiniMax语音合成模型已迭代至2.8版本。Speech-2.8首次实现了原生语气词支持,通过对口语填充词进行原生建模,让每一个“嗯”、“呃”或“哎”都保留了应有的停顿和节奏。音色克隆仅需10秒的原声片段,就能精准捕捉说话时的质感、气息和语速习惯。模型全面支持40种全球语言及方言。


四、Music系列音乐模型
MiniMax Music 3.0于2026年8月发布,是新一代开放权重、生产级全能音乐模型。用户只需提供一个创意想法和可选的歌词,即可生成完整歌曲或纯音乐。Music 2.0于2024年推出,采用MoE与Linear Attention相结合的架构。


第三部分:为什么分这么多版本?
一、从推理模型到Agent操作系统的战略演进
MiniMax的版本分化不是简单的参数缩放,而是一条清晰的战略演进路径。M1是推理模型的从0到1,验证了混合注意力架构在长上下文推理中的可行性;M2果断放弃线性注意力转向全注意力,体现了“技术落地必须贴合实际需求”的务实判断;M2.5将编程能力推向SOTA,使MiniMax在开发者社区中建立了坚实口碑;M2.7开启模型自我进化,让AI深度参与自身迭代;M3则将上下文拉到100万Token并实现原生多模态,完成了从“编程工具”到“Agent操作系统”的质变。


二、全模态协同:五大模态全线自研
MiniMax是国内率先完成文本、语音、视频、图像、音乐五大模态全线自研的大模型公司。H3管视频生成,Speech管语音合成与克隆,Music管音乐创作,M系列管语言理解与代码生成。各模态模型并非孤立存在,而是形成了协同效应——例如H3的视频生成可以结合Speech的语音能力生成带有原生立体声音频的视频内容。这种全模态布局使MiniMax能够为海螺AI等应用提供从视频到语音的全流程AI技术支持,在AI内容创作领域建立了差异化壁垒。


三、开源生态与国产算力的深度适配
MiniMax将M1以Apache 2.0协议开源,M2系列以MIT协议开源,M2.7更是在开源首日即完成华为昇腾、摩尔线程、沐曦、昆仑芯、NVIDIA等多种AI芯片的适配部署。这意味着开发者可以直接获取对应芯片的开箱即用方案,大幅降低了国产算力环境下的部署门槛。开源策略的商业价值在于:开源版本吸引开发者构建应用生态,海螺AI等产品层应用通过API服务实现商业变现,同时为企业级客户提供私有化部署方案。


第四部分:最著名版本——MiniMax-M2 本地部署实战
MiniMax-M2是MiniMax架构转型的关键里程碑,230B总参数/10B激活的全注意力MoE架构以MIT协议开源,是当前开源模型中性价比最高的选择之一。以下为完整的本地部署步骤。


步骤一:环境准备与硬件规划
硬件配置基准:


FP8生产环境:8×H100或8×A100 80GB,显存需求约230GB


BF16完整精度:磁盘约460GB,适用于多卡集群部署


最低门槛:4×A100 80GB可通过FP8量化运行


软件环境清单:


操作系统:Ubuntu 22.04 LTS


CUDA 12.1+,PyTorch 2.5+


Python 3.10+


vLLM 0.11.0+


步骤二:安装vLLM推理框架
bash
# 创建虚拟环境
python3 -m venv minimax_env
source minimax_env/bin/activate


# 安装vLLM
uv pip install -U vllm --torch-backend auto
步骤三:下载模型权重
bash
# 从Hugging Face下载M2权重
huggingface-cli download MiniMaxAI/MiniMax-M2 \
  --local-dir ./MiniMax-M2 \
  --resume-download


# 或从ModelScope下载(国内用户推荐)
pip install modelscope
modelscope download --model MiniMaxAI/MiniMax-M2 \
  --local_dir ./MiniMax-M2
步骤四:启动M2推理服务
bash
# 使用vLLM启动M2推理服务(8卡H100配置)
SAFETENSORS_FAST_GPU=1 vllm serve MiniMaxAI/MiniMax-M2 \
  --trust-remote-code \
  --tensor-parallel-size 8 \
  --enable_expert_parallel \
  --enable-auto-tool-choice \
  --tool-call-parser minimax_m2 \
  --reasoning-parser minimax_m2_append_think
其中 --tensor-parallel-size 8 表示张量并行度为8,--enable_expert_parallel 启用专家并行,--tool-call-parser minimax_m2 启用MiniMax原生的工具调用解析器,--reasoning-parser minimax_m2_append_think 启用推理内容解析。


步骤五:API调用与测试
python
from openai import OpenAI


client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY"
)


response = client.chat.completions.create(
    model="MiniMaxAI/MiniMax-M2",
    messages=[
        {"role": "user", "content": "请用Python实现一个带缓存的斐波那契数列"}
    ],
    temperature=0.6,
    max_tokens=2048
)
print(response.choices[0].message.content)
步骤六:启用工具调用与Agent模式
M2的核心优势之一是原生工具调用能力,支持JSON Mode和结构化输出:


python
response = client.chat.completions.create(
    model="MiniMaxAI/MiniMax-M2",
    messages=[{"role": "user", "content": "查询北京今天的天气并给出出行建议"}],
    tools=[{
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "获取指定城市的实时天气",
            "parameters": {
                "type": "object",
                "properties": {
                    "city": {"type": "string", "description": "城市名称"}
                },
                "required": ["city"]
            }
        }
    }],
    tool_choice="auto"
)
步骤七:监控与调优
关键指标监控:


GPU利用率:目标>80%


Token生成速度:目标>50 tokens/s


显存占用:FP8版本约230GB


降本策略:对简单问答和批量文本处理,建议使用M2.1-highspeed或M2-highspeed等轻量版本;对复杂推理和长链路Agent任务,使用M2.7或M3。


第五部分:不同版本的实践成果
案例一:导演陆川与海螺AI联合开发AI漫剧项目(基于海螺AI视频模型 + Speech语音模型)
2025年12月,第七届海南岛国际电影节·联想AI电影季在三亚开幕。评审会主席、知名导演陆川在现场宣布,由其创办的猿动力正在与MiniMax开展紧密的AIGC技术合作,联手开发电影质感级AI漫剧项目,并且后续会持续合作落地院线电影和精品剧集。MiniMax与旗下AI视频创作平台海螺AI将全程为猿动力内容制作提供从视频到语音的全流程AI技术支持。


实践成效:海螺AI依托多模态大模型的技术积累,在AI电影季“我的人生电影”特别单元赛事中展映了多部作品。这一合作代表了MiniMax在影视内容创作领域的深度布局——海螺AI视频模型负责画面生成,Speech语音模型负责角色配音与音效,形成从视频到语音的全链路AI内容生产方案。海螺视频智能体还入选了2025年上海市数字广告业高质量发展十大创新案例,获评“AI驱动数字广告业高质量发展新引擎”。


案例二:临港实验室GeneClaw生物医药科学智能体(基于MiniMax M系列)
2026年3月,临港实验室自主研发的科学智能体GeneClaw正式接入MiniMax最新一代大模型作为底层推理引擎,在复杂任务推理、响应速度、使用成本三个维度实现显著提升。GeneClaw是面向生物医药领域打造的专业科学智能体,已内置超过300个经专业验证的技能包,覆盖靶点发现、管线情报等核心研发环节。


实践成效:MiniMax大模型作为GeneClaw的核心推理引擎,助力其在靶点发现、管线情报等复杂任务中实现高效推理。这一合作代表了MiniMax在AI for Science领域的突破——从通用编程和办公场景延伸至生物医药研发的专业垂直领域,验证了M系列模型在科学推理场景中的可靠性。


案例三:MiniMax Agent“Mix Claw”接入支付宝Token Pay(基于MiniMax M3)
2026年6月,MiniMax最新大模型M3全面接入支付宝“Token Pay”,实现“批量购买、一键分发”的Token席位管理。用户通过支付宝AI付,在MiniMax Agent提供的Mix Claw服务中说句话即可完成应用内结账。沙特HUMAIN也基于MiniMax M3推出阿拉伯语大模型。


实践成效:M3的Agent能力与支付宝的支付生态深度整合,使AI Agent从“对话工具”升级为“可完成实际交易的生产力工具”。开发者实测显示,M3可以复刻网站交互、从一句话开始设计并开发完整产品、将讲座视频自动截取PPT图片并标注时间戳、从一张图复刻Agent工作台。在OpenRouter平台上,M2是第一个日token消耗量超过50B的中国模型,发布几天内即跃升为OpenRouter全球调用量前三、HuggingFace Trending全球第一。

版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。