第一部分:Step 系列版本全景概览
阶跃星辰(StepFun)由前微软全球副总裁姜大昕于2023年4月在上海创立,核心团队包括首席科学家张祥雨、CTO朱亦博等AI领域顶尖专家,位列“国产大模型六小虎”之一。公司信奉Scaling Law,提出“单模态→多模态→多模理解生成一体化”的技术路线,已发布22款自研模型,构建起覆盖基础模型与多模态模型的Step“1+N”模型矩阵。

大语言模型 阶跃星辰各个版本对比
从版本谱系来看,Step系列已发展出以下主要版本线:


早期基座系列(Step-1 → Step-2) :Step-1千亿参数语言大模型(2023年8月)→ Step-1V千亿参数多模态大模型(2023年11月)→ Step-1.5V多模态大模型(2024年7月)→ Step-1X图像生成大模型(2024年7月)→ Step-2万亿参数MoE语言大模型预览版(2024年3月)/ 正式版(2024年7月)。


推理模型系列(Step R-mini / Step-3) :Step R-mini推理模型(2025年1月)→ Step 3(2025年7月25日发布,7月31日开源),总参数321B,激活参数38B,是阶跃首个全尺寸、原生多模态推理模型,在国产芯片上的推理效率最高可达DeepSeek-R1的300%。


Flash高效Agent系列(Step 3.5 Flash → Step 3.7 Flash) :Step 3.5 Flash(2026年2月2日开源,1960亿总参数/约110亿激活参数)→ Step 3.7 Flash(2026年5月29日发布并开源,198B总参数/约11B激活参数),面向真实Agent场景打造,推理速度最高可达每秒400词元。


多模态与垂直系列:Step-Video-T2V视频生成大模型(2025年2月,300亿参数,全球最大开源视频生成模型)、Step-Audio语音交互大模型(2025年2月,行业首款产品级开源语音交互模型)、Step-Audio 2 mini(2025年9月)、StepAudio 2.5 TTS / Realtime(2026年)。


端侧与智能体系列:Step Edge端侧模型家族(2026年7月)、Step AOS智能体原生操作系统(2026年7月13日发布),构建从基座模型、端侧模型、智能体系统到硬件终端的完整技术闭环。


第二部分:各版本详细对比与拆解
一、基座模型代际演进核心对比
维度 Step-1 Step-1V Step-2 Step 3 Step 3.5 Flash Step 3.7 Flash
发布时间 2023年8月 2023年11月 2024年7月 2025年7月 2026年2月 2026年5月
总参数 千亿级 千亿级 万亿级 321B 196B 198B
激活参数 — — — 38B 约11B 约11B
架构 密集 多模态 MoE MoE 稀疏MoE 稀疏MoE
上下文 未公开 未公开 未公开 — 256K 256K
核心定位 语言基座 多模理解 深度智能 多模态推理 Agent高效推理 Agent生产场景
开源协议 未开源 未开源 未开源 开源 开源 Apache 2.0
Step-1千亿参数语言大模型在逻辑推理、中文知识、英文知识、数学、代码方面的性能全面超过GPT-3.5。Step-1V千亿参数多模态大模型在中国权威的“司南”(OpenCompass)多模态模型评测榜单中位列第一,性能比肩GPT-4V,可精准描述和理解图像中的文字、数据、图表等信息,并实现视频理解。Step-2万亿参数语言大模型采用MoE架构,聚焦深度智能探索,参数量从千亿到万亿增长了一个数量级,对算力、系统、数据、算法四个方面都提出了极高要求,业内只有极少数公司能做到。


Step 3是阶跃星辰首个全尺寸、原生多模态推理模型,采用MoE架构,总参数321B,激活参数38B。在MMMU、MathVision、SimpleVQA、AIME 2025等榜单上取得了开源多模态推理模型的SOTA成绩,在国产芯片上的推理效率最高可达DeepSeek-R1的300%,在基于NVIDIA Hopper架构的芯片上进行分布式推理时,实测吞吐量相比DeepSeek-R1提升超70%。


Step 3.5 Flash与Step 3.7 Flash是阶跃在Agent时代的关键落子。Step 3.5 Flash在AIME 2025基准测试中得分97.3,编码任务的SWE-bench Verified测试中达到74.4%,最高推理速度可达每秒350个token,两天内登顶OpenRouter趋势榜榜首。Step 3.7 Flash专为生产级Agent打造,相比上一代在Agent与工具调用维度从57.1%提升至69.9%(+12.8%),是本次迭代中变化最大的维度,总分从64.0%提升至67.2%。


二、多模态与语音版本对比
维度 Step-Video-T2V Step-Audio Step-Audio 2 mini StepAudio 2.5 TTS
发布时间 2025年2月 2025年2月 2025年9月 2026年4月
参数规模 300亿 — — —
开源协议 MIT 开源 开源 未开源
核心能力 文生视频 语音对话+方言 语音理解+推理+生成 语境感知语音合成
特色功能 204帧540P视频 情绪控制+音色克隆 端到端语音交互 Zero-shot音色复刻
Step-Video-T2V是目前全球范围内参数量最大、性能最好的开源视频生成大模型,参数量达300亿,可直接生成最长204帧、540P分辨率的高质量视频,采用MIT许可协议,支持免费商用和衍生开发。Step-Audio是行业首款产品级开源语音交互大模型,支持情绪控制、方言识别、多语种对话及音色克隆功能。StepAudio 2.5 TTS具备语境感知能力,支持Zero-shot音色复刻,让AI“演”文本而非“念”文本。


第三部分:为什么分这么多版本?
阶跃星辰推出如此丰富的版本矩阵,背后有清晰的战略逻辑。


一、场景适配:从通用基座到智能体原生
阶跃星辰的版本分化遵循“单模态→多模态→多模理解生成一体化”的技术路线演进。Step-1管语言基座,Step-1V管多模态理解,Step-2管深度智能探索,Step 3管原生多模态推理,Step 3.5/3.7 Flash管Agent生产场景,Step-Video-T2V管视频生成,Step-Audio管语音交互,Step Edge管端侧部署。正如CEO姜大昕所言,最适合实际应用的大模型需要满足强智能、低成本、可开源和多模态四个特征,这四个维度缺一不可。每个版本在各自领域做到极致,使企业可以根据实际业务需求灵活选型。


二、效率优先:以Flash路线替代参数竞赛
阶跃星辰连续两代基座模型均主打Flash版本,走了一条有别于单纯追求参数规模的差异化路线。Step 3.7 Flash总参数达1960亿,但每次推理仅激活110亿参数,这种极度稀疏的MoE设计使其在保持模型容量的同时将推理成本控制在极低水平。在推理时代,模型性能随思维链的增长而提升,解码效率成为降低成本的关键。Step 3在架构设计阶段便充分考量系统与硬件特性,实现广泛硬件平台上的高效推理,在国产芯片上的推理效率最高可达DeepSeek-R1的300%。


三、开源生态:以开放构建产业信任
阶跃星辰将Step 3、Step 3.5 Flash、Step 3.7 Flash以开源方式发布,Step-Video-T2V采用最宽松的MIT许可协议,支持免费商用和任意修改。Step 3.7 Flash采用Apache 2.0许可,原生支持图像、视频等多模态输入,围绕智能体、代码生成与联网搜索深度优化,兼容主流智能体框架,适合高频、高并发的企业级多模态智能体工作流。开源版本作为技术标杆吸引开发者构建应用生态,而旗舰商业线通过API服务实现商业变现——截至2026年初,平台API调用量增长近20倍,活跃用户数量增长5倍。


第四部分:最著名版本——Step 3 本地部署实战
Step 3是阶跃星辰首个全尺寸、原生多模态推理模型,321B总参数/38B激活的MoE架构以开源方式发布,在国产芯片上的推理效率最高可达DeepSeek-R1的300%。以下为完整的本地部署步骤。


步骤一:环境准备与硬件规划
硬件配置基准:


FP8生产环境:16×H20或等效GPU集群,显存需求约350GB


BF16完整精度:磁盘约640GB,适用于多卡集群部署


最低门槛:8×A100 80GB可通过FP8量化运行


软件环境清单:


操作系统:Ubuntu 22.04 LTS


CUDA 12.1+,PyTorch 2.5+


Python 3.10+


vLLM 0.9.0+


步骤二:安装vLLM推理框架
bash
# 创建虚拟环境
python3 -m venv step3_env
source step3_env/bin/activate


# 安装vLLM
uv pip install "vllm>=0.9.0" --torch-backend=auto
步骤三:下载模型权重
bash
# 从Hugging Face下载Step 3权重
huggingface-cli download stepfun-ai/Step-3 \
  --local-dir ./Step-3 \
  --resume-download


# FP8量化版
huggingface-cli download stepfun-ai/Step-3-FP8 \
  --local-dir ./Step-3-FP8
步骤四:启动Step 3推理服务
bash
# 使用vLLM启动Step 3推理服务(16卡H20配置)
vllm serve stepfun-ai/Step-3 \
  --trust-remote-code \
  --tensor-parallel-size 16 \
  --reasoning-parser step3 \
  --enable-auto-tool-choice \
  --tool-call-parser step3 \
  --max-num-batched-tokens 4096
其中 --tensor-parallel-size 16 表示张量并行度为16,--reasoning-parser step3 启用Step 3原生的推理内容解析,--tool-call-parser step3 启用工具调用解析器。


步骤五:API调用与测试
python
from openai import OpenAI


client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY"
)


response = client.chat.completions.create(
    model="stepfun-ai/Step-3",
    messages=[
        {"role": "user", "content": "请分析这张财务报表图片中的关键数据并给出投资建议"}
    ],
    temperature=0.6,
    max_tokens=4096
)
print(response.choices[0].message.content)
步骤六:启用多模态理解与工具调用
Step 3原生支持图像和视频输入,并具备工具调用能力:


python
# 多模态图像理解
response = client.chat.completions.create(
    model="stepfun-ai/Step-3",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张UI界面的设计是否合理?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}}
        ]
    }]
)
步骤七:监控与调优
关键指标监控:


GPU利用率:目标>80%


显存占用:FP8版本约350GB


推理吞吐量:相比DeepSeek-R1提升超70%


降本策略:对高并发Agent任务,建议使用Step 3.5 Flash或Step 3.7 Flash;对复杂多模态推理任务,使用Step 3;对简单问答和批量文本处理,使用Step-1V轻量版本。


第五部分:不同版本的实践成果
案例一:千里科技“AI+车”智能座舱(基于Step AOS + Step Edge + 阶跃Amoo)
2026年7月13日,阶跃星辰正式发布全球首个智能体原生操作系统Step AOS、新一代个人智能体阶跃Amoo,以及面向汽车、手机等终端场景的端侧模型家族Step Edge。作为阶跃星辰的战略合作伙伴,千里科技同步宣布将Step AOS、阶跃Amoo、Step Edge引入汽车领域,融合双方在大模型、汽车智能化系统的技术积淀,率先打造面向智能体时代的大模型原生汽车终端体验。


实践成效:Step Edge端侧模型专为手机、汽车等终端硬件定制,具备超低本地延迟响应、全模态本地隐私保护、原生端云协同等核心特点,在29项核心评测指标中位列同类端侧模型第一,覆盖文本视觉、音频理解、语音识别、GUI、图像生成与编辑等多个方向。Step AOS具备记忆、决策与执行、安全三大核心特征,将模型能力与终端能力深度打通,使用户只需表达任务意图,全链路由智能体自主完成,实现了从“人操作系统工具”转向“人机共生”的人机交互范式转变。阶跃Amoo拥有操作系统级身份,能够跨应用调度、端云协同,并在多台设备间无缝接续任务,进入车端后将成为懂用户、能思考、会行动的智能出行伙伴。


案例二:欢瑞世纪“麟跃”AI联合实验室影视内容生产(基于Step-Video-T2V + Step-Audio)
2026年8月,欢瑞世纪宣布与阶跃星辰达成战略合作,双方共建“麟跃”AI联合实验室,并接入阶跃星辰两款最新开源多模态模型——Step-Video-T2V视频生成模型和Step-Audio语音交互模型,用AI技术赋能影视内容生产。


实践成效:Step-Video-T2V作为全球参数量最大的开源视频生成模型,可直接生成最长204帧、540P分辨率的高质量视频,确保生成的视频内容具有极高的信息密度和强大的一致性。Step-Audio支持情绪控制、方言识别、多语种对话及音色克隆功能,在影视娱乐领域具备广阔的应用潜力。欢瑞世纪将在联合实验室的基础上,利用这两款模型覆盖从剧本创作、视觉预演到配音制作的影视内容生产全链条,加速AI技术在影视工业化中的应用落地。


案例三:上海银行沪语交互全链路金融服务(基于Step-Audio语音大模型)
2025年11月,上海银行、财跃星辰与阶跃星辰三方签署战略合作协议,推出首个支持完整沪语交互全链路的应用案例,实现从语音唤醒、多轮对话到业务办理的全流程方言智能化服务。这标志着我国首个聚焦养老金融与方言智能的金融大模型体系全面启动,塑造以“技术创新+场景”的智慧养老金融服务新范式。


实践成效:基于Step-Audio的方言识别与多轮对话能力,上海银行的智能语音服务可精准识别沪语用户的自然语言表达,完成从业务咨询到交易办理的完整流程,解决了老年用户群体因普通话不熟练而难以使用智能金融服务的痛点。这一案例展示了阶跃星辰语音大模型在金融垂直场景中的落地价值——不是简单的语音识别,而是将方言理解、多轮对话和业务系统深度整合,形成完整的方言智能化服务闭环。

版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。