智谱 GLM 系列源自清华大学知识工程实验室(KEG Lab)的技术积累,由北京智谱华章科技股份有限公司研发。自2024年1月GLM-4发布以来,智谱保持着中国大模型厂商中最稳定的季度级发布节奏——18个月内完成8次以上重大版本迭代。2026年1月8日,智谱在港交所上市,成为首家公开上市的中国AI实验室。

GLM 的版本谱系可归纳为以下几条主线:
基础大模型主线(GLM-4 → GLM-5.3) :GLM-4(2024年1月)→ GLM-4-9B开源(2024年6月)→ GLM-4.5(2025年7月)→ GLM-4.6(2025年9月)→ GLM-4.7(2025年12月)→ GLM-5(2026年2月)→ GLM-5.1(2026年4月)→ GLM-5.2(2026年6月)→ GLM-5.3(2026年8月)。这条主线是GLM生态的核心骨架。
轻量开源线(GLM-4.5-Air / Flash) :GLM-4.5-Air(2025年7月)和GLM-4.5-Flash,构成GLM家族的轻量层,单卡级部署友好,免费权重,是中小企业轻量任务的主力配置。
推理专项线(GLM-Z1) :GLM-Z1-32B-0414(2025年4月)→ GLM-Z1-Air / AirX / FlashX / Flash。专攻深度推理,推理速度实测可达200 tokens/秒,性能媲美DeepSeek-R1等顶尖推理模型。
多模态线(GLM-4V / GLM-5V-Turbo) :GLM-4V(2024年)→ GLM-4.5V(2025年8月)→ GLM-5V-Turbo(2026年4月)。让GLM从纯文本模型进化为能处理图像、视频的多模态系统。
语音线(GLM-4-Voice / GLM-ASR) :GLM-4-Voice(2024年10月),端到端情感语音模型,支持中英文实时语音对话、情绪感知和方言表达。GLM-ASR-2512(2025年12月),语音识别模型。
垂直专项线:GLM-OCR(图文解析)、GLM-Image(图像生成)、GLM-CogVideo(视频生成)等。
第二部分:各版本详细对比与拆解
一、GLM-4 到 GLM-5.3 的代际演进对比
维度 GLM-4 GLM-4.5 GLM-4.6 GLM-5 GLM-5.3
发布时间 2024年1月 2025年7月 2025年9月 2026年2月 2026年8月
总参数 未公开 355B 357B 744B 743B
激活参数 — 32B 32B 40B —
上下文 128K 128K 200K 198K 1M输入/128K输出
核心定位 基础基座 Agent原生 Coding旗舰 系统工程+长程Agent 编程+安全审计
开源协议 部分开源 MIT MIT MIT MIT
GLM-4.5是首个原生融合推理、代码与智能体三大能力的开源模型,采用MoE架构,总参数3550亿,激活参数320亿,在23万亿token上多阶段训练后经强化学习精调。GLM-4.5-Air采用更精简设计,总参数1060亿,激活参数120亿,单卡级部署友好。
GLM-5实现了从GLM-4.5的355B到744B的参数跃迁,总参数翻倍,激活参数从32B增至40B,预训练数据从23T tokens扩展到28.5T。核心创新是引入DSA稀疏注意力机制,根据Token重要性动态分配注意力资源,在不折损长上下文理解的前提下大幅降低训练与推理成本。
GLM-5.3在GLM-5.2同基座上通过后训练Scaling实现编程能力暴涨50%,在Terminal Bench 3.0等公开基准上达到开源SOTA水平。其独特的安全审计能力尤为突出——在白盒代码审查与漏洞发现中已联合多个安全团队累计发现2436个漏洞(1097个中高危),CyberGym评测得分84.5%。
二、GLM-Z1 推理专项线
GLM-Z1-32B-0414是在智谱32B基座模型基础上,通过冷启动和扩展强化学习,在数学、代码和逻辑任务上进一步训练得到的推理模型。其核心优势是速度与质量的平衡——实测推理速度可达200 tokens/秒,性能媲美DeepSeek-R1等顶尖模型,而价格仅为DeepSeek-R1的1/30。GLM-Z1-Air-0414价格极低,特别适合高频调用的推理场景。
三、多模态与语音线
GLM-4-Voice是智谱首个开源的端到端语音模型,构建了完全端到端的语音对话系统,将声学特征提取、语义理解、响应生成整合为单一神经网络,避免了传统“语音转文字再转语音”级联方案的延迟和信息损失。它能够理解情感、有情绪表达和情感共鸣,支持多语言和方言,可随时打断。
GLM-5V-Turbo是原生多模态编程基座模型,兼顾视觉理解与Coding能力,强化了GUI Agent和Coding Agent能力,在更小参数量下实现更优性能表现。
第三部分:为什么分这么多版本?
GLM 推出如此丰富的版本矩阵,背后有清晰的战略逻辑。
一、场景适配:从“万金油”到“专用工具”
智谱的产品策略是让每个版本在各自领域做到极致。GLM-5.3管编程和安全审计,GLM-5.2管长程Agent,GLM-Z1管深度推理,GLM-4.5-Air/Flash管轻量任务,GLM-4-Voice管语音交互,GLM-5V-Turbo管多模态编程。这种精细分工使企业可以根据实际业务需求灵活选型,在成本、性能和能力之间找到最优平衡点。
二、开源分层:用开放构建生态,用闭源保留商业能力
智谱将GLM-5系列以MIT协议开源,允许免费商用、二次修改和权重二次分发。这一策略使GLM成为“最具机构可部署性的中国开源权重模型”。开源版本作为技术标杆吸引开发者构建应用生态,而旗舰商业线通过API服务实现变现——GLM-5.3的API与5.2定价持平,Coding Plan低至49元/月,降低了企业级用户的使用门槛。
三、国产算力生态的深度适配
GLM-5从发布伊始就原生适配了中国GPU生态,全面兼容华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、天数智芯与燧原等七大主流国产芯片平台。GLM-4.6更是首个在寒武纪芯片上实现FP8 + Int4集成的中国旗舰模型。
这一适配的战略意义在于:在单台国产算力节点上,GLM-5的性能表现已可媲美由两台国际主流GPU组成的计算集群,长序列处理场景下的部署成本大幅降低50%。对于数据合规要求严格的金融、政务、医疗等行业,国产算力适配是私有化部署的前置条件。
第四部分:最著名版本——GLM-5 本地部署实战
GLM-5 是GLM系列中最具里程碑意义的开源版本,744B总参数/40B激活的MoE架构标志着智谱正式进入开源大模型的第一梯队。以下为完整的本地部署步骤。
步骤一:环境准备与硬件规划
硬件配置基准:
FP8生产环境:8×H200或4×H100机柜,显存需求750GB(FP8版本)
BF16完整精度:磁盘约1.5TB,适用于超大规模机房微调
Q4_K_M GGUF量化:磁盘约376GB,适配4卡H10或高端工作站
UD-IQ2轻量量化:磁盘241GB,Mac Studio M3 Ultra(256GB统一内存)可运行,推理速度3-9 tokens/s
软件环境清单:
操作系统:Ubuntu 22.04 LTS
CUDA 12.1+,PyTorch 2.5+
Python 3.10+
vLLM 0.19.0+
步骤二:安装vLLM推理框架
bash
# 创建虚拟环境
python3 -m venv glm_env
source glm_env/bin/activate
# 安装vLLM
uv pip install "vllm==0.19.0" --torch-backend=auto
步骤三:启动GLM-5推理服务
bash
# 使用vLLM启动GLM-5推理服务
vllm serve zai-org/GLM-5 \
--trust-remote-code \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--chat-template-content-format string
其中 --tensor-parallel-size 8 表示张量并行度为8,--tool-call-parser glm47 启用GLM原生的工具调用解析器,--reasoning-parser glm45 启用推理内容解析。
步骤四:API调用与测试
python
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY"
)
response = client.chat.completions.create(
model="zai-org/GLM-5",
messages=[
{"role": "user", "content": "请用Python实现一个带缓存的斐波那契数列"}
],
temperature=0.6,
max_tokens=2048
)
print(response.choices[0].message.content)
步骤五:GGUF量化部署(Mac Studio方案)
对于拥有256GB统一内存的Mac Studio用户,可使用Unsloth优化的2-bit量化版本:
bash
# 下载UD-IQ2_M量化权重
huggingface-cli download unsloth/GLM-5-GGUF \
--include="UD-IQ2_M/*" \
--local-dir ./GLM-5-GGUF
# 使用llama.cpp运行
./llama-cli -m ./GLM-5-GGUF/UD-IQ2_M/GLM-5-UD-IQ2_M.gguf \
-p "请解释MoE架构的工作原理" \
-n 512
步骤六:监控与调优
监控GPU利用率(目标>80%)和显存占用。若出现OOM错误,可减小--max-model-len参数或启用更激进的量化档。对于长序列任务,GLM-5的DSA稀疏注意力机制会自动优化注意力资源分配,无需额外配置。
第五部分:不同版本的实践成果
案例一:杭州城投人工智能产业大模型项目(基于GLM-4.5)
2025年9月,杭州城投与智谱联手打造的杭州城投人工智能产业大模型项目(一期)发布建设成果,多个大模型及智能体在全国首次亮相——全国首个公交大模型、全国首个路桥养护多模态大模型、全国首个AutoGLM防汛智能体及全国首个自主学习清运调度智能体。该项目以GLM-4.5为核心驱动,创新采用“1+1+3+3”架构,部署多款大语言与推理模型、多模态大模型以及专家小模型,上线专属智能体30余款,实现对26个原有业务系统的能力接入与智能化升级。
实践成效:在公交领域,杭州公交日均客流量超150万人次,拥有9000多辆运营车辆、5000多公里线网和27000多个站点。通过多模态大模型能力,项目构建了“两网融合-安全防控-智能交互-单元管理”全景应用体系,实现了从“数字驱动”到“模型驱动”的运营变革。智谱相关负责人透露,到年底项目还将推出涵盖清运调度、行政管理等多个领域的自主学习智能体。
案例二:值得买科技接入GLM-5.3(基于GLM-5.3)
2026年8月,值得买科技一站式大模型服务平台OpenHubs完成智谱GLM-5.3模型上线,并在消费服务、内容生产、研发办公等场景开展测试与接入。作为智谱AI生态合作伙伴,值得买将GLM-5.3应用于消费智能体场景,增强复杂消费需求理解、任务规划及工具协同能力,支持商品推荐、参数对比、评价总结、价格查询等消费决策服务。在编程场景中,GLM-5.3辅助完成需求拆解、代码理解与生成、问题定位、测试验证及跨模块任务处理。
实践成效:OpenHubs平台已汇聚Qwen、Kimi、DeepSeek、智谱GLM、MiniMax、豆包Seed等主流大模型,GLM-5.3的上线进一步丰富了平台领先模型生态。值得买正逐步形成“模型引入—场景验证—能力沉淀—平台开放”的AI应用路径,将内部业务实践中形成的模型接入、调度和管理能力向企业客户及开发者开放。
案例三:极豆科技座舱原生支付Agent(基于GLM系列)
2026年1月,极豆科技、智谱与中国银联三方联合发布“座舱原生支付Agent”。智谱为系统提供了GLM系列大模型作为基座,依托GLM在长上下文理解与推理方面的能力,使车载系统能够在驾驶场景中理解用户的自然语言指令并安全地完成支付流程。该方案将支付能力直接嵌入智能座舱操作系统,用户无需掏出手机即可在车内完成停车缴费、加油支付等操作。
实践成效:三方合作将AI大模型能力与银联的支付清算网络深度整合,在车载场景中构建了从语音指令到支付完成的完整闭环。这是GLM系列在智能出行与金融支付交叉场景中的一次标志性落地,展示了国产大模型在垂直行业的商业化潜力。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。