LongCat(龙猫)是美团旗下LongCat团队开发的大语言模型系列,专注于智能体(Agentic)任务场景下的实用性与推理效率。自2025年9月首次发布以来,LongCat已从单一的基础对话模型,快速演进为覆盖语言、推理、多模态、视频生成、图像生成、语音交互与数学证明的完整模型矩阵。该系列模型大多以MIT许可证开源发布,可在GitHub及Hugging Face平台获取。

2026年6月30日,美团发布新一代万亿参数大模型LongCat-2.0,并将其定位为“为真实的Agentic Coding任务而生”的旗舰模型。美团创始人王兴在股东大会上表示,AI转型是“必答题”而非“可选题”,所有公司都要面对产品中使用AI和工作中使用AI两件事。
从版本谱系来看,LongCat已发展出以下主要版本线:
基础语言模型系列(Flash系列) :LongCat-Flash-Chat(2025年9月1日,560B MoE)→ LongCat-Flash-Lite(轻量化分支)。这是LongCat的开山之作,确立了“计算效率与先进Agent能力平衡”的技术路线。
推理增强系列(Thinking系列) :LongCat-Flash-Thinking(2025年12月)→ LongCat-Flash-Thinking-2601(2026年1月15日,推理增强升级版)。该系列专攻深度推理与复杂智能体任务,在BrowseComp、VitaBench等基准中登顶开源SOTA。
全模态系列(Omni) :LongCat-Flash-Omni(2025年11月),业界首个实现全模态覆盖、端到端架构、大参数量高效推理于一体的开源大语言模型,总参数5600亿,支持文本、音频、图像、视频及任意组合输入。
垂直专项系列:LongCat-Video(视频生成,13.6B参数)、LongCat-Image(图像生成,6B参数)、LongCat-Audio-Codec(语音编解码)、LongCat-Flash-Prover(数学定理证明,2026年4月)、LongCat-Next(原生多模态模型)。
万亿旗舰系列(2.0) :LongCat-2.0(2026年6月30日发布,7月6日开源),总参数1.6万亿,平均激活约480亿,原生支持1M超长上下文,是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。
第二部分:各版本详细对比与拆解
一、Flash系列与2.0核心对比
维度 LongCat-Flash-Chat LongCat-Flash-Thinking-2601 LongCat-2.0
发布时间 2025年9月1日 2026年1月15日 2026年6月30日
总参数 560B 560B 1.6T
激活参数 18.6B–31.3B(平均27B) 平均27B 约48B(动态33B–56B)
架构 MoE + 零计算专家 + ScMoE MoE + 重思考模式 MoE + LongCat稀疏注意力 + N-gram Embedding
上下文 128K 128K 1M
训练算力 国产算力集群 国产算力集群 五万卡国产算力集群
预训练数据 20万亿Token(30天完成) — 超过30万亿Token
开源协议 MIT MIT MIT
核心定位 高效基础对话 强泛化智能体推理 Agentic Coding旗舰
LongCat-Flash-Chat 是LongCat系列的开山之作。模型采用创新性混合专家架构,通过“零计算专家机制”实现动态激活参数——每个token仅激活186亿至313亿参数(平均270亿),在保持模型容量的同时大幅降低计算开销。在MMLU、ArenaHard、CEval等基准测试中,其结果与主流模型相近或更高,在指令遵循与智能体任务评估中位列前茅,推理速度超过100 TPS。
LongCat-Flash-Thinking-2601 在Flash基础上引入“重思考模式”,通过并行推理与深度总结实现推理宽度与深度的协同扩展。团队构建了覆盖20余个领域、包含上万种情境的规模化训练环境,并系统化注入真实世界扰动进行噪声鲁棒训练,使模型能够在多样化、复杂化、带噪声环境中稳定泛化。在BrowseComp、VitaBench等智能体基准测试中登顶开源SOTA。
LongCat-2.0 是LongCat系列的旗舰里程碑。模型从零开始预训练,预训练数据规模超过30万亿Token,覆盖中文、英文、多语言和代码等多类数据。架构上创新性引入LongCat稀疏注意力和N-gram Embedding,在提升长上下文处理效率与token级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。在正式版发布前,LongCat-2.0预览版本已通过OpenRouter平台面向全球开发者开放调用,跻身OpenRouter全球大模型调用量前三,月调用量在Hermes、Claude Code和OpenClaw分列全球第一、第二和第三位。
二、全模态与垂直专项版本
LongCat-Flash-Omni 于2025年11月发布,总参数5600亿,激活参数270亿。其核心突破在于采用完全端到端的统一架构ScMoE,能够同时接收文本、音频、图像、视频及任意组合的多模态输入,是业界首个实现全模态覆盖、端到端架构、大参数量高效推理于一体的开源大语言模型。
LongCat-Flash-Prover 于2026年3月发布,是专门用于数学形式化与定理证明的5600亿参数MoE模型。它将形式化推理拆解为自动形式化、草稿生成与证明生成三大原子能力,采用工具集成推理策略。在MiniF2F-Test数据集上,仅需72次推理即达到97.1%的通过率,刷新开源模型纪录;在MathOlympiad-Bench上达到46.7%,在PutnamBench上达到41.5%。
LongCat-Video 是视频生成模型,13.6B参数;LongCat-Image 是图像生成模型,6B参数;LongCat-Audio-Codec 是语音编解码模型。
第三部分:为什么分这么多版本?
LongCat推出如此丰富的版本矩阵,背后有清晰的战略逻辑。
一、场景适配:从通用对话到全场景Agent覆盖
LongCat的版本分化不是简单的参数缩放,而是针对不同业务场景的系统性分化。Flash-Chat管基础对话与高效推理,Thinking系列管复杂逻辑拆解与多步规划,Omni管全模态实时交互,Prover管数学定理证明,2.0管Agentic Coding与产业级智能体任务,Video/Image/Audio管多模态内容生成。这种精细分工使企业可以根据实际业务需求灵活选型——需要实时语音交互的智能客服场景优先选择Omni版本;法律文书分析等需要多步骤推理的任务则部署Thinking版本。
二、国产算力战略:从底层构建自主可控
LongCat最核心的差异化在于其全栈国产算力体系。LongCat团队对国产算力的探索始于2023年,三年来从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题,最终在五万卡集群上完成万亿参数模型的全流程训练与推理。面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动,团队通过卡间通信异常处理、弹性扩缩卡和自动故障恢复,将月均日故障率降低70%以上;通过自研设计确定性算子、Bitwise一致性验证和参数检测,保障训练结果的可靠;通过流水线调度、显存优化和算子级控核,训练MFU提升1.5倍。最终实现稳态日吞吐超过1T tokens/day。
在推理阶段,LongCat-2.0针对显存与带宽受限的国产算力芯片进行了深度协同优化:模型层面通过稀疏注意力和ScMoE架构缓解I/O与显存压力;芯片适配层利用Super Kernel减少算子启动开销;部署层采用PD分离部署兼顾首Token延迟与每个输出Token的生成时间。美团表示,此次开源旨在验证国产芯片承载复杂大模型任务的成熟能力,并推动存量算力在真实场景中的应用。华为昇腾、摩尔线程、沐曦股份等国产芯片厂商同步完成对该模型的推理适配工作。
三、Agent优先:以真实任务为锚点的版本设计
LongCat系列从诞生之初就以Agentic任务为核心锚点。与业界部分模型先做通用对话再叠加Agent能力的路径不同,LongCat的设计哲学是“让模型在真实的Agentic Coding任务中更高效、更稳定地完成代码理解、生成与执行”。这一理念贯穿于所有版本的设计——Flash-Chat的零计算专家机制是为了在Agent任务中降低推理成本,Thinking系列的环境扩展训练是为了让智能体在真实世界的噪声环境中稳定泛化,2.0的1M超长上下文和N-gram Embedding是为了支撑仓库级代码理解和产业级工作流闭环。版本分化的本质是Agent能力在不同场景下的逐步深化。
第四部分:最著名版本——LongCat-2.0 本地部署实战
LongCat-2.0是LongCat系列中最具里程碑意义的旗舰版本,1.6T总参数/48B激活的MoE架构以MIT协议开源,是当前开源模型中参数规模最大的选择之一。以下为完整的本地部署步骤。
步骤一:环境准备与硬件规划
硬件配置基准:
FP8生产环境:多卡国产算力集群(昇腾A2/A3等),单卡显存64GB,需PD分离部署
BF16完整精度:磁盘约3.2TB,适用于多卡集群部署
INT8量化版:磁盘约1.6TB,适配显存受限的国产算力芯片
最低门槛:需多卡协同部署,不建议单卡运行
软件环境清单:
操作系统:Ubuntu 22.04 LTS
CUDA 12.1+(或国产芯片对应驱动)
Python 3.10+
vLLM 0.11.0+ 或 LongCat官方推理引擎
步骤二:安装vLLM推理框架
bash
# 创建虚拟环境
python3 -m venv longcat_env
source longcat_env/bin/activate
# 安装vLLM
uv pip install "vllm>=0.11.0" --torch-backend=auto
步骤三:下载模型权重
bash
# 从Hugging Face下载LongCat-2.0权重
huggingface-cli download meituan-longcat/LongCat-2.0 \
--local-dir ./LongCat-2.0 \
--resume-download
# 或从ModelScope下载(国内用户推荐)
pip install modelscope
modelscope download --model meituan-longcat/LongCat-2.0 \
--local_dir ./LongCat-2.0
# INT8量化版下载
huggingface-cli download meituan-longcat/LongCat-2.0-INT8 \
--local-dir ./LongCat-2.0-INT8
步骤四:启动LongCat-2.0推理服务
bash
# 使用vLLM启动推理服务
vllm serve meituan-longcat/LongCat-2.0 \
--trust-remote-code \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--max-model-len 1048576 \
--enable-auto-tool-choice
其中 --tensor-parallel-size 8 表示张量并行度为8,--enable-expert-parallel 启用专家并行,--max-model-len 1048576 设置最大上下文长度为100万Token,--enable-auto-tool-choice 启用原生工具调用。
对于国产算力平台,需使用美团官方提供的国产卡推理代码,采用PD分离部署架构以兼顾首Token延迟与生成效率。
步骤五:API调用与测试
python
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY"
)
response = client.chat.completions.create(
model="meituan-longcat/LongCat-2.0",
messages=[
{"role": "user", "content": "请用Python实现一个带缓存的斐波那契数列,并分析其时间复杂度"}
],
temperature=0.6,
max_tokens=4096
)
print(response.choices[0].message.content)
步骤六:启用Agentic Coding模式
LongCat-2.0深度适配Claude Code、OpenClaw、Hermes等主流Agent框架,可直接作为底层模型接入:
bash
# 设置环境变量,将LongCat-2.0接入Claude Code
export ANTHROPIC_BASE_URL="http://localhost:8000/v1"
export ANTHROPIC_API_KEY="EMPTY"
export ANTHROPIC_MODEL="meituan-longcat/LongCat-2.0"
# 启动Claude Code
claude
在Agent模式下,模型可自主完成文件读写、代码生成、测试运行、错误修复等完整工作流。
步骤七:监控与调优
关键指标监控:
GPU/NPU利用率:目标>80%
显存占用:INT8版本约1.6TB,BF16版本约3.2TB
Token生成速度:关注TPOT(每Token生成时间)
月均日故障率:国产算力集群需监控卡间通信异常,目标是保持训练故障率降低70%以上的运维水平
降本策略:对基础对话和批量文本处理,建议使用LongCat-Flash-Chat(560B)或Flash-Lite等轻量版本;对复杂推理和长链路Agent任务,使用LongCat-2.0;对全模态交互场景,切换至LongCat-Flash-Omni。
第五部分:不同版本的实践成果
案例一:美团“智能掌柜”与“小团”AI助手(基于LongCat-Flash系列)
美团面向商家推出了AI经营工作台CatPaw,以及“智能掌柜”“袋鼠管家”等AI工具,均以LongCat大模型为统一技术底座。面向消费者,美团App内的本地生活AI Agent“小团”基于LongCat系列驱动,覆盖找餐厅、做攻略、帮预订、点外卖、找商品和按症状找药等12类本地生活需求。
实践成效:“智能掌柜”已服务全国超过130万餐饮商家,累计解决商家问题860万个。北京一家火锅店接入后,近三成用户咨询实现全自动处理,前厅效率提升21%。“小团”累计响应超过7亿次用户需求。LongCat官方微信账号的声明强调,该模型拥有建立游戏网站和撰写小说的能力,LongCat大模型在美团内部的API调用量占比已从上年初的10%增长到68%。
案例二:LongCat-Flash-Omni多模态实时交互(基于Omni版本)
LongCat-Flash-Omni是业界首个实现全模态覆盖、端到端架构、大参数量高效推理于一体的开源大语言模型。某游戏公司CTO在体验后表示:“我们正在开发的AI NPC项目,原本需要集成三个不同模型,现在用LongCat-Flash-Omni一个就搞定了,成本直接降了40%。”在教育领域,某在线平台用其开发了“会看作业会讲题”的AI教师;医疗行业,多家三甲医院正在测试基于该模型的影像诊断辅助系统。
实践成效:Omni版本将文本、音频、图像、视频的理解与生成能力整合到单一端到端架构中,使企业无需再为不同模态的任务分别部署独立模型。这一架构的实用价值在于显著降低了多模态Agent系统的集成复杂度和推理成本。
案例三:LongCat-Flash-Prover数学定理证明(基于Prover版本)
2026年3月,美团龙猫团队开源了专门用于数学形式化与定理证明的LongCat-Flash-Prover。该模型针对大语言模型在严密逻辑推演中的短板,通过将形式化推理拆解为自动形式化、草稿生成与证明生成三大原子能力,并采用工具集成推理策略,显著提升了证明的可靠性。
实践成效:在MiniF2F-Test数据集上,仅需72次推理即达到97.1%的通过率,刷新开源模型纪录,显著优于现有开源权重基线。在MathOlympiad-Bench(180次尝试预算)上达到46.7%,在PutnamBench(118次尝试预算)上达到41.5%。这一成果标志着AI在严谨数学推理领域从“算得对”向“证得严”的跨越,为形式化验证、自动定理证明等专业场景提供了可用的开源工具。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。