过去几年,评价一张AI显卡“好不好”,看的是TFLOPS、显存大小、制程工艺——一套延续自传统高性能计算时代的指标框架。但进入2026年,这套方法已经明显失效。行业不再问“有多少张卡”,而是问“有效算力是多少”。从单卡峰值到系统效率,从FLOPS到Token产出,从芯片参数到每瓦智能体数量——AI算力性能的“怎么看”,正在被彻底改写。

一、旧尺子为什么量不动了?
先看看过去我们是怎么看算力性能的。
TFLOPS是最基础的指标,衡量芯片每秒可执行的浮点运算次数。FP16算力、INT8算力、BF16算力——这些数字一度是芯片厂商发布会上的核心卖点。但问题在于,TFLOPS本质上是“理论上限”,而不是“实际跑多快” 。芯片标称的峰值算力,是理想条件下的最大值;实际跑大模型时,受内存带宽、调度逻辑、软件栈优化程度影响,有效利用率可能只有标称值的三成到七成。
显存容量和带宽是另一个常用指标。H100的80GB HBM3、昇腾910C的96GB——数字越大似乎越好。但显存只是“能装多少”,真正决定速度的是带宽——数据搬不搬得动,比能装多少往往更关键。
制程工艺——5nm、4nm、7nm——曾是芯片性能的风向标。但摩尔定律放缓后,单靠制程进步已经撑不起算力的持续增长。
这些传统指标的共同问题是:它们衡量的是“芯片能算多快”,而不是“系统能产出多少有用的AI能力” 。当AI负载从单次对话变成多步骤智能体任务,当推理算力反超训练成为主流,旧尺子自然量不动了。
二、新基准:从“每秒运算”到“每瓦产出”
2026年最标志性的变化,是评估单位从FLOPS变成了Token。
Token per Watt(每瓦Token产出效率) 正在取代峰值算力,成为新的核心KPI。英伟达在GTC 2026上明确释放了这一信号——评价对象已经从“芯片”转向“系统”。一台AI数据中心的价值,不再取决于它装了多少张GPU,而取决于它在固定能源预算下能持续产出多少Token。
更激进的变革来自AA-AgentPerf——独立评测机构Artificial Analysis发布的业界第一个专门为AI智能体设计的推理基准。它的主指标并非每秒多少Token,而是 “每兆瓦并发智能体数(Agents per Megawatt)” 。通俗说,就是每给系统供1兆瓦电力,它能同时“养活”多少个干活的智能体。
为什么需要这样的指标?因为智能体的负载模式和普通对话完全不同。一次对话是“百米冲刺”——模型接一个问题,吐一段回答,结束。但一个智能体干活更像“跑接力”——它把一个目标拆成几十上百个步骤,读文件、写代码、跑命令、看结果,再决定下一步,一棒接一棒。几十次甚至上百次的大模型调用串在一起,复杂度并非简单相加,而是层层相乘。老基准量的是单次定长请求,根本测不出这种链式调用对系统的真实压榨。
英伟达GB300 NVL72在AA-AgentPerf测试中,每兆瓦能同时扛住61400个智能体,而上一代H200只能扛约2600个——差了整整20倍。这个数字,用传统的TFLOPS根本解释不了。
三、效率指标:算力到底用上了多少?
有了新基准,还需要新指标来衡量“算力到底有没有被浪费”。
MFU(Model FLOPs Utilization,模型浮点运算利用率) 是当前最受关注的效率指标。它的定义很简单:实际观测到的FLOPS除以GPU理论峰值FLOPS。比如某GPU集群理论算力1000 PFLOPS,模型实际只跑出110 PFLOPS,MFU就是11%。
这个数字有多残酷?2026年5月,xAI公司被曝拥有55万张英伟达GPU,但MFU仅有11%——理论上能产生100份训练吞吐的硬件,实际只产出了11份。而行业生产级大模型训练的MFU通常落在35%至45%之间,Meta和谷歌分别可达43%和46%。同样一批卡,有人只能榨出11%,有人能榨出46%——中间差了4倍的有效算力。
MFU低的原因很集中:数据等待、通信开销、重新计算——大量电力和硬件时间没有转化为有效的训练吞吐。在万卡集群里,近一半算力其实在等数据,不是在算。GPT-5级别的大模型训练中,跨节点通信开销占了总训练时间的三成以上。
四、推理指标:用户感知到的“快”怎么量?
如果说MFU衡量的是训练效率,那么推理性能的评估有一套完全不同的指标体系。
TTFT(Time To First Token,首Token时间) :从请求发出到收到第一个输出Token的耗时。这直接影响用户的第一感知——点下发送后多久能看到回复。
TPOT(Time Per Output Token,每Token输出时间) :后续每个Token的平均生成时间。这决定了内容的流畅度——是一行一行往外蹦,还是源源不断地流出来。
两者的关系是:总延迟 = TTFT + (Token数量 × TPOT) 。优化推理性能,必须同时关注这两个指标。
吞吐量(Throughput) 则是从系统视角看的指标——单位时间内能处理多少请求、生成多少Token。SemiAnalysis的总结指出,仅约10%到20%的推理任务真正受限于延迟,大部分场景更依赖吞吐与成本效率优化。这意味着,对多数应用而言,“单位时间能产出多少Token”比“单个请求多快回来”更重要。
五、集群指标:单卡强不等于集群强
单卡性能再好,放进集群可能是另一回事。
线性度(Linear Scaling) 是衡量集群扩展效率的关键指标。理想情况下,100张卡的算力应该是1张卡的100倍。但现实中,随着节点增加,通信开销、同步等待、故障重算都会蚕食效率。集群线性度每提升10个百分点,硬件成本降15%、电费省20%——在万卡集群规模下,这意味着数亿元的真金白银。
有效算力正在取代“总卡数”成为行业关注的焦点。十万卡集群的难点不在于“能不能凑出十万张卡”,而在于 “线性加速比” ——简单的硬件堆砌会因为网络延迟、能耗过高等问题导致效率下跌。
稳定性同样关键。一张卡出问题,可能拖累一整组节点的运算效率。大规模集群部署中,故障率、恢复时间、长稳运行能力,都是比单卡跑分更重要的性能指标。
六、标准在变:行业正在重新定义“好算力”
这场评估逻辑的变革,正在被标准化体系所固化。
2026年6月,中国信通院启动了《基于Token计量的算力能力评价指标体系》系列行业标准。这套标准的核心理念是:算力集群性能研判已从硬件峰值参数核验,转向以有效Token产出为核心的系统化量化研究。标准体系从文本推理主干标准出发,向代码生成、多模态、经济性评价、配套能力四个方向延伸。
与此同时,行业标准《通用算力性能测评方法》(SJ/T 12026-2025)已由工信部发布;《全国一体化算力网 算力算效衡量技术要求》国家标准也已正式立项。从芯片到集群、从硬件到系统、从算力到Token——一套覆盖全链路的算力性能评估标准体系正在成形。
七、怎么看?一套实用的评估框架
综合以上变化,评估AI算力性能可以遵循一个递进式的框架:
第一层:看芯片规格——TFLOPS、显存容量、带宽、功耗。这是基础,但只是起点。
第二层:看单卡实测——在真实模型上跑出来的训练吞吐、推理TTFT/TPOT。纸面参数和实测数据之间往往差着一截。
第三层:看集群效率——MFU是多少?线性度如何?万卡集群下有效算力还剩多少?
第四层:看系统产出——每瓦能产出多少Token?每兆瓦能养活多少个智能体?这是2026年最前沿的评估维度。
第五层:看综合成本——单位Token的交付成本是多少?同样产出下,电费、运维费、折旧费加起来差多少?
这套框架的核心逻辑是:从局部到整体,从理论到实际,从硬件到系统。只看第一层,容易被纸面参数误导;只看最后一层,又可能忽略底层硬件的根本差距。五层结合起来,才能真正回答“这套算力到底行不行”。
结语
AI算力性能的评估标准正在经历一场深刻的范式转移。旧的尺子——TFLOPS、显存、制程——依然有用,但已经不够用了。新的尺子——Token per Watt、Agents per Megawatt、MFU、TTFT/TPOT、集群线性度——正在成为行业的新共识。
这场变化的本质,是AI算力从“科研工具”变成了“每天必须支付的运营成本”。当算力成为像水电一样的基础设施,人们不再关心“发电机转得有多快”,而是关心“一度电到底能干多少活”。AI算力的性能评估,正在经历同样的逻辑转变。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。