
问题出在哪?答案远比“算力不够”四个字复杂得多。
一、需求涨得太快,算力根本跟不上
最直接的原因是供需失衡。2026年一季度国内AI算力需求同比暴涨417%,但供给增速仅为128%。Token调用量从2024年初的日均1000亿飙升至2026年3月的140万亿,两年增长超千倍。而算力储备的增长远远落后——有平台用户量暴涨66.7%,算力储备却仅增长8.3%。
这种供需剪刀差造成的直接后果就是排队。2026年7月,腾讯WorkBuddy平台上混元Hy3模型的算力资源被挤爆,下午排队率一度超过50%。调用量超出预期,服务器扛不住,用户只能排队等着。硅谷同样如此,H200一夜涨价30%,H100抢到缺货,“哪怕那些站在算力中心的人,也不得不开始为算力排队”。排队本身意味着海量请求在等待处理,用户的直接感受就是“慢”和“卡”。
更麻烦的是,AI的使用模式变了。过去是“对话消耗”——单次聊天用掉很少的词元;如今转向“任务消耗”——AI智能体执行多步骤复杂任务时,单任务词元消耗能从几千级冲到百万级。每个任务对算力的占用时间更长、资源需求更大,排队和拥堵自然更频繁。
二、网络成了“看不见的瓶颈”
就算有足够的GPU,数据搬不动也是白搭。
一个扎心的事实是:在万卡集群里,近一半算力其实在等数据,不是在算。万卡集群中数据IO瓶颈导致GPU空等时间占比可达40%以上。昂贵的算力芯片有近一半时间在等待数据搬运。
根本原因是算力增长和网络带宽增长严重脱节。从2016年到2024年,AI算力八年增长了约1000倍;推理算力过去四年增长32倍,训练算力增长16倍。但网络带宽同期仅从200G提升到800G,只增长了4倍。腾讯光网络架构师傅思东直言,这是“算力如火箭攀升,网络如步行前进”的失衡状态。
集群规模越大,这个问题越致命。集群从千卡扩到万卡,参与同步的节点翻了十倍,通信冲突却呈指数级膨胀,万卡级分布式训练中网络通信耗时占比达到30%到50%。GPU在等数据,用户在等GPU——层层传导,就是用户感受到的卡顿。
三、集中式云架构,天生不适合实时推理
更深层的问题在于架构本身。
绝大多数AI算力部署在集中式云数据中心——这种架构诞生于静态网页、离线计算时代。所有用户请求要远距离往返核心机房,物理传输距离本身就制造了不可消除的延迟。
Akamai的调研揭示了一个结构性矛盾:46%的企业仍死守单一集中式云架构,但60%的从业者已经认可——靠近终端用户部署推理,才是满足性能底线的关键。集中式架构适合一次性、大批量、长周期的模型训练,但推理是海量并发、短请求、低时延、高频交互的场景。用训练的逻辑做推理,好比用货运火车跑同城快递——车是好车,但根本跑不对场景。
这个错配在电商大促等场景中暴露无遗。618期间,AI商品推荐需要在用户滑动页面的瞬间完成排序,一旦延迟突破250毫秒,用户直接划走。集中式机房面对千万级并发,网络拥堵和算力争抢同时发生。简单追加GPU扩容只能短期缓解峰值卡顿,却解决不了长距离传输带来的固有延迟。
四、超卖与虚标:花钱买了“假算力”
用户花钱租来的算力,实际能用的可能打了折扣。
行业调研显示,2026年国内约30%的GPU租用用户遭遇过算力虚标,小型服务商虚标率高达50%。一些服务商通过BIOS限制GPU核心频率,实测算力较标称值低15%到20%。
更普遍的是资源超售——服务商将单块GPU虚拟化为多个实例分配给不同用户,当所有用户同时满载运行时,算力波动可达10%到15%。用户以为租了一整块GPU的算力,实际上可能只分到了几分之一,高峰期还被邻居抢走一大块。GPU通常按整卡分配给部门或项目,一个只需要十几GB显存的推理服务独占一张卡;算法团队的卡深夜闲置,业务团队白天却在排队等卡。算力被组织边界和分配粒度硬性切成了孤岛,平均利用率只有30%左右。
更隐蔽的是“暗中降智”。2026年初以来,多位开发者揭露GPT-5.5在复杂推理任务中频繁“断链”,推理Token卡在516个,80%的复杂推理被截断。用户花最贵的钱,买到的是被暗中限制的体验。成本高压之下,不少厂商祭出动态推理预算、缓存优化等手段,以牺牲“深度思考”为代价换取服务不宕机——用户感觉AI“变笨了”,背后是算力被悄悄克扣。
五、大模型“挤牙膏”式生成,天生就慢
即便所有资源都到位,大模型本身的工作方式也决定了它快不起来。
大语言模型生成文本时采用自回归方式——每生成一个新词元,都需要一次完整的前向传播。生成N个词元,就要做N次完整的模型前向计算。推理延迟随输出长度线性增长。这就是AI回答“挤牙膏”的根本原因。
更关键的是,大模型推理的瓶颈不是浮点运算,而是显存带宽。GPU大部分时间花在把模型权重从显存搬到计算核心上。算得再快,数据搬不过来也是白搭。在高并发状态下,多个请求同时去抢夺有限的显存带宽,导致数据传输拥堵,计算单元被迫排队等待数据,从而拉长了所有请求的延迟。
当多个请求同时到达时,短小快速的请求可能不得不排队等待长时间请求完成,整体平均响应时间主要受制于等待时间,而非实际计算耗时。高并发场景下的资源调度冲突,让推理延迟出现剧烈波动,99分位的最坏情况延迟可能达到平均延迟的数倍。
六、从“堆卡”到“调优”:慢和卡正在倒逼行业变革
AI算力慢和卡的本质,是需求爆发式增长与供给侧结构性瓶颈共同作用的结果。它不是单一问题,而是一个涉及芯片、网络、架构、调度、软件的多层复合困局。
但慢和卡也在倒逼行业改变打法。过去两年行业的标准动作只有一个:买更多GPU、建更大集群。如今这条路正在被重新审视。同样的硬件,经过调优后有效Token产出能差出40%到50%。智谱通过重构集群组网架构,一张GPU没加,推理吞吐直接提升15%,首Token响应时间P99尾延迟下降40.6%。DeepSeek联合北大发布的DSpark推理加速框架,在同等吞吐量下将单用户生成速度提升60%到85%。GPU一张不加、服务器一台不换,从网络和系统架构里挖效率,正在成为行业的新方向。
AI算力的竞争逻辑正在松动与重构——从“谁囤卡多”变成“谁能把每一分算力用到极致”。用户感受到的每一次卡顿,背后都是整个行业在算力效率这场硬仗上尚未攻克的堡垒。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。