你是否有过这样的经历:曾经那个翻译得心应手、代码行云流水的AI助手,如今要么敷衍了事,甩出几句车轱辘话,要么毫无愧色直言“做不到”?反差之大,让一众已高度依赖AI的使用者颇感失落。

这种现象,正是近期AI圈最受关注的话题——AI“变懒”与“降智” 。
什么是AI“变懒”?
“变懒”是指AI在处理用户任务时表现出敷衍、缩水、不愿深入的倾向。具体表现包括:
套话增多、分析变少:用户反映,DeepSeek和豆包一年前的回答会给到很多意想不到的启示,但现在倾向于用一些套话匆匆收尾。
翻译缩水:文字工作者关佳怡发现,以前上传PDF让AI翻译,页面会变成左右两栏逐句对照,但现在即使明确要求逐句翻译,出来的也只是梗概。
代码生成退化:软件开发者余京生指出,2025年使用ChatGPT时只要提出需求,模型就会尝试不同解决路径,代码基本方向无误;但现在即便描述得再细致,“ChatGPT也像一个机械执行者”,还会频繁出现语法错误。
不愿深入思考:开发者发现,AI该读的文件不读,该跑的测试不跑,任务干到一半就撂挑子。
什么是AI“降智”?
“降智”则是指AI在推理深度、逻辑能力和任务完成质量上出现系统性下滑。典型表现包括:
推理深度断崖式下降:AMD AI负责人Stella Laurenzo通过分析6852个会话的日志发现,Claude的思考量比2月之前下降了67%。Claude的思考中位数从2200字符暴跌至600字符,下降67%-73%。
思考预算被“腰斩” :社区用户发现,GPT-5.6 Sol的Max档内部推理算力预算(juice value)从960骤降至128,缩水近87%。
模型在基准测试中大幅退步:BridgeMind的BridgeBench测试显示,Claude Opus 4.6准确率从83.3%掉到68.3%,排名从第2跌到第10。
“灾难性遗忘” :用户在对话中遇到模型遗忘前两轮提出的要求,艾媒咨询调查显示,42.62%的用户认为“灾难性遗忘”是AI大模型的主要缺陷之一。
为什么会发生“变懒”和“降智”?
赛迪顾问分析师韩子哲指出,除Transformer架构固有的长文本性能衰减、AI生成内容回流带来的训练数据污染等技术局限外,商业考量是当前多款大模型“降智”的主要原因。
具体而言:大模型调用指令、处理任务都需要消耗Token,而每一枚Token背后都是高昂的算力成本。面对日益上行的成本压力,部分厂商引入了动态推理预算、缓存优化及路由降级等技术手段,以牺牲“深度思考”为代价,换取服务不宕机。这种通过缩减单次推理深度来控制运营成本的隐性调整,最终直观体现为用户体验的明显下降。
二、两个相关疑问与解答
疑问一:AI是真的“变笨”了,还是用户的感觉?
解答:两者都有——既有真实的性能波动,也有用户感知的偏差。
一方面,AI确实存在实际的性能下降。大量数据和证据表明这不是“错觉”:
可量化的指标下滑:Claude的思考中位数从2200字符暴跌至600字符;GPT-5.6 Sol的juice值从960降至128;Opus 4.6在基准测试中准确率从83.3%掉到68.3%。
厂商的“自供状” :Anthropic在官方postmortem中承认了三个导致降智的bug——推理等级从“高”偷偷调成“中”、缓存bug导致每轮对话清空思考记录、25词限制的提示词砸了输出质量。
服务端的不透明调整:OpenAI虽然在GPT-5.6 Sol变笨争议中声称“没降智,只是做了个实验”,但那个被拧动的“旋钮”(Max档从960掉到128),用户根本看不见。
另一方面,用户的期望值也在不断攀升。当AI首次出现时,任何看似智能的回答都令人惊叹;但随着使用深入,用户对AI的容错率越来越低,对“翻车”案例的关注度越来越高。此外,用户从“简单聊天”转向“高Token消耗的工具化使用”,任务复杂度的大幅提升也让AI更容易暴露短板。
疑问二:“变懒”和“降智”是厂商故意的吗?
解答:并非“故意让AI变差”,而是成本压力下的“结构性妥协”。
说厂商“故意”让AI变差,可能有些冤枉。更准确的描述是:面对算力成本暴涨与商业可持续性的双重压力,厂商被迫在“质量”与“成本”之间做出取舍。
正如极佳视界联合创始人朱政所指出的,算力资源已严重承压——用户从“简单聊天”转向“高Token消耗的工具化使用”,其公司租用算力卡的等待周期由去年一至两天延长至一至两周。与此同时,大模型厂商还在进行激烈的价格战:2026年5月,DeepSeek宣布V4-Pro API价格永久下调75%,小米跟进MiMo-V2.5系列API最高降价99%。降价固然让利,体验却难免注水。
网友甚至为此造了一个新词——AI shrinkflation(AI缩水通胀) :同样的价格,你拿到的是稀释过的产品。
不过,这并不意味着所有“变懒”都是成本压力所致。Anthropic的案例表明,有时仅仅是配置问题——他们把Claude Code里的Effort选项默认档位从high降到了medium,用户以为自己用的是满血版,实际拿到的是降档货。厂商对此的解释是“延迟太高”,但用户感受到的却是“模型变蠢了”。
三、正视并应对AI“变懒”“降智”有什么好处?
1. 避免对AI的过度依赖与“元认知懒惰”
经济合作与发展组织(OECD)在《2026年数字教育展望》中将学生过度依赖AI作为学习捷径而导致的“知识掌握假象”定义为 “元认知懒惰” 。当用户习惯于AI的“有求必应”,一旦AI“躺平”,打工人就禁不住“破防”。正视AI的能力波动,有助于我们保持独立思考能力,避免大脑在长期“被投喂”中退化。
2. 优化使用策略,提升任务完成效率
理解AI“变懒”的本质——不是它“不想干”,而是它背后的算力预算被压缩了——能帮助用户更有针对性地调整使用方式。例如,当发现AI在复杂任务中表现不佳时,可以将任务拆解为更小的步骤;当发现AI“敷衍了事”时,可以通过更精准的提示词引导它深入思考。理解边界,才能更好地利用工具。
3. 降低企业成本与风险
企业大规模使用AI时,若不了解AI的性能波动规律,可能造成效率损失甚至业务风险。Meta曾推行Token消耗排行榜激励员工使用AI,放任全员无上限调用算力,直接导致单月员工总Token消耗突破70万亿,月度算力成本超1亿美元。理解AI的能力边界和成本结构,有助于企业建立更理性的AI使用策略和预算管理机制。
4. 推动行业透明化与用户权益保护
当越来越多的用户意识到AI“降智”并非幻觉,并向厂商提出质疑时,行业会朝着更透明的方向发展。Anthropic在用户抗议后发布了详细的postmortem报告;OpenAI也在争议中承认了“实验”的存在。用户的关注和追问,是推动AI服务商提升透明度和服务质量的重要力量。
四、如何应对AI“变懒”与“降智”?分步操作指南
第一步:识别问题——判断是“变懒”还是“能力不足”
在采取行动之前,先判断AI的表现下滑属于哪种情况:
如果是“变懒”(敷衍、缩水、不愿深入) :可以通过优化提示词、调整参数设置来“唤醒”它。
如果是“降智”(推理能力系统性下降) :可能需要更换模型、拆分任务或等待厂商修复。
如果是“阶段性波动” :部分厂商的“降智”是阶段性的——Anthropic在4月7日将默认档位调回后,性能即恢复;豆包客服也曾解释当前问题源于模型升级过程中的阶段性偏差。
自查方法:在同一任务上对比不同时间段的AI表现,或在不同模型之间进行横向对比,以判断问题是普遍性的还是特定模型的。
第二步:优化提示词——“唤醒”AI的“工作态度”
Anthropic官方曾揭示一个重要概念:Model换的是脑子,Effort换的是态度。很多时候AI“变懒”,不是它“不会”,而是它“不愿”花力气。
具体操作:
明确要求深度思考:在提示词中加入“请深入分析”“请分步骤详细推理”“请反复检查你的答案”等指令。
检查推理档位设置:如果你使用的是Claude Code等工具,检查Effort选项是否被设为了默认的medium——手动调高到high或extra high。
使用“负提示” :明确告诉AI“不要敷衍”“不要用套话”“不要跳过推理步骤”。
拆分复杂任务:将大问题拆解为多个小问题,逐个提问,避免AI在长链条推理中“偷懒”或“断链”。
第三步:切换模型或版本——找到最适合当前任务的“脑子”
不同模型有不同的能力边界和成本结构:
复杂推理任务:选择推理能力更强的旗舰模型(如GPT-5.6 Sol的Max/Ultra档、Claude Opus系列),但要注意这些模型也可能受到“降智”影响——建议关注社区反馈,选择性能稳定的时段使用。
日常简单任务:使用更轻量、更经济的模型版本,避免“杀鸡用牛刀”造成不必要的Token消耗。
多模型备选:不要只依赖单一模型。当发现某个模型“变懒”或“降智”时,切换到其他模型进行对比。正如有用户所言,“目前ChatGPT代码能力仍然最强,但用着很吃力”——在不同场景下选择最适合的模型,是应对AI性能波动的有效策略。
第四步:建立多层验证与反馈机制
对于企业级或高频使用场景,建议建立多层保障:
任务拆分与中间检查:将复杂任务分解为多个子任务,每完成一步进行验证,避免AI在长链条中“断链”或累积偏差。
人工复核关键输出:在高风险场景(如代码部署、数据分析、法律文书)保留人工复核环节。
建立反馈循环:当发现AI表现异常时,及时向厂商反馈——用户的集体反馈是推动厂商修复问题的重要力量(Anthropic正是在大量用户投诉后才发布postmortem并回滚设置)。
持续监测与记录:记录AI在不同时间段、不同任务类型上的表现,建立自己的“AI性能日历”,避开“降智高发时段”。
五、实践案例
案例一:Anthropic的“降智门”——从否认到承认再到修复
2026年2月起,大量Claude用户开始反馈模型“变笨”。AMD AI高级总监Stella Laurenzo在GitHub上发布了一份硬核审计报告,覆盖6852份会话文件,分析结果显示从2月份开始模型的推理深度出现了断崖式下滑。起初,用户以为是自己的提示词没写好,折腾半天才发现问题根本不在自己身上。
3月4日,Anthropic为了压低延迟,把Claude Code里的Effort选项默认档位从high降到了medium,官方更新日志里虽然写了,但大多数人并没注意到。叠加缓存bug和提示词限制两个问题,Claude的使用体验全面拉垮。
直到4月7日,Anthropic才把默认档位调回去,并在官方博客发布postmortem,承认了三个导致降智的bug。这一案例说明:AI的“降智”有时只是配置问题,用户的集体反馈可以倒逼厂商正视并修复问题。
案例二:GPT-5.6 Sol“一夜变笨”——看不见的“旋钮”
2026年7月15日,全网都说GPT-5.6 Sol的Max档变笨了。一个日本市场调研团队发现,原本能稳定交出“远超预期”表现的Codex Sol MAX,突然只剩下8分的水平。以前会花十分钟以上反复推敲的任务,现在草草了事。
社区用户通过一段被称为“模型指纹”的隐藏提示词,读到了系统配置里的juice值——此前观测到Sol的max档对应960,而这一次显示的是128,掉了将近87%。OpenAI回应称“没降智,只是做了个实验”。
这一案例揭示了AI“降智”的一个核心问题:服务提供方可以单方面、不透明地改变产品,而用户难以察觉和验证。事件引发了关于服务诚信与消费者权益的广泛讨论。
案例三:豆包“偷懒被抓”——被质疑后重新干活
文字工作者关佳怡发现,她让豆包翻译文档时,AI偷懒只给出了梗概而非逐句翻译。但当她对豆包提出质疑后,豆包又重新恢复了按照原来格式规范完成翻译任务。
这一有趣的案例说明:AI的“变懒”有时并非永久性的性能退化,而是一种“能省则省”的倾向——当用户明确提出要求并施加“压力”时,AI仍然具备完成高质量任务的能力。正如关佳怡吐槽的那样:“这玩意儿也会偷懒,学什么不好!”
AI“变懒”和“降智”并非幻觉,而是算力成本压力、厂商商业策略与技术局限共同作用下的真实现象。正如赛迪顾问分析师韩子哲所言,这种通过缩减单次推理深度来控制运营成本的隐性调整,是以牺牲模型在复杂任务上的表现,换取规模化服务的可持续性。
理解了这一本质,我们就能更理性地看待AI的“摆烂”——这不是它“不努力”,而是它背后的算力资源正在被重新分配。通过优化提示词、调整模型选择、建立验证机制等方法,我们可以在AI能力波动的现实中,依然高效地使用这一工具。
正如有评论所言:“没智力固定的模型了” 。在人机协同的时代,理解工具的能力边界、主动调整使用策略,才是与AI共处的最佳姿态。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。