
这个问题我觉得有一个很有意思的地方大家未必认为 ChatGPT 比 Gemini 更容易“降智”但一旦 ChatGPT 表现变差用户的反应往往明显更大。为什么我觉得最核心的原因不是模型跑分而是大家对 ChatGPT 的期待太高了。一个你本来觉得考60分的人这次考55分你可能没什么感觉。但一个长期考95分的人突然连续几次考75分你第一反应一定是“你最近怎么了”ChatGPT现在面对的差不多就是这个问题。ChatGPT最大的问题是它曾经把用户胃口养得太高很多人第一次真正被大模型震撼就是ChatGPT。2022年底刚出来的时候那种感觉现在可能很难复现了。以前搜索一个问题自己找网页。自己看资料。自己判断。ChatGPT出来以后你突然发现我可以直接和电脑讨论问题了。后来模型越来越强推理、图片、文件、搜索、Deep Research、Codex这些能力又不断往里面加。于是用户对ChatGPT的定位慢慢变了。以前是“AI能回答成这样已经很厉害了。”现在变成“你可是ChatGPT这都不会”这句话其实很能说明问题。ChatGPT已经不是在和2022年的AI比较了。它是在和**用户记忆里那个“状态最好时的ChatGPT”**比较。这才是最麻烦的。Gemini的历史包袱反而没那么重Gemini其实也会答错也会出现前后不一致也有一些回答让人觉得莫名其妙。但用户对它的心理预期不太一样。尤其早期Bard时期很多人本来就觉得“Google这个AI好像没有ChatGPT那么惊艳。”后来Gemini一点点追上来反而形成了另一种心理Gemini这次回答不错“可以啊Google最近进步挺大。”ChatGPT这次回答一般“OpenAI是不是又降智了”你会发现同样一个80分的回答放在两个产品身上用户评价可能完全不一样。因为一个是从70分走到80分。另一个在人们印象里可能是从95分掉到了80分。人的感受从来不是只看绝对值。更看重变化。还有一个原因很多人是真的花钱订了ChatGPT这个影响其实很大。如果一个产品免费你偶尔遇到一次回答不好可能关掉就算了。但ChatGPT有大量Plus、Pro用户。尤其是Pro用户每个月付的钱并不少。一旦付费心理就完全不同了。比如昨天同一个Prompt回答特别好。今天突然变得特别敷衍。用户当然会想“我每个月付这么多钱为什么体验还倒退了”这种愤怒并不完全来自“AI变笨”。而是来自付费以后产生的稳定性预期。你可以想象一下。一家餐厅免费请你吃饭。今天味道一般你可能觉得算了。但如果一家餐厅人均500块第一次特别好吃第二次明显变差你大概率会吐槽。不是第二顿真的难吃到不能吃。而是我付的钱和我的期待不匹配了。ChatGPT还有一个特别吃亏的地方大家天天在测它网上测试AI模型有一个很有意思的现象。一个新模型出来以后很多人第一件事就是拿以前ChatGPT答过的问题再问一次。然后开始比较“GPT-5.6这次怎么回答得还不如以前”“这个问题GPT-4当年都能答。”“是不是偷偷换模型了”ChatGPT已经变成了某种意义上的“基准”。大家拿Claude和它比。拿Gemini和它比。拿DeepSeek和它比。甚至ChatGPT的新版本还要和ChatGPT自己的老版本比。所以它特别容易产生“降智”的讨论。Gemini很多时候面对的是“这次有没有超过ChatGPT”ChatGPT面对的是“你为什么没有超过你自己”后一个要求其实难得多。而且“降智”这件事本来就特别难证明我觉得网上关于AI降智的讨论有一部分确实存在体验依据但也有很多属于主观感受。因为大模型不是计算器。同一个问题你问两次本来就可能得到不同答案。另外还会受到很多东西影响模型路由。推理强度。上下文。系统指令。是否联网。工具调用。对话长度。产品策略。甚至你Prompt里面一个词的变化。所以你昨天问一道题答得很好今天答差了并不能直接证明“OpenAI把模型智商砍了20%。”但用户不关心这些。用户看到的就是昨天能做今天做不好。那最直观的解释当然就是“降智了。”还有一个经常被忽略的问题ChatGPT已经不只是一个模型了现在很多人嘴里的“ChatGPT”其实混合了很多东西。模型是一层。推理等级是一层。搜索是一层。工具是一层。Codex又是一层。系统还可能根据任务选择不同的处理方式。所以有时候用户觉得“ChatGPT怎么突然变笨了”未必真的是底层模型能力下降。也可能是这一次没有投入同样的推理资源或者任务被用不同方式处理了。这也是为什么我现在越来越不建议拿一个Prompt测试一次就宣布某个模型降智。至少同一个问题测试几次再换几个不同类型的问题结论才稍微有参考价值。Gemini为什么相对少挨这种骂还有一个很现实的原因很多人的主力工具本来就不是Gemini。这点非常重要。假设你每天使用ChatGPT三个小时。写文章用它。写代码用Codex。查资料用它。分析PDF也用它。突然有一天它某个能力发生变化。你马上就能感觉出来。但如果Gemini你一周才打开两次。它今天比昨天差5%你根本察觉不到。这和手机一样。你每天用的主力手机掉10%续航你会特别敏感。备用机掉20%可能半年以后你才发现。所以一个产品被骂“降智”多有时候反而说明它已经进入了大量用户真正的工作流。我甚至觉得“降智骂得凶”某种程度上是ChatGPT成功的副作用这可能听起来有点奇怪。但你仔细想。如果明天一个没人用的AI模型能力下降20%网上会有人骂吗不会。因为根本没人发现。只有当一个工具变成程序员每天写代码要用。学生每天学习要用。自媒体每天写东西要用。公司每天处理资料要用。它的一点变化才会被迅速放大。这和Windows更新一样。Windows每次更新出点问题网上一片骂声。不是因为全世界只有Windows有Bug。而是因为太多人每天依赖它。当然这不代表所有“ChatGPT降智”都是用户错觉我也不赞成另外一种极端说法“模型跑分提高了所以你觉得变笨一定是你的问题。”这也不合理。跑分提升和真实使用体验本来就不是完全一回事。一个模型可以在数学、代码、科学测试上越来越强同时因为回答风格、路由策略、推理资源或者产品调整让某些用户觉得日常任务反而没有以前顺手。能力更强不等于每一种任务的体验都更好。这点其实很重要。用户最终使用的是产品不是Benchmark表格。你告诉我新模型跑分高了15%但我每天做的那件事情反而更难用了那对于我来说这就是体验下降。所以为什么大家更厌恶ChatGPT“降智”我觉得说到底就是四个字期待太高。ChatGPT是很多人的第一款AI。也是很多人的主力AI。还有大量用户每个月真金白银给它付费。大家已经习惯了它不断变强。于是它一旦表现得没有以前好哪怕只是某些场景下的波动用户都会非常敏感。Gemini则有点相反。它早期没有把用户期待拉到那么夸张的高度后来能力一路往上走用户更容易产生“它越来越好了”的感觉。所以同样一次回答失误Gemini“这次没答好。”ChatGPT“是不是又降智了”我觉得这可能才是两者最大的区别。用户真正厌恶的从来不是一个AI“不够聪明”。而是一个你已经习惯它很聪明、甚至开始依赖它的AI突然没有昨天那么聪明了。从这个角度看大家天天骂ChatGPT降智某种程度上反而说明了一件事很多人已经不是在“体验ChatGPT”了而是真的在依赖ChatGPT。