越会用 AI 的人,学习能力退化得越快
创始人
2026-08-22 22:03:15

这应该是过去三年被讨论最多的一个迷思之一,从ChatGPT走红那天就有。吵了三年多,两边都拿不出像样的证据:

担心的人只有体感,不担心的人只有立场。

8月18日,《经济学人》给这场争论补上了迄今最硬的一份证据。

报道的主角是2.7万名中国中学生。用上AI之后,他们的作业分数平均涨了18%,写一份作业的时间从64分钟缩到45分钟。到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用AI的同学低了20%。

作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用AI的学生中间,作业分越高,基本等于AI用得越深。于是曲线变成了:用得越狠的孩子,考试跌得越惨。

作业分,第一次开始撒谎。

作业分超过100的人之中,不用AI的人分数上涨到了112,用AI之后一路跳水到64。|图片来源:经济学人

《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家6月挂出的论文,标题就叫《生成式AI学习惩罚》。

《生成式AI学习惩罚》|图片来源:SSRN

样本来自中国中部一个县,人口超过一百万。论文特意强调它的普通:像沿海之外的大多数中国县城。26811名初高中生,5所初中、4所高中,装下当地九成中学生,从2022年9月跟到2025年6月,整整30个月。

这个县的作业在线上提交,系统记下每个人的用时;月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。谁在用AI,则来自回收率超过96%的全员问卷。

2022年9月,用AI的学生几乎为零。到2025年6月,这个数字是80%。这条曲线有两次明显跳升,分别踩在DeepSeek V2.5和R1的发布点上。工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。

采纳曲线的两次跳升,都踩在DeepSeek发版上|图片来源:CEPR

结论就是开头那组数字:作业+18%,用时−30%,月考−20%,相当于1.4个标准差。惩罚在各科并不均匀:社科类最重,跌27%;数学22%;英语17%;语文最轻,9%。初中生比高中生惨四成,男生比女生惨。

看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。

升学考试的账要算得更小心。6月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌24%、高考暴跌18%」。论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体AI用户的平均效应只有7%左右。

但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估AI的学习成本。

01

消失的模范生

这项研究6月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用AI但不外包作业,成绩没受损。所以问题不在AI,在用法。

论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于50分钟算「内包」,少于45分钟才算是真「外包」。

刚开始用AI的学生里,外包的占58%。而那些照常花时间写作业、只拿AI当家教的孩子,考试成绩和不用AI的同学几乎没有差别。

论文甚至发现,在50到65分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI本身不带毒性,毒性全在省下来的那段时间里。

如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。

但论文其实更深一步地探讨了这个问题:用满5个月之后,外包的比例从58%涨到81%,完全外包从34%涨到50%。那批花65分钟以上认真写作业的「模范用户」,全部是刚上手不到5个月的新手。

以及采纳满6个月之后,没有一个AI学生的作业用时还超过65分钟。

26811人的样本里,「好好用AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI挤掉的,是强度最高的那部分努力。

用满六个月后,65分钟以上的区间空了|图片来源:CEPR

它不是又一篇「AI让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。

数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。

02

大人的考场

看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。

《柳叶刀·胃肠病学和肝病学》去年8月发表了一项波兰研究:四家内镜中心的19名资深医生,人均做过2000例以上肠镜,用了几个月AI辅助检查之后,回到没有AI的状态,腺瘤检出率从28.4%掉到22.4%,相对下降20%。

和中学生的月考,同一个数字。

这是医学界第一次在真实临床里测到「用AI之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。

第二次在写作者身上。麻省理工媒体实验室去年6月的脑电实验里,54名学生戴着电极帽写作文。用ChatGPT那组的神经连接强度垫底,比纯靠自己写的那组最多低了55%;写完不久,83%的人连自己文章里的一句话都复述不出来。

研究团队给这个现象起了个名字:认知负债。

第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了319名知识工作者,结论一句话就能说完:对AI输出越有信心的人,自己动脑核查的投入越少。

第四次在程序员身上。研究机构METR去年的对照实验里,资深程序员用上AI实测变慢了,自己却觉得快了20%。今年2月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有AI的情况下工作。

和那个再也没人肯花65分钟写作业的教室,一模一样。

脱离AI之后,检出率没有回到从前|图片来源:METR

临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI在场,产出变好;AI离场,能力变差。

回到开头那个吵了三年多的问题。这些研究给出的答案,比一句「会变笨」更难受:AI没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。分数照涨,产出照交,只是那份本该在64分钟里长出来的能力,没有长。

认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。新鲜的是位置:AI接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。

落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。

但把关的前提,是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱,AI的逻辑链一旦错在深处,他连该从哪里起疑都不知道。学生的版本更简单:作业是草稿,考试是Debug。草稿外包出去,Debug那天就露馅。

区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。

论文的最后留了一点余地。把时间拉长看,AI学习惩罚正在收窄:同样用满5个月,2023年初的学生平均损失25%,2025年6月只有16%。

同样用满5个月,惩罚从25%收窄到16%|图片来源:CEPR

师生在适应,工具侧其实也有人想办法,比如逼AI给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。

9月1日开学。全国的教室里,这场26811人的实验,会以更大的样本重跑一遍。

以后看到孩子的作业天天100分,也许得先问一句:这100分是孩子挣来的,还是豆包挣来的。

下一次把方案交给老板之前,这个问题,不妨也先问自己一遍。

如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。

相关内容

热门资讯

上海莱士蛋白C临床申请获受理 ... 来源:上海证券报·中国证券网上证报中国证券网讯(记者 高志刚)8月22日,上海莱士发布公告,公司全资...
国家卫健委发布会:白血病不再是... “白血病既往被世界上公认为‘不治之症’,但是随着技术和方案的进步,白血病已达到可治可控。”在8月21...
旺旺跨界布局宠物赛道 战略投资... (来源:北京商报)8月19日,旺旺集团对外官宣正式进军宠物行业,完成对新锐宠物品牌毛星球 FurFu...
科沃斯推出开源机器人“八界”丨... 8月19日-23日,2026世界机器人大会在北京举办。科沃斯携全栈开源具身智能机器人八界重磅亮相智造...
养老金并轨延迟退休 养老金并轨... 养老金并轨尘埃落定,与此密切相关的延迟退休争议声再起。根据全国老龄办数据,最新或2023(历届)全国...