26000名学生研究显示AI隐藏学习成本需两年才显现
A 26,000-student study shows AI's hidden learning cost takes two full years to surface
一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。
AI助学短期提分但会偷走真正的学习,这2.6万人的研究用两年数据揭穿了安逸的幻觉,是每位家长和开发者都该看的预警。

使用 AI 的学生完成作业更快,成绩也更好。然而在考试中,他们的分数下降了多达 24%,而入学考试中学习差距的全面显现直到大约两年后才出现。
中国中部的一项新研究记录了使用 AI 的中学生学习损失。研究人员分析了来自一个拥有超过一百万居民的县中 26000 多名 7 至 12 年级学生长达 30 个月的面板数据。数据涵盖月考、作业分数与完成时间,以及中考和高考等高风险入学考试。
自我报告的 AI 使用率在研究期间从接近零上升到约 80%,其中一次大幅跃升恰逢 DeepSeek V2.5 于 2024 年 9 月发布以及 DeepSeek R1 于 2025 年 1 月发布。最受欢迎的工具是豆包、DeepSeek、ChatGLM、文心一言 和 通义千问。

这项 研究 利用了学生们在不同时间自行发现 AI 这一事实。作者采用了双重差分设计,这种方法衡量处理组在干预前后的结果变化,并减去未处理对照组在同一时期的变化。
在这里,他们追踪了每个学生在开始使用 AI 之前和之后的表现如何变化,然后将这一趋势与尚未使用 AI 的学生进行对比。首次使用的时间来自自我报告的数据,而因果推断假设的是:如果没有 AI,两组学生本会以相似的方式发展。
作业做得更好,考试成绩却更差
首次使用 AI 六个月后,作业成绩上升了 18%,而每份作业的平均用时从 64 分钟降至 45 分钟。与此同时,每月闭卷考试的成绩下降了 20%。
对高利害入学考试的影响同样巨大,但积累得更慢。常规考试成绩在半年内就出现下滑,但对入学考试的全面影响大约用了两年才显现,降幅在 18% 到 24% 之间。因此,研究人员认为,短期研究漏掉了学习所付出的长期代价。

五分之四的长期用户表现出外包迹象
在使用 AI 超过五个月后,约 81% 的学生能在 50 分钟内完成作业,甚至比最快的非用户还要快。他们的作业成绩很高,但考试成绩却一塌糊涂。作者写道,完成时间短、作业成绩高、考试成绩低这三者的组合表明,这些学生把作业外包给了 AI。

另一方面,那些在作业上花费与不使用 AI 的同学相近时间的 AI 使用者,考试成绩同样出色,同时还获得了更高的作业分数。这一群体没有表现出基于先前成绩的正面筛选迹象,意味着他们并非一开始就是更优秀的学生,AI 也并非天生有害。它主要是在取代独立思考时才造成损害。
社会科学受到的冲击最大
政治和地理等社会科学科目的平均下降幅度为 27%,STEM 科目为 22%,英语为 17%,语文为 9%。这一点很重要,因为此前大多数实验都集中在数学、编程和外语上。

这些影响在不同学生群体之间也差异显著。初中低年级学生比高年级学生损失更大(24% 对 17%),男生受到的冲击比女生更严重(21.6% 对 18.4%),研究将此主要归因于男生使用 AI 更多。
表现最好的学生受影响最大,排名前三分之一的学生出现了负24%的影响,而排名后三分之一的学生为负16%。此外还呈现出剂量-反应模式。每周使用AI最多一小时的学生成绩下降约5%,而使用五小时或以上的学生则下降了30%。
为什么几乎没有人提出反对
估计的学习损失从2023年初的约25%下降到2025年6月的16%。这一下降也出现在一组固定的早期采用者中,表明学生和教师在一定程度上进行了适应,但损失并未消失。
这项研究解释了为何外界的反应一直较为平淡。教师通常只在一个科目上看到学生,而在单个科目中,成绩下降 20% 本身并不罕见。对全县平均成绩的总体影响直到 2025 年 6 月才达到约 -10%,因为此前很少有学生使用 AI 的时间长到足以让损害累积起来。学生自己往往也无法把这些联系起来,误把独立学习时的脑力付出当作自己学得很差的信号。
作为应对措施,该研究建议向学生提供关于外包学习长期代价的可靠信息,更加重视线下考试,并追踪完成时间而非作业成绩。AI 削弱了作业作为一种信号的价值,而在作业成绩高于平均水平的 AI 使用者中,更高的作业成绩实际上预示着更差的考试结果。
Anthropic 研究员 Andrej Karpathy曾主张学校不应再试图管控 AI 生成的作业,而应将大部分评分转移到课堂内完成。他的推理与这项研究的发现一致。当学生知道自己将在没有 AI 的情况下接受测试时,他们就会保持真正学习材料的动力。
这一模式与其他场景近期的研究结果相符。Anthropic 最近的一项研究显示,借助 AI 学习新编程技能的参与者在后续知识测试中的得分比对照组低 17%,而且并没有节省任何实际时间。结果取决于人们如何使用这一工具。那些直接复制 AI 答案的人表现更差,而将 AI 用于更好地理解任务的人则没有出现同样的下滑。
瑞士商学院的一项研究发现,AI 使用与批判性思维之间存在负相关。美国和英国多所大学的研究人员开展的另一项研究表明,那些主要将 AI 当作答案机器的人,认知能力下降得最快。
一项UC Berkeley 研究分析了超过 500,000 份成绩,结果还显示,自 ChatGPT 发布以来,写作和编程密集型课程中最高 A 等级成绩的占比上升了 13 个百分点。在那里,这一效应同样集中在无人监督的作业上,而监考考试则没有出现可比的成绩提升。
来源:The Decoder:AI News(RSS) · the-decoder.com