AI 把作业分抬高 18%,考试却跌 20%

一份追踪了 26811 名中国中学生、跨度 30 个月的研究给出了一组互相打架的数字:用生成式 AI 写作业,作业成绩涨 18%,单次作业耗时从 64 分钟压到 45 分钟;但半年之内,同一批学生的月考成绩掉了 20%。

论文题为《The Generative AI Learning Penalty: Evidence from Chinese Secondary Education》,作者是斯德哥尔摩大学的 David Strömberg 与香港大学的 Victor Lei、Yanhui Wu,今年 6 月作为 CEPR 讨论稿 DP21577 发出,《经济学人》在 8 月 18 日的图表专栏里把它重新摊开讲了一遍。样本覆盖华中地区 7 到 12 年级学生,数据从 2022 年 9 月一直采到 2025 年 6 月,其间约八成学生报告用过生成式 AI。

两年之后账才结清

短期数字全是好看的。作业分上去了,时间省下来了,从家长和学生的体感看,这是一笔明明白白的效率改善。

拉长到两年,另一组数字浮上来:中考成绩下降 24%,高考下降 18%。研究把损失按科目拆开,社会科学掉得最狠,其次是 STEM 和语言类;按人群拆开,初中生、原本成绩靠前的学生和男生受影响最大。

原本成绩靠前的一组掉得更多,这一点比总量更扎眼。通常的直觉是好学生更懂得怎么用工具,实际结果反过来——他们本来就在用较高强度的自主练习换分数,一旦这部分被替代掉,损失的绝对量也最大。

省下来的时间去哪了

粗算一笔。每次作业省 19 分钟,按一年 200 个上学日、每天一次算,一年省下约 63 小时,两年一百多小时。研究没有追踪这些时间流向了哪里,但它明确指出了另一件事:AI 的私人辅导效果与省时效应同时存在,两者相加仍然没能把成绩托住。

换句话说,问题不在于孩子偷懒。作业本身作为一种练习被跳过了——推导过程、试错、卡住之后再想办法,这些在闭卷考场上要复现的动作,在有 AI 的作业流程里没有发生。作业分衡量的是产出,考试分衡量的是能力,两个指标第一次被拉开这么大的口子。

研究者同时提到了反例:把 AI 用于主动学习的大学生,测验得分更高,隔一周后的保持效果也更好。差别在使用方式,不在工具本身。

免费订阅正在反方向推进

时间点凑得有些微妙。同一个月,谷歌刚给符合条件的学生开出一年期 Gemini 免费计划,OpenAI 推了面向青少年的 ChatGPT 版本,国内几家厂商的教育端产品也在返校季密集铺货。研究里被点名的工具正是这批产品的中国同行——截至 2025 年 6 月,在使用 AI 的学生中,豆包占 47%,DeepSeek 占 36%,ChatGLM 占 14%,文心一言 9%,Qwen 8%。

监管侧已经有人做出了相反的选择。挪威从 8 月起禁止 6 至 13 岁学生在校使用 AI,理由与这份研究指向的是同一个东西。

这篇论文不太可能改变厂商的投放节奏,学生市场的获客成本和留存价值摆在那里。但它至少把讨论从”AI 会不会帮到学习”推进到了”哪种用法帮、哪种用法伤”这一层。区分这两者需要教师能看见学生的作业过程,而不只是结果——这恰恰是当前作业系统最不擅长的事。

参考来源:CEPR 讨论稿 DP21577、CocoLoop、《经济学人》图表专栏、南华早报;作业成绩与考试成绩的升降幅度、样本量与工具占比均以论文原始口径核对。