AI寫作業成績漲18%,但考試卻跌20%

一份追蹤26811名中國中學生、時間跨度30個月的研究,端出了一組互相打架的數字:用生成式AI寫作業,作業成績漲了18%,單次作業耗時從64分鐘壓到45分鐘;但半年之內,同一批學生的月考成績卻掉了20%。

這篇論文題為《The Generative AI Learning Penalty: Evidence from Chinese Secondary Education》,作者是斯德哥爾摩大學的David Strömberg,以及香港大學的Victor Lei、Yanhui Wu,今年6月以CEPR討論稿DP21577發表,《經濟學人》在8月18日的圖表專欄裡把它重新攤開講了一次。樣本涵蓋中國華中地區7到12年級(國一到高三)學生,資料從2022年9月採集到2025年6月,期間約八成學生表示用過生成式AI。

兩年後帳才結清

短期數字看起來都很漂亮。作業成績上去了,時間也省下來了,從家長和學生的感受來看,這是一筆明明白白的效率改善。

但把時間拉長到兩年,另一組數字浮現:中考(中國的高中入學考試)成績下降24%,高考(大學入學考試)下降18%。研究把損失依科目拆開,社會科學掉得最兇,其次是STEM與語言類;依族群拆開,國中生、原本成績靠前的學生和男生受影響最大。

原本成績靠前的一組掉得更多,這一點比總量本身更扎眼。一般直覺是成績好的學生更懂得用工具,實際結果卻相反——他們原本就是靠高強度的自主練習換取分數,一旦這部分被取代,損失的絕對值反而最大。

省下來的時間去哪了

粗略算一筆帳:每次作業省19分鐘,以一年200個上課日、每天一次計算,一年約可省下63小時,兩年就超過100小時。研究並未追蹤這些時間流向了哪裡,但它明確指出另一件事:AI的個人輔導效果與省時效果同時存在,兩者相加仍然沒能撐住考試成績。

換句話說,問題不在於孩子偷懶。作業本身作為一種練習被跳過了——推導過程、試錯、卡關之後再想辦法,這些原本要在閉卷考場上重現的動作,在有AI輔助的作業流程裡並未發生。作業分數衡量的是產出,考試分數衡量的是能力,這兩個指標之間的落差,第一次被拉得這麼大。

研究者同時舉了一個反例:把AI用在主動學習上的大學生,測驗得分更高,一週後的記憶保留效果也更好。差別在於使用方式,不在於工具本身。

免費訂閱正朝反方向推進

時間點湊得有些微妙。同一個月,Google剛給符合資格的學生開出一年期Gemini免費方案,OpenAI推出了面向青少年的ChatGPT版本,中國國內幾家廠商的教育端產品也在開學季密集鋪貨。研究裡點名的工具,正是這批產品的中國同行——截至2025年6月,在使用AI的學生中,豆包(Doubao)占47%,DeepSeek占36%,ChatGLM占14%,文心一言(Ernie Bot)占9%,Qwen占8%。

監理端已經有國家做出相反的選擇。挪威從8月起禁止6到13歲學生在校使用AI,理由與這份研究指向的是同一件事。

這篇論文不太可能改變廠商的行銷節奏,畢竟學生市場的獲客成本與留存價值擺在那裡。但它至少把討論從「AI到底有沒有幫助學習」,推進到了「哪種用法有幫助、哪種用法有害」這個層次。要區分這兩者,需要老師能看見學生的作業過程,而不只是結果——這恰恰是目前作業系統最不擅長的事。

參考來源:CEPR討論稿DP21577、CocoLoop、《經濟學人》圖表專欄、南華早報;作業成績與考試成績的漲跌幅度、樣本數與工具占比,均已依論文原始數據核對。