AI News HubLIVE
站內改寫2 分鐘閱讀

聲稱AI幫助學生學習的研究被撤回

一篇聲稱使用ChatGPT能顯著提升學生學習成績的元分析研究,在發表一年後因方法嚴重缺陷被撤回。該研究曾獲得極高關注,並影響教育科技領域的政策,但其結論未得到數據支持。

來源Hacker News AI作者: speckx

2025年5月,杭州師範大學的Jin Wang和Wenxiang Fan在斯普林格·自然旗下的《人文與社會科學通訊》上發表了一項元分析研究,題為“ChatGPT對學生學習成績、學習感知和高級思維的影響:來自元分析的見解”。該研究聲稱,使用ChatGPT或其他AI工具的學生比不使用的學生表現更好,且這種正面影響相當顯著(學習表現效應量g=0.867,學習感知和高級思維效應量分別為0.456和0.457)。研究同時指出,影響需要4-8周的持續時間,且在基於問題的學習和將ChatGPT靈活整合為智能導師、學習夥伴和教育工具時效果最佳。

這一結論迅速被教育科技領域採納,並在社交媒體上廣泛傳播,成為推動AI進入課堂的重要依據。然而,研究發表後不久便遭到批評。不到一個月,本·威廉姆森在其博客中指出該研究存在方法論缺陷、誇大其詞且具有誤導性。隨後,挪威北極大學的Magnus Ingebrigtsen和Marko Lukic發表文章,詳細列舉了研究中的實質性錯誤,包括納入的51項研究中包含已撤回的研究、多項研究被錯誤標記、樣本過小、報告效應過大,以及分析本身未適當加權、高估效應量等。他們指出,僅從研究的森林圖看,學習表現的效應量應接近0.5,而非0.867。更關鍵的是,許多納入的研究未控制混雜變量,可靠性極低。

基於這些嚴重問題,Ingebrigtsen和Lukic要求撤回該研究。斯普林格·自然確認,由於元分析中的差異破壞了編輯對分析有效性和結論的信心,該研究被撤回。據稱,原始作者未對質詢做出回應,導致撤回決定。然而,撤回發生在研究發表整整一年之後,這一年中該研究已被引用超過500次,在社交媒體上獲得極高關注,並很可能影響了AI教育政策的制定。

該事件暴露了AI教育研究領域的深層問題:ChatGPT於2022年11月發佈,而這項元分析在2025年5月發表,前後不足三年,不足以產生高質量的研究。早期研究不可避免地存在樣本小、控制差等缺陷,但期刊卻將這項問題重重的研究推向公眾。這令人質疑《人文與社會科學通訊》的編輯和同行評審流程。

科學的發展速度緩慢,AI對學習的長期影響可能需要數年甚至數十年才能明確。在此期間,不良研究可能產生不成比例的影響。此事件提醒我們,在尋求AI教育指導時,不應依賴有缺陷的研究,而應承認未知。遺憾的是,當這類研究獲得如此突出的平台時,保持謹慎幾乎不可能。希望這一事件能帶來更多的智慧和審慎,尤其是在AI討論中缺乏這些品質的當下。