声称AI帮助学生学习的研究被撤回
一篇声称使用ChatGPT能显著提升学生学习成绩的元分析研究,在发表一年后因方法严重缺陷被撤回。该研究曾获得极高关注,并影响教育科技领域的政策,但其结论未得到数据支持。
2025年5月,杭州师范大学的Jin Wang和Wenxiang Fan在斯普林格·自然旗下的《人文与社会科学通讯》上发表了一项元分析研究,题为“ChatGPT对学生学习成绩、学习感知和高级思维的影响:来自元分析的见解”。该研究声称,使用ChatGPT或其他AI工具的学生比不使用的学生表现更好,且这种正面影响相当显著(学习表现效应量g=0.867,学习感知和高级思维效应量分别为0.456和0.457)。研究同时指出,影响需要4-8周的持续时间,且在基于问题的学习和将ChatGPT灵活整合为智能导师、学习伙伴和教育工具时效果最佳。
这一结论迅速被教育科技领域采纳,并在社交媒体上广泛传播,成为推动AI进入课堂的重要依据。然而,研究发表后不久便遭到批评。不到一个月,本·威廉姆森在其博客中指出该研究存在方法论缺陷、夸大其词且具有误导性。随后,挪威北极大学的Magnus Ingebrigtsen和Marko Lukic发表文章,详细列举了研究中的实质性错误,包括纳入的51项研究中包含已撤回的研究、多项研究被错误标记、样本过小、报告效应过大,以及分析本身未适当加权、高估效应量等。他们指出,仅从研究的森林图看,学习表现的效应量应接近0.5,而非0.867。更关键的是,许多纳入的研究未控制混杂变量,可靠性极低。
基于这些严重问题,Ingebrigtsen和Lukic要求撤回该研究。斯普林格·自然确认,由于元分析中的差异破坏了编辑对分析有效性和结论的信心,该研究被撤回。据称,原始作者未对质询做出回应,导致撤回决定。然而,撤回发生在研究发表整整一年之后,这一年中该研究已被引用超过500次,在社交媒体上获得极高关注,并很可能影响了AI教育政策的制定。
该事件暴露了AI教育研究领域的深层问题:ChatGPT于2022年11月发布,而这项元分析在2025年5月发表,前后不足三年,不足以产生高质量的研究。早期研究不可避免地存在样本小、控制差等缺陷,但期刊却将这项问题重重的研究推向公众。这令人质疑《人文与社会科学通讯》的编辑和同行评审流程。
科学的发展速度缓慢,AI对学习的长期影响可能需要数年甚至数十年才能明确。在此期间,不良研究可能产生不成比例的影响。此事件提醒我们,在寻求AI教育指导时,不应依赖有缺陷的研究,而应承认未知。遗憾的是,当这类研究获得如此突出的平台时,保持谨慎几乎不可能。希望这一事件能带来更多的智慧和审慎,尤其是在AI讨论中缺乏这些品质的当下。