OSCToM:基于强化学习引导的对抗生成的高阶心智理论
一种名为OSCToM的新方法利用强化学习生成对抗样本,测试大语言模型的心智理论,在FANToM基准上达到76%准确率,效率提升6倍。
来源arXiv AI作者: Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat
大型语言模型(LLM)在许多语言任务上表现优异,但在复杂社交场景中,它们的心智理论(Theory of Mind, ToM)推理能力仍不均衡。ToM是指理解他人心理状态(信念、意图、知识)的能力,对于人机交互至关重要。现有的基准测试,如ExploreToM,未能充分测试递归信念和信息不对称带来的挑战,而这些正是复杂社交场景的核心难点。
针对这一问题,来自约翰霍普金斯大学等机构的研究人员提出了OSCToM(Observer-Self Conflict Theory of Mind),这是一种用于建模LLM中嵌套信念冲突的新方法。OSCToM的核心思路是:当观察者对另一个体的看法与观察者自身的信念状态产生冲突时,这种观察者-自我冲突超出了简单的视角转换,要求模型进行递归的多层推理。OSCToM结合了强化学习(RL)、扩展的领域特定语言(DSL)和组合代理模型,通过对抗方式生成这类冲突案例。
在实验中,OSCToM-8B取得了最佳整体表现。在信息不对称的FANToM基准测试中,OSCToM达到了76%的准确率,而此前最好的ExploreToM仅为0.2%,提升幅度显著。此外,OSCToM在Hi-ToM和BigToM基准上也保持了竞争力。数据合成过程的效率提高了6倍,表明定向生成的训练数据能够帮助较小模型处理高级认知推理任务。
该论文共15页,包含12幅图(含15张图像)和3个表格。研究团队已在GitHub上公开了项目代码,以便社区复现和进一步研究。这项工作不仅为LLM的ToM评估提供了更严苛的基准,也为通过对抗性训练提升模型社交推理能力开辟了新途径。