心智理论改进真的有益于人机交互吗?来自互动评估的实证发现
现有的大语言模型(LLM)心智理论(ToM)评估多采用第三人称故事问答,忽略了人机交互的第一人称、动态和开放特性。本研究提出交互式ToM评估新范式,系统评估四种ToM增强技术在多种任务中的表现,发现静态基准的提升并不总能转化为动态交互中的更好表现,强调了基于交互评估的必要性。
来源arXiv AI作者: Nanxu Gong, Zixin Chen, Haotian Li, Zishu Zhao, Jianxun Lian, Huamin Qu, Yanjie Fu, Xing Xie
近日,一篇由Nanxu Gong等七位作者完成的研究论文(arXiv:2605.15205)于2026年4月28日提交,深入探讨了大语言模型(LLM)心智理论(Theory of Mind, ToM)能力的改进是否真正有益于人类与AI的交互。论文指出,当前大多数ToM评估基准依赖故事阅读和第三人称的多选题,这种方式忽略了人机交互(HAI)中第一人称、动态和开放的本质。为直接检验ToM改进技术对实际交互的影响,研究者首先提出了交互式ToM评估的新范式,包括视角和指标的转变。随后,他们按照这一范式,对四种代表性的ToM增强技术进行了系统评估,使用了四个真实世界数据集和一项用户研究,覆盖了目标导向任务(如编程、数学)和经验导向任务(如心理咨询)。研究发现,静态基准测试上的进步并不总能转化为动态HAI交互中的更好表现。这一发现为ToM评估领域提供了关键见解,表明开发下一代具有社交感知能力的LLM以实现人机共生时,基于交互的评估是必不可少的。论文还提供了详细的实验设置和结果分析,强调了在真实交互场景中验证ToM改进技术的重要性。该研究对模型选型、推理成本、产品能力以及评测基准均有潜在影响。此外,研究团队公开了部分代码和数据,以促进该领域的进一步探索。