心智理論改進真的有益於人機交互嗎?來自互動評估的實證發現
現有的大語言模型(LLM)心智理論(ToM)評估多采用第三人稱故事問答,忽略了人機交互的第一人稱、動態和開放特性。本研究提出交互式ToM評估新範式,系統評估四種ToM增強技術在多種任務中的表現,發現靜態基準的提升並不總能轉化為動態交互中的更好表現,強調了基於交互評估的必要性。
來源arXiv AI作者: Nanxu Gong, Zixin Chen, Haotian Li, Zishu Zhao, Jianxun Lian, Huamin Qu, Yanjie Fu, Xing Xie
近日,一篇由Nanxu Gong等七位作者完成的研究論文(arXiv:2605.15205)於2026年4月28日提交,深入探討了大語言模型(LLM)心智理論(Theory of Mind, ToM)能力的改進是否真正有益於人類與AI的交互。論文指出,當前大多數ToM評估基準依賴故事閲讀和第三人稱的多選題,這種方式忽略了人機交互(HAI)中第一人稱、動態和開放的本質。為直接檢驗ToM改進技術對實際交互的影響,研究者首先提出了交互式ToM評估的新範式,包括視角和指標的轉變。隨後,他們按照這一範式,對四種代表性的ToM增強技術進行了系統評估,使用了四個真實世界數據集和一項用户研究,覆蓋了目標導向任務(如編程、數學)和經驗導向任務(如心理諮詢)。研究發現,靜態基準測試上的進步並不總能轉化為動態HAI交互中的更好表現。這一發現為ToM評估領域提供了關鍵見解,表明開發下一代具有社交感知能力的LLM以實現人機共生時,基於交互的評估是必不可少的。論文還提供了詳細的實驗設置和結果分析,強調了在真實交互場景中驗證ToM改進技術的重要性。該研究對模型選型、推理成本、產品能力以及評測基準均有潛在影響。此外,研究團隊公開了部分代碼和數據,以促進該領域的進一步探索。