AI News HubLIVE
站内改写2 分钟阅读

记忆信任缺口:持久记忆智能体中的能力依赖型失败

持久记忆让 AI 智能体显得更个性化,但一项新研究警告:一旦存储事实过期,模型可能用过时信息覆盖工具提供的当前权威证据。论文在 Qwen3 多规模模型上发现这一“记忆信任缺口”源于过度信任,伤害存在能力门控;缓解措施也与模型能力相关。

来源arXiv AI作者: Jundong Hu, Shekar Ramachandran

人工智能助手常借助持久记忆来记住用户偏好与历史事实。然而,一篇来自 arXiv 的预印本论文警告:当存储内容过期时,智能体可能在没有预警的情况下,用旧信息覆盖权威工具给出的当前证据。Jundong Hu 等人撰写的《记忆信任缺口:持久记忆智能体中的能力依赖型失败》(arXiv:2609.01852)系统检验了这种风险如何随模型能力变化。

为区分“无记忆”的两种不同含义,研究者构建了一个冻结的、封闭动作集、自动评分的基准测试,包含两个套件。Benefit 套件只能依靠存储事实才能得分;Safety 套件中权威工具始终返回正确值,因此任何偏离无记忆基线的表现都反映过度信任。作者在 Qwen3 0.6B、1.7B、4B、8B 同系列模型上进行测试。结果发现,模型并不是混淆新旧信息,而是对存储内容过度信任。在 Benefit 套件中,各规模模型使用过期存储值的比例高达 92% 到 100%;而在 Safety 套件中,只要把过期笔记伪装成当前记录,较大的模型就会显著偏离基线,显示损害存在“能力门控”。

进一步的 2×2×2×2 析因实验显示,触发过度信任的特征既取决于特征类型,也取决于模型规模:移除标签会在所有规模上放大过度信任;把过期内容标注为新日期的“近期性”操作对较大模型尤其有误导性。来源权威性的影响较弱且基本不随规模变化;位置线索的影响在 Qwen3 系列中甚至由正转负。研究者使用直接的跨规模对比检验,而不是依靠置信区间重叠来判断这些交互。

缓解策略同样随能力而异:向较强的模型暴露来源等元数据即可提高准确率,但两个较小的检查点必须依靠预先解决冲突才能恢复表现。这一模式也在独立的 Llama-Instruct 模型系列以及 RGB、MisBench 两个外部数据集上得到验证。一项框架控制实验发现,“记忆”标签本身并无稳定优势:在三个较小规模上,模型对过期文档的信任甚至高于对过期记忆的信任;到 8B 时两者差异不再显著。

论文目前为预印本,正在 NeurIPS 2026 研讨会审稿中,全文 14 页、含 7 幅图和 11 张表。作者强调,持久记忆的安全部署不能只关注“记住什么”,还需要考虑模型能力、元数据呈现与冲突消解等上下文因素。