PhantomFill:当表单要求答案时,语言模型会编造一个
研究发现,语言模型在填充必填字段(如JSON字段)时会大幅增加虚构内容。即使模型在自由文本中能诚实回答,必填字段也会导致虚构,且大多数模型无法通过“证据不足”选项或直接指令避免。基准测试PhantomFill揭示了这一问题,并提供了确定性评分。
语言模型在生产环境中并不撰写散文,而是填写表单:JSON字段、函数参数、提取模板。一项新研究表明,表单本身就会导致幻觉。
来自arXiv的论文《PhantomFill:当表单要求答案时,语言模型会编造一个》由Rana Muhammad Usman等人撰写,测试了13个模型,针对同一个输入提出相同问题,仅改变答案格式。输入被设计为无法回答:例如一个显示12400次点赞但无可见回复的病毒帖子,或一个从未转录通话记录的支持工单。
在自由文本格式下,GPT-5.5在98%的情况下诚实回答“没有回复数据”。但当要求填写必填JSON字段(如情感分析)时,该模型在40次测试中均发明了答案。它编造了从未见过的人群情绪,并引用从未听过的客户言论。
这一模式在所有模型中普遍存在。必填字段导致10个模型中的虚构率达到100%。明确的“证据不足”选项仅在少数前沿模型中奏效,所有9个开放权重模型均忽略该选项。直接指令“不要推断情感”在6个模型中有4个被架构覆盖。模型规模并非决定性因素:在同一模型家族中,最小模型拒绝虚构,中型模型虚构,最大模型再次拒绝。格式压力下的诚实性是一个无人测量的训练结果。
虚构行为恰好隐藏在无法回避的地方:必填枚举和最小计数数组,这些字段不适合放置免责声明。研究团队发布了PhantomFill基准测试,提供确定性评分和两个可报告数字:强制虚构率(Coerced Fabrication Rate)和逃避利用率(Escape Utilization Rate)。他们测试的修复方案仅需一行架构代码——将必填字段改为可选——但测量到的失败无处不在。
该论文于2026年6月11日提交至arXiv,包含12页和6幅图。基准测试和代码已公开。这项研究对依赖语言模型进行数据提取、情感分析等任务的应用具有重要警示意义。