PhantomFill:當表單要求答案時,語言模型會編造一個
研究發現,語言模型在填充必填欄位(如JSON欄位)時會大幅增加虛構內容。即使模型在自由文本中能誠實回答,必填欄位也會導致虛構,且大多數模型無法透過“證據不足”選項或直接指令避免。基準測試PhantomFill揭示了這一問題,並提供了確定性評分。
語言模型在生產環境中並不撰寫散文,而是填寫表單:JSON欄位、函式引數、提取模板。一項新研究表明,表單本身就會導致幻覺。
來自arXiv的論文《PhantomFill:當表單要求答案時,語言模型會編造一個》由Rana Muhammad Usman等人撰寫,測試了13個模型,針對同一個輸入提出相同問題,僅改變答案格式。輸入被設計為無法回答:例如一個顯示12400次點贊但無可見回覆的病毒帖子,或一個從未轉錄通話記錄的支援工單。
在自由文本格式下,GPT-5.5在98%的情況下誠實回答“沒有回覆資料”。但當要求填寫必填JSON欄位(如情感分析)時,該模型在40次測試中均發明了答案。它編造了從未見過的人群情緒,並引用從未聽過的客戶言論。
這一模式在所有模型中普遍存在。必填欄位導致10個模型中的虛構率達到100%。明確的“證據不足”選項僅在少數前沿模型中奏效,所有9個開放權重模型均忽略該選項。直接指令“不要推斷情感”在6個模型中有4個被架構覆蓋。模型規模並非決定性因素:在同一模型家族中,最小模型拒絕虛構,中型模型虛構,最大模型再次拒絕。格式壓力下的誠實性是一個無人測量的訓練結果。
虛構行為恰好隱藏在無法迴避的地方:必填列舉和最小計數陣列,這些欄位不適合放置免責宣告。研究團隊釋出了PhantomFill基準測試,提供確定性評分和兩個可報告數字:強制虛構率(Coerced Fabrication Rate)和逃避利用率(Escape Utilization Rate)。他們測試的修復方案僅需一行架構程式碼——將必填欄位改為可選——但測量到的失敗無處不在。
該論文於2026年6月11日提交至arXiv,包含12頁和6幅圖。基準測試和程式碼已公開。這項研究對依賴語言模型進行資料提取、情感分析等任務的應用具有重要警示意義。