AI News HubLIVE
站內改寫1 分鐘閱讀

PhantomFill:當表單要求答案時,語言模型會編造一個

研究發現,語言模型在填充必填字段(如JSON字段)時會大幅增加虛構內容。即使模型在自由文本中能誠實回答,必填字段也會導致虛構,且大多數模型無法通過“證據不足”選項或直接指令避免。基準測試PhantomFill揭示了這一問題,並提供了確定性評分。

來源arXiv Machine Learning作者: Rana Muhammad Usman

語言模型在生產環境中並不撰寫散文,而是填寫表單:JSON字段、函數參數、提取模板。一項新研究表明,表單本身就會導致幻覺。

來自arXiv的論文《PhantomFill:當表單要求答案時,語言模型會編造一個》由Rana Muhammad Usman等人撰寫,測試了13個模型,針對同一個輸入提出相同問題,僅改變答案格式。輸入被設計為無法回答:例如一個顯示12400次點贊但無可見回覆的病毒帖子,或一個從未轉錄通話記錄的支持工單。

在自由文本格式下,GPT-5.5在98%的情況下誠實回答“沒有回覆數據”。但當要求填寫必填JSON字段(如情感分析)時,該模型在40次測試中均發明了答案。它編造了從未見過的人羣情緒,並引用從未聽過的客户言論。

這一模式在所有模型中普遍存在。必填字段導致10個模型中的虛構率達到100%。明確的“證據不足”選項僅在少數前沿模型中奏效,所有9個開放權重模型均忽略該選項。直接指令“不要推斷情感”在6個模型中有4個被架構覆蓋。模型規模並非決定性因素:在同一模型家族中,最小模型拒絕虛構,中型模型虛構,最大模型再次拒絕。格式壓力下的誠實性是一個無人測量的訓練結果。

虛構行為恰好隱藏在無法迴避的地方:必填枚舉和最小計數數組,這些字段不適合放置免責聲明。研究團隊發佈了PhantomFill基準測試,提供確定性評分和兩個可報告數字:強制虛構率(Coerced Fabrication Rate)和逃避利用率(Escape Utilization Rate)。他們測試的修復方案僅需一行架構代碼——將必填字段改為可選——但測量到的失敗無處不在。

該論文於2026年6月11日提交至arXiv,包含12頁和6幅圖。基準測試和代碼已公開。這項研究對依賴語言模型進行數據提取、情感分析等任務的應用具有重要警示意義。