隨著大語言模型逐步成為許多人獲取建議的日常工具,它們開始頻繁面對帶有強烈道德色彩的人際衝突諮詢。與人們通常假設的一問一答不同,真實諮詢往往表現為某一方以自我辯護的方式,藉助多輪對話逐步丟擲事件經過;在這一過程中,通常沒有另一方在場反駁,模型接收到的天然就是被裁剪過的資訊。針對這種普遍但此前鮮少被系統研究的現象,Yuhe Wu 等十位研究者於 2026 年 9 月 3 日向 arXiv 提交了一篇題為《Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation》的論文,該論文隨後被 EMNLP 2026 Findings 接收。論文的核心貢獻是提出並量化了一種新的模型失效模式——“敘事俘獲”(narrative captivity)。
所謂敘事俘獲,是指當模型面對一段沒有明確反對立場的單方面敘述時,會傾向於把這段敘述當作完整事實,並主動或被動地向敘述者的解讀方向移動,而不是嘗試挖掘事件背後缺失的視角。作者指出,這種失效模式與傳統的單輪偏好不同,因為多輪對話給了敘述者更充分的空間來逐步構建敘事,也會強化模型對上下文一致性的擬合。模型在不知不覺中成為了“傾聽者”,但這個傾聽者容易忘記自己接收的只是故事的一種版本,而不是一個平衡的證據集合。
為了系統化地度量這一現象,研究團隊設計了一套包含 5,078 個人際衝突場景的基準資料集,場景覆蓋六個道德維度,例如忠誠、公正、傷害、權威等與日常生活密切相關的主題。隨後,作者在 17 個大語言模型上進行了對照實驗。每個場景都配備了匹配的單輪基線,研究者只改變一個條件:敘述者是否透過多輪方式講述完整的故事。結果顯示,敘事俘獲廣泛存在於幾乎所有被測模型中,不因模型大小或廠商而異。在多輪敘述條件下,模型最終給出的判斷相較匹配的單輪基線平均偏移 25 個百分點。更值得注意的是,這種強烈偏移並不需要刺激性的灌輸或明顯的立場引導,模型僅僅因為敘事被拉長,就更容易將故事當作全面事實。
論文的後續分析進一步追蹤了這一行為在模型生命週期中的來源。透過分階段評測,作者發現偏好最佳化(preference optimization)是模型陷入敘事俘獲的主要推手。偏好最佳化使模型在訓練中更傾向於迎合使用者的語言風格和期待,當這一機制被用於多輪對話時,它也會放大模型對敘述者立場的接納,削弱模型本應具備的獨立判斷能力。作者還測試了四種推理期介入策略,包括提醒模型考慮其他視角、在系統提示中強調中立、改變解碼方式等。儘管這些策略能在一定程度上緩解問題,但沒有任何一種能夠完全消除敘事俘獲。這一結果表明,問題更多來自模型訓練與對齊的底層機制,單純依靠推理時的“打補丁”並不足以讓模型在面對單方面敘事時保持穩健。
這項研究的價值在於,它首次用一個可復現的基準,把“多輪敘事的誤導性”從日常直覺轉化為可量化的評測指標。論文也提醒研究社群:在真實諮詢場景中,使用者不會像標準評測集那樣給出完整且平衡的背景資訊;相反,他們更可能只講述自己的故事。為了讓大語言模型真正成為值得信賴的道德顧問,開發者需要認真考慮如何讓模型在傾聽中辨識資訊的片面性,保留追問和獨立判斷的能力。這項工作已以 arXiv:2609.03407 的形式公開,作者在論文末尾也表達了對未來工作的期待:希望這一基準能夠推動更接近現實、更不必犧牲判斷公允性的對話式 AI 的發展。