在抑制與崩潰之間:使用LENS評估敍事去學習
本文介紹LENS(基於層級的敍事抑制評估),一種用於測試大型語言模型在機器去學習後是否仍會復現虛假信息敍事框架的評估協議。實驗證明,LENS能有效評估並引導敍事去學習的深入研究。
大型語言模型(LLM)在生成文本時可能無意中復現與虛假信息一致的敍事框架,將其作為合理的解釋。這引發了一個關鍵問題:現有的機器去學習算法能否有效抑制這種行為?針對這一挑戰,研究人員提出了LENS(Level-based Evaluation of Narrative Suppression),一種基於上下文定製的評估協議,用於在直接、歸因、對比和抽象抗性四個層面上測試目標敍事復現程度。
研究選取了兩種具有現實背景的敍事:一種將俄羅斯對烏克蘭戰爭歸因於北約東擴,另一種則描繪美國利用或拋棄台灣。實驗中採用了四種接近120億參數的多語言指令模型:Lapa LLM、Gemma-12B、Qwen-14B和TAIDE-Gemma。為了衡量去學習效果與模型性能的平衡,團隊引入了抑制-崩潰效率(SCE)分數,該分數在獎勵目標敍事抑制的同時懲罰輸出質量退化。
結果表明,選定的檢查點能夠有效減少敍事復現,並且抑制效果可能泛化到直接的遺忘提示之外。然而,研究也報告了一種名為“實體恢復”的副作用:抽象A/B/C類型的提示可能使模型在去學習後重新識別與目標框架相關的真實世界參與者。這些發現證實LENS是一種成功的診斷工具,不僅能報告結果,還能指導對敍事去學習深層結構的進一步研究。論文還包含了詳細的提交歷史、參考文獻和實驗數據鏈接。
此外,LENS協議的設計考慮了實際應用場景,例如在社交媒體內容審核和新聞生成中,模型需要避免傳播虛假信息。通過多層次的評估,研究者可以更全面地瞭解去學習算法的有效性及侷限性。SCE分數的引入也為模型部署提供了實用的篩選標準,確保在抑制有害敍事的同時不破壞模型的整體輸出質量。未來的研究可以進一步探索如何緩解實體恢復效應,並擴展LENS到更多類型的敍事和模型上。