AI News HubLIVE
站內改寫2 分鐘閱讀

記憶信任缺口:持久記憶智慧體中的能力依賴型失敗

持久記憶讓 AI 智慧體顯得更個性化,但一項新研究警告:一旦儲存事實過期,模型可能用過時資訊覆蓋工具提供的當前權威證據。論文在 Qwen3 多規模模型上發現這一“記憶信任缺口”源於過度信任,傷害存在能力門控;緩解措施也與模型能力相關。

來源arXiv AI作者: Jundong Hu, Shekar Ramachandran

人工智慧助手常藉助持久記憶來記住使用者偏好與歷史事實。然而,一篇來自 arXiv 的預印本論文警告:當儲存內容過期時,智慧體可能在沒有預警的情況下,用舊資訊覆蓋權威工具給出的當前證據。Jundong Hu 等人撰寫的《記憶信任缺口:持久記憶智慧體中的能力依賴型失敗》(arXiv:2609.01852)系統檢驗了這種風險如何隨模型能力變化。

為區分“無記憶”的兩種不同含義,研究者構建了一個凍結的、封閉動作集、自動評分的基準測試,包含兩個套件。Benefit 套件只能依靠儲存事實才能得分;Safety 套件中權威工具始終返回正確值,因此任何偏離無記憶基線的表現都反映過度信任。作者在 Qwen3 0.6B、1.7B、4B、8B 同系列模型上進行測試。結果發現,模型並不是混淆新舊資訊,而是對儲存內容過度信任。在 Benefit 套件中,各規模模型使用過期儲存值的比例高達 92% 到 100%;而在 Safety 套件中,只要把過期筆記偽裝成當前記錄,較大的模型就會顯著偏離基線,顯示損害存在“能力門控”。

進一步的 2×2×2×2 析因實驗顯示,觸發過度信任的特徵既取決於特徵型別,也取決於模型規模:移除標籤會在所有規模上放大過度信任;把過期內容標註為新日期的“近期性”操作對較大模型尤其有誤導性。來源權威性的影響較弱且基本不隨規模變化;位置線索的影響在 Qwen3 系列中甚至由正轉負。研究者使用直接的跨規模對比檢驗,而不是依靠置信區間重疊來判斷這些互動。

緩解策略同樣隨能力而異:向較強的模型暴露來源等後設資料即可提高準確率,但兩個較小的檢查點必須依靠預先解決衝突才能恢復表現。這一模式也在獨立的 Llama-Instruct 模型系列以及 RGB、MisBench 兩個外部資料集上得到驗證。一項框架控制實驗發現,“記憶”標籤本身並無穩定優勢:在三個較小規模上,模型對過期文件的信任甚至高於對過期記憶的信任;到 8B 時兩者差異不再顯著。

論文目前為預印本,正在 NeurIPS 2026 研討會審稿中,全文 14 頁、含 7 幅圖和 11 張表。作者強調,持久記憶的安全部署不能只關注“記住什麼”,還需要考慮模型能力、後設資料呈現與衝突消解等上下文因素。