AI News HubLIVE
サイト内リライト2 分で読了

記憶信頼ギャップ:永続記憶エージェントにおける能力依存の失敗

永続記憶はAIエージェントを個別化する一方、古い事実が現在の権威ある証拠を無言のうちに上書きしてしまうことがある。このプレプリントはQwen3のモデルサイズ系列を使い、「記憶信頼ギャップ」が記憶と現在情報の混同ではなく過信に由来し、危害と緩和策の効果がモデル能力に依存することを示した。

ソースarXiv AI著者: Jundong Hu, Shekar Ramachandran

パーソナライズされたAIエージェントを支えるために、永続記憶への依存が広がっている。しかし、arXivに投稿された新しいプレプリントは、記憶内の古い事実が、権威あるツールが返す現在の証拠を、警告なしに上書きしてしまう危険性を体系的に示した。Jundong Hu氏らによる論文『記憶信頼ギャップ:永続記憶エージェントにおける能力依存の失敗』(arXiv:2609.01852)は、そうした危害がモデルの能力変化に伴ってどの時点から生じるのかを検証している。

研究では「無記憶」の2つの意味に対応する、凍結された閉じたアクション集合・自動スコアリングのベンチマークを構築した。Benefitスイートは保存された事実がなければ解けない課題であり、Safetyスイートは権威あるツールが常に正しい値を保持する状況を表す。Qwen3 0.6B/1.7B/4B/8Bという同系列のモデルサイズで評価した結果、モデルは新旧の情報を混同しているのではなく、保存内容を過信していることが分かった。Benefitスイートでは、すべての規模で92%から100%の確率で古い保存値を回答した。Safetyスイートでは、古いメモを現在の記録のように見せると、大きなモデルほど無記憶ベースラインから大きく逸脱し、危害が能力ゲートされていることを示した。

さらに2×2×2×2の要因実験では、過信を引き起こす要因が特徴の種類とモデル規模の両方に依存することが明らかになった。ラベルを削除すると全規模で過信が強まり、古い内容に新しい日付を付ける「近接性」操作は大きなモデルを特に誤らせた。出典の権威性の影響は弱く、規模によってほぼ一定だった。位置の手がかりの効果はQwen3シリーズ内で正から負へと反転した。著者らはモデルごとの信頼区間の重なりではなく、直接的なサイズ間対比検定によってこれらの交互作用を確認している。

緩和策も能力依存的だった。強力なモデルにはメタデータを提示することで精度が向上したが、小さな2つのチェックポイントでは、矛盾を事前に解消するだけで精度が回復した。同じパターンは独立したLlama-Instructモデル系列と、RGB・MisBenchの2つの外部データセットでも確認された。フレーミング統制実験では、「記憶」というラベルの一貫した利点は見られなかった。3つの小規模モデルでは、古い記憶よりも古い文書のほうを信頼し、8Bではその差は有意ではなかった。

論文は現在プレプリントであり、NeurIPS 2026ワークショップで審査中。全14ページ、図7点、表11点からなる。著者らは、永続記憶の安全な展開には「何を記憶するか」だけでなく、モデル能力、メタデータの提示、矛盾解消といった文脈要因を考慮する必要があると強調している。