視覚言語モデル(VLM)は、視覚とテキストの表現を共有埋め込み空間で整合させることで、さまざまなマルチモーダルタスクにおいて高い性能を達成してきた。こうしたモデルが高リスク領域で使われるようになるにつれ、モデルの障害を事前に予測し、リスクを意識した運用や人間の介入につなげることの重要性が増している。従来の障害予測は、信頼度スコアや補助分類器に依存することが多く、予測はできても十分な解釈可能性を備えていなかった。
本論文では、Jie Ma氏らが提案する「FailSAE: Towards Interpretable Failure Prediction for Vision-Language Models via Sparse Autoencoders」において、スパースオートエンコーダ(SAE)を用いた解釈可能なVLM障害予測を試みている。提案手法は、障害予測をSAEのスパースな潜在アクティベーションに対する分類タスクとして定式化し、3段階の「障害を意識した」学習パイプラインを導入する。この学習により、潜在方向は解釈しやすい性質を保ちながら、障害予測にとってより有益な情報を持つようになる。実験では、評価したベースライン手法と比較して高い障害予測性能が示された。
さらに分析から、障害を意識した学習によって、SAEの潜在方向がクラス固有の概念をより多く捉えるようになることが分かった。加えて、失敗時のモデル表現の変化を概念レベルで解析し、クラス固有の概念から曖昧な概念やスタイル関連の概念への移行が起きていることを明らかにしている。この知見は、VLMがなぜ特定の入力で失敗するのかを理解する手がかりとなり、障害パターンの特定や今後の改善につながる可能性がある。論文では、学習したSAE潜在方向を実行時の障害回復に活用する可能性についても議論されている。
本論文は、コンピュータビジョンとパターン認識(cs.CV)に分類されるプレプリントで、arXiv:2609.04276として2026年9月2日に公開された。著者はJie Ma氏ら3名であり、PDF版やHTML版はarXivの論文ページから入手できる。