階層画像分類のための認識的深層学習を用いた神経記号論的アプローチ
本論文では、焦点集合推論と微分可能ファジー論理でSwin Transformerを拡張した統合的な神経記号論的・認識的モデリングフレームワークを提案し、階層画像分類における過信と論理的不整合に対処する。実験では、精度を維持しつつ、キャリブレーション、解釈可能性、階層出力間の論理的一貫性が向上した。
深層ニューラルネットワークは画像分類タスクで高い精度を達成するが、しばしば過信な予測を生成し、認識的不確実性を表現できず、データ中の論理的または構造的制約に違反することがある。これらの制限は、細粒度と粗粒度の予測が一貫している必要がある階層分類で特に顕著である。例えば、動物を認識する際にモデルが「ゴールデンレトリバー」と予測した場合、その親カテゴリである「犬」も成立しなければならず、そうでなければ予測は論理的一貫性を欠く。しかし、従来の深層ニューラルネットワークは通常、このような階層的制約を保証できず、曖昧なサンプルに対して過度に自信過剰な誤判断を下す可能性がある。
本研究では、初めて、Swin Transformerを焦点集合推論と微分可能ファジー論理で拡張する、統一的な神経記号論的・認識的モデリングフレームワークを提案する。本手法は、ラベルを孤立したカテゴリとして扱うのではなく、学習された埋め込み空間内でデータ駆動の焦点集合を誘導し、複数の可能性のある細粒度クラスに対する認識的不確実性を捕捉する。これらの焦点集合は、ファジー所属関数とt-ノルム結合を使用して細粒度と粗粒度の予測間の一貫性を促進する信念理論層の基礎を形成する。具体的には、ファジー所属関数はサンプルが特定のカテゴリに属する程度を測定し、t-ノルムは異なる階層の所属度を組み合わせて、細粒度予測の親カテゴリが対応する信頼度を持つことを保証する。
さらに、論文は学習可能な損失関数を導入し、キャリブレーション、質量正則化、論理的一貫性のバランスをとる。キャリブレーションは予測確率が実際の正解率を反映することを保証し、質量正則化は不確実なサンプルに対する過信を防ぎ、論理的一貫性は階層出力が暗黙の包含関係を満たすように強制する。これらの項の重みを適応的に調整することで、モデルはデータ駆動の証拠と記号的構造の間のトレードオフに応じて最適化される。
階層画像分類の実験では、本フレームワークはTransformerベースラインと同等の精度を維持しつつ、よりキャリブレーションされ解釈可能な予測を提供し、過信を低減し、階層出力全体で高い論理的一貫性を強制する。実験結果は、焦点集合推論とファジー論理の組み合わせが、正確で認識的に認識可能な深層学習モデルへの実用的なステップを提供することを示している。この研究は、より信頼性が高く人間の直感に合致する視覚認識システムを構築するための新たな方向性を提供し、将来的には他の構造化予測タスクに拡張される可能性がある。