用於分層圖像分類的神經符號方法與認知深度學習
該論文提出了一種統一的神經符號和認知建模框架,通過焦點集推理和可微模糊邏輯增強Swin Transformer,解決了深度神經網絡在分層圖像分類中過度自信且缺乏邏輯一致性的問題。實驗表明,該方法在保持準確率的同時,提供了更校準、可解釋的預測,減少了過度自信,並強制了層級輸出間的邏輯一致性。
深度神經網絡在圖像分類任務中取得了高準確率,但它們往往產生過度自信的預測,未能表達認知不確定性,並且經常違反數據中的邏輯或結構約束。這些侷限性在分層分類中尤為突出,因為細粒度和粗粒度的預測必須保持連貫性。例如,在識別動物時,如果模型預測為“金毛犬”,那麼父類別“狗”也必須成立,否則預測就缺乏邏輯一致性。然而,傳統深度神經網絡通常無法保證這種層次約束,同時可能對模糊樣本給出過於自信的錯誤判斷。
為此,研究人員首次提出了一種統一的神經符號和認知建模框架,將Swin Transformer與焦點集推理和可微模糊邏輯相結合。該方法不將標籤視為孤立的類別,而是在學習到的嵌入空間內誘導數據驅動的焦點集,從而捕獲多個可能的細粒度類別上的認知不確定性。這些焦點集構成了信念理論層的基礎,該層使用模糊隸屬函數和t-範數連接來鼓勵細粒度和粗粒度預測之間的一致性。具體而言,模糊隸屬函數衡量一個樣本屬於某個類別的程度,而t-範數則用於組合不同層級的隸屬度,確保細粒度預測的父類別具有相應的置信度。
此外,論文引入了一個可學習的損失函數,進一步平衡了校準、質量正則化和邏輯一致性。校準確保預測概率反映真實正確率,質量正則化防止模型對不確定樣本過於自信,而邏輯一致性則強制層級輸出滿足隱含的包含關係。通過自適應地調整這些項的權重,模型能夠根據數據驅動證據和符號結構之間的權衡進行優化。
在分層圖像分類的實驗上,該框架保持了與Transformer基線相當的準確率,同時提供了更校準和可解釋的預測。它減少了過度自信,特別是在難以區分的細粒度類別上,並且強制了層級輸出之間的高邏輯一致性。實驗結果表明,將焦點集推理與模糊邏輯相結合,是實現既準確又具有認知意識的深度學習模型的切實一步。這項工作為構建更可靠、更符合人類直覺的視覺識別系統提供了新思路,未來可能擴展到其他結構化預測任務。