AI News HubLIVE
站内改写2 分钟阅读

用于分层图像分类的神经符号方法与认知深度学习

该论文提出了一种统一的神经符号和认知建模框架,通过焦点集推理和可微模糊逻辑增强Swin Transformer,解决了深度神经网络在分层图像分类中过度自信且缺乏逻辑一致性的问题。实验表明,该方法在保持准确率的同时,提供了更校准、可解释的预测,减少了过度自信,并强制了层级输出间的逻辑一致性。

来源arXiv Computer Vision作者: Ezel Kilicdere, Shireen Kudukkil Manchingal, Fabio Cuzzolin

深度神经网络在图像分类任务中取得了高准确率,但它们往往产生过度自信的预测,未能表达认知不确定性,并且经常违反数据中的逻辑或结构约束。这些局限性在分层分类中尤为突出,因为细粒度和粗粒度的预测必须保持连贯性。例如,在识别动物时,如果模型预测为“金毛犬”,那么父类别“狗”也必须成立,否则预测就缺乏逻辑一致性。然而,传统深度神经网络通常无法保证这种层次约束,同时可能对模糊样本给出过于自信的错误判断。

为此,研究人员首次提出了一种统一的神经符号和认知建模框架,将Swin Transformer与焦点集推理和可微模糊逻辑相结合。该方法不将标签视为孤立的类别,而是在学习到的嵌入空间内诱导数据驱动的焦点集,从而捕获多个可能的细粒度类别上的认知不确定性。这些焦点集构成了信念理论层的基础,该层使用模糊隶属函数和t-范数连接来鼓励细粒度和粗粒度预测之间的一致性。具体而言,模糊隶属函数衡量一个样本属于某个类别的程度,而t-范数则用于组合不同层级的隶属度,确保细粒度预测的父类别具有相应的置信度。

此外,论文引入了一个可学习的损失函数,进一步平衡了校准、质量正则化和逻辑一致性。校准确保预测概率反映真实正确率,质量正则化防止模型对不确定样本过于自信,而逻辑一致性则强制层级输出满足隐含的包含关系。通过自适应地调整这些项的权重,模型能够根据数据驱动证据和符号结构之间的权衡进行优化。

在分层图像分类的实验上,该框架保持了与Transformer基线相当的准确率,同时提供了更校准和可解释的预测。它减少了过度自信,特别是在难以区分的细粒度类别上,并且强制了层级输出之间的高逻辑一致性。实验结果表明,将焦点集推理与模糊逻辑相结合,是实现既准确又具有认知意识的深度学习模型的切实一步。这项工作为构建更可靠、更符合人类直觉的视觉识别系统提供了新思路,未来可能扩展到其他结构化预测任务。