MuteBench:不完整多模态融合的模态不可用容忍性评估
MuteBench是一个新基准,用于评估在两种常见传感器故障模式(模态缺失和模态内缺失)下多模态融合架构的鲁棒性,覆盖7个临床领域的9个数据集、6种融合架构和125,000个样本。研究发现,架构族是鲁棒性的最强预测因子,通道独立模型在模态缺失时表现良好但对模态内缺失敏感,而课程模态丢失只能在训练时最大丢失率内提供保护。
多模态生理数据为从重症监护室到可穿戴设备的临床AI系统提供动力,但传感器在实践中经常失效。两种常见的失效模式是:模态缺失,即整个通道缺失;以及模态内缺失,即连续时间段的丢失。现有的基准测试无法在受控严重程度下,跨多种临床数据集评估多种融合架构在两种失效模式下的表现。为此,我们提出了MuteBench,这是一个涵盖7个临床领域9个数据集、6种融合架构和2种缺失模式的基准测试,总计125,000个样本。该基准测试涵盖了广泛的数据集,包括心电图、脑电图、血压等生理信号,以及影像和文本数据,确保了评估的多样性。融合架构包括早期融合、晚期融合、交叉注意力融合、张量融合、低秩融合和专家混合等多种主流方法。通过控制缺失的严重程度(从轻微到完全缺失),MuteBench能够系统地评估每种架构在两种故障模式下的鲁棒性。
通过该基准测试,我们发现架构族是鲁棒性的最强预测因子,其重要性超过参数数量。通道独立模型能很好地容忍模态缺失,但對模态内缺失敏感,尤其是在短序列上。课程模态丢失仅在训练时使用的最大丢失率内提供可靠的保护。我们还发现,通道数、序列长度和模态对齐共同决定了哪种失效模式更具威胁。例如,当序列较短时,模态内缺失对通道独立模型的影响更为显著;而当通道数较多时,模态缺失的影响可能更大。这些发现为实践者提供了选择合适架构的具体指导。
最后,基于PTB-XL数据集的案例研究表明,扩散基插补可以改善模态内缺失下的下游分类,尤其对专家路由对损坏输入最敏感的模型效果最为显著。然而,这一方法在更多数据集上的广泛验证仍有待探索。MuteBench为实践者提供了具体指导,既有助於选择现有架构,也为未来设计更鲁棒的多模态融合方法提供了参考。