Rad-JEPA 3D:用于3D计算机断层扫描的放射学联合嵌入预测模型
Rad-JEPA 3D是一种自监督预训练框架,通过预测掩码视图的潜在特征来学习3D CT体积表示。其核心是混合H-Mamba编码器,结合状态空间模型和分组查询注意力,并引入隐藏状态正交正则化(HSOR)以提高表示质量。在约12万CT扫描上预训练后,仅用4.0B参数即在封闭式VQA和空间推理基准上达到最先进水平。
arXiv 近期发布了一项新研究,提出了 Rad-JEPA 3D,一种专为3D计算机断层扫描(CT)影像设计的自监督预训练框架。在3D医学图像分析领域,未标记的CT体积数据丰富但专家标注稀缺,因此自监督预训练至关重要。然而,现有的体积编码器通常无法保留下游推理所依赖的粗粒度空间和几何结构,这限制了它们在器官分离、异常检测以及与语言模型结合时的空间理解能力。Rad-JEPA 3D通过从掩码视图预测完整扫描的潜在特征来学习体积CT表示,从而解决了这一问题。
该框架的核心是一个混合H-Mamba编码器,它融合了两个分支:一是Mamba状态空间分支,通过顺序扫描建模切片间的连续性;二是分组查询注意力分支,捕捉跨平面的空间上下文。这两个分支通过一个轻量级的逐令牌路由器进行组合。此外,研究团队还提出了隐藏状态正交正则化(HSOR),用于对齐学生-教师隐藏状态并减少整个编码器中的特征冗余。这种逐层正则化产生了更一致且更具判别性的体积表示,从而在器官识别和空间推理任务上取得了更好的性能。
Rad-JEPA 3D在大约12万次CT扫描上进行了预训练,尽管参数规模仅为4.0B,但在封闭式视觉问答(VQA)任务上达到了与最先进模型相当的结果,并在Spatial-Med基准上获得了最佳平均空间推理得分。消融研究证实,混合模块和HSOR能够互补增益,并且诱导出的空间结构可以在体积推理任务中替代原始语言模型的规模。
该研究的代码和预训练模型预计将在未来公开。Rad-JEPA 3D的提出为3D医学图像分析中的自监督预训练提供了一个高效且强大的新选择,尤其适用于标注数据稀缺的场景。它展示了联合嵌入预测框架在体积医学成像中的潜力,为未来在更广泛的临床应用中的部署奠定了基础。