AI News HubLIVE
站内改写1 分钟阅读

JEPA预测器:可迁移的遮挡特征补全算子

联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。

来源arXiv Computer Vision作者: William Nguyen, Christopher Nguyen

联合嵌入预测架构(JEPA)在训练过程中联合训练一个预测器与编码器,但在下游部署时,预测器通常被丢弃,仅从编码器提取特征。然而,最新研究表明,JEPA预测器本身是一个学习从可见上下文特征到被遮挡位置特征的算子,其结构正是部分视图分类器所需的。更重要的是,该算子可以跨编码器家族迁移。

研究者首先证明,在大量遮挡的情况下,保留冻结的JEPA预测器可以显著缩小与最强非JEPA判别式基线的精度差距。例如,在ImageNet-9数据集上,当遮挡比例较高时,保留预测器的JEPA编码器几乎恢复了因遮挡损失的全部精度。

进一步,研究者将I-JEPA和V-JEPA 2的冻结预测器通过一个简单的线性投影适配到四种非JEPA宿主编码器(CLIP、DINOv3、DINOv2、MAE)上。该线性投影仅需500张ImageNet-1k图像即可通过闭式形式拟合,无需重新训练任何模型。在ImageNet-9和Stanford Dogs数据集上,针对三种遮挡比例,每个宿主-捐赠者组合的精度提升随遮挡比例K单调增长。例如,CLIP与I-JEPA预测器结合,在ImageNet-9上恢复了大部分因遮挡损失的精度,并在Stanford Dogs细粒度分类上将准确率从15.9%提升至52.1%(提升36个百分点)。

该机制的机理可识别:线性投影在可见块上产生固定代价,而预测器在被遮挡块上提供增长性收益;在重度遮挡下收益主导。在细粒度分类的低遮挡比例下,投影代价超过收益,定义了线性桥失效的边界。冻结的JEPA预测器作为可迁移的遮挡特征补全算子,无需重新训练任何模型,仅需为每个遮挡比例拟合匹配的线性探针。这一发现为利用JEPA预测器提升现有视觉编码器的鲁棒性提供了新思路。