JEPA預測器:可遷移的遮擋特徵補全算子
聯合嵌入預測架構(JEPA)在訓練時聯合訓練預測器與編碼器,但下游部署通常丟棄預測器。研究表明,JEPA預測器可作為可遷移的遮擋特徵補全算子,通過線性投影適配到不同編碼器族,顯著提升遮擋分類精度。
聯合嵌入預測架構(JEPA)在訓練過程中聯合訓練一個預測器與編碼器,但在下游部署時,預測器通常被丟棄,僅從編碼器提取特徵。然而,最新研究表明,JEPA預測器本身是一個學習從可見上下文特徵到被遮擋位置特徵的算子,其結構正是部分視圖分類器所需的。更重要的是,該算子可以跨編碼器家族遷移。
研究者首先證明,在大量遮擋的情況下,保留凍結的JEPA預測器可以顯著縮小與最強非JEPA判別式基線的精度差距。例如,在ImageNet-9數據集上,當遮擋比例較高時,保留預測器的JEPA編碼器幾乎恢復了因遮擋損失的全部精度。
進一步,研究者將I-JEPA和V-JEPA 2的凍結預測器通過一個簡單的線性投影適配到四種非JEPA宿主編碼器(CLIP、DINOv3、DINOv2、MAE)上。該線性投影僅需500張ImageNet-1k圖像即可通過閉式形式擬合,無需重新訓練任何模型。在ImageNet-9和Stanford Dogs數據集上,針對三種遮擋比例,每個宿主-捐贈者組合的精度提升隨遮擋比例K單調增長。例如,CLIP與I-JEPA預測器結合,在ImageNet-9上恢復了大部分因遮擋損失的精度,並在Stanford Dogs細粒度分類上將準確率從15.9%提升至52.1%(提升36個百分點)。
該機制的機理可識別:線性投影在可見塊上產生固定代價,而預測器在被遮擋塊上提供增長性收益;在重度遮擋下收益主導。在細粒度分類的低遮擋比例下,投影代價超過收益,定義了線性橋失效的邊界。凍結的JEPA預測器作為可遷移的遮擋特徵補全算子,無需重新訓練任何模型,僅需為每個遮擋比例擬合匹配的線性探針。這一發現為利用JEPA預測器提升現有視覺編碼器的魯棒性提供了新思路。