AI News HubLIVE
サイト内リライト2 分で読了

JEPA予測器:隠蔽特徴補完のための転移可能な演算子

Joint-Embedding Predictive Architectures(JEPA)は、エンコーダと共に予測器を訓練するが、下流タスクでは予測器を破棄する。本研究では、JEPA予測器が隠蔽特徴補完のための転移可能な演算子として機能し、線形投影を介して異なるエンコーダファミリに適応可能であり、隠蔽分類精度を大幅に向上させることを示す。

ソースarXiv Computer Vision著者: William Nguyen, Christopher Nguyen

Joint-Embedding Predictive Architectures(JEPA)は、訓練時にエンコーダと予測器を同時に学習するが、下流タスクへの展開では予測器は破棄され、エンコーダからの特徴のみが使用される。しかし、最新の研究により、JEPA予測器自体が可視コンテキストの特徴からマスクされた位置の特徴を学習する演算子であり、部分ビュー分類器に必要な構造を持つことが示された。さらに、この演算子はエンコーダファミリ間で転移可能である。

研究者らはまず、大量のマスク領域がある場合、JEPAエンコーダ上に凍結予測器を保持することで、最も強力な非JEPA識別ベースラインとの精度ギャップを大幅に縮小できることを確認した。例えば、ImageNet-9データセットにおいて、マスク割合が高い場合、予測器を保持したJEPAエンコーダはマスクにより失われた精度のほとんどを回復した。

次に、I-JEPAおよびV-JEPA 2の凍結予測器を、単一の線形投影を介して4つの非JEPAホスト(CLIP、DINOv3、DINOv2、MAE)に結合した。この線形投影は、500枚のImageNet-1k画像を用いて閉形式で適合され、いずれのモデルも再訓練する必要はない。ImageNet-9とStanford Dogsの両方で、3つのマスク割合にわたって、各ホスト-ドナー対において、マスクエンコーダベースラインからの改善がマスク割合Kとともに単調増加することが示された。CLIPとI-JEPA予測器のペアリングでは、ImageNet-9でマスクによる精度低下の大部分を回復し、Stanford Dogsの細粒度分類では精度が15.9%から52.1%へと36ポイント向上した。

そのメカニズムは明確である。線形投影は可視パッチに固定コストを課し、予測器はマスクパッチに増大する利益をもたらす。重いマスク領域では利益が支配的となる。細粒度分類における低Kでは投影コストが利益を上回り、線形ブリッジが機能しなくなる境界を定義する。凍結JEPA予測器は、エンコーダファミリ間で転移可能な隠蔽特徴補完演算子として機能し、いずれのモデルも再訓練することなく、マスク割合ごとに適合された線形プローブを適用するだけでよい。この発見は、JEPA予測器を利用して既存の視覚エンコーダのロバスト性を向上させる新しいアプローチを提供する。