AI News HubLIVE
站內改寫2 分鐘閱讀

共享語義碼本蒸餾:面向非配對跨模態醫學分類

跨模態知識蒸餾常因醫學影像模態之間的非配對問題而失效。該研究提出共享語義碼本蒸餾(SSCD),透過共享的離散碼本將影像表示為語義分佈,並全域性與類別條件地對齊教師和學生模態,無需配對樣本或直接比較原始特徵。在眼底與胸部X光兩個任務上,SSCD顯著提升學生模型效能並超越現有基線。

來源arXiv Computer Vision作者: Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

跨模態知識蒸餾的目標是將診斷知識從效能強大但計算成本較高的模態(教師)遷移到更輕量、更適合部署的模態(學生)。在醫學影像分析中,這一過程常常面臨一個關鍵障礙:不同模態的資料往往是非配對的。所謂非配對,是指兩類影像可能來自不同的患者佇列,且它們在特徵空間上幾何不相容。在這種情況下,常見的例項級蒸餾方法不再成立,而直接進行特徵匹配也缺乏可靠性。為了解決這一難題,研究團隊提出了共享語義碼本蒸餾(SSCD),這是一種不依賴配對樣本的跨模態知識遷移新方法。

SSCD的核心思想是引入一個與模態無關的共享離散碼本。具體來說,每一張影像都被對映為該碼本詞彙表上的一個機率分佈,而不是直接使用原始特徵。透過這種方式,教師和學生模態可以在同一個語義空間中進行比較。知識遷移透過全域性對齊和類別條件對齊兩種方式實現:全域性對齊讓整體分佈趨於一致,而類別條件對齊則針對每個類別分別進行匹配,從而保留類別相關的判別資訊。整個過程不需要配對樣本,也不要求兩種模態的原始特徵具有可比性。

在訓練過程中,碼本並非靜態不變的,而是透過指數移動平均(EMA)線上更新,以適應不斷變化的特徵分佈。同時,為了確保碼本中的各個碼字都被充分利用,研究採用了熵正則化來鼓勵分佈更加均勻,並透過死碼重啟機制重新啟用那些長期未被使用的碼字。這兩種機制共同作用,有效避免了碼本退化問題。到了推理階段,所有教師側模組以及碼本本身都會被丟棄,系統只需要保留學生編碼器和分類器,因此在實際部署時不會增加任何額外的計算負擔。

研究在兩個具有代表性的非配對跨模態醫學分類任務上進行了驗證:一是OCT到眼底影像的視網膜疾病分類,二是CT到胸部X光的肺炎分類。實驗結果表明,SSCD在這兩個任務上都取得了顯著提升。具體而言,學生模型的macro-F1分數從64.5提高到70.2(OCT到眼底),以及從73.8提高到76.3(CT到胸部X光)。在所有參與對比的蒸餾基線中,SSCD均取得了最優效能,展示了其處理非配對醫學影像資料的強大能力。

目前,研究團隊已經公開了論文的程式碼和預訓練模型,資源可以在GitHub上獲取。論文共16頁,包含2張圖和4張表格,已於2026年7月29日提交至arXiv,編號為2607.27357,涉及計算機視覺與模式識別(cs.CV)以及影像與影片處理(eess.IV)兩個領域。這項研究為非配對跨模態醫學分類提供了一種實用且高效的解決方案,有望推動相關臨床應用的發展。