近年來,將CLIP風格的大規模視覺語言預訓練方法用於乳腺X線攝影受到越來越多的關注。此類方法通常將影像與放射報告配對,學習通用的影像與文本表徵。然而,如果直接沿用標準的CLIP架構與訓練目標,模型在癌症檢測、病變型別判斷和BI-RADS分級等臨床重要任務上的零樣本表現往往十分有限。研究者認為,造成這種落差的關鍵在於乳腺X線攝影資料的兩項特徵被忽視了:一是影像本身是超高解析度,二是在大規模篩查人群中,陰性或者良性結果佔絕大多數,使得放射報告的內容高度同質。若按照常規做法把影像縮放到較小尺寸以遷就GPU視訊記憶體上限,微小的鈣化或腫塊等關鍵徵象會丟失;若保持高解析度,則又難以放入足夠大的訓練批次。
針對這些問題,論文提出TopKSigLIP。該模型在視覺編碼一側引入了一個名為TopK-Patch的模組,其核心思想是建立一個可微的取樣機制,讓模型從整幅高解析度乳腺X線影像中挑選出一組稀疏但資訊量最高的區域性圖塊,並以這些圖塊代替整圖進行訓練。TopK-Patch的學習目標不依賴外部檢測框標註,而是透過端到端訓練自行學會把注意力放到最可能包含病灶的區域。這樣一來,模型就能夠在GPU記憶體有限的情況下保留原生高解析度細節,同時也繞開了以往“解析度越高、批次越小”的兩難取捨。更重要的是,取樣得到的圖塊位置可以直接作為病灶定位的輸出,而不需要像常規可解釋性方法那樣在訓練後另行計算Grad-CAM。
在語言與圖文匹配一側,TopKSigLIP改變了傳統的對比學習目標。標準CLIP使用的對比損失會把同一個批次中不同的圖文對都視為負樣本,但在乳腺X線攝影篩查資料集中,大量報告描述的是相似的陰性或良性發現,這樣的做法會在語義上錯誤的推開本來相近的樣本。為了克服報告同質性帶來的噪聲,作者用Sup-sigmoid損失替代對比損失。Sup-sigmoid損失從SigLIP的sigmoid損失出發,利用結構化資料(如BI-RADS分級、密度分類或病理標籤)構造軟標籤,使模型在訓練時不僅看到“是否配對”的二值訊號,還能利用臨床標籤表達的相似程度。這種軟標籤機制有助於模型把語義相近的陰性報告視為弱正相關,而不是強行把它們拆成互斥類別。
實驗在內部與外部資料集上驗證了TopKSigLIP的有效性。在密度評估、BI-RADS分類、發現亞型和癌症預測等零樣本任務中,TopKSigLIP超過了現有的開源乳腺放射影像VLM以及通用醫學VLM;即便使用比基線小得多的視覺編碼器和更小的訓練批次,線上性探測評估下仍能保持競爭力。在病灶定位方面,TopK-Patch模組也明顯優於事後計算的Grad-CAM。此外,作者已公開程式碼與權重。論文由Young Seok Jeon及其他七位作者共同撰寫,於2026年9月2日提交至arXiv,編號為arXiv:2609.03085,目前歸類於計算機視覺與模式識別(cs.CV)方向。