用於前列腺組織病理學的病理學家注意力對齊報告生成
該研究引入病理學家注意力來訓練報告生成模型,通過收集121例前列腺全切片圖像的多模態注意力數據集,優化模型注意力對齊,提升了報告生成和視覺問答的性能。
在癌症診斷過程中,病理學家從全切片圖像(WSI)中提取關鍵信息的能力高度依賴於他們的視覺注意力分配。這一選擇性過程不僅影響診斷準確性,也為自動化報告生成提供了重要線索。近日,一項由Ruoyu Xue等15位研究者完成的工作,首次將病理學家的視覺注意力引入報告生成模型的訓練中,相關論文已被MICCAI 2026接收。
研究團隊構建了一個包含121例前列腺WSI的多模態人類注意力數據集。他們在五位病理學家對切片進行診斷時,同步記錄了多尺度視口軌跡、口頭描述和光標移動,覆蓋了Gleason分級模式等五個臨牀相關組件。這一精細的註釋方式為模型學習人類的診斷關注點提供了豐富的基礎。
在此基礎上,研究者採用注意力對齊損失對兩個現有的報告生成模型進行微調。該損失函數通過正則化模型在圖像塊上的注意力分佈,使其儘量接近病理學家的注意力分佈。實驗中,兩種模型採用了不同的內部注意力機制(即圖像令牌整合到語言解碼器的方式),從而驗證了方法的通用性。
評估結果顯示,該方法在前列腺癌報告生成和視覺問答任務上均取得顯著提升。基於NLP的指標(如BLEU、ROUGE)平均提升了10.9%,而針對五個臨牀相關報告組件的準確率提高了19.3%。值得一提的是,模型在推理時提取的注意力圖(僅需極小的額外計算開銷)與病理學家的實際注意力更加一致。這使得生成的報告能夠清晰突出對輸出影響最大的圖像區域,為臨牀決策提供了更強的可解釋性和視覺支持。
這項研究不僅證明了將人類專家注意力嵌入深度學習模型的有效性,也為人工智能輔助病理診斷開闢了新路徑。未來,該方法有望推廣至其他癌症類型和更廣泛的醫療影像分析任務中,從而提升自動化報告的質量和可信度。