評估設計條件對專家與自動MeSH差異的影響:基於Cohen基準的詞袋與BiomedBERT對比研究
一項新研究系統比較了專家分配與自動分配的MeSH術語作為分類器特徵用於系統綜述篩選,發現明顯的差異高度依賴於評估設計,對基準解釋具有啓示意義。
系統綜述通常需要篩選數千篇摘要以識別相關研究,這是一個耗時且勞動密集的過程。為了優先處理這一過程,研究人員常使用分類器,其輸入經常藉助醫學主題詞(MeSH)進行增強。MeSH術語可由專業索引員在文章發表後數週或數月內手動分配,也可由自動工具即時生成。然而,這兩種來源作為分類器特徵的直接比較一直缺乏,且評估設計是否影響比較結果更是未曾被探討。
針對這一空白,Samuel M. Okoe-Mensah在arXiv(2607.21685)上發表了一項新研究,使用Cohen等人(2006)的藥物類基準,涵蓋他汀類藥物、阿片類藥物和ADHD三個主題,系統比較了專家分配與自動分配的MeSH術語在系統綜述篩選中的表現。該研究對詞袋邏輯迴歸分類器(七次運行)和BiomedBERT(五個種子)進行了深入表徵。
研究首先採用規範的5折全語料庫設計,結果顯示詞袋分類器在他汀類藥物主題上專家與自動MeSH的差異為+0.096 WSS@95%。然而,當語料庫大小調整至與較小主題匹配(n=803)時,這一差異降至+0.033,且95% bootstrap置信區間包含了零,表明統計不顯著。進一步採用10折交叉驗證且保持完整語料庫大小,差異進一步縮小至+0.021,置信區間勉強排除零。對於BiomedBERT,規範評估下的差異僅為+0.020,完全落在詞袋10折結果的抽樣噪聲範圍內。
功效分析進一步揭示,他汀類藥物大小的效應在阿片類藥物或ADHD主題的方差下無法被檢測到,這意味着這些主題上的零結果並非由於信息缺失,而是受限於實驗設計。此外,研究還發現一個表示不對稱性:當附加專家MeSH術語時,15.1%的他汀類藥物輸入超過了BiomedBERT的512個token限制,因此截斷可能導致Transformer模型差異更小,儘管本研究無法將這一效應與訓練量分離。
綜合而言,在使用Transformer或10折詞袋的篩選流程中,測試主題上的差異約為0.02 WSS@95%,置信區間至少在一端跨越零。這一發現強調,關於特徵來源的基準結論在評估設計的合理變化下可能發生顯著變化,從而為未來的系統綜述自動化研究提供了重要的方法論警示。