评估设计条件对专家与自动MeSH差异的影响:基于Cohen基准的词袋与BiomedBERT对比研究
一项新研究系统比较了专家分配与自动分配的MeSH术语作为分类器特征用于系统综述筛选,发现明显的差异高度依赖于评估设计,对基准解释具有启示意义。
系统综述通常需要筛选数千篇摘要以识别相关研究,这是一个耗时且劳动密集的过程。为了优先处理这一过程,研究人员常使用分类器,其输入经常借助医学主题词(MeSH)进行增强。MeSH术语可由专业索引员在文章发表后数周或数月内手动分配,也可由自动工具即时生成。然而,这两种来源作为分类器特征的直接比较一直缺乏,且评估设计是否影响比较结果更是未曾被探讨。
针对这一空白,Samuel M. Okoe-Mensah在arXiv(2607.21685)上发表了一项新研究,使用Cohen等人(2006)的药物类基准,涵盖他汀类药物、阿片类药物和ADHD三个主题,系统比较了专家分配与自动分配的MeSH术语在系统综述筛选中的表现。该研究对词袋逻辑回归分类器(七次运行)和BiomedBERT(五个种子)进行了深入表征。
研究首先采用规范的5折全语料库设计,结果显示词袋分类器在他汀类药物主题上专家与自动MeSH的差异为+0.096 WSS@95%。然而,当语料库大小调整至与较小主题匹配(n=803)时,这一差异降至+0.033,且95% bootstrap置信区间包含了零,表明统计不显著。进一步采用10折交叉验证且保持完整语料库大小,差异进一步缩小至+0.021,置信区间勉强排除零。对于BiomedBERT,规范评估下的差异仅为+0.020,完全落在词袋10折结果的抽样噪声范围内。
功效分析进一步揭示,他汀类药物大小的效应在阿片类药物或ADHD主题的方差下无法被检测到,这意味着这些主题上的零结果并非由于信息缺失,而是受限于实验设计。此外,研究还发现一个表示不对称性:当附加专家MeSH术语时,15.1%的他汀类药物输入超过了BiomedBERT的512个token限制,因此截断可能导致Transformer模型差异更小,尽管本研究无法将这一效应与训练量分离。
综合而言,在使用Transformer或10折词袋的筛选流程中,测试主题上的差异约为0.02 WSS@95%,置信区间至少在一端跨越零。这一发现强调,关于特征来源的基准结论在评估设计的合理变化下可能发生显著变化,从而为未来的系统综述自动化研究提供了重要的方法论警示。