在一篇新发布的可复现研究中,作者 Yuvraj Verma 对机器学习界广泛使用的 ISOT/Kaggle「Fake and Real News」假新闻语料库提出了一个直接的问题:在这类数据集上动辄出现的 0.98 以上准确率与 F1 分数,究竟测的是什么?论文以一套透明的 TF-IDF 加线性分类器流程作为「测量仪器」,从三条泄漏通道和两种分布偏移协议对语料库进行系统审计,并公开了全部代码与推导出的数值。
审计的第一项发现指出,这个基准在某种程度上是退化的。研究者把文章正文完全丢弃,只把 subject 元数据字段喂给分类器,结果 F1 达到 1.000。原因是两个类别对应的 subject 彼此不相交,模型只要记住主题标签即可完美分类,与判断新闻真假毫无关系。这意味着在这一设定下,高分首先反映的是数据划分方式。
随后,作者逐一移除三条泄漏通道:subject 元数据;出现在 99.2% 真实文章中的通讯社来源标签;以及 6,251 篇重复文档——它们污染了朴素测试集的 19.4%。令人意外的是,全部清理之后 F1 仅下降 1.21 个点,从 0.9935 降到 0.9814。作者进一步检验残余信号的来源,发现它并非集中在少数「泄露答案」的词元上,而是弥散在整个文本的编辑风格之中:即使删掉权重最高的 1,000 个一元词元,F1 仍高达 0.926。换句话说,模型学到的是写作习惯,而不是事实核查能力。
第三项发现说明这种风格信号无法迁移。在主题不重叠的协议下,平均精度从 0.9995 跌至 0.9475,实际部署口径的 F1 从 0.9905 降到 0.8067;经过先验匹配分析后,仍确认存在 5.2 个点的真实判别力损失。相比之下,时间维度的迁移几乎不造成损失,说明脆弱之处主要来自话题分布的变化,而非时间漂移。
模型容量也不是解药。微调后的 DistilBERT 在分布内表现更强,F1 达 0.9993,但在主题偏移下退化得更严重,平均精度损失 12.9 个点,约为线性模型 5.2 个点的两倍多。当三个模型被迁移到独立的 LIAR 基准时,它们的排序能力都跌至接近随机水平,ROC-AUC 仅在 0.54 至 0.57 之间,没有任何一个能超过多数类基线。
作者据此得出结论:在该语料库内部取得的分数,量化的是来源与主题的可分性,而不是新闻的真实性;增加模型容量只会更好地利用这一捷径,而非绕开它。论文建议未来的研究把仅使用元数据的基线、小样本基线和主题不重叠基线作为低成本的常规诊断手段。该论文共 17 页,含 11 张图和 11 张表,实验脚本与机器可读结果均已随代码一并发布;论文于 2026 年 7 月 26 日提交至 arXiv,编号 arXiv:2609.25006,归类于计算与语言(cs.CL)及机器学习(cs.LG)。