在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析
一项新研究结合认知语言特征和DistilBERT嵌入,使用全息约简表示(HRR)检测在线文本中的抑郁症,在Reddit帖子数据集上实现了0.94的宏F1分数,显著优于传统TF-IDF基线的0.80。
一项新的研究旨在通过分析在线社区中的语言模式来改进抑郁症的自动检测方法。该研究由Brian Van Steen完成,并提交至arXiv预印本库,标题为《在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析》。该论文于2026年4月15日提交,编号为arXiv:2606.00026,属于计算与语言(cs.CL)领域。
研究基于Beck的抑郁认知理论,将认知扭曲转化为可量化的语言特征。具体包括第一人称代词的使用密度、绝对化词汇(如“总是”、“从不”)以及负面情感表达。这些特征从Reddit上与抑郁症相关的社区(如r/depression)和对照社区的帖子中提取。使用的数据集是Kaggle Reddit自杀与抑郁检测数据集的一个子集,该数据集包含标注为抑郁或非抑郁的帖子。
研究者比较了两种分类流程:基线模型采用TF-IDF嵌入与朴素贝叶斯分类器;混合模型则将DistilBERT句子嵌入与全息约简表示(HRR)向量拼接,HRR向量编码了上述认知语言特征,最后通过逻辑回归进行分类。全息约简表示是一种将高维向量压缩为低维向量的技术,能够保留特征之间的交互信息。
实验结果显示,混合模型的宏F1分数达到0.94,而基线模型为0.80。在5折交叉验证中,混合模型的F1从0.83提升至0.92,AUC从0.958提升至0.981。这一结果表明,将认知语言特征与先进的嵌入方法相结合,能够显著提高抑郁症检测的准确性。该研究为利用语言学指标进行心理健康筛查提供了新的可能性,并强调了认知理论在自然语言处理中的应用价值。未来工作可进一步探索其他认知扭曲特征(如过度概括、灾难化思维)和不同社交媒体平台的数据,以验证模型的泛化能力。