在線社區中抑鬱症的認知語言指標:基於DistilBERT和全息約簡表示的分析
一項新研究結合認知語言特徵和DistilBERT嵌入,使用全息約簡表示(HRR)檢測在線文本中的抑鬱症,在Reddit帖子數據集上實現了0.94的宏F1分數,顯著優於傳統TF-IDF基線的0.80。
一項新的研究旨在通過分析在線社區中的語言模式來改進抑鬱症的自動檢測方法。該研究由Brian Van Steen完成,並提交至arXiv預印本庫,標題為《在線社區中抑鬱症的認知語言指標:基於DistilBERT和全息約簡表示的分析》。該論文於2026年4月15日提交,編號為arXiv:2606.00026,屬於計算與語言(cs.CL)領域。
研究基於Beck的抑鬱認知理論,將認知扭曲轉化為可量化的語言特徵。具體包括第一人稱代詞的使用密度、絕對化詞彙(如“總是”、“從不”)以及負面情感表達。這些特徵從Reddit上與抑鬱症相關的社區(如r/depression)和對照社區的帖子中提取。使用的數據集是Kaggle Reddit自殺與抑鬱檢測數據集的一個子集,該數據集包含標註為抑鬱或非抑鬱的帖子。
研究者比較了兩種分類流程:基線模型採用TF-IDF嵌入與樸素貝葉斯分類器;混合模型則將DistilBERT句子嵌入與全息約簡表示(HRR)向量拼接,HRR向量編碼了上述認知語言特徵,最後通過邏輯迴歸進行分類。全息約簡表示是一種將高維向量壓縮為低維向量的技術,能夠保留特徵之間的交互信息。
實驗結果顯示,混合模型的宏F1分數達到0.94,而基線模型為0.80。在5折交叉驗證中,混合模型的F1從0.83提升至0.92,AUC從0.958提升至0.981。這一結果表明,將認知語言特徵與先進的嵌入方法相結合,能夠顯著提高抑鬱症檢測的準確性。該研究為利用語言學指標進行心理健康篩查提供了新的可能性,並強調了認知理論在自然語言處理中的應用價值。未來工作可進一步探索其他認知扭曲特徵(如過度概括、災難化思維)和不同社交媒體平台的數據,以驗證模型的泛化能力。