AI News HubLIVE
站內改寫1 分鐘閱讀

線上社群中憂鬱症的認知語言指標:基於DistilBERT和全息約簡表示的分析

一項新研究結合認知語言特徵和DistilBERT嵌入,使用全息約簡表示(HRR)檢測線上文本中的憂鬱症,在Reddit帖子資料集上實現了0.94的宏F1分數,顯著優於傳統TF-IDF基線的0.80。

來源arXiv Computational Linguistics作者: Brian Van Steen

一項新的研究旨在透過分析線上社群中的語言模式來改進憂鬱症的自動檢測方法。該研究由Brian Van Steen完成,並提交至arXiv預印本庫,標題為《線上社群中憂鬱症的認知語言指標:基於DistilBERT和全息約簡表示的分析》。該論文於2026年4月15日提交,編號為arXiv:2606.00026,屬於計算與語言(cs.CL)領域。

研究基於Beck的抑鬱認知理論,將認知扭曲轉化為可量化的語言特徵。具體包括第一人稱代詞的使用密度、絕對化詞彙(如“總是”、“從不”)以及負面情感表達。這些特徵從Reddit上與憂鬱症相關的社群(如r/depression)和對照社群的帖子中提取。使用的資料集是Kaggle Reddit自殺與抑鬱檢測資料集的一個子集,該資料集包含標註為抑鬱或非抑鬱的帖子。

研究者比較了兩種分類流程:基線模型採用TF-IDF嵌入與樸素貝葉斯分類器;混合模型則將DistilBERT句子嵌入與全息約簡表示(HRR)向量拼接,HRR向量編碼了上述認知語言特徵,最後透過邏輯迴歸進行分類。全息約簡表示是一種將高維向量壓縮為低維向量的技術,能夠保留特徵之間的互動資訊。

實驗結果顯示,混合模型的宏F1分數達到0.94,而基線模型為0.80。在5折交叉驗證中,混合模型的F1從0.83提升至0.92,AUC從0.958提升至0.981。這一結果表明,將認知語言特徵與先進的嵌入方法相結合,能夠顯著提高憂鬱症檢測的準確性。該研究為利用語言學指標進行心理健康篩查提供了新的可能性,並強調了認知理論在自然語言處理中的應用價值。未來工作可進一步探索其他認知扭曲特徵(如過度概括、災難化思維)和不同社交媒體平臺的資料,以驗證模型的泛化能力。