AI News HubLIVE
站內改寫1 分鐘閱讀

CHiPS:基於字元直方圖和位置訊號的輕量級羅馬尼亞語作者歸屬方法

研究人員提出了CHiPS,一種輕量級的字元級作者歸屬方法,專門針對羅馬尼亞語文本。該方法結合了字元直方圖分類器(CH-SVM)和位置訊號分類器(FFT12-LR),無需分詞、句法分析、預訓練語言模型或Transformer微調。在封閉集實驗中,CHiPS-F在400個檔案資料集上達到0.9310的準確率,但作者強調其貢獻不在於最佳分類效能,而在於研究在嚴格洩漏控制下,受限且透明的字元證據能達到何種程度。

來源arXiv Computational Linguistics作者: Sanda-Maria Avram, George C. \c{T}urca\c{s}

arXiv發表了一項關於輕量級作者歸屬方法的研究,該研究針對羅馬尼亞語文本,提出了名為CHiPS的字元級方法。該方法由Sanda-Maria Avram和George C. Țurcaș提出,旨在透過簡單、透明的字元特徵進行作者身份識別,避免使用複雜的深度學習和自然語言處理技術。

CHiPS方法由兩個互補的組成部分構成:CH-SVM是基於單字元邊際分佈的字元直方圖分類器,而FFT12-LR則透過將選定字元和標點類表示為脈衝序列(即字元位置上的二進位制指示序列),並提取傅立葉/韋爾奇頻譜描述符,進行位置訊號分類。研究者還報告了CHiPS-F,一種洩漏安全的決策級融合變體,以及一個可選的top-5列表重排序器,該重排序器僅基於摺疊外預測進行訓練。該方法不需要分詞、句法分析、預訓練語言模型或Transformer微調,且在直方圖部分避免使用字元n-gram特徵(n≥2)。

實驗設定為封閉集,即測試文本的真實作者一定存在於訓練資料的候選作者中。在鎖定的分組ROST資料集上,包含來自392個源文本組的400個檔案,由10位作者撰寫,透過源文本級評估和分組五折模型選擇,CHiPS-F達到了0.9310的準確率和0.9341的宏F1分數。然而,研究團隊指出,一種使用不受限制的字元2-5元組TF-IDF SVM對比方法在同一測試集上達到了1.0000的準確率和宏F1分數。因此,該研究的貢獻不在於宣稱最佳分類效能,而在於探究在嚴格洩漏控制下,受限且透明的字元證據究竟能達到何種效果。

在另一個輔助資料集ROStories-cleaned上,包含來自1240個源文本組的1248個檔案,由19位作者撰寫,採用相同實驗協議,CHiPS-R達到了0.8919的準確率和0.8708的宏F1分數。這些結果表明,即使只使用最基本的字元級特徵,在適當的實驗設計下也能取得有競爭力的作者歸屬結果,為未來在資源有限或需要高度可解釋性的場景下應用作者歸屬技術提供了參考。