CHiPS:基于字符直方图和位置信号的轻量级罗马尼亚语作者归属方法
研究人员提出了CHiPS,一种轻量级的字符级作者归属方法,专门针对罗马尼亚语文本。该方法结合了字符直方图分类器(CH-SVM)和位置信号分类器(FFT12-LR),无需分词、句法分析、预训练语言模型或Transformer微调。在封闭集实验中,CHiPS-F在400个文件数据集上达到0.9310的准确率,但作者强调其贡献不在于最佳分类性能,而在于研究在严格泄漏控制下,受限且透明的字符证据能达到何种程度。
arXiv发表了一项关于轻量级作者归属方法的研究,该研究针对罗马尼亚语文本,提出了名为CHiPS的字符级方法。该方法由Sanda-Maria Avram和George C. Țurcaș提出,旨在通过简单、透明的字符特征进行作者身份识别,避免使用复杂的深度学习和自然语言处理技术。
CHiPS方法由两个互补的组成部分构成:CH-SVM是基于单字符边际分布的字符直方图分类器,而FFT12-LR则通过将选定字符和标点类表示为脉冲序列(即字符位置上的二进制指示序列),并提取傅里叶/韦尔奇频谱描述符,进行位置信号分类。研究者还报告了CHiPS-F,一种泄漏安全的决策级融合变体,以及一个可选的top-5列表重排序器,该重排序器仅基于折叠外预测进行训练。该方法不需要分词、句法分析、预训练语言模型或Transformer微调,且在直方图部分避免使用字符n-gram特征(n≥2)。
实验设定为封闭集,即测试文本的真实作者一定存在于训练数据的候选作者中。在锁定的分组ROST数据集上,包含来自392个源文本组的400个文件,由10位作者撰写,通过源文本级评估和分组五折模型选择,CHiPS-F达到了0.9310的准确率和0.9341的宏F1分数。然而,研究团队指出,一种使用不受限制的字符2-5元组TF-IDF SVM对比方法在同一测试集上达到了1.0000的准确率和宏F1分数。因此,该研究的贡献不在于宣称最佳分类性能,而在于探究在严格泄漏控制下,受限且透明的字符证据究竟能达到何种效果。
在另一个辅助数据集ROStories-cleaned上,包含来自1240个源文本组的1248个文件,由19位作者撰写,采用相同实验协议,CHiPS-R达到了0.8919的准确率和0.8708的宏F1分数。这些结果表明,即使只使用最基本的字符级特征,在适当的实验设计下也能取得有竞争力的作者归属结果,为未来在资源有限或需要高度可解释性的场景下应用作者归属技术提供了参考。