超越情感分类:一种用于文本情感强度评估的生成框架
本研究提出了一种新的情感建模方法,将焦点从识别转向评估,通过构建情感强度分数数据集并微调开放权重生成语言模型输出0-100的连续值,展示了比分类基线更富有表现力和通用性的框架,特别适用于金融等领域。
在自然语言处理(NLP)领域,情感分析通常依赖于将文本划分为积极、消极或中性等离散类别。然而,这种方法在需要精确衡量情感程度的场景中显得力不从心,尤其是金融领域,情绪强度的细微变化可能对市场走向产生重大影响。近日,研究人员在arXiv上提交了一篇题为《超越情感分类:一种用于文本情感强度评估的生成框架》的论文,提出了一种全新的情感建模方法,将焦点从情感识别转向情感强度评估。
该研究由Francesco A. Fabozzi等人领导,他们构建了一个情感强度分数数据集,并利用开放权重的生成语言模型(如LLaMA等)进行微调,使其能够输出0到100之间的连续值。这种连续输出不仅比传统的分类基线更具表现力,还展现出令人惊讶的泛化能力,能够迁移到情感和唤醒水平等相关概念上。实验结果表明,该框架在多个任务上优于离散分类方法,尤其适用于金融领域,其中情绪的程度比类别更能影响决策。
论文还详细介绍了数据集构建过程,包括从金融新闻、社交媒体等来源收集文本,并由标注人员为每段文本分配一个0-100的情感强度分数。微调过程使用了LoRA等参数高效微调技术,以确保模型的适应性和效率。研究团队发现,该模型不仅能准确评估已见的情感强度,还能对未见过的文本进行合理评分,显示出较强的迁移学习能力。
这项工作的意义在于,它推动了NLP的跨学科重构,将情感分析从简单的分类问题提升为更精细的评估问题。对于金融从业者而言,这种框架可以直接用于市场情绪分析、风险评估和投资决策支持。此外,由于采用开放权重的模型,该框架具有较好的可访问性和可复制性,有助于学术界和工业界的进一步研究。
总之,这项研究为情感分析领域提供了一种新的范式,有望在多个应用场景中取代传统的分类方法,特别是在需要量化情感强度的领域。