一种用于发展语言研究中方式动词和结果动词测量的可扩展工具
该研究提出了一种基于大语言模型和RoBERTa分类器的计算工具,用于在句子上下文中自动识别方式动词和结果动词,平均准确率达89.6%。该工具通过语言学提示生成标注数据,覆盖436个动词类别,为发展语言研究中的动词语义分析提供了可扩展的测量方法。
近日,一项发表于arXiv的研究提出了一种可扩展的计算工具,用于自动测量句子中的方式动词和结果动词。该研究由Divyesh Pratap Singh等七位作者共同完成,论文标题为《A Scalable Tool for Measuring Manner and Result Verbs in Developmental Language Research》,于2026年5月15日提交至arXiv,论文编号为2605.16654。
在语言习得研究中,方式动词(如“跑”)和结果动词(如“到达”)编码事件结构的不同方面,对理解儿童早期动词学习具有重要意义。然而,由于缺乏大规模的标注资源,这一区分难以在大规模数据中测量。为此,研究者开发了一种基于大语言模型(LLM)的计算方法。
具体而言,研究团队利用语言学的提示(prompts),通过大语言模型从MASC和InterCorp语料库中生成句子级的标注数据。这些标注将VerbNet中原本覆盖的部分扩展至436个动词类别。随后,他们基于这些标注训练了一个RoBERTa分类器,并在三个独立的黄金标准数据集上进行了评估,其中包括先前标注的样本和新构建的专家标注集。实验结果显示,该模型的平均准确率达到89.6%,表现令人鼓舞。该论文共12页,涉及计算与语言(cs.CL)以及人工智能(cs.AI)两个学科领域。
研究者指出,该工具作为可扩展的测量手段,能够支持发展语言学及其他语言数据集中的动词语义分析。不过,他们同时强调,对于边界案例、混合方式/结果动词以及下游发展应用场景,仍需进一步验证。该工具的代码和数据已开放获取,为相关领域研究人员提供了便利。