一種用於發展語言研究中方式動詞和結果動詞測量的可擴充套件工具
該研究提出了一種基於大語言模型和RoBERTa分類器的計算工具,用於在句子上下文中自動識別方式動詞和結果動詞,平均準確率達89.6%。該工具透過語言學提示生成標註資料,覆蓋436個動詞類別,為發展語言研究中的動詞語義分析提供了可擴充套件的測量方法。
近日,一項發表於arXiv的研究提出了一種可擴充套件的計算工具,用於自動測量句子中的方式動詞和結果動詞。該研究由Divyesh Pratap Singh等七位作者共同完成,論文標題為《A Scalable Tool for Measuring Manner and Result Verbs in Developmental Language Research》,於2026年5月15日提交至arXiv,論文編號為2605.16654。
在語言習得研究中,方式動詞(如“跑”)和結果動詞(如“到達”)編碼事件結構的不同方面,對理解兒童早期動詞學習具有重要意義。然而,由於缺乏大規模的標註資源,這一區分難以在大規模資料中測量。為此,研究者開發了一種基於大語言模型(LLM)的計算方法。
具體而言,研究團隊利用語言學的提示(prompts),透過大語言模型從MASC和InterCorp語料庫中生成句子級的標註資料。這些標註將VerbNet中原本覆蓋的部分擴充套件至436個動詞類別。隨後,他們基於這些標註訓練了一個RoBERTa分類器,並在三個獨立的黃金標準資料集上進行了評估,其中包括先前標註的樣本和新構建的專家標註集。實驗結果顯示,該模型的平均準確率達到89.6%,表現令人鼓舞。該論文共12頁,涉及計算與語言(cs.CL)以及人工智慧(cs.AI)兩個學科領域。
研究者指出,該工具作為可擴充套件的測量手段,能夠支援發展語言學及其他語言資料集中的動詞語義分析。不過,他們同時強調,對於邊界案例、混合方式/結果動詞以及下游發展應用場景,仍需進一步驗證。該工具的程式碼和資料已開放獲取,為相關領域研究人員提供了便利。