AI News HubLIVE
站內改寫1 分鐘閱讀

一種用於發展語言研究中方式動詞和結果動詞測量的可擴展工具

該研究提出了一種基於大語言模型和RoBERTa分類器的計算工具,用於在句子上下文中自動識別方式動詞和結果動詞,平均準確率達89.6%。該工具通過語言學提示生成標註數據,覆蓋436個動詞類別,為發展語言研究中的動詞語義分析提供了可擴展的測量方法。

來源arXiv Computational Linguistics作者: Divyesh Pratap Singh, Dakshesh Gusain, Federica Bulgarelli, Alison Eisel Hendricks, John Beavers, Nathan M. Beers, Ifeoma Nwogu

近日,一項發表於arXiv的研究提出了一種可擴展的計算工具,用於自動測量句子中的方式動詞和結果動詞。該研究由Divyesh Pratap Singh等七位作者共同完成,論文標題為《A Scalable Tool for Measuring Manner and Result Verbs in Developmental Language Research》,於2026年5月15日提交至arXiv,論文編號為2605.16654。

在語言習得研究中,方式動詞(如“跑”)和結果動詞(如“到達”)編碼事件結構的不同方面,對理解兒童早期動詞學習具有重要意義。然而,由於缺乏大規模的標註資源,這一區分難以在大規模數據中測量。為此,研究者開發了一種基於大語言模型(LLM)的計算方法。

具體而言,研究團隊利用語言學的提示(prompts),通過大語言模型從MASC和InterCorp語料庫中生成句子級的標註數據。這些標註將VerbNet中原本覆蓋的部分擴展至436個動詞類別。隨後,他們基於這些標註訓練了一個RoBERTa分類器,並在三個獨立的黃金標準數據集上進行了評估,其中包括先前標註的樣本和新構建的專家標註集。實驗結果顯示,該模型的平均準確率達到89.6%,表現令人鼓舞。該論文共12頁,涉及計算與語言(cs.CL)以及人工智能(cs.AI)兩個學科領域。

研究者指出,該工具作為可擴展的測量手段,能夠支持發展語言學及其他語言數據集中的動詞語義分析。不過,他們同時強調,對於邊界案例、混合方式/結果動詞以及下游發展應用場景,仍需進一步驗證。該工具的代碼和數據已開放獲取,為相關領域研究人員提供了便利。