跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

測量梵語文學語義變化的計算方法

文章摘要

一篇新論文探討歷時詞嵌入能否從現代高資源語言遷移到古梵語。作者構建了覆蓋四個經典時期的270萬詞元語料,用神經字節級連聲拆分器和詞形還原器恢復詞邊界,並按時期訓練嵌入。在21項可測試的語義變遷中,19項方向與文獻學考證一致(符號檢驗 p=0.00011)。

來源arXiv Computational Linguistics作者: Tanay Agrawal
測量梵語文學語義變化的計算方法
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 論文介紹:用計算方法測量梵語文獻中的語義變化

2026 年 7 月 31 日,arXiv 在 cs.CL(計算與語言)分類下發布了一篇新論文,標題為《A Computational Approach to Measuring Semantic Change in Sanskrit Literature》(一種測量梵語文獻語義變化的計算方法),作者是 Tanay Agrawal。論文編號為 arXiv:2609.25012v1,提交時間為 2026 年 7 月 31 日星期五 05:22:21 UTC,全文源文件約 34 KB。該論文的 DOI 為 10.48550/arXiv.2609.25012,由 DataCite 發放。論文主題分類為 Computation and Language(cs.CL)。

論文摘要指出,歷時詞嵌入(diachronic word embeddings)已經成為追蹤語義變化的現代標準方法,但這一範式此前主要在現代、高資源且分詞良好的語言上得到驗證。本文測試該範式能否遷移到梵語——一種古老、低資源的語言。梵語的特殊性在於:音系融合(sandhi,連聲)、形態屈折、複合構詞以及一詞多義等現象,給計算處理帶來獨特挑戰。

作者構建了一個包含 270 萬詞元(2.7M-token)的語料庫,覆蓋四個經典時期。為了恢復詞邊界,作者使用神經字節級 sandhi 切分器與詞形還原器(lemmatizer)。隨後,作者跨多種配置訓練了分時期詞嵌入。在評估系統時,作者從歷史學術研究中整理了一個驗證集,並使用錨點位移(anchor displacement)以方向性方式測試語義變化的恢復情況。在 21 個可測試的語義變化中,有 19 個朝着文獻學上得到證實的方向移動(符號檢驗,p=0.00011)。作者進一步展示了語言本身迫使系統採用哪種配置,並評論了改進機會。

需要説明的細節:該論文為預印本,尚不明確是否經過同行評審;摘要中未給出作者所屬機構;論文提供 PDF,以及實驗性 HTML 版本和 TeX 源碼。arXiv 頁面列出當前瀏覽上下文為 cs.CL,並標註為 2026-09 的 new/recent 條目。此外,頁面還提供參考文獻與引用工具(NASA ADS、Google Scholar、Semantic Scholar)、書目與引用工具、代碼與數據鏈接(alphaXiv、CatalyzeX、DagsHub、Gotit.pub、Hugging Face、ScienceCast)、演示與可複製工具(Replicate、Hugging Face Spaces、TXYZ.AI)以及相關論文推薦(Influence Flower、CORE Recommender)等。arXivLabs 部分説明,該框架允許合作者在 arXiv 網站上開發和分享新功能,參與的個人與組織均認同開放、社區、卓越和用户數據隱私等價值觀。

論文的核心貢獻可以概括為:首次系統性地將歷時詞嵌入範式應用於梵語,處理了該語言特有的 sandhi 切分、形態還原和複合詞問題;建立了覆蓋四個經典時期的 270 萬詞元語料;通過歷史學術驗證集和錨點位移方法進行方向性評估,得到了統計上顯著的結果。作者也坦承,該研究仍有改進空間,並指出哪些配置是語言特性所強制的。對於計算語言學、歷史語言學與數字人文交叉領域的研究者而言,這篇預印本提供了一個值得關注的案例:低資源、形態複雜、書寫與音系邊界模糊的古代語言,是否能夠用現代語義變化檢測工具加以研究。結論傾向於肯定,但方法細節、語料選擇、驗證集構建以及統計檢驗的穩健性,仍需後續工作進一步檢驗。

需要補充的是,該論文的摘要與正文鏈接均指向 arXiv 的 abs 頁面,用户可查看 PDF、實驗性 HTML 以及 TeX 源碼。論文提交歷史顯示,這是 v1 版本,由 Tanay Agrawal 提交,時間為 2026 年 7 月 31 日 05:22:21 UTC。頁面還提供“Change to browse by: cs”等導航選項,以及“Which authors of this paper are endorsers?”和“Disable MathJax”等功能鏈接。這些信息雖屬頁面元數據,但有助於理解論文的發佈背景與可獲取性。

展開要點與分析

文章情報

工程師進階

要點

  • 研究測試歷時詞嵌入在古梵語中的可遷移性
  • 構建270萬詞元、覆蓋四個經典時期的語料,並用神經方法恢復因連聲而模糊的詞邊界
  • 21項可測試語義變遷中19項方向與歷史文獻學證據一致,符號檢驗 p=0.00011
  • 論文還討論了梵語迫使採用何種嵌入配置以及改進空間

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。