arXiv 論文介紹:用計算方法測量梵語文獻中的語義變化
2026 年 7 月 31 日,arXiv 在 cs.CL(計算與語言)分類下發布了一篇新論文,標題為《A Computational Approach to Measuring Semantic Change in Sanskrit Literature》(一種測量梵語文獻語義變化的計算方法),作者是 Tanay Agrawal。論文編號為 arXiv:2609.25012v1,提交時間為 2026 年 7 月 31 日星期五 05:22:21 UTC,全文原始檔約 34 KB。該論文的 DOI 為 10.48550/arXiv.2609.25012,由 DataCite 發放。論文主題分類為 Computation and Language(cs.CL)。
論文摘要指出,歷時詞嵌入(diachronic word embeddings)已經成為追蹤語義變化的現代標準方法,但這一正規化此前主要在現代、高資源且分詞良好的語言上得到驗證。本文測試該正規化能否遷移到梵語——一種古老、低資源的語言。梵語的特殊性在於:音系融合(sandhi,連聲)、形態屈折、複合構詞以及一詞多義等現象,給計算處理帶來獨特挑戰。
作者構建了一個包含 270 萬詞元(2.7M-token)的語料庫,覆蓋四個經典時期。為了恢復詞邊界,作者使用神經位元組級 sandhi 切分器與詞形還原器(lemmatizer)。隨後,作者跨多種配置訓練了分時期詞嵌入。在評估系統時,作者從歷史學術研究中整理了一個驗證集,並使用錨點位移(anchor displacement)以方向性方式測試語義變化的恢復情況。在 21 個可測試的語義變化中,有 19 個朝著文獻學上得到證實的方向移動(符號檢驗,p=0.00011)。作者進一步展示了語言本身迫使系統採用哪種配置,並評論了改進機會。
需要說明的細節:該論文為預印本,尚不明確是否經過同行評審;摘要中未給出作者所屬機構;論文提供 PDF,以及實驗性 HTML 版本和 TeX 原始碼。arXiv 頁面列出當前瀏覽上下文為 cs.CL,並標註為 2026-09 的 new/recent 條目。此外,頁面還提供參考文獻與引用工具(NASA ADS、Google Scholar、Semantic Scholar)、書目與引用工具、程式碼與資料連結(alphaXiv、CatalyzeX、DagsHub、Gotit.pub、Hugging Face、ScienceCast)、演示與可複製工具(Replicate、Hugging Face Spaces、TXYZ.AI)以及相關論文推薦(Influence Flower、CORE Recommender)等。arXivLabs 部分說明,該框架允許合作者在 arXiv 網站上開發和分享新功能,參與的個人與組織均認同開放、社群、卓越和使用者資料隱私等價值觀。
論文的核心貢獻可以概括為:首次系統性地將歷時詞嵌入正規化應用於梵語,處理了該語言特有的 sandhi 切分、形態還原和複合詞問題;建立了覆蓋四個經典時期的 270 萬詞元語料;透過歷史學術驗證集和錨點位移方法進行方向性評估,得到了統計上顯著的結果。作者也坦承,該研究仍有改進空間,並指出哪些配置是語言特性所強制的。對於計算語言學、歷史語言學與數字人文交叉領域的研究者而言,這篇預印本提供了一個值得關注的案例:低資源、形態複雜、書寫與音系邊界模糊的古代語言,是否能夠用現代語義變化檢測工具加以研究。結論傾向於肯定,但方法細節、語料選擇、驗證集構建以及統計檢驗的穩健性,仍需後續工作進一步檢驗。
需要補充的是,該論文的摘要與正文連結均指向 arXiv 的 abs 頁面,使用者可檢視 PDF、實驗性 HTML 以及 TeX 原始碼。論文提交歷史顯示,這是 v1 版本,由 Tanay Agrawal 提交,時間為 2026 年 7 月 31 日 05:22:21 UTC。頁面還提供“Change to browse by: cs”等導航選項,以及“Which authors of this paper are endorsers?”和“Disable MathJax”等功能連結。這些資訊雖屬頁面後設資料,但有助於理解論文的釋出背景與可獲取性。