arXiv 论文介绍:用计算方法测量梵语文献中的语义变化
2026 年 7 月 31 日,arXiv 在 cs.CL(计算与语言)分类下发布了一篇新论文,标题为《A Computational Approach to Measuring Semantic Change in Sanskrit Literature》(一种测量梵语文献语义变化的计算方法),作者是 Tanay Agrawal。论文编号为 arXiv:2609.25012v1,提交时间为 2026 年 7 月 31 日星期五 05:22:21 UTC,全文源文件约 34 KB。该论文的 DOI 为 10.48550/arXiv.2609.25012,由 DataCite 发放。论文主题分类为 Computation and Language(cs.CL)。
论文摘要指出,历时词嵌入(diachronic word embeddings)已经成为追踪语义变化的现代标准方法,但这一范式此前主要在现代、高资源且分词良好的语言上得到验证。本文测试该范式能否迁移到梵语——一种古老、低资源的语言。梵语的特殊性在于:音系融合(sandhi,连声)、形态屈折、复合构词以及一词多义等现象,给计算处理带来独特挑战。
作者构建了一个包含 270 万词元(2.7M-token)的语料库,覆盖四个经典时期。为了恢复词边界,作者使用神经字节级 sandhi 切分器与词形还原器(lemmatizer)。随后,作者跨多种配置训练了分时期词嵌入。在评估系统时,作者从历史学术研究中整理了一个验证集,并使用锚点位移(anchor displacement)以方向性方式测试语义变化的恢复情况。在 21 个可测试的语义变化中,有 19 个朝着文献学上得到证实的方向移动(符号检验,p=0.00011)。作者进一步展示了语言本身迫使系统采用哪种配置,并评论了改进机会。
需要说明的细节:该论文为预印本,尚不明确是否经过同行评审;摘要中未给出作者所属机构;论文提供 PDF,以及实验性 HTML 版本和 TeX 源码。arXiv 页面列出当前浏览上下文为 cs.CL,并标注为 2026-09 的 new/recent 条目。此外,页面还提供参考文献与引用工具(NASA ADS、Google Scholar、Semantic Scholar)、书目与引用工具、代码与数据链接(alphaXiv、CatalyzeX、DagsHub、Gotit.pub、Hugging Face、ScienceCast)、演示与可复制工具(Replicate、Hugging Face Spaces、TXYZ.AI)以及相关论文推荐(Influence Flower、CORE Recommender)等。arXivLabs 部分说明,该框架允许合作者在 arXiv 网站上开发和分享新功能,参与的个人与组织均认同开放、社区、卓越和用户数据隐私等价值观。
论文的核心贡献可以概括为:首次系统性地将历时词嵌入范式应用于梵语,处理了该语言特有的 sandhi 切分、形态还原和复合词问题;建立了覆盖四个经典时期的 270 万词元语料;通过历史学术验证集和锚点位移方法进行方向性评估,得到了统计上显著的结果。作者也坦承,该研究仍有改进空间,并指出哪些配置是语言特性所强制的。对于计算语言学、历史语言学与数字人文交叉领域的研究者而言,这篇预印本提供了一个值得关注的案例:低资源、形态复杂、书写与音系边界模糊的古代语言,是否能够用现代语义变化检测工具加以研究。结论倾向于肯定,但方法细节、语料选择、验证集构建以及统计检验的稳健性,仍需后续工作进一步检验。
需要补充的是,该论文的摘要与正文链接均指向 arXiv 的 abs 页面,用户可查看 PDF、实验性 HTML 以及 TeX 源码。论文提交历史显示,这是 v1 版本,由 Tanay Agrawal 提交,时间为 2026 年 7 月 31 日 05:22:21 UTC。页面还提供“Change to browse by: cs”等导航选项,以及“Which authors of this paper are endorsers?”和“Disable MathJax”等功能链接。这些信息虽属页面元数据,但有助于理解论文的发布背景与可获取性。