本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

サンスクリット文学における意味変化を測定する計算手法

記事の要約

新しい論文は、現代の高資源言語で主に検証されてきた通時的な単語埋め込みが、古代の低資源言語であるサンスクリット語の意味変化を追跡できるかを検証する。著者は4つの正典期にわたる270万トークンのコーパスを構築し、ニューラルなバイトレベルのサンディ分割器と見出し語化器で単語境界を復元し、時期別の埋め込みを訓練した。検証可能な21の変化のうち19が文献学で裏付けられた方向に動いた(符号検定 p=0.00011)。

ソースarXiv Computational Linguistics著者: Tanay Agrawal
サンスクリット文学における意味変化を測定する計算手法
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

arXiv論文解説:サンスクリット文献における意味変化を計算的に測定する試み

2026年7月31日、arXivのcs.CL(計算と言語)カテゴリに、Tanay Agrawal氏による論文「A Computational Approach to Measuring Semantic Change in Sanskrit Literature(サンスクリット文献における意味変化を測定する計算的アプローチ)」が公開された。論文番号はarXiv:2609.25012v1、投稿日時は2026年7月31日金曜日05:22:21 UTC、全文ソースは約34KB。DOIは10.48550/arXiv.2609.25012で、DataCiteにより付与されている。主題分類はComputation and Language(cs.CL)である。

論文の要旨によれば、通時的な単語埋め込み(diachronic word embeddings)は意味変化を追跡する現代の標準手法となっているが、これまでは主に現代の高リソースかつ分かち書きが整った言語で検証されてきた。本論文は、そのパラダイムがサンスクリット語に転用できるかを検証する。サンスクリット語は古い低リソース言語であり、音韻融合(sandhi、連声)、形態的屈折、複合語形成、多義性といった特徴が独自の課題をもたらす。

著者は4つの正典的時期にまたがる270万トークン(2.7M-token)のコーパスを構築し、神経ネットワークによるバイトレベルのsandhi分割器と見出し語化器(lemmatizer)を用いて語の境界を復元した。その上で、時期ごとの埋め込みを複数の構成で訓練した。評価では、歴史学術研究から検証セットを整備し、アンカー変位(anchor displacement)によって方向性をもって意味変化の復元を検証した。検証可能な21の変化のうち19が文献学上裏付けられた方向に動いた(符号検定、p=0.00011)。著者はさらに、言語がどの構成を強制するかを示し、改善の余地について論じている。

注意すべき点として、本論文はプレプリントであり、査読を経たかは不明である。要旨には著者の所属機関は記載されていない。arXivページではPDF、実験的なHTML版、TeXソースが提供されている。現在の閲覧コンテキストはcs.CLで、2026-09のnew/recent項目として表示されている。また、参考文献・引用ツール(NASA ADS、Google Scholar、Semantic Scholar)、書誌・引用ツール、コードとデータへのリンク(alphaXiv、CatalyzeX、DagsHub、Gotit.pub、Hugging Face、ScienceCast)、デモと再現ツール(Replicate、Hugging Face Spaces、TXYZ.AI)、関連論文推薦(Influence Flower、CORE Recommender)なども提供されている。arXivLabsの説明では、この枠組みが協力者によるarXivの新機能の開発・共有を可能にし、参加する個人と組織が開放性、コミュニティ、卓越性、ユーザーデータのプライバシーといった価値観を受け入れているとしている。

本研究の中心的貢献は、通時的単語埋め込みのパラダイムをサンスクリット語に体系的に適用した点にある。sandhi分割、形態復元、複合語処理という言語固有の問題に対処し、4つの正典的時期を覆う270万トークンのコーパスを構築した。歴史学術に基づく検証セットとアンカー変位による方向性評価により、統計的に有意な結果を得た。著者自身も改善の余地があると認め、どの構成が言語特性によって強制されるかを指摘している。計算言語学、歴史言語学、デジタル・ヒューマニティーズの交差領域の研究者にとって、このプレプリントは注目に値する事例を提供する。すなわち、低リソースで形態的に複雑、書記と音韻の境界が曖昧な古代語を、現代の意味変化検出ツールで研究できるのかという問いである。結論は肯定的な方向にあるが、手法の詳細、コーパス選択、検証セットの構築、統計検定の頑健性については、今後の研究によるさらなる検証が必要である。

補足すると、投稿履歴にはv1のみが記録され、Tanay Agrawal氏による2026年7月31日05:22:21 UTCの投稿であることが示されている。ページには「Change to browse by: cs」といったナビゲーションや、「Which authors of this paper are endorsers?」「Disable MathJax」などの機能リンクも用意されている。これらのメタデータは、論文の公開背景とアクセス可能性を理解する助けとなる。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 通時的な単語埋め込みが古代の低資源言語サンスクリット語に転移するかを検証
  • 4つの正典期にわたる270万トークンのコーパスを構築し、ニューラルなバイトレベルのサンディ分割器と見出し語化器で単語境界を復元
  • 検証可能な21の変化のうち19が文献学で裏付けられた方向と一致(符号検定 p=0.00011)
  • サンスクリット語が要請する設定と改善の余地についても論じる

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。