タイムカプセル: 歴史的意味形成の方法としての生成的幻覚
ヴィクトリア朝時代のテキストのみで訓練された新しいAIモデルは、生成的幻覚が歴史的存在論を理解するための解釈ツールとしてどのように機能するかを示し、歴史的散文においてGPT-2と比較して45.4%のパープレキシティ削減を達成しつつ、機械生成された歴史的内容における真正性の危機を明らかにする。
最近、arXivに掲載された論文「タイムカプセル:歴史的意味形成の方法としての生成的幻覚」では、ヴィクトリア朝時代のテキストを専門に理解・生成する新しいAIモデルが提案されました。このモデルはTimeCapsuleと名付けられ、12億のパラメータを持つLLaMAスタイルの因果モデルであり、そのユニークな点は、訓練データを完全に1800年から1875年のヴィクトリア朝のテキストに限定し、時間的に孤立した生成アーカイブを構築したことです。
従来の大規模言語モデルは膨大な現代コーパスで訓練されるため、現代的な概念が符号化され、過去の信頼できる語り手としては不十分でした。TimeCapsuleは訓練データの範囲を制限することで、この時間的な過剰露出を回避しています。研究者らは、未来に対する構造的無知がモデルの幻覚を19世紀の存在論を探求する解釈的プローブに変えると主張しています。
定量的評価では、TimeCapsuleはヴィクトリア朝散文のホールドアウトセットにおいて、GPT-2ベースラインと比較して45.4%のパープレキシティ削減を達成し、歴史的テキストのモデリングにおける有効性を示しました。しかし、より大きな現代の因果モデルは、より広範な事前訓練により低い生のパープレキシティを達成するものの、時間的孤立性を欠いています。
注目すべき点として、このモデルは計算的な意味形成を示し、現代の馴染みのない概念に対して歴史的に妥当な類推的説明を生成します。例えば、コンピュータを「肥大化した肺」と表現し、これはヴィクトリア朝の認識枠組みを反映しています。研究者らはさらに、2人の人文科学者を対象とした質的解釈学的プローブ実験を実施しました。彼らは本物のヴィクトリア朝の抜粋とTimeCapsuleが生成したテキストを区別するよう求められました。結果は衝撃的で、本物のヴィクトリア朝の抜粋の約40%が機械生成と誤分類されました。この発見は、歴史的テキスト生成における真正性の危機を明らかにし、高度にリアルな擬似歴史的コンテンツを専門家でさえ識別が困難であることを示しています。
総括すると、TimeCapsuleは歴史研究に新しいツールを提供するだけでなく、AIの歴史的物語における役割について深い考察を促します。未来の知識を意図的に制限することで、研究者は通常欠陥とみなされる幻覚を生産的な解釈的プローブに変換し、歴史的存在論を理解するための新たな道を開いています。この研究は2026年の創造性と認知会議(C&C '26)に受理されました。