美國宗教廣播轉錄文本大規模語料庫:基於網絡流媒體錄音
研究人員構建了一個包含超過60億字轉錄文本的宗教廣播語料庫,覆蓋785個網絡流媒體信號,為分析宗教媒體中的社會政治議題和語音處理研究提供了重要資源。
宗教廣播在美國是一種歷史悠久且影響廣泛的大眾傳媒形式,涵蓋了從地方牧師的佈道到全國性的宗教談話節目等多種內容。然而,由於缺乏大規模、高質量的轉錄數據,對宗教廣播內容的系統性分析一直受到限制。為了解決這一問題,來自美國的研究團隊構建了一個大規模的宗教廣播英語轉錄文本語料庫,相關論文以Data Descriptor的形式發表在arXiv上(arXiv:2607.26249),並將於2026年的IC2S2會議上進行展示。
該語料庫的數據收集過程設計精密。研究者們在2025年7月這一個月期間,從美國各地的785個不同網絡流媒體中實時抓取錄音。他們採用了滾動式錄製策略,每15分鐘截取一個片段,這些流媒體共同轉播了超過2000個AM和FM廣播電台的信號。經過一個月的連續採集,最終獲得了超過70萬個錄音片段,並生成了超過6000萬行經過説話人分割的語音轉錄文本。每個錄音片段都通過自動化的處理流水線進行語音識別和説話人分割,確保不同説話人的話語被準確區分。隨後,團隊使用大型語言模型對每個片段按照節目格式和討論主題進行自動分段和標註,從而為後續分析提供了結構化的元數據。
語料庫以關聯表格的形式存儲,包括三個主要部分:流媒體元數據(如電台名稱、地理位置、所屬宗教傳統)、錄音元數據(如錄製時間、片段時長)以及轉錄行數據(每行包含説話人ID、時間戳和轉錄文本)。這種結構使得研究者能夠便捷地檢索和關聯不同層次的信息。
這一資源為多個研究領域開闢了新的可能性。首先,它支持對宗教廣播在不同地區和宗教傳統之間的差異進行描述性分析。其次,由於宗教媒體在美國社會政治討論中扮演着重要角色,該語料庫可以幫助研究者分析宗教廣播如何塑造和反映公眾對墮胎、移民、氣候變化等熱點議題的看法。最後,在語音處理領域,該語料庫為在代表性不足的領域(如非正式宗教演講)進行聲學模型訓練和評估提供了寶貴的數據基礎。論文的作者包括Samuel Bestvater等五位研究人員,他們表示該語料庫將免費向學術界開放,以促進計算社會科學、語言學和傳播學的交叉研究。