AI News HubLIVE
站內改寫2 分鐘閱讀

美國宗教廣播轉錄文本大規模語料庫:基於網路流媒體錄音

研究人員構建了一個包含超過60億字轉錄文本的宗教廣播語料庫,覆蓋785個網路流媒體訊號,為分析宗教媒體中的社會政治議題和語音處理研究提供了重要資源。

來源arXiv Computational Linguistics作者: Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith

宗教廣播在美國是一種歷史悠久且影響廣泛的大眾傳媒形式,涵蓋了從地方牧師的佈道到全國性的宗教談話節目等多種內容。然而,由於缺乏大規模、高質量的轉錄資料,對宗教廣播內容的系統性分析一直受到限制。為了解決這一問題,來自美國的研究團隊構建了一個大規模的宗教廣播英語轉錄文本語料庫,相關論文以Data Descriptor的形式發表在arXiv上(arXiv:2607.26249),並將於2026年的IC2S2會議上進行展示。

該語料庫的資料收集過程設計精密。研究者們在2025年7月這一個月期間,從美國各地的785個不同網路流媒體中即時抓取錄音。他們採用了滾動式錄製策略,每15分鐘擷取一個片段,這些流媒體共同轉播了超過2000個AM和FM廣播電臺的訊號。經過一個月的連續採集,最終獲得了超過70萬個錄音片段,並生成了超過6000萬行經過說話人分割的語音轉錄文本。每個錄音片段都透過自動化的處理流水線進行語音識別和說話人分割,確保不同說話人的話語被準確區分。隨後,團隊使用大型語言模型對每個片段按照節目格式和討論主題進行自動分段和標註,從而為後續分析提供了結構化的後設資料。

語料庫以關聯表格的形式儲存,包括三個主要部分:流媒體後設資料(如電臺名稱、地理位置、所屬宗教傳統)、錄音後設資料(如錄製時間、片段時長)以及轉錄行資料(每行包含說話人ID、時間戳和轉錄文本)。這種結構使得研究者能夠便捷地檢索和關聯不同層次的資訊。

這一資源為多個研究領域開闢了新的可能性。首先,它支援對宗教廣播在不同地區和宗教傳統之間的差異進行描述性分析。其次,由於宗教媒體在美國社會政治討論中扮演著重要角色,該語料庫可以幫助研究者分析宗教廣播如何塑造和反映公眾對墮胎、移民、氣候變化等熱點議題的看法。最後,在語音處理領域,該語料庫為在代表性不足的領域(如非正式宗教演講)進行聲學模型訓練和評估提供了寶貴的資料基礎。論文的作者包括Samuel Bestvater等五位研究人員,他們表示該語料庫將免費向學術界開放,以促進計算社會科學、語言學和傳播學的交叉研究。