美国宗教广播转录文本大规模语料库:基于网络流媒体录音
研究人员构建了一个包含超过60亿字转录文本的宗教广播语料库,覆盖785个网络流媒体信号,为分析宗教媒体中的社会政治议题和语音处理研究提供了重要资源。
宗教广播在美国是一种历史悠久且影响广泛的大众传媒形式,涵盖了从地方牧师的布道到全国性的宗教谈话节目等多种内容。然而,由于缺乏大规模、高质量的转录数据,对宗教广播内容的系统性分析一直受到限制。为了解决这一问题,来自美国的研究团队构建了一个大规模的宗教广播英语转录文本语料库,相关论文以Data Descriptor的形式发表在arXiv上(arXiv:2607.26249),并将于2026年的IC2S2会议上进行展示。
该语料库的数据收集过程设计精密。研究者们在2025年7月这一个月期间,从美国各地的785个不同网络流媒体中实时抓取录音。他们采用了滚动式录制策略,每15分钟截取一个片段,这些流媒体共同转播了超过2000个AM和FM广播电台的信号。经过一个月的连续采集,最终获得了超过70万个录音片段,并生成了超过6000万行经过说话人分割的语音转录文本。每个录音片段都通过自动化的处理流水线进行语音识别和说话人分割,确保不同说话人的话语被准确区分。随后,团队使用大型语言模型对每个片段按照节目格式和讨论主题进行自动分段和标注,从而为后续分析提供了结构化的元数据。
语料库以关联表格的形式存储,包括三个主要部分:流媒体元数据(如电台名称、地理位置、所属宗教传统)、录音元数据(如录制时间、片段时长)以及转录行数据(每行包含说话人ID、时间戳和转录文本)。这种结构使得研究者能够便捷地检索和关联不同层次的信息。
这一资源为多个研究领域开辟了新的可能性。首先,它支持对宗教广播在不同地区和宗教传统之间的差异进行描述性分析。其次,由于宗教媒体在美国社会政治讨论中扮演着重要角色,该语料库可以帮助研究者分析宗教广播如何塑造和反映公众对堕胎、移民、气候变化等热点议题的看法。最后,在语音处理领域,该语料库为在代表性不足的领域(如非正式宗教演讲)进行声学模型训练和评估提供了宝贵的数据基础。论文的作者包括Samuel Bestvater等五位研究人员,他们表示该语料库将免费向学术界开放,以促进计算社会科学、语言学和传播学的交叉研究。