在印度的宗教节日、政治集会与大型文化聚会中,信息往往以极快速度扩散,而其中夹杂的虚假内容也可能迅速演变为公共安全隐患。大规模聚会场景一旦出现谣言,轻则引起恐慌,重则威胁公共安全,并侵蚀社会信任。针对这些风险,自动虚假新闻检测研究虽然一直在推进,但既有数据集大多以通用社交媒体场景为主,较少反映印度特有的社会文化脉络与事件联动特征。一篇新提交至 arXiv 的论文提出了 BharatGather,尝试以专门面向印度大型集会生态的数据集来弥补这一缺口。
BharatGather 是一个经过策划的多来源数据集,用于印度大型集会场景中的二元错误信息分类,即将内容判定为真实或虚假两类。数据集共包含 14,646 条记录,构建过程并非依赖单一渠道,而是采用了一条混合流水线:团队首先对多个重要事实核查平台进行系统性的网页抓取,随后抽取来自视频、音频等多媒体的转录文本,最后再利用大语言模型(LLM)进行合成数据增强,以增加叙事与场景的多样性。这样的设计旨在覆盖不同语言、地区与传播语境下的表达方式,使模型不至于被某一类模式所局限。
论文指出,印度大型公共活动中的错误信息往往具有强烈的事件属性。围绕某个节庆或政治集会所出现的谣言,其真实含义常常依赖于本地背景与特定事件的动态;直接迁移其他地区训练出的检测模型,可能因为缺乏文化敏感度而产生误判。因此,研究人员希望 BharatGather 能成为该领域一个严谨的基准:一方面帮助训练出更具文化感知能力的分类系统,另一方面也可在高风险的公共环境中公平评估不同模型的实际表现。
该预印本由 Parth Bramhecha 等五位作者完成,于 2026 年 7 月 2 日提交至 arXiv(编号 arXiv:2609.02895),归类于计算与语言(cs.CL)与机器学习(cs.LG)方向,并提供 DOI:10.48550/arXiv.2609.02895。对从事多语言虚假信息检测、事件感知文本分类以及印度本地化自然语言处理研究的工程师与学者来说,BharatGather 提供了具有针对性的评测选项,也为未来在真实大型集会中部署可信内容审核模型奠定了基础。