跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

BharatGather:面向印度公共事件错误信息检测的文化感知基准数据集

文章摘要

大型公共事件中错误信息的快速传播对公共安全和社会凝聚力构成重大风险。该论文提出 BharatGather,一个专为印度大型集会场景设计的二进制错误信息分类数据集,包含通过事实核查平台抓取、多模态转录提取和 LLM 合成增强构建的 14,646 条记录,旨在为文化感知的检测系统提供基准。

来源arXiv Computational Linguistics作者: Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi
BharatGather:面向印度公共事件错误信息检测的文化感知基准数据集
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

在印度的宗教节日、政治集会与大型文化聚会中,信息往往以极快速度扩散,而其中夹杂的虚假内容也可能迅速演变为公共安全隐患。大规模聚会场景一旦出现谣言,轻则引起恐慌,重则威胁公共安全,并侵蚀社会信任。针对这些风险,自动虚假新闻检测研究虽然一直在推进,但既有数据集大多以通用社交媒体场景为主,较少反映印度特有的社会文化脉络与事件联动特征。一篇新提交至 arXiv 的论文提出了 BharatGather,尝试以专门面向印度大型集会生态的数据集来弥补这一缺口。

BharatGather 是一个经过策划的多来源数据集,用于印度大型集会场景中的二元错误信息分类,即将内容判定为真实或虚假两类。数据集共包含 14,646 条记录,构建过程并非依赖单一渠道,而是采用了一条混合流水线:团队首先对多个重要事实核查平台进行系统性的网页抓取,随后抽取来自视频、音频等多媒体的转录文本,最后再利用大语言模型(LLM)进行合成数据增强,以增加叙事与场景的多样性。这样的设计旨在覆盖不同语言、地区与传播语境下的表达方式,使模型不至于被某一类模式所局限。

论文指出,印度大型公共活动中的错误信息往往具有强烈的事件属性。围绕某个节庆或政治集会所出现的谣言,其真实含义常常依赖于本地背景与特定事件的动态;直接迁移其他地区训练出的检测模型,可能因为缺乏文化敏感度而产生误判。因此,研究人员希望 BharatGather 能成为该领域一个严谨的基准:一方面帮助训练出更具文化感知能力的分类系统,另一方面也可在高风险的公共环境中公平评估不同模型的实际表现。

该预印本由 Parth Bramhecha 等五位作者完成,于 2026 年 7 月 2 日提交至 arXiv(编号 arXiv:2609.02895),归类于计算与语言(cs.CL)与机器学习(cs.LG)方向,并提供 DOI:10.48550/arXiv.2609.02895。对从事多语言虚假信息检测、事件感知文本分类以及印度本地化自然语言处理研究的工程师与学者来说,BharatGather 提供了具有针对性的评测选项,也为未来在真实大型集会中部署可信内容审核模型奠定了基础。

展开要点与分析

文章情报

工程师进阶

要点

  • BharatGather 是面向印度大型公共事件错误信息检测的基准数据集,包含 14,646 条记录。
  • 数据集采用混合流程构建:抓取事实核查平台、提取多媒体转录,并通过 LLM 合成增强促进叙事多样性。
  • 该数据集解决了现有基准在印度社会文化背景和事件动态上的不足,支持开发更贴合实际环境的检测系统。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。