在印度的宗教節日、政治集會與大型文化聚會中,資訊往往以極快速度擴散,而其中夾雜的虛假內容也可能迅速演變為公共安全隱患。大規模聚會場景一旦出現謠言,輕則引起恐慌,重則威脅公共安全,並侵蝕社會信任。針對這些風險,自動虛假新聞檢測研究雖然一直在推進,但既有資料集大多以通用社交媒體場景為主,較少反映印度特有的社會文化脈絡與事件聯動特徵。一篇新提交至 arXiv 的論文提出了 BharatGather,嘗試以專門面向印度大型集會生態的資料集來彌補這一缺口。
BharatGather 是一個經過策劃的多來源資料集,用於印度大型集會場景中的二元錯誤資訊分類,即將內容判定為真實或虛假兩類。資料集共包含 14,646 條記錄,構建過程並非依賴單一渠道,而是採用了一條混合流水線:團隊首先對多個重要事實核查平臺進行系統性的網頁抓取,隨後抽取來自影片、音訊等多媒體的轉錄文本,最後再利用大語言模型(LLM)進行合成資料增強,以增加敘事與場景的多樣性。這樣的設計旨在覆蓋不同語言、地區與傳播語境下的表達方式,使模型不至於被某一類模式所侷限。
論文指出,印度大型公共活動中的錯誤資訊往往具有強烈的事件屬性。圍繞某個節慶或政治集會所出現的謠言,其真實含義常常依賴於本地背景與特定事件的動態;直接遷移其他地區訓練出的檢測模型,可能因為缺乏文化敏感度而產生誤判。因此,研究人員希望 BharatGather 能成為該領域一個嚴謹的基準:一方面幫助訓練出更具文化感知能力的分類系統,另一方面也可在高風險的公共環境中公平評估不同模型的實際表現。
該預印本由 Parth Bramhecha 等五位作者完成,於 2026 年 7 月 2 日提交至 arXiv(編號 arXiv:2609.02895),歸類於計算與語言(cs.CL)與機器學習(cs.LG)方向,並提供 DOI:10.48550/arXiv.2609.02895。對從事多語言虛假資訊檢測、事件感知文本分類以及印度本地化自然語言處理研究的工程師與學者來說,BharatGather 提供了具有針對性的評測選項,也為未來在真實大型集會中部署可信內容稽核模型奠定了基礎。