跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

BharatGather:面向印度公共事件錯誤資訊檢測的文化感知基準資料集

文章摘要

大型公共事件中錯誤資訊的快速傳播對公共安全和社會凝聚力構成重大風險。該論文提出 BharatGather,一個專為印度大型集會場景設計的二進位制錯誤資訊分類資料集,包含透過事實核查平臺抓取、多模態轉錄提取和 LLM 合成增強構建的 14,646 條記錄,旨在為文化感知的檢測系統提供基準。

來源arXiv Computational Linguistics作者: Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi
BharatGather:面向印度公共事件錯誤資訊檢測的文化感知基準資料集
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在印度的宗教節日、政治集會與大型文化聚會中,資訊往往以極快速度擴散,而其中夾雜的虛假內容也可能迅速演變為公共安全隱患。大規模聚會場景一旦出現謠言,輕則引起恐慌,重則威脅公共安全,並侵蝕社會信任。針對這些風險,自動虛假新聞檢測研究雖然一直在推進,但既有資料集大多以通用社交媒體場景為主,較少反映印度特有的社會文化脈絡與事件聯動特徵。一篇新提交至 arXiv 的論文提出了 BharatGather,嘗試以專門面向印度大型集會生態的資料集來彌補這一缺口。

BharatGather 是一個經過策劃的多來源資料集,用於印度大型集會場景中的二元錯誤資訊分類,即將內容判定為真實或虛假兩類。資料集共包含 14,646 條記錄,構建過程並非依賴單一渠道,而是採用了一條混合流水線:團隊首先對多個重要事實核查平臺進行系統性的網頁抓取,隨後抽取來自影片、音訊等多媒體的轉錄文本,最後再利用大語言模型(LLM)進行合成資料增強,以增加敘事與場景的多樣性。這樣的設計旨在覆蓋不同語言、地區與傳播語境下的表達方式,使模型不至於被某一類模式所侷限。

論文指出,印度大型公共活動中的錯誤資訊往往具有強烈的事件屬性。圍繞某個節慶或政治集會所出現的謠言,其真實含義常常依賴於本地背景與特定事件的動態;直接遷移其他地區訓練出的檢測模型,可能因為缺乏文化敏感度而產生誤判。因此,研究人員希望 BharatGather 能成為該領域一個嚴謹的基準:一方面幫助訓練出更具文化感知能力的分類系統,另一方面也可在高風險的公共環境中公平評估不同模型的實際表現。

該預印本由 Parth Bramhecha 等五位作者完成,於 2026 年 7 月 2 日提交至 arXiv(編號 arXiv:2609.02895),歸類於計算與語言(cs.CL)與機器學習(cs.LG)方向,並提供 DOI:10.48550/arXiv.2609.02895。對從事多語言虛假資訊檢測、事件感知文本分類以及印度本地化自然語言處理研究的工程師與學者來說,BharatGather 提供了具有針對性的評測選項,也為未來在真實大型集會中部署可信內容稽核模型奠定了基礎。

展開要點與分析

文章情報

工程師進階

要點

  • BharatGather 是面向印度大型公共事件錯誤資訊檢測的基準資料集,包含 14,646 條記錄。
  • 資料集採用混合流程構建:抓取事實核查平臺、提取多媒體轉錄,並透過 LLM 合成增強促進敘事多樣性。
  • 該資料集解決了現有基準在印度社會文化背景和事件動態上的不足,支援開發更貼合實際環境的檢測系統。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。