AI News HubLIVE
站内改写2 分钟阅读

PatiGonit22K:一个用于解决复杂孟加拉语数学应用题的综合数据集

PatiGonit22K是一个扩展的孟加拉语数学应用题数据集,包含22,441个问题,涵盖简单和多步骤方程,经过文化适配和验证,旨在推动低资源语言的数学推理和NLP研究。

来源arXiv Computational Linguistics作者: Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad

近日,研究人员在arXiv上发布了PatiGonit22K数据集,这是一个专门用于解决复杂孟加拉语数学应用题的综合数据集。数学应用题(MWP)是评估自然语言理解和定量推理能力的重要基准。尽管在高资源语言(如英语)方面取得了显著进展,但孟加拉语由于缺乏大规模标注数据集,在该领域仍处于未充分探索的状态。PatiGonit22K数据集的发布旨在填补这一空白。

该数据集包含22,441个问题,是在原始PatiGonit数据集的基础上扩展而来。原始数据集规模较小,而新版本增加了大量更复杂的数学问题,包括多步运算方程。这使得数据集在不同难度级别上提供了均衡的基准,能够更全面地评估模型的数学推理能力。每个问题都经过精心翻译、注释、文化适配和验证,以确保语言一致性和数学正确性。研究人员特别强调了文化适配的重要性,因为数学应用题往往涉及特定文化背景,直接翻译可能导致理解偏差。

通过增加孟加拉语数学应用题的规模和复杂性,PatiGonit22K为低资源语言中的数学推理和教育NLP应用提供了更全面的资源。该数据集有望推动孟加拉语及其他低资源语言在自然语言处理领域的发展,特别是在智能教育系统和数学推理任务方面。论文已提交至arXiv,编号为2607.22859,作者包括Swastika Kundu等人。数据集的使用遵循相关许可证,可用于学术研究。未来,该团队计划进一步扩展数据集,并探索多语言迁移学习的可能性。这一工作不仅对孟加拉语NLP研究具有重要意义,也为其他低资源语言的类似研究提供了范例。

此外,PatiGonit22K的构建遵循了严格的流程。首先,研究人员收集了各种来源的数学问题,包括教科书、考试和在线资源,确保问题的多样性和代表性。然后,这些问题被翻译成孟加拉语,并经过母语者的审核。之后,对每个问题进行了数学注释,包括方程形式、难度等级和所需运算步骤。文化适配环节调整了问题中可能涉及的文化特定元素,例如货币单位、人名和场景,使其更符合孟加拉国的实际情况。最后,通过多轮验证确保正确性。数据集的分层结构允许研究人员根据需求选择特定难度或类型的问题,为模型评估提供了灵活性。

总的来说,PatiGonit22K是一个重要的贡献,它解决了孟加拉语NLP中的一个关键瓶颈——缺乏高质量、大规模且文化适配的数学应用题数据集。随着该数据集的发布,预计将涌现出更多针对孟加拉语数学推理的研究,并促进低资源语言NLP的整体进步。研究人员已公开数据集,并鼓励社区使用和贡献,以进一步丰富这一资源。