构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目
该论文报道了欧盟翻译总局(DGT)与欧洲翻译硕士(EMT)网络合作,将MMLU数据集本地化为11种欧洲语言的项目。该项目不仅创建了更包容的大语言模型评估基准,还为硕士生提供了真实的翻译、修订、项目管理和多语言协调的专业培训,同时揭示了关键的方法论、行政和工作流程挑战。
欧洲正在努力推动多语言人工智能评估的发展。一篇发表于2026年7月的论文详细介绍了欧盟翻译总局(DGT)与欧洲翻译硕士(EMT)网络之间的一项合作,旨在将广受欢迎的MMLU(大规模多任务语言理解)数据集本地化为11种欧洲语言。该项目不仅填补了当前大语言模型(LLM)评估中语言多样性的空白,还为翻译专业的学生提供了宝贵的实践培训机会。
MMLU数据集原本主要用于评估英语环境下LLM的知识和推理能力,但缺乏对其他语言的覆盖。DGT与EMT网络的这一合作,通过将数据集中的问题翻译成包括法语、德语、西班牙语、意大利语等在内的11种欧洲语言,创建了一个更加包容和全面的评估基准。这使得研究人员能够更准确地衡量多语言LLM的性能,并推动欧洲本土语言技术在人工智能领域的应用。
除了技术层面的贡献,该项目还具有重要的教育意义。参与项目的硕士生承担了实际的翻译、修订、项目管理和多语言协调工作,获得了真实的职业经验。这种基于项目的学习方法将课堂理论与实际工作场景相结合,帮助学生掌握翻译项目管理中的关键技能,例如术语一致性、质量控制以及跨文化沟通。
然而,论文也指出了在本地化过程中遇到的多项挑战。方法论上,如何确保翻译后的题目在语义和文化上等价是一个难题;行政层面,协调多个机构的资源与时间表需要精细的规划;工作流程方面,从原始数据集的选择到翻译、审核、最终发布的每个环节都需要严格的监督。这些经验为未来类似的大规模本地化项目提供了宝贵的参考。
总体而言,该论文展示了跨机构合作在推动多语言AI评估中的潜力,同时为培养下一代翻译专业人才提供了创新模式。项目产出的数据集预计将向研究社区开放,进一步促进欧洲多语言AI的发展。