構建歐洲多語言評估資料集:EMT網路中的MMLU本地化專案
該論文報道了歐盟翻譯總局(DGT)與歐洲翻譯碩士(EMT)網路合作,將MMLU資料集本地化為11種歐洲語言的專案。該專案不僅建立了更包容的大語言模型評估基準,還為碩士生提供了真實的翻譯、修訂、專案管理和多語言協調的專業培訓,同時揭示了關鍵的方法論、行政和工作流程挑戰。
歐洲正在努力推動多語言人工智慧評估的發展。一篇發表於2026年7月的論文詳細介紹了歐盟翻譯總局(DGT)與歐洲翻譯碩士(EMT)網路之間的一項合作,旨在將廣受歡迎的MMLU(大規模多工語言理解)資料集本地化為11種歐洲語言。該專案不僅填補了當前大語言模型(LLM)評估中語言多樣性的空白,還為翻譯專業的學生提供了寶貴的實踐培訓機會。
MMLU資料集原本主要用於評估英語環境下LLM的知識和推理能力,但缺乏對其他語言的覆蓋。DGT與EMT網路的這一合作,透過將資料集中的問題翻譯成包括法語、德語、西班牙語、義大利語等在內的11種歐洲語言,建立了一個更加包容和全面的評估基準。這使得研究人員能夠更準確地衡量多語言LLM的效能,並推動歐洲本土語言技術在人工智慧領域的應用。
除了技術層面的貢獻,該專案還具有重要的教育意義。參與專案的碩士生承擔了實際的翻譯、修訂、專案管理和多語言協調工作,獲得了真實的職業經驗。這種基於專案的學習方法將課堂理論與實際工作場景相結合,幫助學生掌握翻譯專案管理中的關鍵技能,例如術語一致性、質量控制以及跨文化溝通。
然而,論文也指出了在本地化過程中遇到的多項挑戰。方法論上,如何確保翻譯後的題目在語義和文化上等價是一個難題;行政層面,協調多個機構的資源與時間表需要精細的規劃;工作流程方面,從原始資料集的選擇到翻譯、稽核、最終釋出的每個環節都需要嚴格的監督。這些經驗為未來類似的大規模本地化專案提供了寶貴的參考。
總體而言,該論文展示了跨機構合作在推動多語言AI評估中的潛力,同時為培養下一代翻譯專業人才提供了創新模式。專案產出的資料集預計將向研究社群開放,進一步促進歐洲多語言AI的發展。