评估本地大语言模型机器翻译中的提示范围和示例相似性
这项研究探讨了在本地大语言模型(LLM)机器翻译中,提示范围和示例选择作为实验变量的影响。研究者比较了三种本地指令调优的LLM与专用机器翻译基线,发现专用系统仍然最强,尤其是日耳曼语系语言。少样本提示对某些模型有帮助,但家庭范围提示可能暴露较小模型的结构化输出失败。研究建议评估LLM翻译时不仅要考虑语言对和指标,还要考虑提示范围、检索策略和多目标遵从性。
大型语言模型(LLM)正越来越多地被用作通用翻译系统,但它们的性能通常仅在单一提示形式下评估:将一条源语句翻译成一种目标语言。然而在实际应用中,用户的需求往往更加多样化,例如要求翻译成一种目标语言、同时翻译成几种相关语言,或者希望基于提供的示例进行条件翻译。这种现实与评估之间的差距,促使研究者深入探讨提示范围和示例选择作为实验变量的影响。
本研究由Mihael Arcan等人完成,论文于2026年7月28日提交至arXiv。研究者评估了从英语到罗曼语族(包括法语、意大利语、西班牙语等)和日耳曼语族(包括德语、荷兰语、瑞典语等)的翻译任务,使用了完整的FLORES开发测试集,涵盖九种欧盟官方语言。他们比较了三种本地指令调优的LLM——llama3.2:3b、mistral:latest和qwen2.5:14b——与来自OPUS-MT和NLLB-200的专用机器翻译基线。实验中测试了零样本提示和k=5的少样本提示,其中示例选择采用了随机、词汇相似性和嵌入相似性三种方法。此外,还比较了单目标提示(每次翻译一个目标语言)与JSON格式的家庭范围提示(一次性翻译同一语族内的所有语言)。
结果显示,专用机器翻译系统仍然整体最强,特别是在日耳曼语言上表现出显著优势。少样本提示对mistral:latest和qwen2.5:14b有帮助,但对llama3.2:3b反而有害;对于较强的LLM,基于嵌入的示例检索平均效果最好,但其相对于随机和词汇示例的优势并不显著。家庭范围提示对于较强的本地LLM是可行的,但在较小模型中暴露了结构化输出失败的问题,例如模型无法正确生成JSON格式。
这些发现具有重要意义:评估LLM翻译性能时,不能仅考虑语言对和自动评估指标,还应将提示范围、检索策略和多目标遵从性纳入考量。这为未来LLM翻译系统的设计和评估提供了新的方向。