AI News HubLIVE
站內改寫1 分鐘閱讀

評估本地大語言模型機器翻譯中的提示範圍和示例相似性

這項研究探討了在本地大語言模型(LLM)機器翻譯中,提示範圍和示例選擇作為實驗變量的影響。研究者比較了三種本地指令調優的LLM與專用機器翻譯基線,發現專用系統仍然最強,尤其是日耳曼語系語言。少樣本提示對某些模型有幫助,但家庭範圍提示可能暴露較小模型的結構化輸出失敗。研究建議評估LLM翻譯時不僅要考慮語言對和指標,還要考慮提示範圍、檢索策略和多目標遵從性。

來源arXiv Computational Linguistics作者: Mihael Arcan

大型語言模型(LLM)正越來越多地被用作通用翻譯系統,但它們的性能通常僅在單一提示形式下評估:將一條源語句翻譯成一種目標語言。然而在實際應用中,用户的需求往往更加多樣化,例如要求翻譯成一種目標語言、同時翻譯成幾種相關語言,或者希望基於提供的示例進行條件翻譯。這種現實與評估之間的差距,促使研究者深入探討提示範圍和示例選擇作為實驗變量的影響。

本研究由Mihael Arcan等人完成,論文於2026年7月28日提交至arXiv。研究者評估了從英語到羅曼語族(包括法語、意大利語、西班牙語等)和日耳曼語族(包括德語、荷蘭語、瑞典語等)的翻譯任務,使用了完整的FLORES開發測試集,涵蓋九種歐盟官方語言。他們比較了三種本地指令調優的LLM——llama3.2:3b、mistral:latest和qwen2.5:14b——與來自OPUS-MT和NLLB-200的專用機器翻譯基線。實驗中測試了零樣本提示和k=5的少樣本提示,其中示例選擇採用了隨機、詞彙相似性和嵌入相似性三種方法。此外,還比較了單目標提示(每次翻譯一個目標語言)與JSON格式的家庭範圍提示(一次性翻譯同一語族內的所有語言)。

結果顯示,專用機器翻譯系統仍然整體最強,特別是在日耳曼語言上表現出顯著優勢。少樣本提示對mistral:latest和qwen2.5:14b有幫助,但對llama3.2:3b反而有害;對於較強的LLM,基於嵌入的示例檢索平均效果最好,但其相對於隨機和詞彙示例的優勢並不顯著。家庭範圍提示對於較強的本地LLM是可行的,但在較小模型中暴露了結構化輸出失敗的問題,例如模型無法正確生成JSON格式。

這些發現具有重要意義:評估LLM翻譯性能時,不能僅考慮語言對和自動評估指標,還應將提示範圍、檢索策略和多目標遵從性納入考量。這為未來LLM翻譯系統的設計和評估提供了新的方向。