多語言語言模型在面對語義等價的不同語言問題時,常常會給出不一致的答案,這促使研究者提出多種方法來提升跨語言一致性(Cross-Lingual Consistency, CLC)。然而,現有方法通常在不同的模型、任務和實驗協議下進行評測,導致它們的相對優劣並不明確。為了填補這一空白,本研究對代表性的 CLC 增強方法進行了統一評估,涵蓋推理時干預(inference-time interventions)和訓練後方法(post-training approaches),並使用了三個模型家族和三個封閉式問答基準資料集。
研究結果顯示,訓練後方法通常更為可靠,其中直接分佈對齊(direct distribution alignment)能夠在所有模型與資料集的組合中持續改進 CLC,而其他方法則對答案格式和語言覆蓋範圍較為敏感。值得注意的是,跨領域遷移的效果有限,除非源任務和目標任務具有相似的輸出格式。
進一步地,研究者探討了 CLC 增強是否會損害模型在需要時做出不同回應的能力,即在面對文化相關問題時是否無法因文化差異而給出不同答案。透過兩個文化多樣化問答基準的評估,他們發現在受控的封閉式評估中,CLC 增強並未導致系統性效能下降;然而,在開放式生成中,偶爾會出現準確性降低的情況,尤其是對於非英語回答。
這項研究的工作強調了需要在跨領域魯棒性和文化適當變異性兩個維度上評估 CLC 增強方法,為未來的訓練後方法研究和基準構建提供了重要啟示。論文為預印本,所有程式碼和資料集將在發表後公開。該論文於 2026 年 9 月 3 日提交至 arXiv,編號為 arXiv:2609.04409,屬於計算與語言(cs.CL)和人工智慧(cs.AI)領域。