多语言语言模型在面对语义等价的不同语言问题时,常常会给出不一致的答案,这促使研究者提出多种方法来提升跨语言一致性(Cross-Lingual Consistency, CLC)。然而,现有方法通常在不同的模型、任务和实验协议下进行评测,导致它们的相对优劣并不明确。为了填补这一空白,本研究对代表性的 CLC 增强方法进行了统一评估,涵盖推理时干预(inference-time interventions)和训练后方法(post-training approaches),并使用了三个模型家族和三个封闭式问答基准数据集。
研究结果显示,训练后方法通常更为可靠,其中直接分布对齐(direct distribution alignment)能够在所有模型与数据集的组合中持续改进 CLC,而其他方法则对答案格式和语言覆盖范围较为敏感。值得注意的是,跨领域迁移的效果有限,除非源任务和目标任务具有相似的输出格式。
进一步地,研究者探讨了 CLC 增强是否会损害模型在需要时做出不同回应的能力,即在面对文化相关问题时是否无法因文化差异而给出不同答案。通过两个文化多样化问答基准的评估,他们发现在受控的封闭式评估中,CLC 增强并未导致系统性性能下降;然而,在开放式生成中,偶尔会出现准确性降低的情况,尤其是对于非英语回答。
这项研究的工作强调了需要在跨领域鲁棒性和文化适当变异性两个维度上评估 CLC 增强方法,为未来的训练后方法研究和基准构建提供了重要启示。论文为预印本,所有代码和数据集将在发表后公开。该论文于 2026 年 9 月 3 日提交至 arXiv,编号为 arXiv:2609.04409,属于计算与语言(cs.CL)和人工智能(cs.AI)领域。