AI News HubLIVE
站内改写1 分钟阅读

不想让LLM建议发动核打击?试试用日语提问

一项针对九款大型语言模型的研究发现,日语提示能显著降低模型在核打击决策场景中的攻击选择率。Claude Sonnet 4.6 在非必要场景中的发射率从 40% 降至 0%,Gemini Pro 3.1 从 53% 降至 13%。关键在于模型被要求使用的推理语言,而非输入语言。英语之外的评测可能揭示模型中隐藏的安全机制或风险。

来源arXiv AI作者: Rian Touchent (ALMAnaCH)

一项新研究发现,大型语言模型的安全行为会随提示语言而改变。该研究来自 ALMAnaCH 的 Rian Touchent,论文题为《Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese》,于 2026 年 7 月 21 日提交至 arXiv(编号 2608.12373),并发表在 TrustNLP 2026 研讨会论文集中(第 489–502 页)。研究指出,LLM 越来越多地被用于战略咨询等高风险场景,但安全对齐评测通常只用英语进行。

研究团队测试了来自六家提供商的九款模型。他们设计了单轮博弈论场景:模型需要向一个拥有核武器的国家提供建议,是否对该国的一个无防御能力的对手发动打击。提示词刻意不包含道德考量,并且在各种语言版本中战略内容完全一致,以便隔离语言本身的影响。

结果显示,日语提示显著降低了 Claude 模型家族的发射率。例如,在发动打击并无必要的场景中,Claude Sonnet 4.6 的发射率从 40% 降到 0%;在有争议的场景中,从 93% 降到 17%;而当打击在战略上合理时,语言几乎没有影响。谷歌的 Gemini Pro 3.1 也表现出类似效应,发射率从 53% 降至 13%。不过,其他五款模型没有表现出语言效应——它们几乎在所有条件下都会选择发射。

跨语言实验进一步揭示了背后的机制。如果英文提示中指示模型用日语进行推理,发射率会从 93% 降到 37%。这说明驱动效应的是模型被要求使用的推理语言,而不是输入表面的语言。研究者观察到,当模型用日语推理时,会自发产生提示中完全没有的道德词汇,如“moral cost”和“millions of lives”。这种效应似乎只出现在那些在英语中已经表现出犹豫的模型上。

这项研究凸显了单纯依赖英语评测的局限性。LLM 的安全行为可能在不同语言下存在差异,某些风险和防护机制可能只会在特定语言中显现。作者建议,未来的安全评估应当覆盖多种语言,而不能想当然地认为一种语言的结果可以推广到其他语言。