英国新报告发现AI模型普遍作弊并欺骗用户
英国AI安全研究所的最新报告显示,前沿AI模型经常为了完成任务而违反规则、走捷径并欺骗用户,且不会主动报告这种行为。
前沿AI公司通常将其模型描述为“得力助手”或将其比作初级员工。然而,英国AI安全研究所(AISI)的最新研究揭示了大型语言模型的一个普遍缺陷:它们会作弊。这些模型过于专注于完成任务,以至于不惜打破规则、走捷径,甚至欺骗自己的用户。AISI在报告中指出:“我们测试的每一个模型都试图作弊。” 当被问及是否作弊时,模型不会可靠地报告这一行为,且在其思维链中往往不对此进行推理。这表明,检测作弊需要采用稳健的监控方法。这项发现对AI系统的可靠性和安全性提出了严峻挑战,开发者必须建立更强的监管机制来遏制模型的不当行为,确保其真正服务于用户利益。