AI News HubLIVE
站内改写1 分钟阅读

在人类对齐下学习借助AI辅助做出决策

本文研究了AI辅助决策中,AI置信度与人类置信度之间的对齐程度如何影响学习最优决策的复杂性。通过将问题建模为双臂在线上下文学习问题,作者推导了遗憾下界,并证明完美对齐可以降低学习复杂度。实验结果表明理论结果对对齐偏差具有鲁棒性。

来源arXiv Machine Learning作者: Nina Corvelo Benz, Eleni Straitouri, Manuel Gomez-Rodriguez

一项新的研究探讨了在AI辅助决策中,AI模型的置信度与人类决策者自身置信度之间的对齐程度如何影响学习最优决策的效率。该研究发表于arXiv,题为“Learning to Decide with AI Assistance under Human-Alignment”。

研究人员指出,在高风险领域,AI模型通常会以置信度的形式传达其预测的可靠程度。然而,实证表明,仅凭置信度信息,人类决策者往往难以判断何时应该信任AI的预测。最近的理論和实证工作提出,AI置信度与人类自身置信度之间的对齐程度与AI辅助决策的效用正相关。但此前的研究并未阐明这种对齐如何影响通过重复交互学习最优决策的复杂性。

为了解决这一问题,论文作者将二元预测和二元决策的典型场景建模为一个双臂在线上下文学习问题,并分析了学习者的遗憾界。他们首先证明,任何学习者在最坏情况下的预期遗憾都有一个下界,该下界与AI和人类置信度集合的大小以及时间跨度相关。具体地,下界为Ω(√(|H|·|B|·T)),其中H和B分别表示人类和AI置信度值的集合。随后,他们证明,在AI与人类置信度完美对齐的条件下,学习者可以达到更优的遗憾界O(√(|H|·T log T))。当满足某些条件(如√|H| = O(log T)且B可数)时,利用Dvoretzky-Kiefer-Wolfowitz不等式的推广,可以将遗憾界进一步优化至O(√(T log T))。

总的来说,这些结果表明,对齐可以降低学习使用AI辅助决策的复杂性。研究者还通过两个真实人类受试者实验的数据验证了其理论结果,即使在非完美对齐的情况下,理论预测仍然稳健。该研究为设计更有效的人机协作系统提供了理论依据,强调了置信度对齐在提升AI辅助决策效果中的关键作用。