在人類對齊下學習藉助AI輔助做出決策
本文研究了AI輔助決策中,AI置信度與人類置信度之間的對齊程度如何影響學習最優決策的複雜性。透過將問題建模為雙臂線上上下文學習問題,作者推導了遺憾下界,並證明完美對齊可以降低學習複雜度。實驗結果表明理論結果對對齊偏差具有魯棒性。
一項新的研究探討了在AI輔助決策中,AI模型的置信度與人類決策者自身置信度之間的對齊程度如何影響學習最優決策的效率。該研究發表於arXiv,題為“Learning to Decide with AI Assistance under Human-Alignment”。
研究人員指出,在高風險領域,AI模型通常會以置信度的形式傳達其預測的可靠程度。然而,實證表明,僅憑置信度資訊,人類決策者往往難以判斷何時應該信任AI的預測。最近的理論和實證工作提出,AI置信度與人類自身置信度之間的對齊程度與AI輔助決策的效用正相關。但此前的研究並未闡明這種對齊如何影響透過重複互動學習最優決策的複雜性。
為了解決這一問題,論文作者將二元預測和二元決策的典型場景建模為一個雙臂線上上下文學習問題,並分析了學習者的遺憾界。他們首先證明,任何學習者在最壞情況下的預期遺憾都有一個下界,該下界與AI和人類置信度集合的大小以及時間跨度相關。具體地,下界為Ω(√(|H|·|B|·T)),其中H和B分別表示人類和AI置信度值的集合。隨後,他們證明,在AI與人類置信度完美對齊的條件下,學習者可以達到更優的遺憾界O(√(|H|·T log T))。當滿足某些條件(如√|H| = O(log T)且B可數)時,利用Dvoretzky-Kiefer-Wolfowitz不等式的推廣,可以將遺憾界進一步最佳化至O(√(T log T))。
總的來說,這些結果表明,對齊可以降低學習使用AI輔助決策的複雜性。研究者還透過兩個真實人類受試者實驗的資料驗證了其理論結果,即使在非完美對齊的情況下,理論預測仍然穩健。該研究為設計更有效的人機協作系統提供了理論依據,強調了置信度對齊在提升AI輔助決策效果中的關鍵作用。