AI代理的執行時治理:路徑上的策略
本文提出了一個用於AI代理執行時治理的形式化框架,將合規策略定義為從代理身份、部分路徑、提議的下一步行動和組織狀態到策略違規機率的確定性函式。作者論證了執行時評估是路徑依賴策略的通用情況,並給出了具體策略示例(受AI法案啟發)以及參考實現。
論文《AI代理的執行時治理:路徑上的策略》由Maurits Kaptein等人撰寫,於2026年3月17日提交至arXiv。該論文關注AI代理(利用大語言模型進行規劃、推理和行動的系統)在執行時產生的非確定性和路徑依賴行為,這些行為無法在設計時完全治理。作者們將“治理”定義為在最大化任務完成率與最小化法律、資料洩露、聲譽等成本之間取得平衡。他們提出,執行路徑是執行時治理的核心物件,並形式化合規策略為確定性函式,該函式將代理身份、部分路徑、提議的下一步行動和組織狀態對映到策略違規機率。
論文進一步展示了提示級指令(系統提示)和靜態訪問控制是該框架的特例:前者透過影響路徑分佈而不直接評估路徑;後者評估忽略路徑的確定性策略,因此只能處理所有可能路徑的一個子集。作者強調,執行時評估是通用情況,對於任何路徑依賴的策略都是必要的。他們還開發了形式化框架,提出了受AI法案啟發的具體政策示例,討論了參考實現,並指出了風險校準和強制合規的侷限性等開放問題。
該框架為AI代理的負責任部署提供了理論基礎,特別是在需要動態適應和合規的複雜環境中。它揭示了現有方法(如系統提示和訪問控制)的不足,並呼籲採用更全面的執行時治理方法。論文的貢獻在於將治理問題形式化,併為後續研究提供了清晰的方向。未來工作包括風險校準、多代理環境下的治理,以及強制合規的邊界等。