AI代理的運行時治理:路徑上的策略
本文提出了一個用於AI代理運行時治理的形式化框架,將合規策略定義為從代理身份、部分路徑、提議的下一步行動和組織狀態到策略違規概率的確定性函數。作者論證了運行時評估是路徑依賴策略的通用情況,並給出了具體策略示例(受AI法案啓發)以及參考實現。
論文《AI代理的運行時治理:路徑上的策略》由Maurits Kaptein等人撰寫,於2026年3月17日提交至arXiv。該論文關注AI代理(利用大語言模型進行規劃、推理和行動的系統)在運行時產生的非確定性和路徑依賴行為,這些行為無法在設計時完全治理。作者們將“治理”定義為在最大化任務完成率與最小化法律、數據泄露、聲譽等成本之間取得平衡。他們提出,執行路徑是運行時治理的核心對象,並形式化合規策略為確定性函數,該函數將代理身份、部分路徑、提議的下一步行動和組織狀態映射到策略違規概率。
論文進一步展示了提示級指令(系統提示)和靜態訪問控制是該框架的特例:前者通過影響路徑分佈而不直接評估路徑;後者評估忽略路徑的確定性策略,因此只能處理所有可能路徑的一個子集。作者強調,運行時評估是通用情況,對於任何路徑依賴的策略都是必要的。他們還開發了形式化框架,提出了受AI法案啓發的具體政策示例,討論了參考實現,並指出了風險校準和強制合規的侷限性等開放問題。
該框架為AI代理的負責任部署提供了理論基礎,特別是在需要動態適應和合規的複雜環境中。它揭示了現有方法(如系統提示和訪問控制)的不足,並呼籲採用更全面的運行時治理方法。論文的貢獻在於將治理問題形式化,併為後續研究提供了清晰的方向。未來工作包括風險校準、多代理環境下的治理,以及強制合規的邊界等。