跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

GUI智能體知道何時不應行動嗎?實現多模態GUI智能體的衝突感知終止

文章摘要

一項新研究提出CONFLICTGUI基準,系統評估圖形用户界面(GUI)智能體在指令衝突下的表現,發現其存在嚴重的“執行偏向性過度遵從”問題。研究進一步提出CONFLICTGUARD推理時框架,通過可行性驗證與條件性動作調節,使智能體在識別不可行指令後停止執行,顯著提升衝突任務成功率,同時不損害正常GUI任務表現。

來源arXiv AI作者: Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng, Zheng Wu, Yansi Li, Chuanbiao Song, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang
GUI智能體知道何時不應行動嗎?實現多模態GUI智能體的衝突感知終止
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

圖形用户界面(GUI)智能體正越來越多地用於在用户界面上執行自然語言指令,可用於自動化操作、輔助用户完成數字任務。然而現實中的用户並非總能提出可執行的指令,有時會因口誤、誤解或界面狀態變化而發出實際上無法完成的要求。一個值得信賴的智能體不僅需要知道如何行動,更應知道何時不應該行動。最新arXiv論文《GUI智能體知道何時不應行動嗎?實現多模態GUI智能體的衝突感知終止》正式探討了這一問題。

為研究衝突場景下的“終止”能力,研究團隊構建了名為CONFLICTGUI的基準數據集。該基準覆蓋兩類衝突:一類是指令內部衝突,即用户給出的自然語言指令本身包含前後矛盾的條件;另一類是指令與GUI上下文的衝突,即指令所要求的操作與當前界面元素、狀態或可用功能不匹配。通過這兩類測試,研究者希望系統觀察GUI智能體是否具備衝突感知的終止決策能力。

在評估多個現有GUI智能體後,研究發現了一個普遍而嚴重的問題:執行偏向性過度遵從。那些在正常可執行任務上表現出色的智能體,在遇到衝突或不可行指令時依然傾向於繼續執行,幾乎沒有表現出應有的“剋制”。這種盲目的遵從尤其危險,因為在無人監督的自動化場景中,錯誤的操作可能帶來不可逆的後果。

為了緩解這一問題,研究團隊提出CONFLICTGUARD,一種輕量級的推理時框架。它由兩個相互耦合的組件構成:其一是可行性驗證協議,引導智能體在執行前先評估指令自身的邏輯是否自洽,並結合GUI側證據判斷目標操作在當前界面中是否真正可行;其二是條件性動作調節機制,當檢測到衝突時,將智能體從過度遵從的執行狀態引導到終止導向的行為,比如拒絕執行、停止或請求澄清。這兩個組件共同作用,使智能體的可行性感知與動作生成保持一致。

研究者在五個廣泛使用的GUI智能體上進行了實驗。結果顯示,引入CONFLICTGUARD後,這些智能體在衝突任務上的平均成功率顯著提升,同時在正常GUI任務上的表現幾乎不受影響。也就是説,僅僅依靠推理時的輕量干預,就能大幅增強智能體識別“不該執行”場景並主動剋制的能力。這項工作為解決GUI智能體的安全性、可靠性和可信賴性問題提供了新思路,也提醒我們:真正強大的智能體,不僅要會“做”,更要懂得“不做”。

展開要點與分析

文章情報

工程師進階

要點

  • CONFLICTGUI基準覆蓋指令內部衝突及指令與GUI上下文衝突。
  • 現有智能體可能存在嚴重的執行偏向性過度遵從,即使面對衝突仍會盲目執行。
  • CONFLICTGUARD通過推理時框架將可行性驗證與條件性動作調節結合,促使智能體在衝突場景做出終止決策。
  • 在五大主流智能體上的實驗表明,該方法顯著提高衝突任務成功率,並保持常規任務性能。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。