跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

GUI智能体知道何时不应行动吗?实现多模态GUI智能体的冲突感知终止

文章摘要

一项新研究提出CONFLICTGUI基准,系统评估图形用户界面(GUI)智能体在指令冲突下的表现,发现其存在严重的“执行偏向性过度遵从”问题。研究进一步提出CONFLICTGUARD推理时框架,通过可行性验证与条件性动作调节,使智能体在识别不可行指令后停止执行,显著提升冲突任务成功率,同时不损害正常GUI任务表现。

来源arXiv AI作者: Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng, Zheng Wu, Yansi Li, Chuanbiao Song, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang
GUI智能体知道何时不应行动吗?实现多模态GUI智能体的冲突感知终止
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

图形用户界面(GUI)智能体正越来越多地用于在用户界面上执行自然语言指令,可用于自动化操作、辅助用户完成数字任务。然而现实中的用户并非总能提出可执行的指令,有时会因口误、误解或界面状态变化而发出实际上无法完成的要求。一个值得信赖的智能体不仅需要知道如何行动,更应知道何时不应该行动。最新arXiv论文《GUI智能体知道何时不应行动吗?实现多模态GUI智能体的冲突感知终止》正式探讨了这一问题。

为研究冲突场景下的“终止”能力,研究团队构建了名为CONFLICTGUI的基准数据集。该基准覆盖两类冲突:一类是指令内部冲突,即用户给出的自然语言指令本身包含前后矛盾的条件;另一类是指令与GUI上下文的冲突,即指令所要求的操作与当前界面元素、状态或可用功能不匹配。通过这两类测试,研究者希望系统观察GUI智能体是否具备冲突感知的终止决策能力。

在评估多个现有GUI智能体后,研究发现了一个普遍而严重的问题:执行偏向性过度遵从。那些在正常可执行任务上表现出色的智能体,在遇到冲突或不可行指令时依然倾向于继续执行,几乎没有表现出应有的“克制”。这种盲目的遵从尤其危险,因为在无人监督的自动化场景中,错误的操作可能带来不可逆的后果。

为了缓解这一问题,研究团队提出CONFLICTGUARD,一种轻量级的推理时框架。它由两个相互耦合的组件构成:其一是可行性验证协议,引导智能体在执行前先评估指令自身的逻辑是否自洽,并结合GUI侧证据判断目标操作在当前界面中是否真正可行;其二是条件性动作调节机制,当检测到冲突时,将智能体从过度遵从的执行状态引导到终止导向的行为,比如拒绝执行、停止或请求澄清。这两个组件共同作用,使智能体的可行性感知与动作生成保持一致。

研究者在五个广泛使用的GUI智能体上进行了实验。结果显示,引入CONFLICTGUARD后,这些智能体在冲突任务上的平均成功率显著提升,同时在正常GUI任务上的表现几乎不受影响。也就是说,仅仅依靠推理时的轻量干预,就能大幅增强智能体识别“不该执行”场景并主动克制的能力。这项工作为解决GUI智能体的安全性、可靠性和可信赖性问题提供了新思路,也提醒我们:真正强大的智能体,不仅要会“做”,更要懂得“不做”。

展开要点与分析

文章情报

工程师进阶

要点

  • CONFLICTGUI基准覆盖指令内部冲突及指令与GUI上下文冲突。
  • 现有智能体可能存在严重的执行偏向性过度遵从,即使面对冲突仍会盲目执行。
  • CONFLICTGUARD通过推理时框架将可行性验证与条件性动作调节结合,促使智能体在冲突场景做出终止决策。
  • 在五大主流智能体上的实验表明,该方法显著提高冲突任务成功率,并保持常规任务性能。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。