PQR:一种生成多样化、逼真用户查询以触发问答代理失败的框架
PQR框架通过迭代交互两个互补模块(查询优化模块和提示优化模块),自动生成既能触发代理失败又符合真实用户意图的多样化查询。在电商问答代理评估中,该方法检测到的无帮助响应增加了23%-78%,且生成的查询比之前的方法更多样化和逼真。
评估基于大语言模型(LLM)的代理仍然是一个挑战,因为识别有意义的失败案例通常需要大量人工设计逼真的测试场景。先前的工作主要集中于自动发现由对抗性用户引发的代理失败,而忽略了那些具有真实用户意图但同样能触发代理失败的查询。为此,研究者提出了PQR框架,它不仅能根据特定目标(如帮助性、安全性等)暴露代理失败,还能模拟真实用户的意图。
PQR通过两个互补模块之间的迭代交互运行。查询优化模块执行改写以探索多样化的查询变体,而提示优化模块则利用先前的反馈推导新的违反目标的策略和逼真性策略,从而优化提示,进而生成触发失败且逼真的查询。研究者将PQR应用于检测电商问答代理的无帮助响应。实验结果表明,该方法能检测出比基线多23%至78%的无帮助响应,并且生成的查询在多样性和逼真度方面均优于先前的方法。
该研究为LLM代理的评估提供了新的视角,尤其适用于需要兼顾失败发现效率和用户意图真实性的场景。未来,PQR有望扩展到更多领域的代理评估中,进一步提升AI系统的鲁棒性和可靠性。PQR框架的核心创新在于其双模块迭代设计,能够自动探索广泛的查询空间,并利用反馈不断改进生成策略。这种方法不仅提高了失败检测的覆盖率,还确保了生成的查询贴近真实用户的行为模式,减少了人工设计测试用例的负担。此外,PQR的模块化设计使其易于适配不同的评估目标和领域,为AI系统的全面评估提供了有力工具。