AI News HubLIVE
站内改写2 分钟阅读

SAAG:结构化智能体评估与校准框架

SAAG提出了一种级联诊断框架,将智能体调用评估分解为三个可解释的阶段:注册一致性、结构完整性和参数校准,并支持基于阶段特定信号的迭代自我修复,有效提升参数精度并减少幻觉。

来源arXiv AI作者: Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

arXiv上发布的一项新研究提出了SAAG(结构化智能体评估与校准),这是一个旨在诊断和改进AI智能体调用可靠性的级联诊断框架。在当前的AI系统中,智能体调用(agent calling)是连接大型语言模型与外部工具和服务的核心机制。然而,传统的精确匹配评估方法掩盖了智能体调用中截然不同的失败模式:例如,模型可能正确选择了函数,但却虚构了参数值;或者满足了模式要求,但选择了不合适的智能体。现有基准将这些问题简化为单一的二进制得分,使得从业者难以定位智能体调用失败的具体原因。

SAAG通过将智能体调用评估分解为三个连续的阶段来解决这一限制:注册一致性(registry conformance)、结构完整性(structural completeness)和参数校准(argument grounding)。注册一致性阶段检查调用的函数是否存在于注册表中,确保模型选择的是可用函数。结构完整性阶段验证参数是否满足函数的模式要求,包括类型、格式和必选字段。参数校准阶段评估参数值是否合理且不会产生幻觉,这通常是智能体失败的主要来源。每个阶段产生可解释的诊断结果,这些结果不仅用于评估,还可以指导迭代自我修复:在预测失败时,阶段特定的信号可以引导有针对性的修正,而不会泄露真实值。

研究人员在基于Glaive函数调用数据集构建的受控基准上评估了SAAG,使用了三个参数量低于4B的本地模型(如TinyLlama、Phi-2等),并设置了5、10和15个智能体的注册表大小。实验结果显示,与单次推理和无信息的二进制反馈相比,结构化反馈一致性地提高了参数精度并减少了值幻觉。例如,在注册表大小为10时,参数校准阶段的精确率提高了约15%,同时值幻觉率降低了近一半。然而,端到端的F1得分提升较为温和,通常在2到5个百分点之间,并且依赖于模型和注册表规模。这些结果表明,阶段分解诊断评估是理解和提升跨模型系列和注册表规模的智能体调用可靠性的必要视角。

SAAG被ACL 2026的KnowFM研讨会接收(非存档),论文共16页,由Ritvik Garimella等人撰写。该研究为AI社区提供了一种更透明和可操作的智能体调用评估方法,有助于改进模型在工具使用场景中的表现,并推动更可靠的智能体系统发展。