跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

以反例作为智能体自我修正的反馈信号

文章摘要

arXiv:2609.02892 提出 A-CEGIS,一个轻量级评测框架,用确定性检查器生成的反例作为反馈,测试自然语言到正则表达式合成中的多轮自我修正能力。在 NL-RX-Turk 的 30 个任务上,诊断性反例反馈四轮内解决 90% 的任务,而零样本生成仅为 17%,通用自我修正为 27%,仅含错误信息的反馈为 23%。完整诊断流程加入加固后,隐藏测试集全部任务最终都被解决,平均成功轮数为 2.7 轮,额外针对性探测后鲁棒成功率仍为 77%。

来源arXiv Computational Linguistics作者: Sidhesh Badrinarayan, Adithya Parthasarathy
以反例作为智能体自我修正的反馈信号
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

单轮代码生成指标是评估语言模型编程能力的常用方式,但在真实部署中,智能体往往不只需要一次性生成正确结果,更需要在与外部环境的多轮交互中,凭借具体反馈修正自己生成出的错误产物。针对自然语言到正则表达式生成任务,一篇于 2026 年 7 月 1 日提交至 arXiv 的新论文提出 A-CEGIS,一个利用反例作为反馈信号、衡量智能体多轮修正效率的轻量级评估框架。

A-CEGIS 的工作流程并不复杂。智能体会为一组自然语言描述生成一个正则表达式,随后一个确定性 oracle 在全匹配语义下对该表达式进行检验。如果表达式不正确,oracle 会产生紧凑的反例说明失败模式:假正例意味着表达式错误地接受了一个不该接受的字符串,假负例则意味着表达式错误地拒绝了一个本应匹配的目标串。这些反例连同本轮失败信息一起被反馈给智能体,为下一轮自我修正提供明确方向。这种“提出—检验—反馈—修正”的循环,模拟了真实系统中智能体依据外部信号持续改善输出的过程。

实验结果展示了这种反馈方式的有效性。研究团队使用 NL-RX-Turk 数据集中的 30 个任务进行四轮消融实验:诊断性反例反馈在四轮内解决了 90% 的任务;相比之下,零样本生成只能解决 17%,通用自我修正只能解决 27%,而只提供错误类型、不含具体反例的反馈仅能解决 23%。当运行完整诊断流程并加入“加固”处理后,隐藏测试集中的全部任务都在最终轮之前被解决,平均成功轮数为 2.7 轮。研究还发现,在额外进行有针对性的探测后,表达式仍能保持 77% 的鲁棒成功率,说明该方法并未仅仅拟合已有测试用例。

作者认为,A-CEGIS 的价值在于提供了一种比单轮指标更贴近实际部署的评测方式。它既反映了智能体在多轮反馈中改进的速度与上限,也通过隐藏测试集和定向探测增加了对结果泛化能力的检查。该论文属于计算与语言(cs.CL)和人工智能(cs.AI)方向,arXiv 编号为 2609.02892。

展开要点与分析

文章情报

工程师进阶

要点

  • 单轮代码生成指标难以真实反映已部署智能体在收到具体反馈后修复错误产物的重要能力。
  • A-CEGIS 用确定性 oracle 检查正则表达式,并返回简洁的假阳性或假阴性反例以引导下一轮修正。
  • 在 NL-RX-Turk 的 30 个任务上,反例反馈四轮内解决 90%,明显优于零样本(17%)与通用自我修正(27%)。
  • 加入加固的完整诊断能解决隐藏集全部任务,平均 2.7 轮达到成功,针对性探测后仍有 77% 的鲁棒成功率。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。