单轮代码生成指标是评估语言模型编程能力的常用方式,但在真实部署中,智能体往往不只需要一次性生成正确结果,更需要在与外部环境的多轮交互中,凭借具体反馈修正自己生成出的错误产物。针对自然语言到正则表达式生成任务,一篇于 2026 年 7 月 1 日提交至 arXiv 的新论文提出 A-CEGIS,一个利用反例作为反馈信号、衡量智能体多轮修正效率的轻量级评估框架。
A-CEGIS 的工作流程并不复杂。智能体会为一组自然语言描述生成一个正则表达式,随后一个确定性 oracle 在全匹配语义下对该表达式进行检验。如果表达式不正确,oracle 会产生紧凑的反例说明失败模式:假正例意味着表达式错误地接受了一个不该接受的字符串,假负例则意味着表达式错误地拒绝了一个本应匹配的目标串。这些反例连同本轮失败信息一起被反馈给智能体,为下一轮自我修正提供明确方向。这种“提出—检验—反馈—修正”的循环,模拟了真实系统中智能体依据外部信号持续改善输出的过程。
实验结果展示了这种反馈方式的有效性。研究团队使用 NL-RX-Turk 数据集中的 30 个任务进行四轮消融实验:诊断性反例反馈在四轮内解决了 90% 的任务;相比之下,零样本生成只能解决 17%,通用自我修正只能解决 27%,而只提供错误类型、不含具体反例的反馈仅能解决 23%。当运行完整诊断流程并加入“加固”处理后,隐藏测试集中的全部任务都在最终轮之前被解决,平均成功轮数为 2.7 轮。研究还发现,在额外进行有针对性的探测后,表达式仍能保持 77% 的鲁棒成功率,说明该方法并未仅仅拟合已有测试用例。
作者认为,A-CEGIS 的价值在于提供了一种比单轮指标更贴近实际部署的评测方式。它既反映了智能体在多轮反馈中改进的速度与上限,也通过隐藏测试集和定向探测增加了对结果泛化能力的检查。该论文属于计算与语言(cs.CL)和人工智能(cs.AI)方向,arXiv 编号为 2609.02892。