單輪代碼生成指標是評估語言模型編程能力的常用方式,但在真實部署中,智能體往往不只需要一次性生成正確結果,更需要在與外部環境的多輪交互中,憑藉具體反饋修正自己生成出的錯誤產物。針對自然語言到正則表達式生成任務,一篇於 2026 年 7 月 1 日提交至 arXiv 的新論文提出 A-CEGIS,一個利用反例作為反饋信號、衡量智能體多輪修正效率的輕量級評估框架。
A-CEGIS 的工作流程並不複雜。智能體會為一組自然語言描述生成一個正則表達式,隨後一個確定性 oracle 在全匹配語義下對該表達式進行檢驗。如果表達式不正確,oracle 會產生緊湊的反例説明失敗模式:假正例意味着表達式錯誤地接受了一個不該接受的字符串,假負例則意味着表達式錯誤地拒絕了一個本應匹配的目標串。這些反例連同本輪失敗信息一起被反饋給智能體,為下一輪自我修正提供明確方向。這種“提出—檢驗—反饋—修正”的循環,模擬了真實系統中智能體依據外部信號持續改善輸出的過程。
實驗結果展示了這種反饋方式的有效性。研究團隊使用 NL-RX-Turk 數據集中的 30 個任務進行四輪消融實驗:診斷性反例反饋在四輪內解決了 90% 的任務;相比之下,零樣本生成只能解決 17%,通用自我修正只能解決 27%,而只提供錯誤類型、不含具體反例的反饋僅能解決 23%。當運行完整診斷流程並加入“加固”處理後,隱藏測試集中的全部任務都在最終輪之前被解決,平均成功輪數為 2.7 輪。研究還發現,在額外進行有針對性的探測後,表達式仍能保持 77% 的魯棒成功率,説明該方法並未僅僅擬合已有測試用例。
作者認為,A-CEGIS 的價值在於提供了一種比單輪指標更貼近實際部署的評測方式。它既反映了智能體在多輪反饋中改進的速度與上限,也通過隱藏測試集和定向探測增加了對結果泛化能力的檢查。該論文屬於計算與語言(cs.CL)和人工智能(cs.AI)方向,arXiv 編號為 2609.02892。