單輪程式碼生成指標是評估語言模型程式設計能力的常用方式,但在真實部署中,智慧體往往不只需要一次性生成正確結果,更需要在與外部環境的多輪互動中,憑藉具體反饋修正自己生成出的錯誤產物。針對自然語言到正規表示式生成任務,一篇於 2026 年 7 月 1 日提交至 arXiv 的新論文提出 A-CEGIS,一個利用反例作為反饋訊號、衡量智慧體多輪修正效率的輕量級評估框架。
A-CEGIS 的工作流程並不複雜。智慧體會為一組自然語言描述生成一個正規表示式,隨後一個確定性 oracle 在全匹配語義下對該表示式進行檢驗。如果表示式不正確,oracle 會產生緊湊的反例說明失敗模式:假正例意味著表示式錯誤地接受了一個不該接受的字串,假負例則意味著表示式錯誤地拒絕了一個本應匹配的目標串。這些反例連同本輪失敗資訊一起被反饋給智慧體,為下一輪自我修正提供明確方向。這種“提出—檢驗—反饋—修正”的迴圈,模擬了真實系統中智慧體依據外部訊號持續改善輸出的過程。
實驗結果展示了這種反饋方式的有效性。研究團隊使用 NL-RX-Turk 資料集中的 30 個任務進行四輪消融實驗:診斷性反例反饋在四輪內解決了 90% 的任務;相比之下,零樣本生成只能解決 17%,通用自我修正只能解決 27%,而只提供錯誤型別、不含具體反例的反饋僅能解決 23%。當執行完整診斷流程並加入“加固”處理後,隱藏測試集中的全部任務都在最終輪之前被解決,平均成功輪數為 2.7 輪。研究還發現,在額外進行有針對性的探測後,表示式仍能保持 77% 的魯棒成功率,說明該方法並未僅僅擬合已有測試用例。
作者認為,A-CEGIS 的價值在於提供了一種比單輪指標更貼近實際部署的評測方式。它既反映了智慧體在多輪反饋中改進的速度與上限,也透過隱藏測試集和定向探測增加了對結果泛化能力的檢查。該論文屬於計算與語言(cs.CL)和人工智慧(cs.AI)方向,arXiv 編號為 2609.02892。