跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

以反例作為智能體自我修正的反饋信號

文章摘要

arXiv:2609.02892 提出 A-CEGIS,一個輕量級評測框架,用確定性檢查器生成的反例作為反饋,測試自然語言到正則表達式合成中的多輪自我修正能力。在 NL-RX-Turk 的 30 個任務上,診斷性反例反饋四輪內解決 90% 的任務,而零樣本生成僅為 17%,通用自我修正為 27%,僅含錯誤信息的反饋為 23%。完整診斷流程加入加固後,隱藏測試集全部任務最終都被解決,平均成功輪數為 2.7 輪,額外針對性探測後魯棒成功率仍為 77%。

來源arXiv Computational Linguistics作者: Sidhesh Badrinarayan, Adithya Parthasarathy
以反例作為智能體自我修正的反饋信號
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

單輪代碼生成指標是評估語言模型編程能力的常用方式,但在真實部署中,智能體往往不只需要一次性生成正確結果,更需要在與外部環境的多輪交互中,憑藉具體反饋修正自己生成出的錯誤產物。針對自然語言到正則表達式生成任務,一篇於 2026 年 7 月 1 日提交至 arXiv 的新論文提出 A-CEGIS,一個利用反例作為反饋信號、衡量智能體多輪修正效率的輕量級評估框架。

A-CEGIS 的工作流程並不複雜。智能體會為一組自然語言描述生成一個正則表達式,隨後一個確定性 oracle 在全匹配語義下對該表達式進行檢驗。如果表達式不正確,oracle 會產生緊湊的反例説明失敗模式:假正例意味着表達式錯誤地接受了一個不該接受的字符串,假負例則意味着表達式錯誤地拒絕了一個本應匹配的目標串。這些反例連同本輪失敗信息一起被反饋給智能體,為下一輪自我修正提供明確方向。這種“提出—檢驗—反饋—修正”的循環,模擬了真實系統中智能體依據外部信號持續改善輸出的過程。

實驗結果展示了這種反饋方式的有效性。研究團隊使用 NL-RX-Turk 數據集中的 30 個任務進行四輪消融實驗:診斷性反例反饋在四輪內解決了 90% 的任務;相比之下,零樣本生成只能解決 17%,通用自我修正只能解決 27%,而只提供錯誤類型、不含具體反例的反饋僅能解決 23%。當運行完整診斷流程並加入“加固”處理後,隱藏測試集中的全部任務都在最終輪之前被解決,平均成功輪數為 2.7 輪。研究還發現,在額外進行有針對性的探測後,表達式仍能保持 77% 的魯棒成功率,説明該方法並未僅僅擬合已有測試用例。

作者認為,A-CEGIS 的價值在於提供了一種比單輪指標更貼近實際部署的評測方式。它既反映了智能體在多輪反饋中改進的速度與上限,也通過隱藏測試集和定向探測增加了對結果泛化能力的檢查。該論文屬於計算與語言(cs.CL)和人工智能(cs.AI)方向,arXiv 編號為 2609.02892。

展開要點與分析

文章情報

工程師進階

要點

  • 單輪代碼生成指標難以真實反映已部署智能體在收到具體反饋後修復錯誤產物的重要能力。
  • A-CEGIS 用確定性 oracle 檢查正則表達式,並返回簡潔的假陽性或假陰性反例以引導下一輪修正。
  • 在 NL-RX-Turk 的 30 個任務上,反例反饋四輪內解決 90%,明顯優於零樣本(17%)與通用自我修正(27%)。
  • 加入加固的完整診斷能解決隱藏集全部任務,平均 2.7 輪達到成功,針對性探測後仍有 77% 的魯棒成功率。

技術影響

可能影響 Agent 架構、工具調用、工作流自動化和產品集成。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。