AI News HubLIVE
站內改寫1 分鐘閱讀

反思性提示調優:利用語言模型函數調用

反思性提示調優(RPT)是一種通過LLM函數調用模擬人類提示工程師迭代工作流程的框架。RPT使用診斷函數評估模型在優化集上的表現,總結失敗模式,並利用累積記憶逐步改進提示。在三個推理任務上,RPT將初始提示性能提升高達12.9個點,並與現有最佳方法競爭,同時改善置信度校準。

來源arXiv Computational Linguistics作者: Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

大型語言模型(LLM)在遵循指令和複雜推理方面能力日益增強,這使得提示設計成為一種無需參數更新的靈活接口。然而,提示設計仍依賴於大量人工,且對格式、措辭和指令順序高度敏感。為解決這一問題,自動化提示優化方法應運而生,旨在減少手動工作同時保持推理時的靈活性。但現有方法通常搜索候選提示或使用由單個示例或小批量驅動的固定批評-優化流水線,難以捕捉系統性錯誤模式並進行基於失敗歷史的有針對性編輯。

研究人員提出了反思性提示調優(RPT),這是一個利用LLM函數調用模擬人類提示工程師迭代工作流程的框架。RPT中的LLM優化器調用一個診斷函數,該函數在整個優化集上評估目標模型,總結反覆出現的失敗模式,並返回結構化的診斷報告。優化器利用該報告以及以往報告的累積記憶,為下一輪迭代修改提示。RPT還通過診斷反饋和最終提示選擇中的校準信號支持置信度感知的優化。

在三個推理任務上,RPT相比初始提示性能提升高達12.9個點,與現有最佳方法保持競爭力,並改善了置信度校準。分析表明,RPT在多跳和數學推理任務上尤其有效,它能生成與診斷出的失敗模式相匹配的針對性提示修訂,從而帶來任務性能和校準的提升。該研究證明了利用函數調用進行自動化、迭代式提示優化的潛力。研究者還指出,RPT的設計靈感來源於人類提示工程師的工作方式:他們通過觀察模型在大量實例上的表現來識別常見錯誤,然後針對性地調整提示。RPT通過函數調用機制自動執行這一過程,並且能夠記憶之前的診斷結果,從而避免重複犯同樣的錯誤。此外,RPT的置信度感知優化允許模型在不確定時更謹慎地選擇提示,進一步提升了結果的可靠性。這項工作為自動化提示工程提供了新的方向,有望降低提示設計的人工成本,並提高LLM在各種任務上的表現。