AI News HubLIVE
站內改寫1 分鐘閱讀

反思性提示調優:利用語言模型函式呼叫

反思性提示調優(RPT)是一種透過LLM函式呼叫模擬人類提示工程師迭代工作流程的框架。RPT使用診斷函式評估模型在最佳化集上的表現,總結失敗模式,並利用累積記憶逐步改進提示。在三個推理任務上,RPT將初始提示效能提升高達12.9個點,並與現有最佳方法競爭,同時改善置信度校準。

來源arXiv Computational Linguistics作者: Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

大型語言模型(LLM)在遵循指令和複雜推理方面能力日益增強,這使得提示設計成為一種無需引數更新的靈活介面。然而,提示設計仍依賴於大量人工,且對格式、措辭和指令順序高度敏感。為解決這一問題,自動化提示最佳化方法應運而生,旨在減少手動工作同時保持推理時的靈活性。但現有方法通常搜尋候選提示或使用由單個示例或小批次驅動的固定批評-最佳化流水線,難以捕捉系統性錯誤模式並進行基於失敗歷史的有針對性編輯。

研究人員提出了反思性提示調優(RPT),這是一個利用LLM函式呼叫模擬人類提示工程師迭代工作流程的框架。RPT中的LLM最佳化器呼叫一個診斷函式,該函式在整個最佳化集上評估目標模型,總結反覆出現的失敗模式,並返回結構化的診斷報告。最佳化器利用該報告以及以往報告的累積記憶,為下一輪迭代修改提示。RPT還透過診斷反饋和最終提示選擇中的校準訊號支援置信度感知的最佳化。

在三個推理任務上,RPT相比初始提示效能提升高達12.9個點,與現有最佳方法保持競爭力,並改善了置信度校準。分析表明,RPT在多跳和數學推理任務上尤其有效,它能生成與診斷出的失敗模式相匹配的針對性提示修訂,從而帶來任務效能和校準的提升。該研究證明了利用函式呼叫進行自動化、迭代式提示最佳化的潛力。研究者還指出,RPT的設計靈感來源於人類提示工程師的工作方式:他們透過觀察模型在大量例項上的表現來識別常見錯誤,然後針對性地調整提示。RPT透過函式呼叫機制自動執行這一過程,並且能夠記憶之前的診斷結果,從而避免重複犯同樣的錯誤。此外,RPT的置信度感知最佳化允許模型在不確定時更謹慎地選擇提示,進一步提升了結果的可靠性。這項工作為自動化提示工程提供了新的方向,有望降低提示設計的人工成本,並提高LLM在各種任務上的表現。