AI News HubLIVE
站内改写1 分钟阅读

反思性提示调优:利用语言模型函数调用

反思性提示调优(RPT)是一种通过LLM函数调用模拟人类提示工程师迭代工作流程的框架。RPT使用诊断函数评估模型在优化集上的表现,总结失败模式,并利用累积记忆逐步改进提示。在三个推理任务上,RPT将初始提示性能提升高达12.9个点,并与现有最佳方法竞争,同时改善置信度校准。

来源arXiv Computational Linguistics作者: Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

大型语言模型(LLM)在遵循指令和复杂推理方面能力日益增强,这使得提示设计成为一种无需参数更新的灵活接口。然而,提示设计仍依赖于大量人工,且对格式、措辞和指令顺序高度敏感。为解决这一问题,自动化提示优化方法应运而生,旨在减少手动工作同时保持推理时的灵活性。但现有方法通常搜索候选提示或使用由单个示例或小批量驱动的固定批评-优化流水线,难以捕捉系统性错误模式并进行基于失败历史的有针对性编辑。

研究人员提出了反思性提示调优(RPT),这是一个利用LLM函数调用模拟人类提示工程师迭代工作流程的框架。RPT中的LLM优化器调用一个诊断函数,该函数在整个优化集上评估目标模型,总结反复出现的失败模式,并返回结构化的诊断报告。优化器利用该报告以及以往报告的累积记忆,为下一轮迭代修改提示。RPT还通过诊断反馈和最终提示选择中的校准信号支持置信度感知的优化。

在三个推理任务上,RPT相比初始提示性能提升高达12.9个点,与现有最佳方法保持竞争力,并改善了置信度校准。分析表明,RPT在多跳和数学推理任务上尤其有效,它能生成与诊断出的失败模式相匹配的针对性提示修订,从而带来任务性能和校准的提升。该研究证明了利用函数调用进行自动化、迭代式提示优化的潜力。研究者还指出,RPT的设计灵感来源于人类提示工程师的工作方式:他们通过观察模型在大量实例上的表现来识别常见错误,然后针对性地调整提示。RPT通过函数调用机制自动执行这一过程,并且能够记忆之前的诊断结果,从而避免重复犯同样的错误。此外,RPT的置信度感知优化允许模型在不确定时更谨慎地选择提示,进一步提升了结果的可靠性。这项工作为自动化提示工程提供了新的方向,有望降低提示设计的人工成本,并提高LLM在各种任务上的表现。