AI News HubLIVE
站内改写1 分钟阅读

基于示例的符号程序和提示程序性能预测

研究通过少数示例预测程序性能的方法,提出硬币翻转模型,发现符号程序性能先验为全有或全无,提示程序性能先验分散,并据此开发RAP方法,实现可靠的性能预测。

来源arXiv Machine Learning作者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

大型语言模型(LLM)的提示(prompting)被广泛用于自然语言描述的任务,但其可靠性一直备受质疑:一个提示可能在少量测试用例上表现出色,却在部署时遭遇失败。来自arXiv的一项新研究(编号2605.21515)聚焦于性能预测问题,旨在解决这一困境。研究内容如下:给定一个程序——可以是符号程序(如Python脚本),也可以是基于LLM的提示程序——以及少量来自同一领域的示例,预测该程序在未见过的任务上的表现。

研究人员采用了一种简单的硬币翻转模型来建立理论框架。他们将每一次程序执行(通过或失败)视为一个伯努利随机变量,其成功概率即为程序未知的真实性能。在这个模型中,性能完全取决于两个因素:一是测试用例上的观察执行结果,二是性能的先验分布。通过对包含多种程序和任务的数据集进行编译,团队获得了经验性的性能先验分布,并发现了一个关键差异:符号程序(例如Python)的性能呈现全有或全无的分布,而提示程序则具有分散的先验,其中存在大量近乎正确的程序。这一差异从本质上解释了为何少数通过测试能够认证符号程序的可靠性,却无法认证提示程序的可靠性。

基于这一洞察,研究团队开发了RAP(Retrieved Approximate Prior,检索近似先验)方法。RAP从现有数据集中检索相似的任务和提示程序,构建一个代理先验,进而用于性能预测。实验表明,RAP方法取得了可靠的性能。这项工作不仅揭示了符号程序与提示程序在可靠性上的根本差异,还为LLM应用的安全部署提供了一种实用的性能预测工具,有助于在实际应用中评估和选择更可靠的程序或提示策略。