基於示例的符號程序和提示程序性能預測
研究通過少數示例預測程序性能的方法,提出硬幣翻轉模型,發現符號程序性能先驗為全有或全無,提示程序性能先驗分散,並據此開發RAP方法,實現可靠的性能預測。
大型語言模型(LLM)的提示(prompting)被廣泛用於自然語言描述的任務,但其可靠性一直備受質疑:一個提示可能在少量測試用例上表現出色,卻在部署時遭遇失敗。來自arXiv的一項新研究(編號2605.21515)聚焦於性能預測問題,旨在解決這一困境。研究內容如下:給定一個程序——可以是符號程序(如Python腳本),也可以是基於LLM的提示程序——以及少量來自同一領域的示例,預測該程序在未見過的任務上的表現。
研究人員採用了一種簡單的硬幣翻轉模型來建立理論框架。他們將每一次程序執行(通過或失敗)視為一個伯努利隨機變量,其成功概率即為程序未知的真實性能。在這個模型中,性能完全取決於兩個因素:一是測試用例上的觀察執行結果,二是性能的先驗分佈。通過對包含多種程序和任務的數據集進行編譯,團隊獲得了經驗性的性能先驗分佈,並發現了一個關鍵差異:符號程序(例如Python)的性能呈現全有或全無的分佈,而提示程序則具有分散的先驗,其中存在大量近乎正確的程序。這一差異從本質上解釋了為何少數通過測試能夠認證符號程序的可靠性,卻無法認證提示程序的可靠性。
基於這一洞察,研究團隊開發了RAP(Retrieved Approximate Prior,檢索近似先驗)方法。RAP從現有數據集中檢索相似的任務和提示程序,構建一個代理先驗,進而用於性能預測。實驗表明,RAP方法取得了可靠的性能。這項工作不僅揭示了符號程序與提示程序在可靠性上的根本差異,還為LLM應用的安全部署提供了一種實用的性能預測工具,有助於在實際應用中評估和選擇更可靠的程序或提示策略。