AI News HubLIVE
站內改寫1 分鐘閱讀

基於示例的符號程式和提示程式效能預測

研究透過少數示例預測程式效能的方法,提出硬幣翻轉模型,發現符號程式效能先驗為全有或全無,提示程式效能先驗分散,並據此開發RAP方法,實現可靠的效能預測。

來源arXiv Machine Learning作者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

大型語言模型(LLM)的提示(prompting)被廣泛用於自然語言描述的任務,但其可靠性一直備受質疑:一個提示可能在少量測試用例上表現出色,卻在部署時遭遇失敗。來自arXiv的一項新研究(編號2605.21515)聚焦於效能預測問題,旨在解決這一困境。研究內容如下:給定一個程式——可以是符號程式(如Python指令碼),也可以是基於LLM的提示程式——以及少量來自同一領域的示例,預測該程式在未見過的任務上的表現。

研究人員採用了一種簡單的硬幣翻轉模型來建立理論框架。他們將每一次程式執行(透過或失敗)視為一個伯努利隨機變數,其成功機率即為程式未知的真實效能。在這個模型中,效能完全取決於兩個因素:一是測試用例上的觀察執行結果,二是效能的先驗分佈。透過對包含多種程式和任務的資料集進行編譯,團隊獲得了經驗性的效能先驗分佈,並發現了一個關鍵差異:符號程式(例如Python)的效能呈現全有或全無的分佈,而提示程式則具有分散的先驗,其中存在大量近乎正確的程式。這一差異從本質上解釋了為何少數透過測試能夠認證符號程式的可靠性,卻無法認證提示程式的可靠性。

基於這一洞察,研究團隊開發了RAP(Retrieved Approximate Prior,檢索近似先驗)方法。RAP從現有資料集中檢索相似的任務和提示程式,構建一個代理先驗,進而用於效能預測。實驗表明,RAP方法取得了可靠的效能。這項工作不僅揭示了符號程式與提示程式在可靠性上的根本差異,還為LLM應用的安全部署提供了一種實用的效能預測工具,有助於在實際應用中評估和選擇更可靠的程式或提示策略。