AI News HubLIVE
サイト内リライト2 分で読了

言語モデル関数呼び出しによる内省的プロンプトチューニング

内省的プロンプトチューニング(RPT)は、LLM関数呼び出しを用いて人間のプロンプトエンジニアの反復作業を模倣するフレームワークです。RPTは診断関数を呼び出して最適化セット全体でターゲットモデルを評価し、繰り返し発生する失敗パターンを要約し、蓄積された記憶を使ってプロンプトを段階的に改良します。3つの推論タスクにおいて、RPTは初期プロンプトを最大12.9ポイント改善し、最先端技術と競合しつつ信頼度キャリブレーションも向上させます。

ソースarXiv Computational Linguistics著者: Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

大規模言語モデル(LLM)は指示追従や複雑な推論能力が向上しており、プロンプト設計はパラメータ更新なしでモデルを適応させる柔軟なインターフェースとなっています。しかし、プロンプト設計は依然として手間がかかり、書式、表現、指示の順序に非常に敏感です。この問題に対処するため、手作業を減らしつつ推論時の柔軟性を維持する自動プロンプト最適化手法が注目されています。しかし、既存手法はプロンプト候補を探索するか、個々の例や小さなバッチに基づく固定の批評・改良パイプラインを使用するため、体系的なエラーパターンを捉え、失敗履歴に基づいた的を絞った編集が困難でした。

研究者らは、LLM関数呼び出しを利用して人間のプロンプトエンジニアの反復作業を模倣するフレームワーク「内省的プロンプトチューニング(RPT)」を提案しました。RPTでは、LLMオプティマイザーが診断関数を呼び出し、最適化セット全体でターゲットモデルを評価、繰り返し発生する失敗モードを要約し、構造化された診断レポートを返します。オプティマイザーはこのレポートと過去のレポートの蓄積メモリを使用して、次のイテレーションのプロンプトを修正します。さらにRPTは、診断フィードバックと最終プロンプト選択におけるキャリブレーション信号を利用した信頼度認識最適化をサポートします。

3つの推論タスクにおいて、RPTは初期プロンプトを最大12.9ポイント改善し、最先端技術と競合しつつ信頼度キャリブレーションも向上させました。分析により、RPTはマルチホップ推論や数学的推論で特に効果的であり、診断された失敗パターンに合わせた的を絞ったプロンプト修正を生成し、タスク性能とキャリブレーションの向上につながることが示されました。この研究は、関数呼び出しを用いた自動化・反復的プロンプト最適化の可能性を示しています。さらに、RPTの設計は人間のプロンプトエンジニアの作業方法に着想を得ており、多数のインスタンスに対するモデルの振る舞いを観察して共通のエラーを特定し、それに基づいてプロンプトを調整するプロセスを自動化しています。過去の診断結果を記憶することで同じ誤りを繰り返さないようにし、信頼度を考慮した最適化により不確実な場合にはより慎重なプロンプト選択が可能となります。この研究は、プロンプト設計の人手コストを削減し、LLMの多様なタスクでの性能を向上させる新しい方向性を示しています。