AI News HubLIVE
サイト内リライト2 分で読了

SkillSmith:エージェントスキルを境界ガイドされたランタイムインターフェースにコンパイルする

SkillSmithは、スキルから細粒度の操作境界を抽出し、オフラインで最小の実行可能インターフェースにコンパイルする境界優先のコンパイラ・ランタイムフレームワークです。LLMベースのエージェントシステムにおける不要なコンテキスト注入や冗長な推論を削減します。SkillsBenchベンチマークでは、トークン使用量57.44%削減、思考反復42.99%削減、解決時間50.57%短縮(2.02倍高速化)、コスト57.44%削減を達成。さらに、強力なモデルが生成したコンパイル成果物を、より小さなモデルが再利用でき、精度が向上する場合もあります。

ソースarXiv AI著者: Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

近年、大規模言語モデル(LLM)ベースのエージェントシステムは、様々な領域でスキル(技能)を利用して特定のタスクを実行するようになっています。既存のフレームワークでは、スキルは通常、コンテキストガイダンスとしてエージェントの推論ループに注入され、ランタイムタスクにマッチすると特殊な問題解決機能を発揮します。しかし、この実行パラダイムには2つの大きな冗長性の原因があります。1つは無関係なコンテキストの注入であり、現在のタスクに関係のないスキル内容も一緒に入力されることです。もう1つは、タスク固有の推論と計画が毎回繰り返されることです。

これらの非効率性を解決するために、Duling Xuらの研究チームはSkillSmithを提案しました。これは境界優先のコンパイラ・ランタイムフレームワークで、スキルパッケージをオフラインで分析し、細粒度の操作境界(入出力仕様、依存関係、実行条件など)を抽出して、最小限の実行可能インターフェースにコンパイルします。ランタイムでは、エージェントは完全なスキル記述を読み込む代わりに、タスクの要求に応じてインターフェースの関連コンポーネントのみに動的にアクセスし実行します。これにより、不要なコンテキスト注入が最小限に抑えられ、冗長な推論が排除されます。

研究チームはSkillsBenchベンチマークを用いてSkillSmithを評価しました。生のスキルを使用する標準的な手法と比較して、SkillSmithは解決段階のトークン使用量を57.44%、思考反復回数を42.99%、解決時間を50.57%(2.02倍高速)、トークン比例の金銭的コストを57.44%削減しました。これらの結果は、SkillSmithが推論オーバーヘッドを大幅に削減できることを示しています。

さらに注目すべきは、SkillSmithのコンパイル成果物がモデル間で再利用可能な点です。強力なモデル(GPT-4レベルなど)が生成したコンパイルインターフェースは、より小さく効率的なランタイムモデルが直接利用できます。生のスキル解釈が失敗するケースでは、コンパイル成果物を再利用することでタスクの精度が向上することもあります。この特性は、異なる規模のモデル間の連携に新たな可能性を開き、企業が推論時にコスト効率の良いモデルを使用しながら、性能を維持または向上させることを可能にします。

SkillSmithに関する論文はarXivで公開されており、ソースコードとデータセットはGitHubでオープンソースとして提供されています。この研究は、LLMエージェントの推論コスト削減のための実用的なソリューションを提供するだけでなく、将来のより効率的で柔軟なエージェントシステム構築の基盤を築くものです。研究者らは今後、より複雑なマルチスキル協調シナリオへのフレームワーク適用や、コンパイル段階の自動化をさらに進める予定です。