自己改善エージェントによるエンドツーエンド推論の高速化
Asari AI は、自己改善エージェント(共同発明者)が AI 推論スタック全体を最適化し、DeepSeek v4 Pro と GLM 5.2 でスループットとインタラクティブ性を最大 16% 向上させたことを発表しました。分布レベルの正確性チェックによりモデルの動作を維持し、エージェントは実験から学んだ知識をモデル間で転用します。
Asari AI は、自己改善型エージェント(「共同発明者」)がエンドツーエンドの AI 推論を大幅に高速化する方法を発表しました。これらのエージェントは、NVIDIA B200 GPU と vLLM v0.23 上で動作する 2 つの大規模オープンソース LLM(DeepSeek v4 Pro および GLM 5.2)に対して、推論スタック全体を最適化しました。実験の結果、複数の最大同時実行レベルにおいて、スループットとインタラクティブ性が最大 16% 向上し、分布レベルの正確性チェックによってモデルの動作が維持されました。各同時実行レベルの最適化には約 1 日を要しました。
vLLM v0.26 の時点で、エージェントが行った変更のほとんどは上流バージョンに相当するものはありません。変更はカーネル、スケジューラ、ロードバランサ、設定など、推論スタック全体に及びます。Asari AI は、単一の高速カーネルだけでは高速システムにはならず(アムダールの法則)、正確性も保証できないと強調しています。そのため、個々のコンポーネントではなくスタック全体を一度に最適化しています。
速度は、モデルの動作が正しく維持されている場合にのみ意味があります。標準的なベンチマーク(GSM8K や GPQA など)の精度だけでは、カスタマイズによってモデルの出力が微妙に変化する可能性を捉えきれません。そのため、Asari AI は機能テストやベンチマークスコアではなく、厳格な分布一致チェックを使用しています。
エージェントは時間とともに学習します。各実験は再利用可能な洞察を生み出し、エージェントがモデルやワークロードを超えて発明プロセスを改善するために使用されます。例えば、エージェントは DeepSeek v4 Pro の最適化から学んだ教訓を GLM 5.2 に応用し、44 分の不必要な待機時間を節約する分散デッドロックを回避することを学びました。
推論システムの最適化は困難です。エージェントは、調整可能なパラメータやアルゴリズム実装を含む数百万行のコード、および無数のサーバー設定を考慮する必要があり、探索空間は膨大です。適切な場所での小さな変更が大きな利益を生み出す可能性がありますが、それらを見つけて優先順位を付けることが難しいのです。
最新の推論システムは、ソフトウェア(OS、カーネル、高レベルスクリプト、ランタイム、スケジューリング、キャッシング、負荷分散、相互接続、クライアント-サーバー設定)、ハードウェア(GPU、CPU、メモリ、ディスク、ノード内およびノード間接続)、およびランタイムダイナミクス(入力分布、キャッシュ動作、メモリプレッシャー、スロットリング、ネットワーク通信)など、多くの相互作用する要因に依存しています。これらのシステムは非常に動的であるため、最適化には継続的な評価とプロファイリングが必要であり、静的コード分析だけでは不十分です。しかし、エンドツーエンドの評価は遅く計算コストが高く、1 回の評価に数時間かかることもあります。
Asari AI の発明ループは、「発見と構築→評価→検証→自己改善」という厳格なプロセスに従い、多くのエージェントが並行して動作します。エージェントは最適化戦略を探索・実装し、各高速化が本物かどうかを評価し、モデルの出力を維持しているかどうかを検証し、学習した内容を次の実行に活かします。
発見と構築の段階では、エージェントは動的プロファイリング、静的解析、および自己改善メカニズムによる学習経験を使用して最適化戦略を提案します。潜在的な高速化と数値精度への影響を比較検討することで、最適化ターゲットに優先順位を付け、探索空間を狭め、探索と活用のバランスを取ります。
評価段階では、実際のプロダクションサーバー環境を再現したサンドボックスでフィードバックを得ます。エージェントはカスタマイズされた vLLM サービングスタックをテストし、独自の最適化カーネルとコードをデフォルト実装の代わりにディスパッチします。数千億から数兆のパラメータを持つモデルを複雑なワークロードで実行する場合、測定は遅く本質的にノイズが多くなります。バッチ処理動作の変化や GPU のパワースロットリングなどのハードウェア効果により、パフォーマンス評価にばらつきが生じます。Asari AI は測定ノイズの原因を特定して軽減し、エージェントが最適化中にクリーンなフィードバックを得られるようにします。次に、統計分析とアンチチートチェックを適用して、測定された高速化がプロダクションでも有効であることを確認します。
検証段階では、高速化がモデルの動作を十分に維持していることを確認します。小さな出力エラーが長いシーケンスで蓄積され、品質を低下させる可能性があります。彼らは、モデル出力分布の一致に基づく厳格な正確性チェックを使用します。これは、最適化されたモデルとオリジナルモデルの間のトークンレベルの確率分布に関する統計的整合性テストを含み、AllenAI Common Crawl C4 データセットからの多言語プロンプトコーパスを使用して評価されます。検証の頻度も重要で、多すぎると計算リソースを浪費し、少なすぎるとエージェントが軌道から外れる可能性があります。
自己改善の段階では、エージェントは実験から洞察を抽出し、それらをモデル間で再利用し、自身の推論、戦術、知識を更新します。これらの洞察は単なる事実検索を超え、エージェントは経験を使用してワークフローと発見プロセスを変更します。例えば、アンチパターンの回避、カーネル探索の改善、ワークフロールーティングの最適化、評価フレームワークの配線などが含まれます。
最適化の例としては、カスタムカーネル、カーネル融合、並列化戦略、起動オーバーヘッドの削減などが挙げられます。ほとんどの最適化は M=1 のスキニー GEMM カーネルやグルーコードの変更を対象としており、上流の vLLM v0.26 には相当するものはありません。
将来に向けて、Asari AI は長期間にわたって確実に動作し、最高レベルの厳密性を持つ実用的なシステム設計と最適化エージェントを構築しています。彼らの共同発明プロセスは、以下の要素によって強化されています。ループ内の全システムの正確な観察により、エージェントはシステムレベルの改善を推論できます。正確性により、各パフォーマンス向上が出荷可能で有意義な洞察の源となります。自律性により、エージェントは人間だけでは探索できない広大な空間を探索できます。学習により洞察が蓄積され、各実行でエージェントはより多くの経験を引き出せます。
スケーラブルな検証は依然として未解決の問題であり、フロンティア規模で自律最適化を実用的にするためには、その進展が必要です。Asari AI はこの初期段階で厳格な数値許容差を適用し、より広範な正確性概念に一般化するための強固な基盤を築いています。エージェントはより一般的な近似許容差の下で最適化できます。彼らは現在、共同発明者をさまざまなユースケースとデプロイメントパターンに積極的に適用しています。