GitHubは、Project HydraFusionをリサーチプレビューとして公開しました。これは、モデル選択を一度きりの設定として扱うのではなく、リクエストごとに実行計画を作成するという新しいアプローチです。従来のようにプロンプトを単一のモデルにルーティングする代わりに、HydraFusionはあるモデルでドラフトを作成し、別のモデルにそれを批評させたり、品質ゲートが最初の試行を拒否した場合にはより強力なモデルにエスカレーションしたりします。モデルは複数のプロバイダから調達され、開発者は他のモデルを選ぶのと同じようにHydraFusionを一度選択するだけで済みます。
導入範囲は限定的ですが、実際にデプロイ可能です。HydraFusionはすべてのGitHub Copilotプランのユーザー向けに、GitHub Copilot CLI内でのみリサーチプレビューとして提供されています。オープンウェイトやセルフホストの道はありません。利用するには、/update、/experimental on、/modelの順に実行し、HydraFusion (Research Preview)を選択します。課金は、ワークフローが呼び出した各モデルが消費したトークン単位で、各モデルの標準レートに従って計算されます。
HydraFusionは、GitHubが2026年初頭にリリースしたAuto model selectionの上に構築されています。Auto model selectionはタスクを最適な1つのモデルにマッチングする機能ですが、HydraFusionはさらに一歩進んで、ワークフロー選択を最適化問題として扱います。推論、コード生成、デバッグ、ツール使用などの能力シグナルを読み取り、品質基準を満たすと予測される最小限の複雑さのワークフローを選択します。追加のモデル呼び出しは、それが役立つ可能性が高い場合にのみ使用されます。
HydraFusionが現在選択できる実行パターンは3つです。Singleは選択された1つのモデルがタスクを直接解決します。Cascadeは効率的なモデルがソリューションをドラフトし、品質ゲートがそれを受け入れるか、より強力なモデルにエスカレーションします。Critiqueでは、1つのモデルがドラフトを作成し、別のモデルファミリーに属する独立した読み取り専用の批評家がそれをレビューし、ドラフト作成モデルが一度改訂します。このレビューはRubber Duckと同じパターンです。各パターンは品質とコストのトレードオフを異なる方法で扱います。Singleは速度を優先し、Cascadeはより強力な推論への道を開き、Critiqueは複数回の独立試行よりもレビューが有効な場面で外部の視点を追加します。
リポジトリレベルの作業に備えて、GitHubはランタイムに5つの運用原則を組み込みました。すべてのレッグ(ドラフト、批評、改訂、エスカレーション、リトライ、フォールバック)にわたる完全なアカウンティング、各レッグの明示的なタイムアウトとキャンセル境界、ツールを利用しないコンテキストで批評家がリポジトリを変更できないようにする分離レビュー、キャンセルまたは検証失敗時にパッチを適用しないフェイルセーフ、実行開始前にモデルバインディング・フォールバック動作・可用性を検証するルーティングです。内部的には各レッグの役割、結果、コスト、遅延、診断情報が記録されます。開発者には一貫した応答と権限認識型の変更セットだけが表示されます。
GitHubチームは、3つのエージェント型コーディングベンチマークで固定ポリシーのHydraFusionを評価しました。ベースラインとしてClaude Opus 5とGPT-5.6 Solを使用し、すべてのモデルを中程度の推論レベルで実行しました。報告された数値はOpus 5との比較です。TerminalBench 2.1では推定コストが67%低く、検証済みタスク品質が+4.9ポイント上回りました。DeepSWEではコスト36%減、品質-1.5ポイント、CheckpointBench(GitHub内部のマルチターンセットで、実際のCopilotセッションから収集され、不変の公開コミットに固定されているため再現可能)ではコスト65%減、品質-0.1ポイントでした。つまり、HydraFusionはコストを大幅に削減しながら、同等以上の品質を達成できることを示しています。この機能は現在Copilot CLIの/experimentalで利用でき、各基盤モデルの標準レートで課金されます。