本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

Google、Gemini Flashモデルにエージェント型動画理解を導入——動画トークンを最大88%削減

記事の要約

GoogleはGemini Flashモデル向けに、動画を1FPSで丸ごと読み込む方式から、プロンプトに必要な部分だけを探して処理するエージェント型動画理解を開始した。動画トークンを最大88%、コストを最大66%削減し、ベンチマーク精度は最大7%向上する。Gemini APIやAI Studioで利用でき、1つのフィールドで有効化できる。

ソースMarkTechPost著者: Michal Sutter
Google、Gemini Flashモデルにエージェント型動画理解を導入——動画トークンを最大88%削減
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

動画は、大規模言語モデルにとって最も処理コストが高いモダリティだ。これまでGeminiモデルが90分の講義動画を渡された場合、プロンプトが「全体的な要約を出して」でも「講演者が料金スライドに切り替えたのは何時か」でも、毎秒1フレームの固定レートで動画全体を読み込んでいた。音声は1kbps・モノラル、タイムスタンプは1秒ごとという決め打ちの処理で、この単一パス方式は「コンテキスト全体にコストを払う」か「あらかじめ分割して重要部分を見逃すリスクを取る」かの二者択一を強いる。

Googleが今回Flashモデル向けに提供を始めたエージェント型動画理解は、この流れを根本的に変える。モデルはタイムラインを最初から全部取り込むのではなく、プロンプトをもとに「どこを見るか」「何fpsで見るか」「どのモダリティを使うか」を判断し、フレーム・音声・文字起こしの中から必要な部分だけを検索・スキャンして読み込む。以前も開発者が手作業で似たループを組むことはできたが、今回の変更はGeminiがそのループを内部で実行する点で、開発のオーバーヘッドが不要になる。Googleの評価によると、Gemini 3.7 Flashはエージェント型理解を使うことで、動画分析の精度対コストでパレート最前線に位置する。効果が大きいのは10分のハウツーから数時間に及ぶ長尺動画だ。

利用形態はホスト型APIのみだ。オープンウエイトはなく、セルフホストもできない。Gemini APIのほか、Google AI StudioとGemini Enterprise Agent Platformから利用でき、ファイルアップロードと公開YouTube URLの両方に対応する。課金は通常のGemini APIトークン価格が適用され、追加の機能料金はない。有効化の方法は、動画partのprocessingフィールドをagenticに設定するだけ。同じリクエスト内でも動画ごとにモードを混在でき、長い講義はagentic、短いクリップはstaticという使い分けが可能だ。

APIのレスポンスには、新しいステップ型が追加される。モデルが動画セグメントや文字起こしを要求するとprocessing_call、その読み込みが完了するとprocessing_resultがsteps配列に現れる。これらは思考ステップと交互に置かれ、model_outputの前に来るため、UIでライブの進行状況を表示したり、実際にagenticモードで処理されたかを確認したりできる。トークン会計も分割され、ナビゲーションの推論は思考トークン(total_thought_tokens)、オンデマンドで読み込んだフレームや音声・文字起こしはツール使用トークン(total_tool_use_tokens)として計上される。

なお、静的処理は引き続き全Geminiモデルのデフォルトであり、5分未満のクリップやフレーム単位の精密な確認が必要な場合はstaticの方が適している。対応モデルはGemini 3.8、3.7、3.6 Flash、および3.5 Flash-Liteで、1つのprocessingフィールドで切り替えられる。Googleは、最大88%のトークン削減、最大66%のコスト削減、標準ビデオベンチマークで最大7%の精度向上という数値を示している。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 動画タイムラインを検索し、必要なセグメントだけを読み込む方式。
  • 最大88%のトークン削減、最大66%のコスト削減、最大7%の精度向上を発表。
  • ホスト型APIのみで提供され、オープンウェイトやセルフホストは不可。
  • レスポンスにprocessing_call/processing_resultが追加され、思考トークンとツール使用トークンに分けて計上。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。