跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

谷歌為Gemini Flash模型推出智慧體影片理解,影片Token消耗最高削減88%

文章摘要

谷歌為Gemini Flash系列模型推出智慧體式影片理解。該功能不再以固定每秒1幀的方式通讀整段影片,而是讓模型主動決定觀看哪些片段、以何種幀率分析,最高可減少88%的影片Token、降低66%成本,並在標準影片基準上提升最多7%準確率。功能透過Gemini API等託管服務提供,開發者只需在影片請求中設定一個欄位即可啟用。

來源MarkTechPost作者: Michal Sutter
谷歌為Gemini Flash模型推出智慧體影片理解,影片Token消耗最高削減88%
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

影片一直是大模型推理成本最高的模態之一。過去,Gemini 模型拿到一段 90 分鐘的講座影片時,無論使用者想概括全片,還是隻想找到演講者切換到定價幻燈片的具體時間,模型都會按每秒 1 幀的固定速率把影片整體抽幀讀一遍。音訊則固定按 1Kbps 單聲道處理,每一秒都插入時間戳。這種靜態單遍設計意味著開發者只能在“付出完整時間線的上下文開銷”和“預先切塊但可能漏掉關鍵細節”之間二選一。

谷歌這次為 Flash 模型推出的 agentic 影片理解,把流程倒了過來。模型不再被動吞入整條時間線,而是先根據提示詞進行推理,再借助原生影片工具去搜尋、掃描和檢查相關片段,按需載入目標區間的幀、音訊和轉錄文本。這個迴圈在模型內部自動完成,雖然開發者以前也能用手工串程式碼的方式實現類似效果,但如今無需自己搭建編排邏輯。Google 的評測顯示,在影片分析任務上,Gemini 3.7 Flash 配合 agentic 理解已經落在準確率與成本的帕累託前沿;提升尤其集中在較長時間的內容上,例如 10 分鐘教程或數小時錄影。

部署上,該功能目前並非開源或可自託管。它作為託管 API 能力提供,正式支援 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform,可傳入本地檔案或公開 YouTube URL。計費沿用標準 Gemini API token 價格,不額外收取功能費。啟用方法也很簡單:在影片 part 裡把 processing 設為 agentic。同一請求中的不同影片可以分別選擇模式,例如對長講座開 agentic,對短影片片段繼續用 static。值得注意的是,模型“決定看什麼”的導航推理會作為 thought tokens 計費(total_thought_tokens),而按需載入的幀、音訊和轉錄內容則計入 tool-use tokens(total_tool_use_tokens)。

從 API 響應上,agentic 模式會在 steps 陣列中多出兩類步驟:processing_call 表示模型請求某個影片片段或轉錄,processing_result 表示對應內容載入完畢。兩者與思考步驟交錯排列,並出現在 model_output 之前,所以開發者可以拿這些步驟驅動介面裡的即時進度,也能用來確認 agentic 模式確實執行。官方還提醒,static 處理仍是所有 Gemini 模型的預設模式;對短於 5 分鐘的影片或需要逐幀精確檢查的任務,靜態模式仍然更合適。當前支援 Gemini 3.8、3.7、3.6 Flash 以及 3.5 Flash-Lite,只要設定一個 processing 欄位就能切換。實際收益因影片長度和提示詞而異,Google 給出的參考是 Token 最多減少 88%、成本最多下降 66%、標準影片基準準確率最多提高 7%。

展開要點與分析

文章情報

工程師進階

要點

  • 模型按需檢索影片片段、音訊和字幕,替代固定1 FPS的全量抽幀。
  • 谷歌稱最高可減少88% Token、降低66%成本,並提高7%準確率。
  • 僅透過Gemini API、AI Studio與Enterprise Agent Platform託管提供,不支援自託管。
  • 返回結果新增processing_call與processing_result步驟,方便追蹤進度。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。