跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

谷歌为Gemini Flash模型推出智能体视频理解,视频Token消耗最高削减88%

文章摘要

谷歌为Gemini Flash系列模型推出智能体式视频理解。该功能不再以固定每秒1帧的方式通读整段视频,而是让模型主动决定观看哪些片段、以何种帧率分析,最高可减少88%的视频Token、降低66%成本,并在标准视频基准上提升最多7%准确率。功能通过Gemini API等托管服务提供,开发者只需在视频请求中设置一个字段即可启用。

来源MarkTechPost作者: Michal Sutter
谷歌为Gemini Flash模型推出智能体视频理解,视频Token消耗最高削减88%
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

视频一直是大模型推理成本最高的模态之一。过去,Gemini 模型拿到一段 90 分钟的讲座视频时,无论用户想概括全片,还是只想找到演讲者切换到定价幻灯片的具体时间,模型都会按每秒 1 帧的固定速率把视频整体抽帧读一遍。音频则固定按 1Kbps 单声道处理,每一秒都插入时间戳。这种静态单遍设计意味着开发者只能在“付出完整时间线的上下文开销”和“预先切块但可能漏掉关键细节”之间二选一。

谷歌这次为 Flash 模型推出的 agentic 视频理解,把流程倒了过来。模型不再被动吞入整条时间线,而是先根据提示词进行推理,再借助原生视频工具去搜索、扫描和检查相关片段,按需加载目标区间的帧、音频和转录文本。这个循环在模型内部自动完成,虽然开发者以前也能用手工串代码的方式实现类似效果,但如今无需自己搭建编排逻辑。Google 的评测显示,在视频分析任务上,Gemini 3.7 Flash 配合 agentic 理解已经落在准确率与成本的帕累托前沿;提升尤其集中在较长时间的内容上,例如 10 分钟教程或数小时录像。

部署上,该功能目前并非开源或可自托管。它作为托管 API 能力提供,正式支持 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform,可传入本地文件或公开 YouTube URL。计费沿用标准 Gemini API token 价格,不额外收取功能费。启用方法也很简单:在视频 part 里把 processing 设为 agentic。同一请求中的不同视频可以分别选择模式,例如对长讲座开 agentic,对短视频片段继续用 static。值得注意的是,模型“决定看什么”的导航推理会作为 thought tokens 计费(total_thought_tokens),而按需加载的帧、音频和转录内容则计入 tool-use tokens(total_tool_use_tokens)。

从 API 响应上,agentic 模式会在 steps 数组中多出两类步骤:processing_call 表示模型请求某个视频片段或转录,processing_result 表示对应内容加载完毕。两者与思考步骤交错排列,并出现在 model_output 之前,所以开发者可以拿这些步骤驱动界面里的实时进度,也能用来确认 agentic 模式确实执行。官方还提醒,static 处理仍是所有 Gemini 模型的默认模式;对短于 5 分钟的视频或需要逐帧精确检查的任务,静态模式仍然更合适。当前支持 Gemini 3.8、3.7、3.6 Flash 以及 3.5 Flash-Lite,只要设置一个 processing 字段就能切换。实际收益因视频长度和提示词而异,Google 给出的参考是 Token 最多减少 88%、成本最多下降 66%、标准视频基准准确率最多提高 7%。

展开要点与分析

文章情报

工程师进阶

要点

  • 模型按需检索视频片段、音频和字幕,替代固定1 FPS的全量抽帧。
  • 谷歌称最高可减少88% Token、降低66%成本,并提高7%准确率。
  • 仅通过Gemini API、AI Studio与Enterprise Agent Platform托管提供,不支持自托管。
  • 返回结果新增processing_call与processing_result步骤,方便追踪进度。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。