Gemini让模型自己挑帧,视频token省88%

谷歌 9 月 1 日在 Gemini API 上线了一项叫 agentic video 的视频处理模式,把「怎么看视频」这件事交回给模型自己决定。开发者即刻可用,Gemini App 端随后铺开,YouTube 的 Ask YouTube 功能计划在未来几个月接上。

改动落在采样这一层。此前 Gemini 处理视频走的是固定帧率,默认每秒抽一帧,不管这段素材是发布会还是监控录像,一律按同一节奏喂进上下文。新模式下模型带上原生视频工具,边推理边决定看哪些片段、以什么速度看、走视觉帧、音频还是字幕,只把需要的时刻取回来。

三个数字

谷歌公布的对照结果是:token 消耗最多下降 88%,成本最多下降 66%,准确率最多提升 7%。同时给出的另一个结论是 Gemini 3.7 Flash 在视频分析上落到了准确率与成本的帕累托前沿,也就是同等价位再找不出更准的,同等准确度再找不出更便宜的。

三个数字里最反直觉的是第三个。降采样通常伴随信息损失,少看就该少知道。这里能反向涨分,是因为固定帧率的浪费和遗漏同时存在:一段两小时的会议录像里,大部分帧是同一个人对着同一张幻灯片,重复内容挤占了上下文预算;而真正的关键动作可能发生在某一秒之内,1 FPS 恰好错过。按需取片段既省掉了冗余帧,又能在需要处把采样密度提上去。

一笔粗账

一小时素材按每秒一帧就是 3600 帧,逐帧塞进上下文,输入 token 的量级是六位数起步(粗算)。这个数字决定了很多需求根本不敢做:一场三小时的直播回放、一周的门店监控、一部完整的纪录片,光是把素材读一遍的成本就压过了业务价值。砍掉 88% 之后落回五位数,长视频分析从演示 demo 挪进产品的门槛,就是在这个量级上过线的。

谷歌今年在 Flash 这条线上反复做的动作,基本都指向单位成本。视频这一块此前的进展是把单段可处理长度往上推,现在换成把单位长度的开销往下压。两件事叠起来,效果比任何一项单独推进都明显。

支持范围与开关

能用上的模型是 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,入口在 Gemini API(经由 Google AI Studio)和 Gemini Enterprise Agent Platform。计费仍走标准 Gemini API 的 token 价格,不额外收功能费——省下来的 token 直接体现在账单上。开发者侧的改动很轻,把配置里的处理方式设成 agentic 即可。

谷歌列的四类典型用途也说明了它想抢什么场景:亚秒级的片段定位,用来做剪辑;多小时长视频里的大海捞针式检索;靠动态重采样做异常检测;以及跨时间轴准确清点动作和物体的数量。前两类偏内容行业,后两类明显冲着监控、质检、巡检这些工业场景去。

国内团队怎么算这笔账

做短视频分发、直播质检、安防复核的团队,此前算长视频这笔账基本算不过来,通行做法是先用廉价模型或传统 CV 粗筛,再把可疑片段丢给大模型。采样权交给模型之后,这条流水线可以少掉一环——粗筛这件事本身被并进了模型的推理过程。

要留一句保守的:88%、66%、7% 都是「最多」,取的是最有利场景下的上限值。素材类型、问题类型不同,实际收益会往下掉多少,谷歌没有给分布。真要上生产,还得拿自家的素材跑一轮对照。

参考来源:Google 官方博客、CocoLoop、Google DeepMind;token 降幅 88%、成本降幅 66%、准确率提升 7% 三项口径与适用模型、计费方式,均按官方公告核对,帧数换算部分为编辑粗算。