Gemini Omni 1.1 Flash 单段视频能接到 40 秒

8 月 27 日,谷歌把视频模型 Gemini Omni 1.1 Flash 推给开发者。Google AI Studio 当天开放,Gemini 企业版 Agent 平台 API 同步接入,Google Flow 和 Gemini app 面向 Plus、Pro、Ultra 订阅用户上线。谷歌在博客里给这一版加了一句定性:

“Omni 1.1 is production-ready for professional use via the Gemini API.” (Omni 1.1 经由 Gemini API 已达到可投入专业生产的状态。)

续接窗口从一秒变成十秒

改动最实的一处在场景延续。六月底那版做续接时只读视频的最后一秒,模型拿到的信息基本等同一张静帧:镜头正在往哪个方向推、人物手上的动作做到了哪一步,它都无从判断。接出来的第二段于是经常像换了片场——跨场景的角色一致性保不住,谷歌在上一版的说明里自己承认过

1.1 把这个窗口拉到前十秒。续接仍按十秒一段往下走,但累计长度可以堆到四十秒。配套新增的一项是首帧和末帧都能指定,转场从”生成完再挑”变成”两头先钉死、中间交给模型补”。做分镜的人对这套逻辑不陌生,关键帧定死,中间的运动才有得推。

草稿档、4K 放大和三秒视频参考

另外几项改动都冲着工作流去:新增 360p 草稿模式,出片速度比 720p 最多快 60%,用来快速筛构图;片子定下来之后可以走 4K 放大;多模态输入这头新增了视频参考,单段最长三秒,此前只能喂文字和图片。最终输出给到 1080p 和 4K 两档。

视频参考改的是输入侧的表达方式。以前想让模型学一段运镜,只能用文字描述”缓慢向左横移、轻微手持抖动”,模型领会到哪一步全看运气;现在可以直接丢三秒样片进去。三秒装不下一场戏,但足够装下一次完整的运镜或一个动作循环,对需要统一镜头语言的系列片来说,这比写十行提示词省事得多。360p 草稿档和它是一组配套:先用低分辨率把节奏、构图、镜头运动这些结构性的东西定下来,再切高分辨率补细节,中间不必每轮都付全价。

一段四十秒的片子要花多少钱

谷歌这次没有单列各分辨率的秒单价,只在定价文档里留了一个换算口径:视频输出按 token 计费,720p 每秒折合 5792 个 token,标准档视频输出每百万 token 17.50 美元,倒推下来约合每秒 0.10 美元。这个数字和六月底那版持平,两个月没动过。

按 720p 口径粗算,一段四十秒的连贯片子大约 4 美元。草稿档的账要另算:如果先用 360p 把十条构图筛到三条,再把留下的三条走 720p 或 1080p 出成片,同样的预算能多试两轮镜头语言。1080p 和 4K 的实际单价谷歌没公开,按 token 计费的规则粗推,分辨率越高单位时长的 token 越多、单价越贵,具体倍数要等文档补齐。

时长这条线一直在被往后推

把 Omni 这条产品线串起来看,节奏挺清楚。六月底的 preview 版单段封顶十秒,一秒 0.1 美元,短板写得明明白白。两个月后,单段长度没变,但能往后接三次,总时长翻了四倍,上下文窗口翻了十倍。谷歌走的是拆段拼接的路子:不去堆单次生成的长度,而靠每一段被下一段准确接住来攒总时长。这条路对显存和推理成本更友好,代价是接缝处的稳定性要靠上下文窗口硬撑——窗口从一秒变十秒,正是在补这个洞。

四十秒剪不出一条完整的广告片,但社交平台上那批十几到二十秒的短视频,一段够用,两段有剪辑余量。谷歌把”可投入专业生产”这句话写在博客里,赌的也是这批量大、单条价值不高、对连贯性又有基本要求的活儿。

参考来源:谷歌开发者博客、Google DeepMind、CocoLoop、Gemini API 定价文档;按 720p 每秒 5792 token、标准档视频输出每百万 token 17.50 美元核验秒单价换算口径。