Gemini讓模型自選影格 token省最多88%

Google在9月1日於Gemini API上線了一個名為agentic video的影片處理模式,把「影片該怎麼看」這件事交還給模型自己判斷。開發者即刻可用,Gemini App端隨後跟進,YouTube的Ask YouTube功能則計劃在未來幾個月內接上。

三個數字

這次改動落在取樣這一層。過去Gemini處理影片走的是固定影格率,預設每秒抽一格,不論素材是發表會還是監視器畫面,一律用同樣的節奏餵進上下文視窗。新模式下,模型帶著原生影片工具,一邊推理一邊決定要看哪些片段、用什麼速度看、要抓畫面、音軌還是字幕,只把真正需要的時刻取回來。

Google公布的對照結果是:token消耗最多下降88%,成本最多下降66%,準確率最多提升7%。同時Google也表示,Gemini 3.7 Flash在影片分析上已站上準確率與成本的柏拉圖前緣(Pareto frontier),也就是同樣價位再找不到更準的、同樣準確度再找不到更便宜的。

三個數字裡最違反直覺的是第三個。降低取樣密度通常伴隨資訊損失,看得少理論上該知道得少。這裡卻能反過來拉高分數,原因是固定影格率同時存在浪費和遺漏:一段兩小時的會議錄影裡,大部分畫面都是同一個人站在同一張投影片前,重複內容佔掉了上下文預算;而真正關鍵的動作可能只發生在短短一秒之內,每秒一格恰好會漏掉。按需取片段一方面省掉冗餘畫面,另一方面又能在需要的地方把取樣密度拉高。

一筆粗略帳

一小時的素材若以每秒一格計算就是3,600格,逐格塞進上下文,輸入token量級粗估要從六位數起跳。這個數字讓很多需求根本不敢碰:三小時的直播回放、一週份的店面監視畫面、一整部紀錄片,光是把素材讀過一遍的成本就已經超過了業務本身的價值。砍掉88%之後落回五位數,長影片分析從展示用的demo跨進產品功能的門檻,就是卡在這個量級。

Google今年在Flash這條產品線上反覆做的動作,大致都指向單位成本。影片這一塊過去的進展是把單段可處理長度往上推,這次則換成把單位長度的開銷往下壓。兩件事疊加起來,效果比單獨推進任何一項都明顯。

支援範圍與開啟方式

目前支援的模型是Gemini 3.7 Flash、3.6 Flash與3.5 Flash-Lite,入口在Gemini API(透過Google AI Studio)以及Gemini Enterprise Agent Platform。計費仍按標準Gemini API的token價格計算,不額外收取功能費用——省下來的token直接反映在帳單上。開發者端要做的改動很小,只要把設定裡的處理方式改成agentic即可。

Google列出的四類代表性用途,也透露了鎖定的場景:亞秒級的片段定位,用於剪輯;數小時長影片裡的大海撈針式檢索;靠動態重新取樣做異常偵測;以及跨時間軸準確清點動作與物件的數量。前兩類偏向內容與媒體產業,後兩類則明顯衝著監控、品管、巡檢這類工業場景而來。

對影片處理流程來說意味著什麼

做短影音發布、直播品質檢核、保全影像複核的團隊,過去這筆長影片分析的帳大多算不過去,慣用做法是先用便宜的模型或傳統電腦視覺粗篩,再把可疑片段丟給大模型。取樣的判斷權轉移到模型之後,這條流程有機會少掉一道工序——粗篩這件事本身被併進了模型的推理過程裡。

要留一句保守的話:88%、66%、7%都是「最多」的數字,取的是最有利情境下的上限值。素材類型與任務類型不同,實際效益會往下掉多少,Google並未公布分布區間。真要上線到正式環境,還是得拿自家素材先跑一輪對照測試。

參考來源:Google官方部落格、CocoLoop、Google DeepMind;token降幅88%、成本降幅66%、準確率提升7%三項數字,以及適用模型、計費方式,皆依官方公告核對,影格數換算部分為編輯部粗估。