8月27日,Google將影片模型Gemini Omni 1.1 Flash推送給開發者。Google AI Studio當天開放,Gemini Enterprise版Agent平台API同步串接,Google Flow和Gemini App則針對Plus、Pro、Ultra訂閱用戶上線。Google在部落格為這個版本下了一句定位:
"Omni 1.1 is production-ready for professional use via the Gemini API."
(Omni 1.1透過Gemini API,已達到可投入專業正式產製的水準。)
接續視窗從1秒拉長到10秒
這次改動最實在的地方在場景延續性。6月底那版做接續時只讀取影片的最後1秒,模型拿到的資訊基本上等同一張靜態畫面:鏡頭正往哪個方向推、角色手上的動作做到哪個階段,它完全無從判斷。接出來的下一段畫面因此常常像是換了一個場景——跨場景的角色一致性難以維持,Google自己在上一版的說明文件中就承認過這點。
1.1把這個視窗拉長到前10秒。接續仍然是以10秒為一段往下走,但累積長度可以疊到40秒。同步新增的一項功能是首尾影格都能指定,轉場邏輯從「先生成、再挑選」變成「兩端先釘死、中間交給模型補」。做分鏡的人對這套邏輯不陌生:關鍵影格一旦固定,中間的動態才有依據可以推演。
草稿模式、4K放大與3秒影片參考
其餘幾項改動都是衝著工作流程去的:新增360p草稿模式,出片速度比720p最多快60%,用來快速篩選構圖;片子定案之後可以走4K放大;多模態輸入這端新增了影片參考,單段最長3秒,先前只能餵文字和圖片。最終輸出提供1080p與4K兩種規格。
影片參考改變的是輸入端的表達方式。過去想讓模型學一段運鏡,只能靠文字描述「緩慢向左橫移、輕微手持晃動」,模型能不能領會全憑運氣;現在可以直接丟一段3秒的樣片進去。3秒裝不下一整場戲,但足夠裝下一次完整的運鏡或一次動作循環,對需要統一鏡頭語言的系列作品來說,這比寫十行提示詞省事得多。360p草稿模式與它是搭配使用的組合:先用低解析度把節奏、構圖、鏡頭運動這些結構性的東西定案,再切到高解析度補細節,不必每一輪都付全額費用。
一段40秒的影片要花多少錢
Google這次沒有列出各解析度的秒單價,只在定價文件裡留了一個換算基準:影片輸出按token計費,720p每秒相當於5792個token,標準級距的影片輸出每百萬token收費17.50美元,換算下來大約每秒0.10美元。這個數字和6月底那版打平,兩個月沒有變動過。
以720p估算,一段40秒的連貫片子大約4美元。草稿模式的成本要另外算:如果先用360p把10種構圖篩到3種,再把留下的3種送去720p或1080p出成片,同樣的預算能多試兩輪鏡頭語言。1080p和4K的實際單價Google沒有公開,按token計費的規則推估,解析度愈高、單位時間耗用的token愈多,單價也會愈貴,實際倍數要等文件補齊。
片長這條線一直在往後推
把Omni這條產品線串起來看,節奏相當清楚。6月底的預覽版單段封頂10秒,每秒0.1美元,短板寫得明明白白。兩個月後,單段長度沒有變,但可以往後接3次,總長度翻了4倍,上下文視窗則放大了10倍。Google走的是分段拼接的路線:不去堆疊單次生成的長度,而是靠每一段被下一段準確接住來累積總長度。這條路線對顯示記憶體和推論成本比較友善,代價是接縫處的穩定性得靠上下文視窗硬撐——視窗從1秒拉長到10秒,正是在補這個洞。
40秒剪不出一支完整的廣告片,但社群平台上那批10幾到20秒的短影片,一段就夠用,兩段還有剪輯的餘裕。Google把「可投入專業正式產製」這句話寫進部落格,賭的正是這批量體大、單支價值不高、但對連貫性仍有基本要求的活兒。
參考來源:Google開發者部落格、Google DeepMind、CocoLoop、Gemini API定價文件;秒單價換算依720p每秒5792 token、標準級距影片輸出每百萬token 17.50美元核實。