Google DeepMind於10月6日發布新一代圖像模型Nano Banana 2.1,同日在Gemini API正式上線(GA),模型ID為「gemini-nano-banana-2.1」。這是Nano Banana 2(介面名稱gemini-3.1-flash-image)的更新版本,舊版介面將於10月29日停用。
根據官方模型卡,Nano Banana 2.1屬於Gemini 3系列,底層基於Gemini 3.6 Flash,本身是原生多模態推理模型。輸入支援文字與圖片,上下文視窗最高可達100萬token;輸出可以是圖片,也可以是最長6.4萬token的文字。
這次更新了哪些地方
API更新日誌列出四項改進:畫面品質、提示詞遵循度、多輪對話中的角色一致性,以及文字渲染。新增功能是超寬畫面比例,支援1:4、4:1、1:8、8:1四種比例,解析度可選1K、2K、4K。官方表示速度與成本仍維持在Flash等級。
模型卡列出了兩組對比數據:
- 文字生成圖片的整體人類偏好評分,Nano Banana 2.1的Thinking版為1050(±14),Nano Banana 2則為990(±7);
- 資訊圖表的事實準確率從0.179提升到0.521。
後者的漲幅接近三倍。資訊圖表不只要求畫面正確,數字與標註也必須準確,過去生圖模型在這方面最容易出錯。即便如此,0.521仍代表約有一半的資訊圖表存在事實性問題,若要用於正式資料,還是得靠人工再核對一次。
官方自己承認的缺點
模型卡列出了幾項已知限制:小字級與長段落的文字渲染效果不佳;輸入與輸出之間的角色一致性無法保證;空間方位推理能力有限,左右方向偶爾會搞混。知識截止時間方面,部分領域到2026年3月,其他領域則只到2025年1月。
安全性部分,模型卡表示該模型已通過兒童安全的上線門檻,專項紅隊測試未發現嚴重問題,前沿安全評估中也沒有觸及任何需要追蹤或屬於關鍵等級的能力。
整合到哪些產品
除了Gemini App、Google AI Studio與Gemini API,Nano Banana 2.1也接入了搜尋的AI模式、Google Ads、影片工具Flow,以及設計工具Stitch。廣告與搜尋這兩個入口顯示,Google打算直接把它用在商用素材的大量生成上。
對中國大陸開發者的影響
Gemini API在中國大陸無法直接連線,當地團隊多數透過海外雲端服務或第三方聚合平台呼叫。舊版介面23天後就會停用,聚合平台能否即時切換模型對應關係,是最容易出狀況的環節;目前用gemini-3.1-flash-image跑正式服務的團隊,最好這週就在測試環境換成新的模型ID。
中文使用場景還有一點要注意。模型卡把「小字級文字渲染效果不佳」列為限制之一,而中文字筆畫密集,同樣字級下比英文更容易糊掉,製作海報與電商主圖時,大標題問題不大,但小字說明可能還是得靠後製補強。Google目前尚未單獨公布中文渲染的評測數據。
更新日誌也沒有寫出新模型的價格,是否沿用Nano Banana 2的計費標準,官方還沒說明。
參考來源:CocoLoop、Google DeepMind模型卡、Gemini API更新日誌;偏好評分與資訊圖表準確率以模型卡公布的評測結果為準,停用安排以Gemini API更新日誌為準。