Gemini 3.8 Flash 發布,程式碼跑分追平貴六倍對手

Google DeepMind 於9月2日發布 Gemini 3.8 Flash。根據官方模型卡的說法,它建立在 3.7 Flash 之上,改進集中在軟體工程與智能體知識工作流程兩塊。距離員工內測版本外流,只隔了短短幾天。

規格沒有大幅調整:輸入內容脈絡最高100萬 token,單次輸出上限6.4萬 token,知識截止到2026年3月,部分領域仍停在2025年1月。發布通路一次到位,Gemini 應用程式、AI Studio、Gemini API、Gemini Enterprise Agent Platform、Google AI Mode 與程式開發工具 Antigravity 都能使用。模型支援可調整的努力等級,讓開發者自行在品質、成本與延遲之間取得平衡。

同一張表裡的兩副面孔

官方對比表把 3.8 Flash 和 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 擺在一起,看點在價格與跑分之間的落差。

3.8 Flash 沿用促銷價,每百萬輸入 token 0.75美元、輸出3.75美元;Claude Opus 5 則是5美元與25美元,兩者相差超過六倍。在這個價差之下,兩者在 Terminal-bench 2.1 上是89.4比89.1,幾乎打平;CharXiv Reasoning 是86.2比83.7、HLE-Verified 是54.9比54.4、金融分析任務是61.4比58.6、Harvey 法律工作流程是10.0比6.7,都是3.8 Flash領先,長影片理解則以87.8比75.4拉開更大差距。

把任務拉長,局面就整個翻轉。Terminal-bench 4.0 考察更通用的智能體能力,Opus 5拿下51.8分,3.8 Flash只有19.1分;智能體操作電腦的 OSWorld-2.0 是75.4比59.0;衡量知識工作的 GDPVal-AA v2 Elo 分數,則是1824比1545。在 DeepSWE 這類長週期軟體工程任務上,74.0比71.0,差距不算大,但方向一致。

規律相當清楚:任務越短、越接近單輪判斷,價格級距的影響就越小;任務越長、越需要模型自行維持狀態並修正錯誤,級距之間的差距就重新拉開。粗略估算,跑完同一條中等複雜度的程式碼流程,3.8 Flash 的推論成本大概是 Opus 5 的六分之一,成績差距則在一個百分點以內;換成需要連續操作幾十個步驟的智能體流程,省下來的錢會被失敗重試吃掉多少,得自己實測才知道。

相較 3.7 Flash,這次的進步倒是實打實。DeepSWE 從65.3提升到71.0,Terminal-bench 4.0 從11.2提升到19.1,OSWorld 從50.6提升到59.0,生物研究工作流程的困難題型更是從43.4跳到56.5。以每隔幾週就推出新版的節奏來看,這個幅度並不算小。

使用者比官方公告更早知道

官方模型卡公布之前,開發者社群裡就已經有人察覺不對勁:網頁版與 Antigravity 上標示的仍是3.7 Flash,但被問到「你是什麼模型」時,卻回答自己是3.8 Flash。也有人在使用途中,模型選擇器裡突然多出一行3.8 Flash,努力等級預設還選了 High。

在前沿實驗室裡,悄悄更換模型是常見做法,好處是能先在真實負載下跑一輪,出問題隨時能切回去。代價則落在使用者身上:同一個模型名稱底下,行為在某個時間點就變了,提示詞效果、token 消耗與輸出風格都可能跟著改變,而這些通常不會寫進任何更新日誌。對按 token 計費的團隊來說,帳單上的波動往往比官方公告來得更早。

社群第一批測試用的還是老方法:讓模型一次生成太陽系動畫,或是畫一隻鵜鶘的 SVG。這類測試稱不上科學,勝在門檻低、好壞一眼就能看出來,在官方跑分出爐之前,往往是唯一能參考的依據。風評也沒有一致的定論,有人稱讚有人批評,跟每次模型更新時的情況差不多。

便宜是有期限的

模型卡列出了幾項已知限制:偶發的回應緩慢與逾時問題依然存在;努力等級調高時,模型會為了拉高表現多花費 token,實際成本未必會跟標示價格呈線性關係。安全性方面,官方表示整體與3.7 Flash相當,人工紅隊測試確認達到兒童安全的上線門檻,但非英語場景的安全指標則略有下滑。

價格欄位下方還有一行小字:3.7與3.8 Flash 的促銷價將於12月31日截止,明年1月1日起恢復到每百萬輸入 token 1.5美元、輸出7.5美元,正好翻倍。這張性價比表,四個月後就得重新計算一遍。

參考來源:Google DeepMind 模型卡、CocoLoop、Google 官方效能對比表、開發者社群討論;內容脈絡長度、輸出上限、知識截止日期與發布通路以模型卡核對,各項跑分與每百萬 token 單價則取自官方對比表。