員工搶先用上Gemini 3.8 Flash

根據《Business Insider》報導,Google 部分員工已經拿到 Gemini 3.8 Flash 的預覽版本,管道是公司內部的程式碼平台 Jetski。一名參與測試的員工形容,這個新版本「明顯比 3.7 Flash 好」,但也補充現在下完整定論還太早。Google 拒絕就此事發表評論。

把時間軸攤開來看,節奏一目了然:Gemini 3.6 Flash 在 7 月發布,3.7 Flash 三週後接力上場,3.8 Flash 現在則進入員工內測階段。Google 執行長 Sundar Pichai 在第二季財報電話會議上曾表示,公司會朝著接近每月發布一次的頻率推進。這句話當時聽起來像是目標,如今看來更像是已經在執行中的排程表。

旗艦延期,Flash 頂上陣線

Google 下一代旗艦大型模型的時程一再往後延,公司把資源集中投向了 Flash 這條產品線。《Business Insider》的報導把 Flash 系列定位為「主力機型」,對應的場景是寫程式與執行代理(agent)任務——這兩類工作負載的共同點是呼叫密集、上下文長,而且對單次品質落差的容忍度,比對成本的容忍度來得高。

這種取捨在帳面上相當好理解。同一條代理工作流程,把模型從 Pro 等級換成 Flash 等級,推論成本往往能省下近一個數量級(粗估數字,實際差距會隨上下文長度與快取命中率而變動)。當企業客戶開始逐月盯緊 AI 帳單,選用哪個等級的模型,決定權正從工程團隊移轉到財務部門手上。

Jetski 這個入口

內部程式碼平台率先拿到新模型,這個安排本身就透露出訊息。Google 數萬名工程師每天寫程式所產生的真實工作量,是一個規模夠大、回饋密度也夠高的驗證場,比任何公開的評測榜單都更貼近實際生產環境。讓模型先在內部程式碼平台跑上幾週再對外釋出,等於把成本最高的一輪紅隊測試,外包給了自家員工。

類似的做法在 OpenAI 與 Anthropic 身上也能看到影子。前沿實驗室自身的使用規模已經大到足以充當第一批使用者,模型的迭代速度因此不再受限於對外分階段釋出的節奏。

加速之後的副作用

模型從「一年一代」壓縮到「幾週一版」,評測榜單的有效期也跟著縮短。上一版才剛整合進產品線,下一版的預覽已經在內部跑了起來;對開發者而言,模型選型不再是一次性的決策,而是變成持續性的維護成本——提示詞要重新調校,工具呼叫格式要重新測試,成本模型也要重新計算。

對 Google 自己來說,密集發布同樣會稀釋單次發布所獲得的關注度。3.6、3.7、3.8 這三個版本號之間,實際能力差距有多大,外界目前並沒有可供比較的公開評測。Google 尚未公布 3.8 Flash 的正式發布時程,參數規模、定價、上下文長度也都還沒有對外揭露。

參考來源:Business Insider、CocoLoop、Google 第二季財報電話會議紀錄;模型版本代號、內部平台名稱與測試者說法以 Business Insider 報導為準,成本比較為編輯部粗估。