Google Cloud 把 Gemini 蒸餾服務推進了預覽階段。這項服務的做法是拿一個大型模型的回答與推理過程,去訓練一個更小的模型,目的是壓低延遲與呼叫成本。在搶先體驗期間,教師模型與學生模型都不開放選擇:教師固定為 gemini-3.1-pro,學生固定為 gemini-2.5-flash。
門檻先擺在前面。專案 ID 必須先進入許可名單,文件要求使用者聯繫自己的 Google 業務代表提出申請;蒸餾作業必須在 us-central1 地區執行,沒有第二個選項。
資料集要求寫得相當細
訓練資料是存放在 Cloud Storage 上的 JSONL 提示詞集合。每一筆紀錄中,contents 欄位為必填,用來放使用者端的輸入;systemInstruction 為選填,用來放系統提示詞。多輪對話則按 user 與 model 交替排列。
規模方面,文件建議樣本數至少 1,000 筆,硬性上限為 5 萬筆;來源 JSONL 檔案不得超過 1 GB;單筆紀錄的輸入上限為 8,000 token,教師模型的輸出上限為 24,000 token。整套服務只接受純文字,多模態輸入不在支援範圍內。
至於價格與配額,文件隻字未提。這套服務目前掛在預發布條款之下,Google 自己也標註不建議用於正式環境。
把四個步驟收進一個作業裡
蒸餾本身是個老技術了,過去要自己做,得從頭搭一條流程:叫教師模型批次產生回答、清洗與去重、拿這批資料微調學生模型、再跑一輪評估。這四個步驟每一步都得自己寫程式碼、自己管理運算資源。代管服務把它們收進一個作業裡提交,使用者只需要交出提示詞資料集。
省下來的是工程量,換回來的是選擇權變少。教師與學生都被鎖定在指定型號上,代表使用者沒辦法拿一個更貴的教師模型去堆疊效果,也沒辦法把產出灌進一個自訂架構的小型模型。us-central1 這條地區限制,則直接把資料落地的位置定死了,對有合規要求的使用者來說,這一點比功能本身還關鍵。
同一個詞,兩種待遇
「蒸餾」這個詞,這兩年在中美之間的語境變得有點複雜。美國三個機構今年點名過六家中國企業蒸餾美國模型,Anthropic 也在報告中提過阿里巴巴等公司的大規模 API 呼叫。在那些場合裡,蒸餾被當成一種需要被追究責任的行為。
差別在條款,不在技術動作本身。Google 這套服務裡,教師與學生都是自家模型,使用者拿自己的提示詞資料集去跑,產出的學生模型服務於同一個帳號,整個過程都在授權範圍之內。跨廠商蒸餾——拿別家 API 的輸出去訓練自己的模型——通常會被服務條款明文禁止。同一串操作,落在授權範圍內是產品功能,落在範圍外就可能是違約甚至變成訴訟材料。
對中國開發者來說,這項服務的實際可用性接近於零。許可名單得先過業務關卡,地區又鎖死在 us-central1,兩道門檻疊在一起,把大部分中國區專案擋在外面。能參考的是它公開的那組參數:1,000 筆起跳、5 萬筆封頂、8,000 token 輸入,這是 Google 自己對「一次蒸餾需要多少資料」給出的工程口徑,做類似事情的團隊可以拿它當量尺。
預覽期間的空白
GA 時程、定價、配額上限,三樣都還沒公布。教師與學生模型的型號會不會擴充,文件也沒提。在這些資訊補齊之前,這套服務更像是給已經在用 Gemini Enterprise 的大型客戶開的一條搶先體驗通道,還不是能直接排進計畫的工具。
參考來源:Google Cloud 官方文件、CocoLoop;教師與學生模型型號、地區限制、資料集欄位與各項上限,均逐條對照文件原文核實。