Gemini 蒸馏服务开预览,只跑一个区域

谷歌云把 Gemini 蒸馏服务放进了预览阶段。这套服务做的事是拿一个大模型的回答和推理过程去训练一个更小的模型,目的是把延迟和调用费用压下来。优享先机期间,教师模型和学生模型都不给选:教师固定为 gemini-3.1-pro,学生固定为 gemini-2.5-flash。

门槛先摆在前面。项目 ID 必须先进许可名单,文档让用户联系自己的 Google 销售代表申请;蒸馏作业必须在 us-central1 区域运行,没有第二个选项。

数据集要求写得很细

训练数据是存在 Cloud Storage 上的 JSONL 提示集。每条记录里,contents 字段必填,装用户侧的输入;systemInstruction 可选,用来放系统提示。多轮对话按 user 和 model 交替排列。

规模上,文档建议样本量不少于 1000 条,硬上限 5 万条;源 JSONL 文件不超过 1 GB;单条记录的输入封顶 8000 token,教师模型的输出封顶 24000 token。整套服务只接受纯文本,多模态输入不在支持范围内。

价格和配额,文档一个字没写。这套东西目前挂在预发布条款下,谷歌自己标注为不建议用于生产环境。

把四步收进一个作业

蒸馏是个老技术了,之前想做要自己搭一条链路:调教师模型批量生成回答、清洗和去重、拿这批数据微调学生模型、再做一轮评估。四步里每一步都要自己写代码、自己管算力。托管服务把它们收成一个作业提交,用户只交提示集。

省下来的是工程量,换回来的是选择权变少。教师和学生都被锁死在指定型号上,意味着用户没法拿一个更贵的教师去堆效果,也没法把产出灌进一个自定义架构的小模型。us-central1 这条区域限制则把数据驻留的位置直接定死了,对有合规要求的用户,这一条比功能本身更关键。

同一个词,两种待遇

“蒸馏”这个词最近两年在中美之间的语境有点复杂。美国三家机构今年点名过六家中国企业蒸馏美国模型,Anthropic 也在报告里提过阿里等公司的大规模调用。在那些场合里,蒸馏被当作一种需要追责的行为。

差别在条款,不在技术动作。谷歌这套服务里,教师和学生都是自家模型,用户拿自己的提示集去跑,产出的学生模型服务于同一个账号,全程在授权范围内。跨厂商蒸馏——拿别家 API 的输出去训自己的模型——通常被服务条款明令禁止。同一串操作,落在授权里是产品功能,落在授权外是违约甚至诉讼材料。

对国内开发者来说,这条服务的实际可用性接近于零。许可名单要过销售关,区域锁在 us-central1,两道门叠在一起,把它挡在了大部分中国区项目之外。能参考的是它给出的那组参数:1000 条起、5 万条封顶、8000 token 输入,这是谷歌自己对”一次蒸馏需要多少数据”给出的工程口径,做同类事情的团队可以拿它当刻度尺。

预览期的空白

GA 时间、定价、配额上限,三样都还没有。教师和学生模型型号会不会扩充,文档也没提。在这些信息补齐之前,这套服务更像是给已经在用 Gemini 企业版的大客户开的一条内测通道,不是一个可以直接排进计划的工具。

参考来源:Google Cloud 官方文档、CocoLoop;教师与学生模型型号、区域限制、数据集字段与各项上限逐条核对文档原文。