Google Cloud ha puesto su servicio de destilación de Gemini en fase de vista previa. Este servicio toma las respuestas y el proceso de razonamiento de un modelo grande para entrenar un modelo más pequeño, con el objetivo de reducir la latencia y el costo de las llamadas a la API. Durante el acceso anticipado, no se pueden elegir los modelos profesor y alumno: el profesor está fijado en gemini-3.1-pro, el alumno en gemini-2.5-flash.
Las barreras aparecen desde el principio. El ID del proyecto debe estar antes en una lista de acceso autorizado; la documentación indica al usuario que contacte a su representante de ventas de Google para solicitarlo. Los trabajos de destilación deben ejecutarse obligatoriamente en la región us-central1, sin una segunda opción.
Los requisitos del conjunto de datos están muy detallados
Los datos de entrenamiento son conjuntos de prompts en formato JSONL almacenados en Cloud Storage. En cada registro, el campo contents es obligatorio y contiene la entrada del lado del usuario; systemInstruction es opcional y sirve para el prompt de sistema. Las conversaciones de varios turnos alternan entre user y model.
En cuanto a la escala, la documentación recomienda no menos de 1.000 muestras, con un límite duro de 50.000; el archivo JSONL de origen no debe superar 1 GB; la entrada de cada registro tiene un tope de 8.000 tokens, y la salida del modelo profesor, de 24.000 tokens. Todo el servicio solo acepta texto plano, las entradas multimodales no están dentro del alcance soportado.
Sobre precios y cuotas, la documentación no dice absolutamente nada. Este servicio se encuentra actualmente bajo términos previos a la disponibilidad general (pre-GA), y el propio Google señala que no se recomienda para entornos de producción.
Cuatro pasos reunidos en un solo trabajo
La destilación es una técnica antigua; antes, para hacerla había que construir uno mismo todo un flujo: hacer que el modelo profesor generara respuestas en lote, limpiarlas y eliminar duplicados, usar esos datos para ajustar (fine-tuning) el modelo alumno y luego realizar una ronda de evaluación. Cada uno de esos cuatro pasos exigía escribir código propio y gestionar cómputo propio. El servicio gestionado los reúne en un solo trabajo, y el usuario solo tiene que entregar el conjunto de prompts.
Lo que se ahorra es esfuerzo de ingeniería; lo que se pierde es capacidad de elección. Tanto el profesor como el alumno quedan fijados a modelos específicos, lo que significa que el usuario no puede usar un profesor más caro para mejorar la calidad, ni verter la salida en un modelo pequeño de arquitectura personalizada. La restricción a la región us-central1, por su parte, fija de forma directa dónde reside la información; para usuarios con requisitos de cumplimiento normativo, esto pesa más que la función en sí.
Una misma palabra, dos tratos distintos
«Destilación» es un término que en los últimos dos años ha adquirido un contexto complicado entre China y Estados Unidos. Tres agencias estadounidenses señalaron este año, por su nombre, a seis empresas chinas por destilar modelos estadounidenses; Anthropic también mencionó en un informe llamadas a gran escala de empresas como Alibaba. En esos contextos, la destilación se trató como una conducta que exige rendición de cuentas.
La diferencia está en los términos contractuales, no en el acto técnico. En el servicio de Google, tanto el profesor como el alumno son modelos propios de la empresa, el usuario ejecuta su propio conjunto de prompts, y el modelo alumno resultante sirve a la misma cuenta, todo dentro del alcance autorizado. La destilación entre proveedores distintos —usar la salida de la API de otra empresa para entrenar el propio modelo— suele estar explícitamente prohibida por los términos de servicio. La misma secuencia de operaciones, dentro de la autorización es una función del producto; fuera de ella, es un incumplimiento contractual o incluso material para un litigio.
Para los desarrolladores en China, la utilidad práctica de este servicio es prácticamente nula. La lista de acceso exige pasar por el equipo de ventas, la región está fijada en us-central1, y ambas barreras juntas dejan fuera a la mayoría de los proyectos de la región china. Lo que sí sirve de referencia es el conjunto de parámetros que Google ha dado a conocer: mínimo 1.000, tope de 50.000, entrada de 8.000 tokens; es la propia vara de medir técnica de Google para «cuántos datos necesita una destilación», y los equipos que hagan trabajos similares pueden usarla como referencia.
Los vacíos del periodo de vista previa
La fecha de disponibilidad general (GA), el precio y el tope de cuotas: ninguno de los tres está definido todavía. Tampoco dice la documentación si se ampliará la lista de modelos profesor y alumno disponibles. Hasta que se complete esa información, este servicio se parece más a un canal de pruebas interno abierto a grandes clientes que ya usan Gemini Enterprise que a una herramienta que ya se pueda incorporar a un plan.
Fuentes: documentación oficial de Google Cloud, CocoLoop; las versiones de los modelos profesor y alumno, la restricción de región, los campos del conjunto de datos y todos los límites se cotejaron línea por línea con el documento original.