Las llamadas diarias de tokens en China suben a 500 billones en solo tres meses

Un reportaje emitido hoy por CCTV Finance ofrece una cifra: hasta junio de este año, el promedio diario de llamadas de tokens en China superó los 500 billones. El mismo criterio de medición se había reportado oficialmente apenas tres meses antes, cuando la cifra era de 140 billones.

Repasar esta línea temporal ayuda a entenderlo mejor. El término chino para token, "ciyuan" (词元), se oficializó en marzo de este año; en el mismo comunicado, el promedio diario ya superaba los 140 billones de tokens, más de mil veces por encima de los 100 mil millones de principios de 2024 y un 40% más que los 100 billones de finales de 2025. Siguiendo este ritmo, el crecimiento del segundo trimestre de este año fue varias veces mayor que el del trimestre anterior: un cálculo aproximado lo sitúa en casi 3,6 veces. La curva dio un giro pronunciado precisamente en el segundo trimestre.

El giro está del lado de la inferencia

Según CCTV Finance, el foco de la competencia ha pasado de la simple carrera por la "inteligencia" de los modelos hacia el despliegue de agentes de IA y la construcción de ecosistemas. Llevado a la cuenta de cómputo, esto tiene un significado muy concreto: una llamada tipo chat es una pregunta y una respuesta, que consume de unos cientos a unos miles de tokens antes de terminar; en cambio, un agente de IA que asume una tarea debe buscar información repetidamente, leer contexto, invocar herramientas y ejecutar varias rondas de retroalimentación, de modo que el consumo de tokens para la misma tarea puede variar en uno o dos órdenes de magnitud.

Liu Feng, gerente general de Industrias Inteligentes de Tencent, aportó en el reportaje una cifra directamente comparable: en la primera semana tras el lanzamiento oficial de Hunyuan 3, las llamadas de tokens aumentaron 68 veces respecto a la generación anterior, Hunyuan 2. Un salto de casi setenta veces en un solo cambio de generación ya no se explica solo por "más usuarios"; parece más bien que toda la estructura de consumo de una sola tarea ha cambiado.

Esto también explica por qué todas las compañías están ampliando sus clústeres de inferencia en lugar de centrarse solo en las tarjetas de entrenamiento. El entrenamiento es una inversión puntual que se amortiza en cuanto el modelo termina de entrenarse; la inferencia es un gasto continuo —cuanto más se usa, más se gasta— y los agentes de IA son precisamente el tipo de producto que convierte el "uso intensivo" en la norma.

El ciclo de iteración se ha comprimido a cuatro o seis semanas

Feng Wen, arquitecta jefe de la plataforma abierta de MiniMax, mencionó otro cambio: en la segunda mitad de 2025, el objetivo de las compañías todavía era iterar un modelo cada tres meses; ahora hay que lanzar un modelo nuevo cada cuatro a seis semanas.

Esta presión sobre el cómputo se ejerce en ambas direcciones. Del lado del entrenamiento, los calendarios se han comprimido: un clúster apenas termina una ronda cuando ya tiene que empezar la siguiente. Del lado de la inferencia, hay que atender simultáneamente varias versiones que siguen en servicio: el lanzamiento de un modelo nuevo no significa que la versión anterior se retire de inmediato, y las versiones antiguas en la API suelen mantenerse disponibles varios meses más, por lo que la capacidad de servicio debe planificarse para sostener varias versiones en paralelo.

Este ritmo más acelerado trae otro efecto colateral: la ventana para amortizar el costo de entrenamiento de un solo modelo se ha acortado. Los modelos nacionales chinos han bajado de precio repetidamente este año, en una guerra de precios muy dura, algo que está directamente relacionado con esta ventana cada vez más estrecha: aprovechar el periodo en que el modelo aún está en servicio para maximizar el volumen de llamadas resulta más rentable que venderlo poco a poco a un precio alto.

Los centros de datos de IA siguen la lógica de los contratos a largo plazo

Zheng Zihao, gerente general del Centro de Cómputo de IA de Envision Group, describió la construcción de centros de datos de IA como un crecimiento explosivo, y atribuyó esto a que los clientes están ofreciendo compromisos de pedidos estables a largo plazo.

La expresión "compromisos de pedidos estables a largo plazo" es la clave. Los centros de datos son activos de capital intensivo: un edificio tarda de uno a dos años entre la adquisición del terreno y su puesta en marcha, y lo que más temen los inversores es construir y terminar con capacidad ociosa. Con contratos a largo plazo como base, los constructores se atreven a diseñar directamente para la capacidad máxima, resolviendo de una sola vez el suministro eléctrico, la refrigeración líquida y la densidad de racks. Las "fábricas de tokens" nacionales y los complejos de centros de datos de IA que varias regiones de China están impulsando siguen la misma lógica: primero asegurar la demanda, después ampliar la capacidad, llevando la cadena industrial nacional de cómputo de IA de la fase de validación de producto a la de entrega a gran escala.

Lo que falta más allá de la cifra

Por ahora, los 500 billones carecen de un punto de comparación internacional. Los canales públicos todavía no muestran una cifra global calculada con el mismo criterio, así que la idea de estar en el "primer grupo" sigue siendo, por ahora, solo una valoración cualitativa, sin una proporción concreta que la respalde.

Repartiendo los 500 billones entre los 1.400 millones de habitantes, resulta un promedio aproximado de 350.000 tokens por persona al día. Esta cifra en sí misma no tiene mucho sentido práctico: la gran mayoría de las llamadas provienen de sistemas empresariales y de agentes de IA que operan en segundo plano, sin relación con la cantidad que teclea una persona. Su utilidad está en recordar algo: el token ha dejado de ser un indicador técnico para convertirse en un indicador industrial. Lo que se comparará una y otra vez de aquí en adelante será el costo eléctrico, las horas de tarjeta y los ingresos que hay detrás de cada billón de tokens.

Fuentes: CCTV Finance, ITHome, CocoLoop, comunicados públicos de la Administración Nacional de Datos; las cifras de llamadas se han contrastado punto por punto con el comunicado oficial anterior, y el promedio per cápita es una estimación aproximada de la redacción.