Ox Alpha debuta en el anonimato con 1 millón de tokens de contexto gratis

El 20 de agosto apareció una nueva línea en la lista de modelos de OpenRouter: stealth/ox-alpha. En la columna del proveedor solo dice "Stealth", y la página trae una única frase de explicación: el modelo lo desarrolla y opera un tercero que ha optado por mantenerse en el anonimato. Las especificaciones, en cambio, están todas a la vista: ventana de contexto de 1.048.576 tokens, salida máxima de 131.072 tokens por llamada, entradas en texto, imagen y video, con soporte para llamadas a funciones y salida en JSON. En la columna de precio, dos ceros: tanto la entrada como la salida cuestan 0 dólares por millón de tokens.

Una etiqueta de precio con dos ceros

Mirar la estructura del tráfico dice más que mirar las especificaciones. En el ranking de aplicaciones de OpenRouter, los que más tráfico envían a Ox Alpha son Hermes Agent, Claude Code y omp, todos envoltorios de agente, ninguno una ventana de chat. La página del modelo registra una latencia P50 de 6,70 segundos, un rendimiento de 20 tokens por segundo, una disponibilidad a tres días del 99,50% y un uptime del 99,99%. Una velocidad que en un producto conversacional haría renegar a cualquiera, pero que a nadie le importa en una tarea de programación que corre toda la noche.

Lo gratuito aquí se parece más a cambiar costo de inferencia por trayectorias de datos. Un contexto de 1 millón de tokens sumado a entrada de video, metido en un bucle de agente que llama herramientas una y otra vez, es de las categorías más caras entre todos los tipos de solicitud. El proveedor paga esto de su bolsillo porque quiere recoger justamente ese proceso completo en el que "el modelo llama herramientas cincuenta veces seguidas dentro de un repositorio real, falla, reintenta y al final logra que las pruebas pasen en verde", algo que casi no existe en los corpus públicos y que tampoco se puede fabricar inflando rankings. La tasa de error en llamadas a herramientas, de alrededor del 4,45% según la página, solo se puede medir con precisión cuando personas reales alimentan proyectos reales.

Haciendo cuentas por encima: una sola tarea de agente suele consumir varios cientos de miles de tokens, y un desarrollador que lo usa gratis durante una semana ya le ahorra al proveedor, solo en costo de inferencia, el equivalente a una tarifa de etiquetado de datos, y encima con contexto de negocio real y casos de fallo incluidos.

Las huellas apuntan a Zhipu

A los dos días del lanzamiento, la comunidad ya había acotado bastante el círculo de sospechosos. Un error dejó al descubierto un stack trace del lado del servidor, en el que apareció la ruta com.wd.paas.api.domain.v4.chat.ChatCompletionRequest, que coincide con la nomenclatura de la API en la documentación pública de Zhipu; el código de error 1214 se puede reproducir en los modelos de la serie GLM en OpenRouter, pero no en el modelo homónimo alojado por DeepInfra; una prueba del tokenizador con 30 conjuntos, que cubrían distintos sistemas de escritura, emojis, código y SQL, coincidió las 30 veces con el patrón de segmentación de GLM. Quien hizo esta comparación le asignó a su propio juicio un nivel de confianza de 0,98, apuntando a una variante de GLM-5.3. La hipótesis secundaria recae sobre el equipo MiMo de Xiaomi. Todo esto sigue siendo inferencia externa; por ahora, ninguna de las partes lo ha reclamado como propio.

En cuanto a los benchmarks, solo hay muestras sueltas. Un desarrollador llamado Ben Davis midió un 80% en DeepSWE, y en la misma ronda Fable obtuvo 65% y GPT-5.6 Sol, 52%. El resultado de una sola persona en una sola ronda no puede considerarse concluyente, pero coincide con la estructura del tráfico: quienes llegan son, sin excepción, agentes de programación.

El lanzamiento anónimo se está convirtiendo en una estrategia

Los modelos anónimos ya habían aparecido varias veces antes en OpenRouter. Los modelos con nombre en clave Hunter y Healer siguieron exactamente ese camino: primero gratuitos durante un tiempo, luego reclamados por el equipo MiMo de Xiaomi, y solo después con un precio oficial. GLM-5 y MiMo-V2-Pro también llegaron así.

El proceso ya está lo bastante consolidado como para considerarlo una estrategia de lanzamiento en sí misma: en la fase anónima se recopilan datos, se construye reputación y se evitan las comparativas masivas que suelen amontonarse el día del anuncio oficial; una vez que la posición en el ranking y la reputación entre desarrolladores se afianzan, se quita la máscara y pasa a ser de pago.

Para los fabricantes chinos, esto tiene además una utilidad extra. Cuando un modelo se presenta con la etiqueta de tal o cual laboratorio chino, la primera reacción de los desarrolladores extranjeros suele fijarse antes que nada en el origen; sin firma, la evaluación solo puede apoyarse en el código mismo. Para cuando se revela la identidad, esa primera tanda de buenas reseñas ya está escrita en foros y publicaciones.

El precio de lo gratuito está escrito en la propia página. La política de datos de OpenRouter señala que las indicaciones (prompts) y las respuestas quedan retenidas por el proveedor, con el único compromiso de no usarlas para entrenamiento; mientras que la ruta de conexión directa de OpenCode anuncia retención cero de datos, dos versiones que no cuadran a lo largo de la misma cadena de solicitudes. Usarlo para proyectos de código abierto tiene un impacto limitado, pero antes de meter todo un repositorio privado de una empresa en esta ventana de 1 millón de tokens, conviene leerse bien esa letra pequeña.

OpenRouter solo dice que la vista previa es un experimento por tiempo limitado, sin dar una fecha de cierre. Cuándo se quitará la máscara y a qué precio se venderá después, por ahora nadie lo tiene claro.

Fuentes: página del modelo en OpenRouter y descripción de la política de datos del proveedor, CocoLoop, registros de comparación de huellas y publicaciones públicas de benchmarks de la comunidad de desarrolladores; la ventana de contexto, la salida máxima, la latencia y el rendimiento siguen los datos de la página del modelo en OpenRouter, y el resultado de DeepSWE proviene de una sola prueba de un único desarrollador.