Astra y Sol: la suscripción acelera a 50 tokens por segundo

OpenAI ha aumentado un nivel la velocidad de salida predeterminada de GPT-6 Astra y GPT-6.1 Sol en sus productos de suscripción. Thibault Sottiaux, responsable de Codex, anunció el 5 de octubre en una red social que la velocidad predeterminada de ambos modelos sube en conjunto alrededor de un 50%, pasando de unos 30 tokens por segundo a unos 50, y que esto cubre todos los productos propios de OpenAI además de todas las aplicaciones de socios conectadas mediante "Sign in with ChatGPT".

Los usuarios no necesitan cambiar ninguna configuración. Según Sottiaux, la actualización se irá implementando para todos en un plazo de dos horas.

La "mejora" entregada al día siguiente

El momento elegido para esta mejora de velocidad no es casual. El 4 de octubre, Sottiaux fijó para el equipo de Codex un plazo público de 28 días: cada día debía lanzarse algo que suponga una mejora perceptible para la mayoría de los usuarios de Codex y ChatGPT Work, o de lo contrario se restablecerían por completo las cuotas de uso de todos.

El aumento de velocidad encaja justo con ese criterio de "perceptible para la mayoría de los usuarios". No depende del caso de uso: escribir código, buscar información o ejecutar tareas de agentes se benefician por igual, y tampoco requiere que los usuarios aprendan ninguna función nueva. Dentro de un compromiso que exige entregar algo cada día, este tipo de cambio es el más fácil de reconocer como tal.

El alcance también es mayor que un simple cambio en ChatGPT. Entre los socios mencionados por Sottiaux están la herramienta de programación de código abierto OpenCode, Pi, Amp, y Devin, de Cognition. Estos productos permiten a los usuarios iniciar sesión directamente con su suscripción de ChatGPT, consumiendo la cuota de la suscripción en lugar de facturación por API, por lo que la mejora de velocidad del lado de la suscripción se traslada a ellos sin cambios.

De 30 a 50: la cuenta da más de la mitad

El anuncio oficial habla de "alrededor de un 50%", pero, según las dos cifras dadas —de 30 a 50 tokens por segundo—, el aumento real es de alrededor de un 67%. Sottiaux no explicó la diferencia entre ambas formas de contarlo. Una posibilidad es que el 50% se refiera a la experiencia completa de extremo a extremo, incluido el tiempo de espera hasta el primer token, mientras que, si solo se mira la fase de generación, el aumento sería de cerca de dos tercios.

Convertido en el tiempo que percibe el usuario, un cálculo aproximado:

Longitud de salida30 tokens/s50 tokens/s
Un fragmento de código de 2.000 tokensunos 67 segundosunos 40 segundos
Una tarea de agente con 20.000 tokens de salidaunos 11 minutosunos 6,7 minutos

Esto solo contempla el tiempo en que el modelo genera texto. En las tareas de agentes también hay llamadas a herramientas, ejecución de pruebas y espera de red, partes que no se acortan por el aumento de velocidad. Por eso, el porcentaje de tiempo que realmente se ahorra al completar una tarea suele ser menor que las cifras de la tabla.

Tokenizador y consumo de tokens

Sottiaux también mencionó que ambos modelos ya usan un tokenizador optimizado, lo que reduce la cantidad de tokens necesarios para completar la misma tarea. OpenAI no ha dado cifras concretas sobre cuánto se ha reducido.

Este punto podría tener un impacto más directo en los suscriptores que la propia velocidad. Las cuotas de Codex y ChatGPT Work se calculan según el consumo de tokens: si la misma tarea consume menos tokens, la misma cuota permite hacer más trabajo. En cambio, el simple aumento de velocidad no cambia la cuota en sí: generar texto más rápido solo hace que el usuario llegue antes al límite de la ventana de cinco horas. Algunos medios han señalado precisamente este punto en sus coberturas.

Cuando GPT-6.1 Sol se presentó en el DevDay del 29 de septiembre, pruebas de terceros detectaron que, para completar la misma tarea, usaba entre un 10% y un 30% más de tokens de salida que la generación anterior. Cuánto de eso puede compensar el nuevo tokenizador solo se sabrá cuando se repitan pruebas independientes.

Sin cambios, por ahora, en el lado de la API

La división de roles entre ambos modelos es clara. GPT-6 Astra es el modelo insignia, con un precio estándar de API de 10 dólares por millón de tokens de entrada y 50 dólares por los de salida; GPT-6.1 Sol está orientado a agentes de programación y manejo de ordenadores, con 2 dólares de entrada y 10 de salida, ambos equivalentes a una quinta parte del precio de Astra. Esta mejora de velocidad del lado de la suscripción cubre a ambos modelos a la vez.

Este ajuste solo afecta a la velocidad predeterminada de los productos de suscripción. Para los usuarios de la API, que pagan por token, no se ha mencionado en la intervención de Sottiaux si la velocidad cambia también, y la documentación de la API de OpenAI tampoco se ha actualizado al respecto por ahora.

Fuentes: declaraciones públicas de Thibault Sottiaux en redes sociales, CocoLoop, RuntimeWire, Crypto Briefing; la tasa de salida sigue las cifras de tokens por segundo dadas oficialmente, y el aumento y el tiempo ahorrado son estimaciones basadas en ese criterio.