StepFun lanza Step 5 Preview y afirma que su coste es solo un octavo del de Opus 5

El 20 de septiembre, StepFun presentó su nuevo modelo base insignia, Step 5 Preview, disponible desde ya en sus propios productos y por API, con los pesos completos previstos para abrirse como código abierto el 15 de octubre.

El modelo sigue la vía de MoE disperso, con 600 000 millones de parámetros en total, de los cuales se activan 27 000 millones por token, con una ventana de contexto de 1 millón de tokens y soporte nativo para entradas de texto e imagen. El anuncio detalla con precisión los ámbitos de aplicación: programación con IA, ingeniería de software, trabajo de conocimiento profesional y escenarios financieros.

Resultados en clasificaciones y benchmarks propios

En el índice de inteligencia combinada de Artificial Analysis, Step 5 Preview obtiene 44 puntos, situándose entre los tres primeros modelos de código abierto a nivel mundial. El resto de benchmarks públicos arroja: GPQA Diamond 93,5 %, Terminal-Bench v2.1 85,0 %, BrowseComp 88,7 %, y 76,0 % en el multimodal MMMU-Pro. StepFun también menciona haber obtenido el mejor o el segundo mejor resultado en benchmarks como AA-LCR y CyberGym.

Hay otro conjunto de cifras que conviene analizar por separado. StepFun también presentó resultados en StepCodeBench y FinStepBench, dos benchmarks desarrollados por la propia empresa: StepCodeBench cubre 553 repositorios de código, 9 tipos de tareas, 20 áreas de aplicación y 33 lenguajes de programación, y se usa para medir tareas de desarrollo reales como corrección de errores, desarrollo de funciones, refactorización de código y configuración de entornos. La propia StepFun señala en sus materiales que el propósito de diseño de los benchmarks propios difiere del de las clasificaciones públicas, y que los resultados obtenidos en configuraciones distintas no son directamente comparables.

En cuanto a las capacidades de agente, StepFun afirma que el modelo puede ejecutar de forma autónoma tareas continuas de más de 3 horas, con soporte para depuración de código, acceso a puertos serie, captura de pantalla, uso de cámara y simulación de ratón. Estas descripciones aún carecen de reproducción por parte de terceros; lo único verificable desde fuera son los resultados de las clasificaciones públicas mencionadas.

Una cuenta, y cómo se hizo esa cuenta

La frase más citada del anuncio es: el coste por tarea equivale a solo un octavo del de Claude Opus 5, de Anthropic. Esta afirmación procede de la propia StepFun, y los materiales públicos no indican la base del cálculo: cuántas tareas, qué distribución de dificultad, si se calcula según el precio de lista de la API o según el uso real; nada de eso se especifica.

Si se aplica esta proporción a un escenario concreto: si un equipo gasta 100 000 yuanes al mes en inferencia con Opus 5, un octavo de eso equivaldría a unos 12 500 yuanes con Step 5 Preview, un ahorro anual del orden de los millones. Esta cifra solo se sostiene si la distribución de tareas coincide con la que usó StepFun en su medición, y esa es precisamente la parte que no se ha hecho pública. Para los equipos que estén considerando migrar, tras la publicación de los pesos el 15 de octubre, ejecutar su propio conjunto de tareas equivalente es más fiable que citar ese factor de ocho veces.

La elección del modelo de comparación también revela el posicionamiento. StepFun no tomó como referencia otro modelo de código abierto, sino el más caro del primer nivel de los modelos de código cerrado.

Una ventana de un mes

La versión Preview llega primero a la API, y los pesos oficiales tardarán un mes más en llegar, un ritmo que los fabricantes chinos han adoptado cada vez más este año: ocupar primero las clasificaciones y la atención pública, y liberar los pesos después. El riesgo es que, en ese mes intermedio, en cualquier momento puede aparecer un modelo de código abierto insignia de tamaño similar, y nadie puede garantizar que esta posición de 44 puntos se mantenga hasta el 15 de octubre.

Desde el punto de vista de ingeniería, la configuración de 600 000 millones de parámetros totales con 27 000 millones activados resulta relativamente favorable para quienes lo desplieguen; una activación de 27 000 millones implica que la inferencia multi-GPU en una sola máquina es viable, sin necesidad de los recursos que exigiría un modelo denso de 600 000 millones. Esta es también la condición previa para abrir los pesos: a medida que la escala de parámetros siga creciendo, el valor práctico del código abierto se verá cada vez más erosionado por las barreras de despliegue.

StepFun tampoco ha publicado esta vez ni la licencia de uso ni los precios de la API. Ambos factores determinarán cuántas personas realmente lo adopten después del 15 de octubre.

Fuentes: anuncio oficial de StepFun, Phoenix New Media (Ifeng), CocoLoop, Sina Tech; el tamaño de los parámetros, la puntuación del índice de inteligencia combinada de AA y la fecha de apertura del código se han contrastado con la información oficial; el factor de coste y los resultados de los benchmarks propios son datos aportados unilateralmente por StepFun.