Le 20 septembre, StepFun a lancé son nouveau modèle de base phare, Step 5 Preview, disponible dès maintenant sur ses propres produits et via son API, les poids complets devant être publiés en open source le 15 octobre.
Le modèle repose sur une architecture MoE éparse, avec 600 milliards de paramètres au total, dont 27 milliards sont activés par token, une fenêtre de contexte d'un million de tokens, et une prise en charge native du texte et de l'image en entrée. L'annonce précise clairement les cas d'usage visés : programmation assistée par IA, ingénierie logicielle, travail de connaissance professionnel et scénarios financiers.
Résultats de classement et benchmarks maison
Sur l'indice d'intelligence combiné d'Artificial Analysis, Step 5 Preview obtient 44 points, se classant parmi les trois meilleurs modèles open source au monde. Les autres benchmarks publics donnent : GPQA Diamond 93,5 %, Terminal-Bench v2.1 85,0 %, BrowseComp 88,7 %, et 76,0 % sur le benchmark multimodal MMMU-Pro. StepFun indique également avoir obtenu le meilleur ou le deuxième meilleur résultat sur des benchmarks tels qu'AA-LCR et CyberGym.
Un autre ensemble de chiffres mérite d'être considéré séparément. StepFun communique aussi des résultats sur StepCodeBench et FinStepBench, deux benchmarks conçus en interne : StepCodeBench couvre 553 dépôts de code, 9 types de tâches, 20 domaines d'application et 33 langages de programmation, et sert à mesurer des tâches de développement réelles comme la correction de bugs, le développement de fonctionnalités, la refactorisation de code et la configuration d'environnement. StepFun précise elle-même dans sa documentation que l'objectif de conception de ses benchmarks maison diffère de celui des classements publics, et que les résultats obtenus dans des configurations différentes ne sont pas directement comparables.
Concernant les capacités d'agent, StepFun affirme que le modèle peut exécuter de manière autonome des tâches continues de plus de 3 heures, avec prise en charge du débogage de code, de l'accès aux ports série, de la capture d'écran, de l'utilisation de la caméra et de la simulation de la souris. Ces descriptions manquent pour l'instant de reproduction par des tiers ; ce que l'on peut vérifier de l'extérieur se limite aux quelques résultats des classements publics.
Un calcul, et la façon dont il a été fait
La phrase la plus citée de l'annonce est la suivante : le coût par tâche ne représente qu'un huitième de celui de Claude Opus 5, d'Anthropic. Cette affirmation vient de StepFun elle-même, et les documents publics n'indiquent aucune base de calcul — combien de tâches, quelle répartition de difficulté, un calcul basé sur le tarif catalogue de l'API ou sur l'usage réel — rien de tout cela n'est précisé.
En appliquant ce ratio à un scénario concret : si une équipe dépense 100 000 yuans par mois en inférence sur Opus 5, un huitième de ce montant reviendrait à environ 12 500 yuans avec Step 5 Preview, soit une économie annuelle de l'ordre du million. Ce chiffre ne tient que si la répartition des tâches correspond à celle utilisée par StepFun lors de sa mesure, et c'est précisément la partie qui n'a pas été rendue publique. Pour les équipes qui envisagent une migration, après la publication des poids le 15 octobre, faire tourner son propre jeu de tâches équivalent sera plus fiable que de citer ce facteur de huit.
Le choix du modèle de comparaison en dit aussi long sur le positionnement. StepFun n'a pas pris un autre modèle open source comme référence, mais a choisi le modèle le plus cher du premier rang des modèles à source fermée.
Une fenêtre d'un mois
La version Preview arrive d'abord sur l'API, les poids officiels ne suivant qu'un mois plus tard — un rythme de plus en plus adopté cette année par les fabricants chinois : occuper d'abord les classements et l'attention médiatique, puis publier les poids ensuite. Le risque est que, pendant cet intervalle d'un mois, un modèle open source phare de taille comparable puisse apparaître à tout moment, et personne ne peut garantir que cette place à 44 points tiendra jusqu'au 15 octobre.
D'un point de vue technique, la configuration à 600 milliards de paramètres au total avec 27 milliards activés est relativement favorable pour ceux qui déploient le modèle ; ce niveau d'activation de 27 milliards signifie que l'inférence multi-GPU sur une seule machine est faisable, sans nécessiter les ressources d'un modèle dense de 600 milliards. C'est aussi la condition préalable pour ouvrir les poids : à mesure que l'échelle des paramètres continue d'augmenter, l'intérêt pratique de l'open source est de plus en plus rongé par les barrières de déploiement.
StepFun n'a publié cette fois ni la licence d'utilisation ni les tarifs de l'API. Ces deux éléments détermineront combien de personnes adopteront réellement le modèle après le 15 octobre.
Sources : annonce officielle de StepFun, Phoenix New Media (Ifeng), CocoLoop, Sina Tech ; la taille des paramètres, le score de l'indice d'intelligence combiné AA et la date d'ouverture du code ont été vérifiés à partir des informations officielles, tandis que le facteur de coût et les résultats des benchmarks maison sont des données fournies unilatéralement par StepFun.