StepFun lança Step 5 Preview e afirma custo de apenas um oitavo do Opus 5

Em 20 de setembro, a StepFun lançou seu novo modelo-base principal, o Step 5 Preview, já disponível em seus próprios produtos e via API, com os pesos completos previstos para serem abertos em 15 de outubro.

O modelo segue a linha de MoE esparso, com 600 bilhões de parâmetros no total, dos quais 27 bilhões são ativados por token, janela de contexto de 1 milhão de tokens, com suporte nativo a entradas de texto e imagem. O anúncio detalha as aplicações-alvo: programação com IA, engenharia de software, trabalho de conhecimento profissional e cenários financeiros.

Resultados em rankings e benchmarks próprios

No índice de inteligência combinada da Artificial Analysis, o Step 5 Preview obteve 44 pontos, entrando no top 3 global de modelos de código aberto. Os demais benchmarks públicos trazem: GPQA Diamond 93,5%, Terminal-Bench v2.1 85,0%, BrowseComp 88,7%, e 76,0% no MMMU-Pro multimodal. A StepFun também menciona ter obtido o melhor ou segundo melhor resultado em benchmarks como AA-LCR e CyberGym.

Há outro conjunto de números que precisa ser analisado à parte. A StepFun também divulgou resultados no StepCodeBench e no FinStepBench, dois benchmarks criados por ela mesma: o StepCodeBench cobre 553 repositórios de código, 9 tipos de tarefas, 20 áreas de aplicação e 33 linguagens de programação, usado para medir tarefas reais de desenvolvimento como correção de bugs, desenvolvimento de funcionalidades, refatoração de código e configuração de ambiente. A própria StepFun registra em seus materiais que o propósito de design de benchmarks próprios difere dos rankings públicos, e que resultados em configurações diferentes não são diretamente comparáveis.

Quanto às capacidades de agente, a StepFun afirma que o modelo consegue executar de forma autônoma tarefas contínuas de mais de 3 horas, com suporte a depuração de código, acesso a porta serial, captura de tela, uso de câmera e simulação de mouse. Essas descrições ainda carecem de reprodução por terceiros; o que pode ser verificado externamente são apenas os resultados dos rankings públicos.

Uma conta, e a forma como ela foi feita

A frase mais citada do anúncio é: o custo por tarefa é de apenas um oitavo do Claude Opus 5, da Anthropic. Essa afirmação vem da própria StepFun, e os materiais públicos não indicam a base do cálculo — quantas tarefas, qual distribuição de dificuldade, se pelo preço de tabela da API ou pelo uso real — nada disso é especificado.

Aplicando essa proporção a um cenário concreto: se uma equipe gasta 100 mil yuans por mês em inferência no Opus 5, um oitavo disso equivaleria a cerca de 12,5 mil yuans no Step 5 Preview, uma economia anual na casa dos milhões. Esse número só se sustenta se a distribuição de tarefas for a mesma usada pela StepFun em sua medição, e é justamente essa parte que não foi divulgada. Para equipes que consideram migrar, depois que os pesos forem liberados em 15 de outubro, rodar o próprio conjunto de tarefas equivalente é mais confiável do que citar esse fator de oito vezes.

A escolha do modelo de comparação também revela o posicionamento. A StepFun não usou outro modelo de código aberto como referência, mas sim o modelo mais caro do primeiro escalão dos modelos de código fechado.

Uma janela de um mês

A versão Preview chega primeiro à API, e os pesos oficiais só vêm um mês depois — um ritmo cada vez mais adotado por fabricantes chineses neste ano: primeiro ocupar os rankings e a atenção pública, depois liberar os pesos. O risco é que, nesse intervalo de um mês, um modelo de código aberto de porte semelhante pode surgir a qualquer momento, e ninguém pode garantir que essa posição de 44 pontos se mantenha até 15 de outubro.

Do ponto de vista de engenharia, a configuração de 600 bilhões de parâmetros totais com 27 bilhões ativados é relativamente amigável para quem for implantar o modelo; a ativação de 27 bilhões significa que a inferência multi-GPU em uma única máquina é viável, sem precisar de recursos equivalentes a um modelo denso de 600 bilhões. Essa também é a condição prévia para abrir os pesos — quanto maior a escala de parâmetros, mais o valor prático do código aberto é corroído pelas barreiras de implantação.

Licença de uso e preços de API, a StepFun não divulgou nenhum dos dois desta vez. Esses dois pontos vão determinar quantas pessoas realmente vão adotar o modelo depois de 15 de outubro.

Fontes: anúncio oficial da StepFun, Phoenix New Media (Ifeng), CocoLoop, Sina Tech; o tamanho dos parâmetros, a pontuação do índice de inteligência combinada da AA e a data de abertura do código foram conferidos com base em informações oficiais; o fator de custo e os resultados dos benchmarks próprios são dados fornecidos unilateralmente pela StepFun.