ModelBest abre agentes para acelerar software industrial

Em 4 de agosto, ModelBest e OpenBMB abriram o ForgeStencil, um sistema de dois agentes para otimização de stencil. Ele encontra gargalos em software científico e industrial real, cria operadores CUDA, aplica patches de volta à aplicação e mede correção e velocidade com o próprio harness do programa.

O README oficial diz que o ForgeStencil rodou em 100 aplicações validadas end-to-end em petróleo e gás, eletromagnetismo, imagem médica, CFD, clima, astrofísica, materiais e benchmarks de HPC. A mediana de aceleração end-to-end é 1,41x, com média geométrica de 2,05x.

O difícil é entrar no software real

Stencil aparece sob previsão do tempo, imagem sísmica, simulação eletromagnética e dinâmica de fluidos. O código lê pontos vizinhos de uma grade repetidamente, então um layout de memória ruim pode deixar a GPU esperando dados.

O Kernel Agent explora tiling, fusion, layout e occupancy. O App Agent localiza hotspots, cria uma linha de base de GPU, verifica correção e integra o resultado ao programa original.

“ForgeStencil automates the strategy discovery and the deployment.”

Os números precisam de escopo

Nos 100 resultados de aplicação, a faixa vai de 0,998x a 97,7x. O README informa que 89% das aplicações superam 1,05x, 73% superam 1,20x, 43% superam 1,50x, 21% superam 3x e 7% superam 10x.

O nível de operador é outra métrica. No A100, kernels stencil limitados por largura de banda chegam a 74% a 85% do pico de DRAM. Em 32 casos com a mesma precisão, a vantagem geométrica sobre as melhores baselines públicas fica em torno de 2,16x.

A cobertura chinesa também cita gprMax/FDTD Maxwell com 2,47x, minisweep com 5,78x, RTM sísmico com 1,81x, MRI não cartesiano com 2,45x e DBT backprojection com 1,63x.

O próximo teste é reprodução

O que importa não é o maior número. Equipes externas precisam reproduzir a partir de um fresh clone, adicionar novas aplicações em patch mode e ver validação end-to-end no H100 e no B200. Hoje os 100 pacotes de aplicação estão validados no A100; a validação mais ampla ainda está no roadmap.

Para manufatura e computação científica, ForgeStencil importa porque transforma conhecimento raro de tuning HPC em um workflow de agentes registrado e auditável. Se os números se mantiverem fora do ambiente de lançamento, a tese será mais útil do que dizer que a IA escreveu código.

Fontes: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; fontes verificam 100 aplicações validadas, acelerações end-to-end em A100, baselines de operador, escopos de FDTD/minisweep/RTM/MRI/DBT e limites de validação.