El 4 de agosto, ModelBest y OpenBMB publicaron ForgeStencil, un sistema de dos agentes para optimización stencil. Busca cuellos de botella en software científico e industrial real, crea operadores CUDA, integra parches en la aplicación y mide corrección y velocidad con el propio harness del programa.
El README oficial dice que ForgeStencil se ejecutó en 100 aplicaciones validadas end-to-end de petróleo y gas, electromagnetismo, imagen médica, CFD, clima, astrofísica, materiales y benchmarks HPC. La mediana de aceleración end-to-end es 1,41x, con media geométrica de 2,05x.
Lo difícil es entrar en aplicaciones reales
Stencil aparece bajo la predicción meteorológica, la imagen sísmica, la simulación electromagnética y la dinámica de fluidos. Lee puntos vecinos de una cuadrícula una y otra vez, así que un mal diseño de memoria puede dejar a la GPU esperando datos.
El Kernel Agent explora tiling, fusion, layout y occupancy. El App Agent localiza hotspots, construye una línea base GPU, verifica la corrección e integra el resultado en el programa original.
“ForgeStencil automates the strategy discovery and the deployment.”
Las cifras dependen del alcance
En las 100 aplicaciones, el rango va de 0,998x a 97,7x. El README indica que 89% supera 1,05x, 73% supera 1,20x, 43% supera 1,50x, 21% supera 3x y 7% supera 10x.
El nivel de operador es otra medida. En A100, los kernels stencil limitados por memoria alcanzan entre 74% y 85% del ancho de banda DRAM pico. En 32 casos con la misma precisión, la ventaja geométrica frente a las mejores baselines públicas ronda 2,16x.
La cobertura china también cita gprMax/FDTD Maxwell con 2,47x, minisweep con 5,78x, RTM sísmico con 1,81x, MRI no cartesiano con 2,45x y DBT backprojection con 1,63x.
La siguiente prueba es reproducirlo
Lo importante no es el máximo. Equipos externos deben poder reproducir desde un fresh clone, añadir nuevas aplicaciones en patch mode y ver validación end-to-end en H100 y B200. Los 100 paquetes están validados hoy en A100; la validación más amplia sigue en la hoja de ruta.
Para manufactura y computación científica, ForgeStencil importa porque convierte conocimiento escaso de tuning HPC en un flujo de agentes documentado y auditable. Si las cifras se sostienen fuera del entorno de lanzamiento, será más útil que decir que la IA escribió código.
Fuentes: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; se verifican 100 aplicaciones validadas, aceleraciones end-to-end en A100, baselines de operador, alcances FDTD/minisweep/RTM/MRI/DBT y límites de validación.