ModelBest ouvre des agents pour accélérer les logiciels industriels

Le 4 août, ModelBest et OpenBMB ont publié ForgeStencil, un système à deux agents pour l'optimisation stencil. Il détecte les goulets dans de vrais logiciels scientifiques et industriels, forge des opérateurs CUDA, réintègre les correctifs dans l'application, puis mesure exactitude et vitesse avec le propre harness du programme.

Le README officiel indique que ForgeStencil a été exécuté sur 100 applications validées end-to-end couvrant pétrole et gaz, électromagnétisme, imagerie médicale, CFD, climat, astrophysique, matériaux et benchmarks HPC. La médiane d'accélération end-to-end est de 1,41x, avec une moyenne géométrique de 2,05x.

Le vrai défi est l'intégration

Le stencil se trouve sous la météo, l'imagerie sismique, la simulation électromagnétique et les calculs de fluides. Il lit sans cesse les voisins d'une grille, donc un mauvais agencement mémoire peut laisser le GPU attendre les données.

Le Kernel Agent explore tiling, fusion, layout et occupancy. L'App Agent localise les hotspots, établit une base GPU, vérifie la correction et intègre le résultat dans le programme d'origine.

“ForgeStencil automates the strategy discovery and the deployment.”

Les chiffres ont plusieurs périmètres

Sur les 100 applications, les résultats vont de 0,998x à 97,7x. Le README dit que 89% dépassent 1,05x, 73% dépassent 1,20x, 43% dépassent 1,50x, 21% dépassent 3x et 7% dépassent 10x.

Le niveau opérateur est distinct. Sur A100, les kernels stencil limités par la bande passante mémoire atteignent 74% à 85% du pic DRAM. Dans 32 cas à précision identique, l'avantage géométrique face aux meilleures baselines publiques est d'environ 2,16x.

La couverture chinoise cite aussi gprMax/FDTD Maxwell à 2,47x, minisweep à 5,78x, l'imagerie sismique RTM à 1,81x, l'IRM non cartésienne à 2,45x et la rétroprojection DBT à 1,63x.

La prochaine étape est la reproduction

Le point à suivre n'est pas le record. Des équipes externes doivent pouvoir reproduire le flux depuis un fresh clone, ajouter des applications en patch mode et voir une validation end-to-end sur H100 et B200. Les 100 paquets sont aujourd'hui validés sur A100; la validation plus large reste sur la feuille de route.

Pour l'industrie et le calcul scientifique, ForgeStencil compte parce qu'il transforme un savoir-faire HPC rare en workflow d'agents documenté et auditable. Si les chiffres tiennent hors de l'environnement de publication, c'est plus utile qu'un simple récit sur l'IA qui écrit du code.

Sources: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; vérification des 100 applications validées, accélérations end-to-end A100, baselines opérateur, périmètres FDTD/minisweep/RTM/MRI/DBT et limites de validation.