Pada 4 Agustus, ModelBest dan OpenBMB membuka ForgeStencil, sistem dua agent untuk optimasi stencil. Sistem ini mencari hotspot di software ilmiah dan industri, membuat operator CUDA, memasang patch kembali ke aplikasi, lalu mengukur kebenaran dan kecepatan dengan harness aplikasi itu sendiri.
README resmi menyebut ForgeStencil telah berjalan pada 100 aplikasi tervalidasi end-to-end di minyak dan gas, elektromagnetik, pencitraan medis, CFD, iklim, astrofisika, material, dan benchmark HPC. Median speedup end-to-end adalah 1,41x, dengan rata-rata geometrik 2,05x.
Yang sulit adalah masuk ke aplikasi nyata
Stencil berada di bawah prakiraan cuaca, pencitraan seismik, simulasi elektromagnetik, dan komputasi fluida. Pola ini terus membaca titik tetangga pada grid, sehingga tata letak memori yang buruk membuat GPU menunggu data.
Kernel Agent mengeksplorasi tiling, fusion, layout, dan occupancy. App Agent menemukan hotspot aplikasi, membuat baseline GPU, memverifikasi hasil, dan mengintegrasikan optimasi ke program asli.
“ForgeStencil automates the strategy discovery and the deployment.”
Angka harus dibaca sesuai cakupan
Untuk 100 aplikasi, rentang hasilnya 0,998x sampai 97,7x. README menyebut 89% aplikasi melewati 1,05x, 73% melewati 1,20x, 43% melewati 1,50x, 21% melewati 3x, dan 7% melewati 10x.
Hasil operator-level berbeda. Di A100, kernel stencil yang dibatasi bandwidth memori mencapai 74% sampai 85% dari puncak bandwidth DRAM. Perbandingan presisi yang sama di 32 kasus menunjukkan keunggulan rata-rata geometrik sekitar 2,16x atas baseline publik terbaik.
Liputan berbahasa Mandarin juga mencatat gprMax/FDTD Maxwell 2,47x, minisweep 5,78x, RTM seismic imaging 1,81x, non-Cartesian MRI 2,45x, dan DBT backprojection 1,63x.
Ujian berikutnya adalah reproduksi
Yang perlu dilihat bukan angka tertinggi. Tim luar harus bisa mereproduksi dari fresh clone, menambah aplikasi baru dengan patch mode, dan melihat validasi end-to-end untuk H100 serta B200. Saat ini 100 paket aplikasi divalidasi pada A100, sedangkan validasi lintas GPU masih masuk roadmap.
Bagi manufaktur dan komputasi ilmiah, ForgeStencil penting karena mengubah pengetahuan tuning HPC yang langka menjadi workflow agent yang tercatat dan dapat diaudit. Jika angka itu bertahan di luar lingkungan rilis, klaimnya jauh lebih berguna daripada sekadar “AI menulis kode”.
Sumber: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; sumber memverifikasi 100 aplikasi tervalidasi, speedup end-to-end A100, baseline operator-level, cakupan FDTD/minisweep/RTM/MRI/DBT, dan batas validasi.