工业软件的慢,很多时候慢在一段看不见的底层循环里。
8 月 4 日,面壁智能联合 OpenBMB 开源 ForgeStencil,一个面向 Stencil 计算的双 Agent 优化系统。它绕过“补全几行 CUDA”的轻量场景,直接进入真实科学与工业软件:找热点函数,生成和筛选 kernel,把补丁接回应用,再用应用自己的校验和计时器测结果。
官方 README 给出的核心结果很硬:ForgeStencil 已在 100 个端到端验证应用上跑通,覆盖油气、电磁、医学影像、流体力学、气候、天体物理、材料和 HPC benchmark;端到端加速中位数 1.41 倍,几何平均 2.05 倍。新智元完整报道中也写到,它在一周内完成 100+ 个真实工业与科学计算软件的自动优化,全程没有人类专家介入优化决策。
这让它不像普通开源工具,更像一次对“工业软件性能只能靠少数专家手调”的公开挑战。
难点在真实部署
Stencil 可以粗略理解成“规则网格上的邻居计算”。天气预报、地震成像、电磁仿真、流体计算、材料模拟里,大量底层代码都在反复读取周围网格点,再更新当前点。它访存密集,显存带宽和线程组织稍微不顺,GPU 就会等数据。
过去的自动优化工具能做一部分代码生成,但策略设计和接入真实应用仍要靠人。ForgeStencil 的拆法是两个 Agent 分工:
- Kernel Agent 负责底层算子,反复经历 Plan、Code、Profile,尝试 tiling、fusion、layout、occupancy 等策略;
- App Agent 负责真实应用,定位热点、建立 GPU 基线、锻造应用专属算子、验证正确性并集成回原程序。
官方 README 有一句定义很清楚:
“ForgeStencil automates the strategy discovery and the deployment.”
自然译成中文:它要自动化的不只是写 kernel,还包括优化策略发现和部署进真实应用。
这句话是整件事的钩子。AI 编程工具已经能写 demo,但工业软件不接受“看起来能跑”。它要的是可复现、可审计、数值结果不乱变。ForgeStencil 在仓库里给每个应用保留 provenance、fetch script、integration patch 和 harness,不直接打包第三方源码;测量时原始路径和优化路径只差一个开关,用同一个程序交错计时,正确性由程序自己的检查决定。
数字要按口径读
ForgeStencil 的数字不少,最容易被写乱。官方把口径分成两层。
第一层是 100 个应用的端到端结果:中位数 1.41 倍,几何平均 2.05 倍,范围从 0.998 倍到 97.7 倍;其中 89% 应用至少加速 1.05 倍,73% 至少 1.20 倍,43% 至少 1.50 倍,21% 至少 3 倍,7% 至少 10 倍。这些数来自结果 registry,并以 A100 上的端到端验证为主。
第二层是 operator-level 结果。官方写到,内存带宽受限的 stencil kernel 在 A100 上达到 74% 至 85% 的峰值 DRAM 带宽;与 Halide、Devito、EBISU、DRStencil 等公开基线按同精度比较,32 个 case 的几何平均优势约 2.16 倍。这里看的是算子,不等同于整个应用。
新智元报道中的若干应用案例,可以和 README 的结果解释互相校准:gprMax/FDTD Maxwell 的端到端加速为 2.47 倍;minisweep 核反应堆中子学计算 5.78 倍;RTM 油气地震成像 1.81 倍;非笛卡尔 MRI 重建 2.45 倍;数字乳腺断层成像反投影 1.63 倍。这些数字都不能混成“所有工业软件平均提速多少”,只能按应用、硬件和测量协议分别读。
这件事对中文读者的增量在哪
国内 AI 新闻里,“Agent 自动写代码”已经不新鲜。ForgeStencil 有意思的地方,是它把 Agent 放进了中国制造业最难被口号覆盖的一层:CAE、EDA、电磁、地震、医学影像这些软件底座。
这些场景有三个共同点。第一,应用价值高,但底层性能优化枯燥且稀缺;第二,代码历史长,业务逻辑和数值校验复杂,不能靠生成一段新代码替代;第三,国产算力和国产工业软件都在补课,单纯堆硬件无法解决软件效率问题。
ForgeStencil 的路线,相当于把“少数 HPC 专家手里的经验”做成可并行复制的 Agent 流程。它短期不会替代工程师,反倒更像给工程师多了一批能跑测例、改补丁、留记录的自动化助手。更该盯的,是 100 个应用里那些 1.0 到 1.5 倍的普通结果:如果已经高度调优的存量软件也能稳定拿到小幅收益,工业侧才会把它当工具,演示色彩会被压低。
还有一个限制必须放在台面上。README 明确写到,100 个端到端应用包目前验证在 A100;H100、B200 的端到端重验证还在路线图里。跨代 GPU 的 operator study 已经做了,但官方也提示 B200 来自 preemptible cloud pod,绝对毫秒数受节点状态影响。ForgeStencil 现在给出的更接近一套可复跑的研究和工程框架,距离“所有硬件立刻通吃”的商业承诺还有验证距离。
下一步看复现,不看口号
这类开源系统的后续指标很具体。
- 外部团队能否按 README 从 fresh clone 复现实验;
applications/里的 100 个包能否持续补齐 provenance 和上游版本;- H100、B200 的端到端重验证能否按路线图公开;
- 社区能否把新应用接入 patch-mode,减少对发布数字的旁观。
如果这些节点跑通,ForgeStencil 的价值会比“AI 写了很多代码”更实在:它把科学计算和工业软件调优变成一条可记录、可审计、可重复的流水线。对制造业来说,稀缺项并非会写 CUDA 的新闻标题,稳定释放真实工程软件算力的流程更有用。
参考来源:OpenBMB ForgeStencil GitHub README、CocoLoop、新智元;核验 100 个端到端验证应用、A100 端到端加速中位数与几何平均、operator-level 同精度基线、FDTD/minisweep/RTM/MRI/DBT 应用口径和验证限制。