모델베스트, 산업 소프트웨어 가속 Agent 공개

모델베스트와 OpenBMB는 8월 4일 stencil 계산 최적화 시스템 ForgeStencil을 공개했다. 이 시스템은 실제 과학·산업 소프트웨어에서 병목을 찾고, CUDA 연산자를 만들고, 패치를 다시 통합한 뒤 애플리케이션 자체 검증과 타이머로 결과를 측정한다.

공식 README는 ForgeStencil이 석유·가스, 전자기, 의료 영상, CFD, 기후, 천체물리, 재료, HPC 벤치마크 등 100개 단대단 검증 애플리케이션에서 실행됐다고 설명한다. 단대단 가속 중앙값은 1.41배, 기하평균은 2.05배다.

어려운 부분은 실제 배포

Stencil은 날씨 예측, 지진 영상, 전자기 시뮬레이션, 유체 계산의 밑단에 있다. 주변 격자점을 반복해서 읽기 때문에 메모리 배치가 나쁘면 GPU는 계산보다 데이터 대기에 묶인다.

Kernel Agent는 tiling, fusion, layout, occupancy 전략을 탐색한다. App Agent는 애플리케이션 병목을 찾고 GPU 기준선을 세우며, 정확성을 확인한 뒤 결과를 원래 프로그램에 통합한다.

“ForgeStencil automates the strategy discovery and the deployment.”

숫자는 범위를 나눠 읽어야 한다

100개 애플리케이션 결과의 범위는 0.998배에서 97.7배다. README는 89%가 1.05배 이상, 73%가 1.20배 이상, 43%가 1.50배 이상, 21%가 3배 이상, 7%가 10배 이상이라고 적었다.

연산자 레벨은 별도 지표다. A100에서 메모리 대역폭에 묶인 커널은 피크 DRAM 대역폭의 74%에서 85%에 도달했고, 32개 같은 정밀도 비교에서는 공개 기준 대비 약 2.16배 기하평균 우위를 보였다.

중국어 보도는 gprMax/FDTD Maxwell 2.47배, minisweep 5.78배, RTM 지진 영상 1.81배, 비직교 MRI 2.45배, DBT 역투영 1.63배도 제시했다.

다음 검증은 재현성

중요한 것은 최고값이 아니다. 외부 팀이 fresh clone에서 같은 절차를 재현하는지, patch mode로 새 애플리케이션을 추가하는지, H100과 B200 단대단 검증이 공개되는지가 다음 체크포인트다. 100개 애플리케이션 패키지는 현재 A100에서 검증됐고 다른 GPU 세대의 단대단 검증은 로드맵에 남아 있다.

제조와 과학 계산 팀에게 ForgeStencil의 의미는 희소한 HPC 튜닝 경험을 기록 가능한 Agent 워크플로로 바꾸는 데 있다. 공개 환경 밖에서도 숫자가 유지된다면 “AI가 코드를 썼다”보다 훨씬 실용적인 주장이다.

출처: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; 100개 검증 애플리케이션, A100 단대단 가속, 연산자 수준 기준, FDTD/minisweep/RTM/MRI/DBT 범위와 검증 제한을 확인.