ModelBest mở Agent tăng tốc phần mềm công nghiệp

Ngày 4 tháng 8, ModelBest và OpenBMB mở mã nguồn ForgeStencil, hệ thống hai agent cho tối ưu stencil. Nó tìm điểm nghẽn trong phần mềm khoa học và công nghiệp thật, tạo toán tử CUDA, đưa bản vá trở lại ứng dụng, rồi dùng chính kiểm tra và bộ đếm thời gian của ứng dụng để đo kết quả.

README chính thức nói ForgeStencil đã chạy trên 100 ứng dụng xác thực end-to-end thuộc dầu khí, điện từ, ảnh y tế, CFD, khí hậu, vật lý thiên văn, vật liệu và benchmark HPC. Median speedup end-to-end là 1,41x, còn trung bình hình học là 2,05x.

Khó nhất là đưa vào ứng dụng thật

Stencil nằm dưới dự báo thời tiết, ảnh địa chấn, mô phỏng điện từ và tính toán chất lưu. Nó liên tục đọc các điểm lưới lân cận, nên bố trí bộ nhớ kém có thể khiến GPU chờ dữ liệu.

Kernel Agent tìm các chiến lược tiling, fusion, layout và occupancy. App Agent tìm hotspot của ứng dụng, lập baseline GPU, kiểm tra đúng sai và tích hợp kết quả vào chương trình gốc.

“ForgeStencil automates the strategy discovery and the deployment.”

Phải đọc số liệu theo phạm vi

Với 100 ứng dụng, kết quả trải từ 0,998x đến 97,7x. README cho biết 89% ứng dụng vượt 1,05x, 73% vượt 1,20x, 43% vượt 1,50x, 21% vượt 3x và 7% vượt 10x.

Kết quả cấp toán tử là phạm vi khác. Trên A100, các kernel stencil bị giới hạn bởi băng thông bộ nhớ đạt 74% đến 85% băng thông DRAM đỉnh. So sánh cùng độ chính xác trên 32 case cho thấy lợi thế trung bình hình học khoảng 2,16x so với baseline công khai tốt nhất.

Bài viết tiếng Trung cũng nêu gprMax/FDTD Maxwell 2,47x, minisweep 5,78x, RTM seismic imaging 1,81x, non-Cartesian MRI 2,45x và DBT backprojection 1,63x.

Bước kiểm tra tiếp theo là tái lập

Điểm cần theo dõi không phải speedup cao nhất. Đội bên ngoài có tái lập từ fresh clone được không, có thêm ứng dụng bằng patch mode được không, và khi nào có xác thực end-to-end cho H100, B200. Hiện 100 gói ứng dụng được xác thực trên A100; xác thực end-to-end cho thế hệ GPU khác vẫn nằm trong roadmap.

Với sản xuất và tính toán khoa học, ForgeStencil đáng chú ý vì biến tri thức tuning HPC khan hiếm thành workflow agent có ghi nhận và kiểm toán. Nếu các con số giữ được ngoài môi trường phát hành, tuyên bố này thực dụng hơn nhiều so với “AI đã viết mã”.

Nguồn: OpenBMB ForgeStencil GitHub README, CocoLoop, Xinzhiyuan; nguồn kiểm chứng 100 ứng dụng xác thực, speedup end-to-end A100, baseline cấp toán tử, phạm vi FDTD/minisweep/RTM/MRI/DBT và giới hạn xác thực.