智能AI
morning
全球首个!国产AI开源系统一周狂改百款软件,全程0人干预
摘要
新智元报道 当前,中国正处于从「制造大国」向「智造强国」跨越的关键历史节点,其中工业软件(如CAE仿真、流体力学计算、电磁EDA等)是这一历史转折的核心桥梁。 从天气预报、地震勘探,到电磁仿真、材料模拟……现代工业与前沿科研的每一次突破,都离不开规模庞大的高性能计算(HPC)软件。 近年来,国产工业软件在算法功能和物理建模上进展迅速,正在加速实现自主可控。然而,当这些软件真正投入到航空航天、芯片设...
HPC
Stencil
ForgeStencil
GPU
Kernel
新智元报道
中国正处于从
制造大国
智造强国
跨越的关键历史节点
2026-08-04
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 当前,中国正处于从「制造大国」向「智造强国」跨越的关键历史节点,其中工业软件(如CAE仿真、流体力学计算、电磁EDA等)是这一历史转折的核心桥梁。 从天气预报、地震勘探,到电磁仿真、材料模拟……现代工业与前沿科研的每一次突破,都离不开规模庞大的高性能计算(HPC)软件。 近年来,国产工业软件在算法功能和物理建模上进展迅速,正在加速实现自主可控。然而,当这些软件真正投入到航空航天、芯片设计、能源勘探等高精尖的一线场景时, 往往会面临一个核心瓶颈——性能不足,也就是「跑得慢」 。 在这些工业软件的底层, Stencil(模板计算) 是最基础、也是最消耗算力的计算模式。由于它极度消耗显存带宽,一旦代码与硬件架构的适配不够极致,再先进的 GPU 芯片也会陷入原地「干等」数据的性能荒。 过去,想让这些软件跑得更快,往往要靠少数高性能计算(HPC)专家逐个分析和调试,耗时数日到数周进行代码手工精调,由此每人每年所能优化的软件应用通常不超过20个——在庞大的国产工业软件优化需求面前,这一速度难以跟上国产智造加速的脚步。 AI Agent时代,这个长达数十年的工业软件性能优化枷锁,正在被一家中国大模型公司打破。 今天,面壁智能联合OpenBMB开源社区正式发布并开源了全球首个Stencil 优化「自动研究+自动部署」大闭环的AI系统—— ForgeStencil , 仅用1周时间就自动完成了100+真实工业和科学计算软件的重构优化,全程0人类专家介入。 这是面壁智能继今年5月底发布全球首个完全由AI编写的大模型预训练框架 ForgeTrain(训练速度比英伟达Megatron快10%)后,基于 Forge Engineering(锻造工程) 软件工程新范式研发的又一重磅技术成果,也是面壁智能在 AI 智能自主进化方向布局的最新力作。 在整个过程中,人类只需要提供待优化的应用源码,后续全流程由 ForgeStencil 接手——从自动分析真实应用、定位热点函数、锻造 Kernel,到完成算子替换、正确性验证与集成回原应用,全程没有人类专家介入任何一步优化决策,首次实现了 从「提出优化想法」到「应用无缝部署」的全自动闭环 。 ForgeStencil不仅证明了通过AI重构代码路线、无需追加硬件投资即可成倍榨干既有物理性能的可能,更深刻切中了当前中国制造业升级的核心诉求: 用算力平替人力,为国产工业软件按下自演化的加速键。 开源链接 : https://github.com/OpenBMB/ForgeStencil 双Agent驱动 0人工介入,全球首个 ForgeStencil要优化的Stencil,究竟是什么? Stencil(模块计算)是工业软件与科学计算中分布最广、最基础的核心计算模式之一,其核心是对规则网格上每个点及其固定邻域执行相同局部运算。 无论是大气动力学、地震波场传播、电磁场演化,还是流体力学与相场模拟,其底层的计算都可以归纳为同一种操作:用网格点邻居的加权组合,反复更新整个网格——即Stencil计算。这类计算访存密集、受内存带宽主导,往往占据整个应用的大部分运行时间。 在Stencil的计算中,最大的挑战是数据量太大:程序需要反复读取和写入海量数据,路线一旦设计不合理,GPU就得原地干等。一个底层步骤慢下来,整个应用都会被拖慢。它也因此成为许多工业与科学计算软件的性能瓶颈。 过去,让Stencil跑出硬件极限速度,通常是少数高性能计算(HPC)专家的硬功夫。他们既要看懂算法和应用,又要根据数据规模和 GPU 调整代码。换一个应用,甚至换一款芯片,原有方案都可能需要重做。面对数量庞大的工业与科学计算软件优化需求,这种逐个依赖专家优化的方式很难规模化。 ForgeStencil的出现,打破了这一困局。 ForgeStencil系统由Kernel Agent与App Agent组成,二者结合完成了从算子优化到应用部署的完整闭环,超越了以往所有自动调优工具。其中: Kernel Agent专注于底层算子编写优化,使其无限逼近硬件物理极限。 它会针对不同类型的Stencil、不同的网格形状和计算精度,自动生成大量候选Kernel,尝试各种数据读取方式、线程调度策略和计算结构,再通过编译、运行和性能反馈,一轮轮筛出最快的算子。 在算子测试中,ForgeStencil与目前市面上开源的最优算法(包括Halide、Devito、EBISU、DRStencil、FlashFFTStencil等知名框架)在同等硬件下进行对比测试,展示了强劲的技术优势: 同精度(fp32)对比下,获得了几何平均2.35×的加速比; 混合精度(fp16)读写时,又拿下了额外的1.95×提速; 即便在业界公认最难的「变系数 Stencil」全部Shape 上,相比最优基线仍取得几何平均下1.34×的加速。 然而,一个底层算子跑得快,并不等于整个庞大的工业软件能直接变快。在真实的科研和工业生产代码中,Stencil循环的代码往往写得非常复杂,常常与多物理场耦合项混写,精度和数据格式也无法直接套用现成的标准算子库。如果直接从现成算子库里选个包塞进去,软件必然会报错或无法编译。 App Agent负责工程部署,要解决的正是从算子快到应用快的关键一环。 App Agent的做法是为每个应用单独锻造方案:定位性能热点、建立应用自身的GPU基线、锻造候选优化、用程序自带的校验与计时验证、再集成回原应用。 在框架级,App Agent寻找算子融合的机会,并把待优化的Stencil算子提取出来。Kernel Agent则负责优化具体的算子,其在之前建立的算子矩阵被作为后续开发的知识库。最终,App Agent会使用应用自带的测例做端到端评测,以确保优化面向真实场景。 Kernel Agent与App Agent紧密协同,让ForgeStencil成功完成了从「自动生成代码」向「自动研究优化」、从「局部算子提速」向「真实应用部署」的智能进化, 实现 全程0人工介入 。 1周优化100+真实应用 超越人类专家 在双Agent闭环驱动下,ForgeStencil将单个真实工业软件与科学计算应用的优化从数天、数周压缩到了小时级内。 据统计,ForgeStencil在一周内完成了 100+真实工业与科学计算应用的自动优化,全程0人工介入,研发吞吐提升了1-2个数量级,研发效率远超人类专家。 ForgeStencil 性能效率表 此外,与人类专家优化相比,AI优化还有另一个技术优势,即: 人类专家的经验都在自己脑子里,很难共享给别人;但ForgeStencil有大量并行的Agent共享知识库,经验可以实时共享,可以 实现智能的集体同步进化 。 在 HPC 的世界中,所有的软件研发范式迭代都必须接受真实工业场景和真实生产代码的严苛检验。ForgeStencil 自动优化的 100+ 个软件中, 约42% 直接对应真实的实体工业生产场景 。 为了更直观地体现ForgeStencil对现代工业制造升级的助力,我们深度剖析了其中两个最具代表性、技术壁垒极高的国产化重器场景: 攻克通用CAE软件的数学心脏: hypre(加速3.86×) 在航空航天、汽车
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱