今年夏天,接续生成的台风、突发性的极端暴雨,再次把“天气预报能算多准”推到了台前。答案藏在一个数字里:分辨率。全球主流气象机构都在向1-5公里级数值预报冲刺,欧洲ICON、美国MPAS等模式团队已相继转向异构加速计算平台。这是一场算力与模式的双向奔赴,谁的算力撑得起来,谁就能看得更细、报得更早。
近日,中科曙光与中国气象局地球系统数值预报中心联合宣布:MCV数值模式依托曙光8000,实现1小时完成全球5公里分辨率、未来10天的预报计算,达到国际主流业务时效标准,并通过批量预报质量检验。
公里级预报难在哪儿?先算一笔账。模式分辨率从2公里提到1公里,网格数量成倍增加,算力需求直接提升8倍。而这8倍不是多做几道运算就能解决的,网格越密,计算单元之间要交换的数据越多,模拟结果也要在更短周期内写出。系统规模越大,通信、存储、任务调度对效率的拖累就越明显,单纯堆处理器,整场预报未必能按比例提速。

中科曙光高端计算总工程师卜景德在演讲中把挑战归纳为三道坎:其一,传统架构走不通,国际架构正朝着异构化方向发展,哪些计算交给通用处理器、哪些交给加速卡大规模并行完成,需要重新切分;其二,人工智能时代到来,传统科学计算与AI计算如何在同一套系统里融合运行,成了全新命题;其三,也是最容易低估的一关,把一个包含物理、动力等近一百个模块的复杂模式,高效移植到国产平台上,还要“跑得准”。
“跑得准”有多难?计算机领域有个经典细节:数学上A+B+C等于A+C+B,但在浮点运算的世界里,两者并不相等,因为存在精度损失。模式对数值一致性极其敏感,移植一旦引入偏差,预报结果就不可信。双方为此定下“标准化移植”的硬要求,如果工程团队改完代码,而气象科学家看不懂,那么模式就无法持续迭代,这个合作就不可持续。围绕这一点,团队持续优化编译器与软件环境,将大量可复用的计算过程系统化记录、按需替换,把移植从一遍遍人肉调试变成可累积的工程流程。
对策的另一端,是系统。今年7月发布的曙光8000,是中科曙光“芯片、计算、存储、网络、散热、应用、服务”全链条能力的集大成之作,即一套10万卡规模的超智融合系统,可在如下三个维度充分赋能气象数值模式。
第一,超智融合异构加速。一套系统同时承载传统科学计算与AI训练推理,提供全精度算力。这意味着数值模式与AI模式不必分居两套平台,为下一代科学智能融合模式预留了架构空间。
第二,存储与通信的重写。数值预报是典型的I/O密集型应用,全球模式以10秒为周期持续写出海量场数据,还要承受全局性的流量冲击。曙光8000采用分布式全闪存存储ParaStor与低时延高带宽网络:通过异构加速卡直接嵌入存储通路等创新,关键读写环节从6分钟压缩到10秒,存储读写效率整体提升约30倍,这一提升幅度远超内存带宽本身的进步,说明瓶颈从来不在单一部件,而在系统协同。通信侧同样如此:减少CPU侧的数据搬运、重构算法通信次序、尽可能打包传输,计算与通信重叠推进,为大规模扩展打下基础。
第三,10万卡的稳定运行。气象业务是小时级窗口,一小时内算不完,预报员就拿不到结果。系统在设计之初就围绕可靠性做文章:液冷散热、严苛的计算标准、智能化运维提前预警。10万卡规模连续数小时稳定运行,是这套系统能够支撑业务化运行的前提。
值得一提的是,中科曙光与气象部门的合作由来已久,在二十年前参与到气象局各个方面的工作:2017年承担新一代国产化系统建设,将原有IBM的系统全面走向国产硬件系统;2023年实现新一代系统建设,并支撑了当前气象局业务化运行;2025年双方开启的新一轮合作,目标直指下一代公里级模式,把MCV做到“既跑得快,又跑得准”的业务化级别。
长期来看,这次验证的意义不只是一项纪录。当科学问题倒逼计算架构演进、异构算力反过来促进数值方法与人工智能结合,先进算力正在从“支撑模拟”走向“参与研究”。对防灾减灾、气候变化研究而言,这条由国产算力铺出来的公里级路线,才刚刚开始发力。
更新时间:2026-09-20
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号