4.31倍加速,万节点并行效率89%!自主海浪模式基于“灵晟”超算攻克高精度预报挑战
面对海洋资源开发对高精度海浪预报的迫切需求,传统算力已难以承载分辨率提升带来的“计算量爆炸”。自然资源部第一海洋研究所自研MASNUM海浪模式,创新构建OceanHPCFrame并行框架,通过“多级并行+深度向量化”优化,发挥“灵晟”超算极致算力,相对传统纯MPI计算实现4.31倍加速,万级节点规模89%并行效率,为“智慧海洋”建设提供了强劲算力支撑。
海洋是资源的宝库,也是风险的温床。从渔业捕捞到海上风电,从航运物流到跨海大桥建设,精准的海浪预报是这一切安全运行的“定海神针”。随着人类对海洋开发的深入,对高分辨率海洋模型的需求日益迫切,而算力负担也随之剧增——水平分辨率每提高一倍,计算成本上涨约8倍,仅依赖传统计算资源已捉襟见肘。与此同时,“灵晟”超算问鼎全球,“灵晟”LX2 CPU通过在线CPU加速能力与高带宽片上内存,协同加速计算密集型和内存密集型任务,成为破解海浪模拟算力困局的关键。
作为我国自主研发的第三代海浪模式,MASNUM历经多次实测验证,已广泛应用于海浪预报、海洋工程、灾害预警及气候变化研究,是支撑“智慧海洋”建设的核心技术之一。为释放高精度模型的潜力,研发团队对MASNUM进行底层重构,创新设计了高效并行框架OceanHPCFrame,并针对“灵晟”架构特性深度优化打破瓶颈:
1. 负载均衡的多级并行及封装
海洋模式迭代步长短、同步通信频繁,传统方案多采用纯MPI扁平化并行,为适配“灵晟”的分层存储与多NUMA架构,OceanHPCFrame创新构建了“MPI跨节点通信 + Pthreads节点内通信 + 计算核线程簇内共享内存通信”的三级协同并行策略,并进行了封装。该策略在大幅缩减了MPI进程总数,降低进程间通信开销的同时,充分释放了LX2 CPU片上内存的高带宽优势,从而显著提升了整体计算效率,同时通过封装,大幅度降低领域专家适配“灵晟”的分层存储与多NUMA架构的难度。
2. 深度向量化
针对波浪数值模拟中计算量最大的模块,团队提出了深度向量化方法,专门适配“灵晟”LX2 CPU的可扩展向量扩展指令集。通过改进算法结构、扩展数据边界以及对非连续数据的特殊处理,主循环内代码的向量化比例超过95%,在尽可能实现向量化计算的同时,规避了数据不连续带来的额外开销,倍级提升计算性能。
在“灵晟”超算平台上,OceanHPCFrame交出了一份亮眼的数据:
● 4.31倍性能飞跃:与传统纯MPI方案相比,应用OceanHPCFrame并行框架并基于“灵晟”优化的MASNUM模式,在1/4°和1°分辨率下分别实现了4.31倍和4.17倍的加速比。
● 万节点高扩展性:在计算节点从512个扩展至20480个的大规模并行环境下,框架仍保持89%的高并行效率,为超大规模海洋模拟提供了高效的技术底座。
MASNUM在“灵晟”超算上的成功,得益于其“平衡内存局部性与通信效率”的核心设计思想,这也为大气、气候等其他地球系统模型的优化提供了宝贵参考。随着以“灵晟”为代表的超算深入应用,这场由算力驱动的海洋科技革命,必将为“智慧海洋”建设注入更为强劲的数字动能。