摘要:
HPL是高性能计算广泛采用的Linpack 测试软件包,传统HPL算法中,求解矩阵将以块为单位循环分布到所有处理器,由于国产加速器(China Accelerator)的底层矩阵乘接口仅支持定制接口,传统HPL算法已不适合CPU + China Accelerator异构系统,因此,必须基于定制接口完成矩阵分布细致划分与封装dPEM,以提供一个通用的HPL测试配置环境;同时,为了充分发挥国产异构系统的效率,设计了异构协同矩阵乘调度算法OA4MM,以提高国产异构系统的效率。实验验证了dPEM的有效性和OA4MM算法的高效性,OA4MM较传统的异构HPL调度算法性能提升近10%。
甘新标1,2,孙燎原3,刘杰1,雄成伟1,黄嘉昆1. 面向国产异构系统的HPL异构协同设计[J]. 计算机工程与科学.
GAN Xin-biao1,2,SUN Liao-yuan3,LIU Jie1,XIONG Cheng-wei1,HUANG Jia-kun1. Orchestrating HPL between CPU and China accelerator[J]. Computer Engineering & Science.