AI芯片AI芯片大模型训练性能实测GEMM

2048核AI芯片在大模型训练中的性能实测

李思涵
2026-07-10
10分钟

测试环境与配置

本次测试使用配备2048核AI加速芯片的8卡服务器集群,每卡包含2048个定制AI核心,运行频率1.8GHz,配备64GB HBM3内存。对比基准为8卡NVIDIA H100 SXM5集群。训练模型为基于GPT架构的70B参数大语言模型,使用混合精度训练策略。

矩阵乘法性能:GEMM算子的极致优化

在大模型训练中,矩阵乘法(GEMM)占据约60%的计算时间。2048核AI芯片通过脉动阵列架构,每个核内的256个MAC单元可在单周期完成512次浮点运算。实测显示,在FP16精度下,2048核芯片的矩阵乘法吞吐量达到每秒1.2PetaFLOPS,较单卡H100的989TFLOPS有约21%的领先优势。主要归功于2048核芯片的二维脉动阵列设计,数据在阵列中以流水线方式逐行逐列传播,最大化数据复用率,将片外内存访问减少了约40%。

注意力机制:FlashAttention的硬件适配

自注意力机制的计算复杂度为O(n squared),是大模型训练的另一个瓶颈。2048核AI芯片针对FlashAttention算法进行了硬件级优化,在片上SRAM中实现了分块注意力计算,避免了中间结果的片外存储。在8K序列长度下,注意力计算延迟仅为H100的68%。

梯度同步:All-Reduce的拓扑感知调度

8卡集群的梯度同步采用Ring All-Reduce算法。2048核芯片间的互联带宽为600GB/s(双向),8卡构成的双向环网总带宽达到4.8TB/s。实测梯度同步耗时仅占单步训练时间的3.2%,远低于H100集群的5.8%。

端到端训练吞吐量

在70B参数模型上,8卡2048核AI芯片集群的端到端训练吞吐量达到每秒处理85,000个token,相较8卡H100集群的72,000 token/s有18%的性能优势。每token的能耗降低约22%,展现出卓越的能效比。