在单个 GPU 计算性能方面,首先需要设计先进的 GPU 处理器,在功耗允许条件下,研发单 GPU 更多并行处理核心,努力提高运行频率。 其次,通过优化高速缓存设计,减少 GPU 访问内存延迟,进一步提升单 GPU 芯片运行效率。 第三,优化浮点数表示格式,探索从 FP16 到 FP8 浮点数的表示格式,通过在芯片中引入新的存储方式和精度,在保持一定精度条件下,大幅提升计算性能。 最后,针对特定计算任务,可在 GPU 芯片上集成定制化的硬件加速逻辑单元,这种基于 DSA (DomainSpecific Architecture) 的并行计算设计,可提升某些特定业务领域的计算速度。
加速推进超越单机8 卡的超节点形态服务器 为满足万亿或更大参数量模型的部署需求,建议产业界致力于研制突破单机8 卡限制的超节点形态服务器,通过利用提高 GPU 南向的 Scale up 互联能力,提升张量并行或 MoE 并行对大模型训练任务的收益,实现性能跃升,缩短训练总时长,实现大模型训练整体性能的优化。 加快引入面向 Scale up 的 Switch 芯片 建议在节点内集成支持 Scale up 能力的 Switch 芯片,以优化 GPU 南向的互联效率和规模,增强张量并行或 MoE 并行的数据传输能力。
如图2 所示,通过引入节点内的 Switch 芯片,以增强 GPU 卡间的点对点 (Point to Point,P2P) 带宽,有效提升节点内的网络传输效率,满足大模型日益增长的 GPU 互联和带宽需求,为大规模并行计算任务提供强有力的硬件支持。
优化 GPU 卡间互联协议以实现通信效率跃升 建议对 GPU 卡间互联协议进行系统性优化和重构,以提升 AIl2All 模式下的通信效率。通过重新设计卡间通信过程中的数据报文格式、引入 CPO (Co-PackagedOptics) /NPO (Near Packaged Optics) 、提高和优化 SerDes 传输速率、优化拥塞控制和重传机制以及多异构芯片 C2c(Chip-to-Chip)封装等多种途径,提高超万卡集群的 GPU 卡间互联的网络利用率,减少通信时延,实现带宽能力跃升,从而支持所需的更高频次、更大带宽和更低延迟通信特性。
计算引擎卸载加速 1/0 设备的数据路径与控制路径,面向节点提供标准化的virtio-net(Virtual1/0 Network)、virtio-blk(Virtiual 1/0 block)后端接口,屏蔽厂商专用驱动。 存储引擎在 DPU 上实现存储后端接口,可基于传统 TCP/IP 网络协议栈或RDMA(Remote Direct Memory Access)网络功能连接块存储集群、对象存储集群、文件存储集群及文件存储集群,将节点的全类型存储任务卸载至 DPU 中完成。 网络引擎将虚拟交换机卸载至 DPU 上,采用标准的流表和卸载接口实现网络流量的卸载,全线速释放硬件性能;同时集成 RDMA 网络功能,降低多机多卡间端到端通信时延,提升多机间端到端通信带宽至 400G 级别,构建节点间数据交换的高速通道”. 安全引擎通过信任根机制以及标准的IPsec等加密通讯协议对系统和多租户网络进行安全防护,并基于DPU提供有效的卸载方案。 管控引擎屏蔽裸金属、虚拟机和容器等算力单元的形态差异,实现 DPU 资源统一管理和全链路管控运维。 以上述五大引擎为蓝图,中国移动于 2020 开始打造具有自主知识产权的磐石DPU,并于 2021 年正式推出磐石 DPU 版本。经过移动云现网的打磨,中国移动持续升级磐石 DPU 产品能力,并于 2024 年将磐石 DPU 的 FPGA 架构全面升级为ASIC 架构,旨在围绕磐石 DPU 软硬融合重构算力基础设施,重新定义算力时代云计算技术新标准,构建算力时代新技术曲线。
动3D 并行策略: 支持基础数据并行、模型并行及流水线并行的一种或多种组合形态。 自动并行方案生成: 根据模型结构及参数量、现有硬件资源拓扑情况、网络带宽等信息,以通信代价最小为目标,自动生成配置模型训练过程的最优 3D 并行参数组合。 自动计算图优化: 计算图作为连接深度学习框架和前端语言的主要中间表达,被目前主流框架如 TensorFlow 和 PyTorch 所使用或者作为标准文件格式来导出模型。计算图的执行效率极大程度上影响代码执行效率。构建高效算子库,预置算子融合库,设计子图替换规则,以计算图在节点间的计算通信信息为输入,尽量使每个节点的负载做到均衡,在编译阶段,触发白动计算图优化。 数据流水线优化: 数据预处理和训练数据加载阶段 GPU 空闲,可采用数据并行处理、数据分布式加速缓存等技术,优化提升 GPU 利用率,提升模型训练效率。 显存优化: 显存优化方法通常包括代码优化、梯度累计、存储格式优化、半精度训练等,通过综合使用多种显存优化方法,降低显存消耗,提高大模型训练的稳定性和可扩展性。
作业路径可视
环境健康检查 环境健康检查包括集群环境健康检查和作业运行前环境检查两种类型,均与 AI作业训练的环境准备相关。集群环境健康检查:对集群环境进行全面检查,规避软硬件问题。对集群软硬件、环境配置及性能进行健康评估,并输出完整报告。作业运行前环境检查:对作业运行所需资源的健康、一致性、性能等进行检查,提高作业运行成功率。 故障诊断 对执行失败的作业进行智能故障诊断定界,分析全链路影响因子,基于作业运行环境日志进行诊断,覆盖常见软件栈报错,同时对计算、网络、存储域的告警、故障进行时空关联分析,实现多种典型故障的实时诊断。基于 Al 训练场景搭建故障知识库,提供快速精准的故障知识检索能力。 集群资源管理 提供作业集群管理能力,包括集群名称、状态、计算节点个数等信息。 支持对集群信息的配置和修改能力,提供运维管控面的集群相关元数据管理。 设备管理 提供集群内计算、网络、存储、光模块等全量设备的静态数据录入、采集和管理能力,能够快速检索查看设备的详细信息,提升AI集群资源的管理效率。支持将服务器设备添加到智能运维管理系统进行统一管理,监控资源、告警、性能数据,提升管理效率。 监控分析 基于静态数据、性能数据以及日志数据,提供软硬件、作业等多维度的性能分析,动态评估和监控软硬件、作业的运行状态,提供监控分享告警、日志分析与检索,快速识别关键信息,提升日常运维效率。 监控大盘 实时呈现集群资源使用和运行状况、训练任务得执行情况等相关监控数据,动态展现一段时间内性能的变化情况,实现对关键监控数据集中显示的功能,及时、全面、快捷的地掌握集群的运行状况。
