2024-05-08-中国移动-面向超万卡集群的新型智算技术白皮书(2024年)_32页_9mb
报告摘要
面向超万卡集群的新型智算技术白皮书总结
核心内容概述
本白皮书由中国移动通信集团有限公司发布,聚焦于超万卡集群在人工智能大模型训练中的技术挑战与解决方案。随着大模型参数量从千亿级迈向万亿级,超万卡集群成为实现高效训练、快速迭代和稳定运行的关键基础设施。白皮书系统梳理了超万卡集群的背景、挑战、设计原则、关键技术及未来发展方向,旨在推动智算基础设施向更高性能、更高效能和更绿色低碳方向演进。
主要观点与关键信息
1.1 大模型驱动智能算力爆发式增长
- 大模型发展迅速,参数量从1.1亿(BERT)到1750亿(GPT-3)再到1.8万亿(GPT-4)。
- Scaling Law验证了模型参数与性能的正相关性,推动算力需求指数级增长。
- 超万卡集群成为大模型训练的标配,以支持万亿参数模型的高效训练。
- 多模态模型(如文生视频、文生音频)推动应用场景多样化,进一步加剧对算力的需求。
1.2 超万卡集群建设加速
- 国内外科技公司纷纷部署超万卡集群,如Google、Meta、Microsoft等。
- 国内通信运营商、互联网企业、AI研发企业和初创企业均在加速建设或使用超万卡集群。
- 超万卡集群不仅提升企业竞争力,也推动智算基础设施发展。
超万卡集群面临的挑战
2.1 极致算力使用效率
- 单卡算力与集群整体算力并非线性增长,需优化GPU利用率和集群线性加速比。
- 需通过网络设计优化、软硬件全栈调优等提升有效算力。
2.2 海量数据处理
- 万亿模型训练对数据吞吐性能要求高达10TB/s。
- 传统存储系统面临协议处理、吞吐性能和数据管理的挑战。
- 需引入多协议融合、自动分级存储等技术提升数据处理效率。
2.3 超大规模互联
- 需支持ScaleOut和ScaleUp两种并行训练模式。
- 参数面网络要求带宽达到200Gbps至400Gbps,数据面网络需支持100Gbps带宽。
- 需解决高速大象流交换冲突、通信瓶颈、低时延和无阻塞问题。
2.4 高可用和易运维
- 千万级器件的高负荷运行带来高故障率和复杂故障定位。
- 需构建自动断点续训机制,减少训练中断对效率的影响。
- 需实现故障快速感知与恢复,提升集群稳定性。
2.5 高能耗高密度机房设计
- 高功率GPU(400~700W)带来高功耗和高散热需求。
- 需采用液冷技术(冷板式、浸没式)提升能效。
- 需考虑机房承重、供电、通风和线缆布放等基础设施优化。
超万卡集群的核心设计原则和总体架构
3.1 核心设计原则
- 极致集群算力:结合ScaleUp与ScaleOut提升单节点与集群整体算力。
- 协同调优系统:优化并行训练策略(DP/PP/TP/EP)提升计算通信比。
- 长稳可靠训练:支持自动故障检测与修复、断点续训。
- 灵活算力供给:支持按需资源调度与多租户隔离。
- 绿色低碳发展:推进液冷技术与低PUE设计。
3.2 总体架构设计
- 四层一域:机房配套层、基础设施层、智算平台层、应用使能层、智算运营和运维域。
- 各层功能:
- 机房配套层:高效供电、制冷、承重、走线。
- 基础设施层:算、网、存三资源协同,支持多协议存储、高带宽网络。
- 智算平台层:支持K8s,提供资源纳管、任务调度、拓扑感知和全链路监控。
- 应用使能层:支持模型训练框架优化、工具集开发,实现自动化训练。
- 运维域:支持智能运维管理,实现故障快速定位和资源自动调度。
超万卡集群关键技术
4.1 集群高能效计算技术
- 提升单芯片计算性能和显存访问效率。
- 引入HBM、FP8精度、DSA架构等提升计算能力。
- 优化GPU间互联协议,减少通信时延。
4.2 高性能融合存储技术
- 实现多协议融合(NFS、S3、POSIX)支持无缝数据流转。
- 提升存储吞吐性能至10TB/s以上,实现秒级checkpoint恢复。
- 引入自动分级存储,支持冷热数据动态管理。
4.3 大规模机间高可靠网络技术
- 构建参数面、数据面、业务面、管理面独立组网。
- 推动GSE和DCQCN等技术提升网络性能与可靠性。
- 采用Spine-Leaf或胖树组网模式实现大规模互联。
- 优化端口级负载均衡和算网协同负载均衡提升网络吞吐。
4.4 高容错高效能平台技术
- 支持断点续训、并行计算优化、智能运维。
- 构建统一容器平台与智能运维系统,实现全链路自动化。
- 提供作业路径可视、环境健康检查、故障诊断、资源管理等能力。
4.5 新型智算中心机房设计
- 实现高效制冷(液冷技术)、弹性供电、敏捷部署。
- 推动绿色能源应用(光伏、风力、氢能)实现低碳运营。
- 引入智能化运维管理,结合大数据与AI技术提升运维效率。
未来展望
- 引入超节点,拓展ScaleUp能力,突破传统8卡限制,支持万亿级模型训练。
- 探索大规模逻辑集群,突破传输距离限制,实现跨节点互联。
- 提升软件框架自动化能力,支持跨平台、跨集群、边缘训推。
- 突破摩尔极限,探索存算一体、光子芯片等新技术,推动下一代智算架构发展。
缩略语列表
| 缩略语 | 英文全称 | 中文解释 |
|---|---|---|
| AI | Artificial Intelligence | 人工智能 |
| C2C | Chip-to-Chip | 芯片到芯片 |
| CDU | Cooldown Distribution Unit | 冷量分配单元 |
| CPO | Co-Packaged Optics | 光电共封装 |
| DCQCN | Data Center Quantized Congestion Notification | 数据中心量化拥塞通知 |
| DP | Data Parallel | 数据并行 |
| DPFR | Data Plane Fast Recovery | 数据面故障快速恢复 |
| DPU | Data Processing Unit | 数据处理单元 |
| DSA | Domain Specific Architecture | 特定领域架构 |
| ECMP | Equal Cost Multi Path | 等价多路径 |
| ECN | Explicit Congestion Notification | 显示拥塞通知 |
| FC | Fully Connected | 全互联拓扑 |
| GSE | Global Scheduled Ethernet | 全调度以太网 |
| HBM | High Bandwidth Memory | 高带宽内存 |
| IaaS | Infrastructure as a Service | 基础设施即服务 |
| IB | InfiniBand | 无限宽带技术 |
| IOPS | Input/Output Per Second | 每秒输入/输出操作次数 |
| MFU | Model FLOPs Utilization | 集群有效算力 |
| MoE | Mixture of Experts | 专家并行 |
| MP | Model Parallel | 模型并行 |
| MTBF | Mean Time Between Failure | 平均故障间隔时间 |
| MTTR | Mean Time To Repair | 平均修复时间 |
| NICC | New Intelligent Computing Center | 新型智算中心 |
| NFS | Network File System | 网络文件系统 |
| NPO | Near Packaged Optics | 近封装光学 |
| OISA | Omnidirectional Intelligent Sensing Express Interconnect Architecture | 全向智感互连 |
| P2P | Point to Point | 点对点 |
| PFC | Priority-based Flow Control | 基于优先级的流量控制 |
| POSIX | Portable Operating System Interface | 可移植操作系统接口 |
| PP | Pipeline Parallel | 流水线并行 |
| PUE | Power Usage Effectiveness | 电能利用效率 |
| RDMA | Remote Direct Memory Access | 远程直接数据存取 |
| RoCE | RDMA over Converged Ethernet | 融合以太网承载RDMA |
| S3 | Sample Storage Service | 简单存储服务 |
| TTA | Time to Accuracy | 模型训练至预定精度的时长 |
| UEC | Ultra Ethernet Consortium | 超以太网联盟 |
参考文献
- Kaplan J, Mccandlish S, Henighan T, et al. Scaling Laws for Neural Language Models. 2020.
- Shazeer N, Mirhoseini A, Maziarz K, et al. Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. 2017.
- Touvron H, Martin L, Stone K, et al. Llama 2: Open foundation and fine-tuned chat models. 2023.
- 中国移动. NICC新型智算中心技术体系白皮书. 2023.
- Jiang Z, Lin H, Zhong Y, et al. MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs. 2024.
- Kim B, et al. The Breakthrough Memory Solutions for Improved Performance on LLM Inference. IEEE Micro, 2024.
- 中国移动研究院. 全调度以太网技术架构白皮书. 2024.
- Shoeybi M, Patwary M, Puri R, et al. Megatron-lm: Training multi-billion parameter language models using model parallelism. 2019.
- Rasley J, Rajbhandari S, Ruwase O, et al. Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters. 2020.
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载