计算中心有效算力评测体系白皮书_40页_7mb
报告摘要
计算中心有效算力评测体系白皮书总结
核心内容概述
本白皮书聚焦于计算中心新型基础设施的高质量建设,提出“有效算力”和“有效算力指标(CUE)”的概念,旨在通过业务导向的评测体系,实现对计算中心算力的科学、合理、全面评估,从而推动“节能”与“增效”双轮驱动,支撑数字经济高质量发展。
主要观点
- 有效算力是对计算中心在真实业务场景下,综合计算、存储、网络及基础软件等全栈性能的衡量,不同于传统规格算力。
- 有效算力的提出有助于实现计算中心的绿色化、集约化和多样化发展,推动新型基础设施的高质量建设。
- 有效算力评测体系应从“极值”走向“积分”,实现对计算中心建设质量的全面评估。
- 有效算力评测体系需涵盖人工智能、通用、超算等多种场景,并推动相关标准和工具的建设。
关键信息
有效算力的内涵
-
有效算力是计算中心在真实业务场景下,通过软硬件协同优化所能实现的性能指标。
-
它不仅衡量硬件性能,也关注软件优化、数据处理效率和系统整体资源利用率。
-
有效算力的计算公式为:
$$
\mathrm{CUE} = \alpha^ {n} \sqrt {\prod_ {i = 0} ^ {n} \left(\frac {P _ {i}}{P _ {si}}\right) ^ {\omega_ {i}}}
$$其中 $\alpha$ 为调整系数,建议取值为100,$P_i$ 为测试集在目标系统上的实际性能,$P_{si}$ 为基准系统上的实际性能,$\omega_i$ 为测试集中不同负载的权重。
有效算力的应用场景
- 人工智能计算中心:主要应用于深度学习模型训练与推理,代表性负载包括ResNet50和Bert-Large等模型,关注计算效率和吞吐能力。
- 一体化大数据中心:主要负载包括大数据分析、数据库、Web/应用中间件和云主机,关注数据处理能力、存储与网络协同。
- 超算中心:主要负载包括气象预测、制造CAE、生命科学等,关注高精度计算与大规模数据处理。
- 算力网络:关注算力需求度量、资源管理和交易,推动算力的灵活调度与共享。
有效算力的评测方法
- 指令混合法:基于指令频率的加权平均,已不能全面反映现代系统性能。
- 核心程序法:基于代表性程序的测试,更贴近系统实际性能。
- 基准程序法:基于实际业务负载的测试,如AISBench、MLPerf、TPC-DS等,是当前最贴近实际应用的评测方式。
有效算力的测试集与工具
- 面向人工智能计算中心的测试集可参考《信息技术 人工智能 服务器系统性能测试规范》(T/CESA 1169-2021)。
- 测试工具包括AISBench Test Toolkit,用于人工智能系统的性能测试。
- 测试集需兼顾效率、公平性和牵引性,未来将扩展至大模型、国产数据集等。
有效算力的标准进展
人工智能场景
- T/CESA 1169-2021标准已发布,涵盖人工智能服务器系统的性能测试方法,包括训练与推理任务的吞吐率、能耗、能效等指标。
通用场景
- 正在制定的《数据中心算力技术要求和测评方法》及《数据中心算力测试方法》标准,涵盖通用计算设备的性能评测。
- CESA发布的三项通用算力标准:
- CESA-2020-4-007:通用计算CPU性能测试评价技术要求
- CESA-2021-3-001:通用计算CPU性能测试基准负载设计要求
- CESA-2021-3-002:通用计算CPU性能测试基准运行框架要求
超算场景
- 超算行业仍主要依赖Linpack/HPL等传统基准,但缺乏对实际业务性能的评估。
- 2021年绿色计算产业联盟发布的《服务器应用场景性能测试方法高性能计算》标准,尝试以典型业务应用(如气象、基因、CFD)进行评测。
推进有效算力评测体系的建议
- 政策引导:建议将“有效算力”作为计算中心高质量建设的先行先试标准,形成政策可循的建设体系。
- 指标标准化与工具化:加快有效算力指标体系的标准化和工具开发,形成统一的测试方法和评估标准。
- 组织承载与榜单发布:建议由权威第三方机构主导,联合行业参与者建立评测组织,定期发布有效算力榜单,推动行业良性竞争与技术发展。
结语
有效算力评测体系的建设,是推动计算中心向高质量、绿色化、智能化方向发展的关键。通过有效算力的引入,可以更精准地反映计算系统的实际性能,实现从“规格算力”向“真实业务算力”的转变。白皮书指出,未来将围绕有效算力的推广,持续发布相关白皮书,推动其在更多场景中的应用,如边缘数据中心、算力网络等。
白皮书强调,有效算力的全面覆盖和标准统一仍需进一步研究与实践,以实现“业务牵引、全栈优化、节能增效”的目标,支撑数字经济与双碳战略的实施。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载