【字节跳动】2025年GPU_Scale-up_互联技术白皮书_24页_4mb
报告摘要
字节跳动GPU Scale-up互联技术白皮书总结
核心内容
字节跳动基于以太网技术,提出了一种自研的下一代Scale-up网络协议——EthLink,旨在满足AI应用对GPU集群高速互联的需求。EthLink不仅支持Load/Store语义,还支持RDMA语义,覆盖了Scale-up网络的所有应用场景。该方案通过优化以太网协议栈,实现了低延迟、高带宽、高可靠性的GPU互联。
主要观点
- GPU架构与数据传输:当前主流GPU架构采用Load-Store语义进行数据传输,数据处理主要由计算引擎完成,而数据搬运由LSU负责。对于大块数据传输,传统方式需要计算引擎持续生成地址信息,会消耗算力资源。新型GPU如NVIDIA Hopper系列引入了TensorMemoryAccelerator(TMA)模块,用于Global Memory与Shared Memory之间的数据搬运,减少计算引擎的负担。
- Scale-up与Scale-out网络:Scale-up网络强调高带宽和低延迟,适用于内存数据传输,而Scale-out网络则强调带宽和异步操作,适用于大块数据传输。EthLink支持两种语义,兼顾了两种网络场景的需求。
- 下一代Scale-up网络需求:下一代Scale-up网络需要同时支持Load/Store和RDMA语义,以实现小块数据和大块数据的高效传输。同时,系统软件可承担Cache Coherency的维护,减少对网络硬件的依赖。网络需支持语义操作的保序,以及多协议栈间的负载均衡。
关键信息
GPU架构与数据传输机制
- Load-Store语义:GPU计算引擎从寄存器读写数据,通过LSU完成数据在寄存器、Shared Memory、L1/L2 Cache和Global Memory之间的传输。
- TMA模块:新型GPU引入TMA模块,用于Global Memory与Shared Memory之间的数据搬运,避免计算引擎持续计算地址信息,提高效率。
- 数据传输时延与IO Size:
- Load/Store语义:IO时延为10ns级,IO Size为寄存器级(32/64 bit)。
- Cache Miss时:IO时延为100ns级,IO Size为Cache Line Size(64/128/256 Byte)。
- RDMA语义:IO时延为10us级,Max IO Size为2GB。
GPU互联方案
- Scale-up网络:基于Load/Store语义,用于数据传输时延敏感的应用场景,如AI推理。
- Scale-out网络:基于RDMA语义,用于带宽需求大、时延不敏感的应用场景,如AI大模型训练。
- EthLink网络方案:支持Load/Store和RDMA语义,覆盖Scale-up网络所有应用场景。通过优化以太网协议栈,提升带宽、降低延迟和传输开销。
EthLink协议栈
- 系统架构:EthLink协议栈分为Scale-Up语义层和Scale-up网络层。语义层支持Load/Store和RDMA操作,网络层使用LLR和CBFC实现可靠传输。
- 报文封装:EthLink报文包含Reliability Header(RH)和Optimized EthLink Forwarding Header(OEFH),用于提升有效负载率并缩短报文头长度。
- 支持的操作类型:
- Load:从Global Memory或Shared Memory加载数据。
- Store:向Global Memory或Shared Memory存储数据。
- RDMA Write:向远端Global Memory写入数据。
- RDMA Write with Immediate:向远端Global Memory写入数据,并发送Immediate Data给远端GPU。
- RDMA Read:从远端Global Memory读取数据。
- Atomic:原子操作。
- Message:向远端GPU发送消息。
网络拓扑与负载均衡
- 网络拓扑:EthLink支持多协议栈部署,每个协议栈支持1~4个以太网接口,支持最大1024个GPU节点。
- 端口负载均衡:通过Multi-Path实现负载均衡,提升网络带宽利用率。
- 乱序处理:负载均衡可能引入乱序,需由上层应用处理。
链路层可靠传输机制
- FEC优化:采用低延迟的RS-272 FEC方案,减少链路层延迟。
- LLR机制:Link Level Retry,用于处理链路丢包问题,降低FEC要求,提升可靠性。
- CBFC机制:Credit Based Flow Control,用于处理交换机内部丢包问题,提供更细粒度的控制,降低端到端延迟。
- Switch Event Notification:交换机通过快速通知Source GPU链路状态变化,支持快速路径切换,提升网络可靠性。
总结
EthLink作为字节跳动自研的Scale-up网络协议,基于以太网构建,优化了标准以太网协议栈,实现了低延迟、高带宽、高可靠性的GPU互联。它支持Load/Store和RDMA语义,满足了AI训练和推理的不同需求。通过引入TMA模块、优化报文格式、采用LLR和CBFC机制,EthLink有效降低了数据传输的延迟和算力消耗,提升了GPU集群的整体效率和可靠性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载