20250320-中智凯灵_北京_科技-基于eBPF和Agent构建LLM训练推理优化体系_43页_12mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
本次2024 AI+研发数字峰会聚焦于AI驱动的研发变革,探讨了如何通过新技术提升训练和推理效率,降低企业成本。核心内容包括:LLM训练和推理的效率挑战、传统解决方案的问题、基于eBPF和Agent的零侵扰可观测性构建方法、PyTorch全栈剖析与追踪实践,以及Agent自动优化ML代码的探索。
主要观点
- LLM训练和推理效率低:由于模型参数大、GPU利用率低、训练时间长等问题,LLM训练和推理面临显著的效率挑战。
- 传统解决方案不足:现有工具如Nsight和PyTorch Profiler存在侵入性高、性能影响大、无法有效解决分布式环境下的问题等局限。
- eBPF构建零侵扰可观测性:eBPF技术为构建零侵扰的全栈可观测性提供了可能,能够实时分析GPU和CPU的使用情况,以及网络性能。
- PyTorch剖析与优化:通过eBPF技术对PyTorch进行剖析,能够发现显存拷贝、数据交换、模型检查点等问题,并提供优化方案。
- Agent自动优化ML代码:利用LLM Agent对ML代码进行智能分析和优化,减少CPU资源消耗,提升性能。
关键信息
1. LLM训练和推理的效率挑战
- 训练开销大:如GPT-4和Llama-3.1,训练时间长(数月),模型参数大(万亿),GPU数量多(数万),GPU利用率低(30%~43%)。
- 推理开销大:推理时显存需求高,如Llama-405B推理显存需求高达1.48TB。
- GPU利用率低的原因:
- 硬件问题(78%的中断归因于硬件问题)。
- 显存拷贝(27.9%)。
- 数据交换(7.08%)。
- 不合理的代码设计(如不合理的batch size、模型检查点等)。
2. 传统解决方案的问题
- Nsight和PyTorch Profiler的局限性:
- 需要重启进程。
- 缺少CPU上下文。
- 侵入性强,对性能影响大。
- RDMA网络问题:
- 公有云RDMA网络为性能黑盒。
- 需要主动拨测和分析网络指标。
3. eBPF构建零侵扰可观测性
- eBPF的优势:
- 零侵扰,无需修改代码。
- 实现GPU和CPU的实时性能剖析。
- 支持网络性能分析,如RDMA API Hook。
- eBPF实现方法:
- Hook CUDA RT函数(如
cuda_malloc、cuda_free、cudaMemcpy)。 - Hook RDMA API(如
ibv_modify_qp、ibv_reg_mr、ibv_post_send)。 - Hook其他关键函数(如
ncclAllReduce、ncclAllGather)。
- Hook CUDA RT函数(如
- 技术挑战:
- 数据采集、关联和分析。
- 栈合并,实现全栈剖析。
- 分布式追踪,实现跨节点性能分析。
4. PyTorch全栈剖析和追踪实践
- DeepFlow中的eBPF AutoProfiling:
- 提供CPU和GPU火焰图。
- 分析显存申请、使用和数据交换。
- 优化建议:
- 启用自动内存钉扎(pin_memory=True)。
- 减少数据交换频率,使用大batch size。
- 增强通信效率,使用压缩通信。
5. Agent自动优化ML代码
- LLM Agent的作用:
- 自动分析和优化ML代码。
- 识别和优化关键性能瓶颈。
- 性能分析结果:
- 与定时器相关的操作(如
runtime.siftdownTimer、runtime.runOneTimer)消耗大量CPU资源。 main.busyLoop表明业务逻辑中存在忙等,可能需要优化。time.Sleep和调度相关函数(如runtime.gopark、runtime.mcall)显示程序有意识的休眠和调度问题。
- 与定时器相关的操作(如
总结
本次峰会深入探讨了AI在研发中的应用,特别是LLM训练和推理的效率问题。通过eBPF和Agent等新技术,可以实现零侵扰的全栈可观测性,从而识别和优化性能瓶颈。传统工具存在诸多不足,需进一步探索更高效的解决方案。同时,Agent自动优化ML代码为提升研发效率提供了新思路,值得进一步研究和应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载