肖彬:大模型推理框架升级之路-26页_5mb
报告摘要
大模型推理框架升级优化总结
大模型推理框架性能优化主要集中在四个方面:量化、投机采样、TTFT/TPOT优化、通信优化。
一、量化优化方向
量化技术通过降低模型权重与缓存的存储精度,显著减少显存占用且提升推理速度。
- Weight-int8 + KV_cache-int8:显存减少50%,服务承载能力提升。
- Activ-int8:降低Gemmm运算耗时,首token耗时下降50%。
- Weight-int4 + KV_cache-int4:显存进一步减半,支持更高bathc,成本下降30%。
- Communication-Int8与Attention-QKVint8:两项通信量化工作正在开发中。
二、投机采样改进
利用decode阶段的冗余算力,生成多个候选token并行验证,提高批处理能力。
- 特别设计了4候选token策略,并采用动态构建候选树的方式。
- Clover模型架构通过新增AugmentingBlock提升预测能力,使命中率提升50%~77%,速度提升30%~93%。
- Clover2损失函数增加数据蒸馏项,防止模型“走捷径”,提升预测一致性。
三、TTFT与TPOT优化
TTFT(首token延迟)与TPOT(后续token延迟)的优化聚焦于用户体验。
- Chunk Prefill技术将计算拆分,提升了decode效率。
- PD分离策略根据不同请busy情况使用分段推理或专用prefill节点处理,有效平衡两种延迟。
- 多级动态LRU与Session Cache进一步缓计算,减少首token延迟。
四、通信优化
尤其对NVIDIA 4090卡等通信能力弱的硬件针对性优化:
- 采用计算通信overlap机制,将通信与计算结合。
- 针对4卡、8卡等不同部署方式设计了多阶段计算调整方案。
- 通过均衡计算与通信耗时比例,实现最佳性能。
以上优化全面提升了框架性能,使推理框架更加高效、成本更低,且适应多种硬件部署环境。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载