2024-12-22-百川智能-大模型推理框架升级之路_26页_5mb
报告摘要
大模型推理框架升级之路总结
-
内容概述: 本次报告基于DataFunSummit 2024,讨论优化大模型推理框架性能的核心方法。主要内容围绕四个优化方向展开:量化、投机采样、注意力机制优化和通信优化。这些优化旨在提高推理效率、减少延迟和降低成本。
-
优化专项一:量化
- 目标是降低显存占用和计算开销。
- 使用量化级别如int8和int4来压缩权重和KV缓存,支持在低端显卡(如int4部署)上运行更长序列。
- 效果:显存减少50%以上,推理成本下降,具体案例显示在业务部署中已实现显著收益。
- 技术挑战:处理激活量化后运算耗时优化。
-
优化专项二:投机采样
- 利用过程冗余通过并行生成候选输出来加速推理。
- 策略包括构建候选树,采用动态采样方法如贪心搜索。
- 贡献:命中率提升50%+,端到端推理速度加快,但需考虑云端候选数量限制。
-
优化专项三:模型结构优化
- 介绍了Clover和Clover2等新模型,针对transformer结构进行增强,提升全局信息捕获能力。
- 如增加Augmenting Block来扩展表示,效应在Clover2中最大提升7.7%命中率。
- 特性:Focus on cross-entropy loss改进和顺序预测优化,有益于标准数据集表现。
-
优化专项四:性能平衡与通信优化
- 针对TTFT(端到端起始时间)和TPOT(吞吐量)优化,使用chunk pre-fill和PD分离技术来平衡短输入和长请求的延迟与吞吐。
- 在通信弱的GPU(如NVIDIA 4090)上,采用overlap计算通信策略,并通过量化减少通信耗时占比。
- 目标:最大化计算效率和响应速度,已开发动态调度策略进行优先加速,收益上限因硬件不同。
总之,这些优化路径全面提升了推理框架在实际场景中的适用性和性能,降低了部署门槛,并在多个硬件平台验证了可靠性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载