2025-03-24-中智凯灵_北京_科技-SUBLLM新架构_文本下采样机制革新大语言模型效率_44页_4mb
报告摘要
SUBLLM新架构总结
背景
大语言模型处理长文本面临训练与推理效率低下的挑战,主要源于Transformer模型中Attention复杂度与模型窗长之间的关系。为此,SUBLLM新架构应运而生,旨在提升资源利用率,同时保持模型能力,并兼容现有attention模型生态。
技术挑战分析
- 训练阶段:为支持更大窗长,需通过数据/位置编码优化降低训练成本。
- 推理阶段:窗长越大,推理速度下降幅度越大,例如模型窗长从2k扩展至200k,推理时间增加28倍。
- 模型结构扩展方案:现有方案如Infini-Transformer、MEGALODON可提升记忆机制与效率。
SUBLLM架构设计
- 核心理念:借鉴语音信号下采样思路,减少冗余信息,保留必要内容。
- 模块组成:
- Learnable Subsampling模块:动态判断token重要性并进行采样,平衡保留比例,解决训练/推理不一致性问题。
- Upsampling模块:通过合并采样后的token恢复序列长度,增强梯度传递。
- Bypass模块:对下采样与上采样序列进行池化混合,提升收敛稳定性。
实验结果
- 性能提升:
- 训练速度提升:34~37%(部分场景)。
- 内存占用下降:约10 GB/GPU。
- 效果验证:
- 与Llama在参数量持平情况下,SUBLLM在few-shot任务性能持平。
- 通过多次实验发现,采样保留比例为75%时,可达到最低验证损失。
未来方向
- 提升通用性:适应不同tokenizer和长文本场景(如200k窗长下的最小保留率)。
- 探索多模态应用:利用下采样对冗余特征(如视觉标记)的优化潜力。
分支结构总结
SUBLLM架构在优化效率与兼容性的同时,为未来大规模语言模型的压缩、部署和扩展提供了可行路径,具备广泛的应用前景。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载