DeepSeek_R1深度解析及算力影响几何-_36页_16mb
报告摘要
证券研究报告·行业动态研究总结
核心内容
DeepSeek发布了一款具备深度推理能力的大模型R1,其在多个推理任务上表现优异,包括数学、代码和自然语言推理。该模型通过结合微调和强化学习策略,实现了与OpenAI-o1-1217相当甚至超越的性能。同时,该报告还分析了国内模型在深度推理领域的进展,包括Kimi 1.5和Qwen2.5系列模型的发布,以及它们在推理性能、算力优化和多模态能力方面的创新。
主要观点
-
深度推理模型的发展:
- DeepSeek-R1在AIME 2024、MATH-500和Codeforces等任务中表现优异,特别是在数学推理和代码生成方面。
- Kimi 1.5实现了短链推理(Short-CoT)和长链推理(Long-CoT)的突破,其在数学、代码和多模态任务上均表现出SOTA级别的性能。
-
算力优化策略:
- DeepSeek-R1通过算法、框架和硬件的协同优化,降低了训练和推理的算力需求。
- 采用GRPO策略替代PPO,取消价值网络,减少计算资源消耗。
- 引入FP8混合精度训练,提升训练效率并保持数值稳定性。
- 优化流水线并行策略和跨节点通信,提高资源利用率。
- 多token预测技术提高了模型的推理效率。
-
国产模型的创新:
- 国产模型在深度推理方面展现出强劲的竞争力,如DeepSeek-R1和Kimi 1.5。
- Qwen2.5系列模型在多个任务中表现出顶尖的性能,且在算力效率方面有显著提升。
关键信息
DeepSeek R1
- 训练过程:基于DeepSeek-V3-Base模型,经过两次微调和两次强化学习训练。
- 强化学习阶段:
- 冷启动阶段:使用长CoT人工标注样本进行微调。
- 面向推理的强化学习:引入语言一致性奖励,解决语言混杂问题。
- 拒绝采样与监督微调:生成新的SFT数据以优化模型。
- 面向全场景的强化学习:覆盖所有类型任务,使用不同的奖励信号和提示分布。
- 性能表现:
- AIME 2024(Pass@1):79.8%
- MATH-500(Pass@1):97.3%
- Codeforces(Rating):2029
- AlpacaEval 2.0(LC-winrate):87.6%
- Arena-Hard(GPT-4-1106评分):92.3%
Kimi 1.5
- 创新点:
- 长上下文扩展:支持128k上下文窗口,提升推理能力。
- 策略优化:采用在线镜像下降法、有效采样策略、长度惩罚等方法。
- 简化RL框架:构建更高效的推理模型。
- 多模态处理能力:同时处理文本和视觉数据。
- 强化学习框架:
- Partial Rollout:允许从缓冲区继续推理,提高效率。
- Long2Short RL:将长链推理模型的思维先验转移到短链模型,优化算力。
- 性能表现:
- 在Short-CoT模式下,数学、代码和视觉推理性能超越GPT-4o和Claude 3.5,领先幅度达550%。
- 在Long-CoT模式下,数学、代码和多模态推理性能达到OpenAI o1正式版水平。
Qwen2.5系列模型
- 模型发布:包括0.5B、1.5B、3B、7B、14B、32B、72B,以及专用模型Qwen2.5-Coder和Qwen2.5-Math。
- 性能表现:
- 在MMLU、MMLU-Pro、LiveCodeBench等任务中,性能领先。
- Qwen2.5-Max在多个基准测试中全面超越DeepSeek V3。
- 技术优化:
- 预训练阶段使用更高质量数据集和专门的上下文训练方式,扩展到18万亿个token。
- 采用YARN和DCA技术,提升序列处理能力。
- 两阶段强化学习:离线RL和在线RL,提升模型的推理和生成能力。
OpenAI o1模型
- 推理机制:采用PRM(Policy-Route Monte Carlo)和蒙特卡洛搜索策略,实现深度推理。
- 性能表现:在多个推理任务中表现优异,但其算力需求较高。
风险提示
- 大模型技术发展不及预期
- 商业化落地不及预期
- 政策监管力度不及预期
- 数据数量与数据质量不及预期
算力趋势分析
- 当前阶段:大模型行业正从生成式模型向深度推理模型过渡,算力需求从预训练阶段转向后训练和推理侧。
- 长期趋势:尽管DeepSeek R1等模型通过优化降低了算力需求,但深度推理阶段的算力需求仍呈爆发式上涨,算力仍是AI模型性能进步的关键因素。
问答案例分析
-
开关控制灯泡问题:
- DeepSeek R1:最终存活的是第2、3、4号囚犯,1号和5号被处死。
- Kimi 1.5:分析结果存在不确定性,但倾向于多人存活。
- Qwen2.5:倾向于所有囚犯都存活。
-
囚犯抓豆子博弈:
- DeepSeek R1:2号、3号存活,1号和5号被处死。
- Kimi 1.5:存活人数不确定,但倾向于多人存活。
- Qwen2.5:倾向于所有囚犯都存活。
-
逻辑谜题:
- DeepSeek R1:分析显示日期为7月16、8月15或8月17。
- Kimi 1.5:日期为7月16、8月15或8月17。
- Qwen2.5:分析过程类似,但最终结论仍存在不确定性。
总结
- DeepSeek R1和Kimi 1.5等模型在深度推理领域表现出色,展示了国产模型的竞争力。
- 算力优化策略在模型性能提升和成本控制方面起到了关键作用。
- 国内模型在技术上不断创新,如强化学习框架、多模态处理、多token预测等。
- 尽管当前模型在算力方面有所优化,但深度推理阶段的算力需求仍会持续增长,推动算力行业的长期发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载