DeepSeek_R1-论文-通过强化学习的推理能力_44页_11mb
报告摘要
DeepSeek-R1:通过强化学习激励LLMs的推理能力
核心贡献
-
首推纯强化学习RL的推理模型
DeepSeek-R1-Zero通过纯强化学习(RL)训练,无需监督微调(SFT),实现了创新性思维链推理和自进化能力,展示了LLMs推理能力的内生发展可能。 -
引入冷启动与蒸馏降低能耗
DeepSeek-R1在RL初始结合冷启动数据与分阶段训练,显著优化了推理过程中的输出可读性,同时实现模型蒸馏将推理模式高效提炼至7B等小型模型。 -
蒸馏结果显著超越同规模SFT模型
高效蒸馏模型如DeepSeek-R1-7B在数学基准测试中优势显著,尤其在AIME2024和MATH-500上超越主流开源模型,显示该方法经济可靠。
方法架构解析
2.1 DeepSeek-R1-Zero
- RL框架: 采用GRPO算法,通过群体得分估计奖励已替代传统评论家模型,提升训练效率。
- 奖励机制: 分为准确性与格式(CoT布局)两部分奖励,拒绝复杂神经奖励模型以防范奖励黑客。
- 训练模板: 强制结构化输出(推理+摘要),避免特殊策略偏见。
2.2 DeepSeek-R1(冷启动版)
- 三阶段训练:
- 冷启动数据生成:收集长CoT增强可读性(带摘要格式输出)。
- 推理导向RL强化:加码语言一致性奖励,提升模型表达纯净度。
- 强化监督微调(SFT)整合:统一训练数据覆盖推理与通用任务。
2.3 蒸馏与推理模式迁移
- 蒸馏蒸馏简化版RL流程: 直接在开源基模上训练SFT,证明大型模型推理模式可经济有效地迁移至烈模型。
实测效果突出
DeepSeek-R1,在多个国际基准测试中超越或匹敌OpenAI-o1-1217等头部模型:
- 数学推理: AIME2024中多数投票共识得分867%,数学-500题达973%,堪称当前最强数学LLM之一。
- 编程能力: LiveCodeBench和Codeforces基准测试中表现出专业级解答能力,兼顾创意与算法。
- 通用推理: 在编码、逻辑、科学等多任务中均取得90-96%的pass@1准确率。
讨论与展望
- 明确指出纯RL方法虽然潜力巨大,但依赖准确标注困难,加入冷启动数据则可提升训练稳定性和实用性。
- 强调蒸馏策略在小型模型应用上的成功,但同时承认大规模RL训练仍需巨大计算资源。
- 继续聚焦大型语言模型安全、多语言、少样本任务响应质量,并计划深化模型在软件工程任务的逻辑能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载