DeepSeek图解10页PDF_11页_2mb
报告摘要
DeepSeek本地部署与技术解析总结
1 本地部署DeepSeek原因
- 保护隐私与数据安全:数据不上传云端,避免第三方访问。
- 可定制化与优化:支持微调、适配特定任务(如行业术语、知识库)。
- 离线运行:适用于无网络环境,提高系统稳定性。
2 本地部署步骤
- 安装 Ollama 软件:
- 下载安装,自动管理大模型。
- 下载模型:
- 命令:
ollamapull deepseek-r1:1.5b
- 命令:
- 运行对话:
- 命令:
ollama run deepseek-r1:1.5b
- 命令:
3 DeepSeek零基础必知
- LLM基础:
- 参数意义:
7b代表70亿参数。 - 通用性优势:基于多领域数据训练,具备强迁移能力。
- 参数意义:
- Training方法:
- 预训练:大规模无监督学习。
- 监督微调(SFT):优化特定任务。
- 强化学习(RL):使用人类反馈提升输出质量。
4 DeepSeek-R1训练核心创新(2.0 及以上版本侧重)
- 推理导向训练(R1-Zero):
- 直接通过强化学习生成高质量的CoT推理数据,减少人工标注,推理能力接近甚至超越OpenAI O1。
- 通用强化学习:
- 基于SFT,进一步优化模型在多任务上的表现(如帮助性、安全性),增强非推理场景能力。
- 结构:
graph LR A[DeepSeek-v3-Base] --> B[推理导向强化学习 (R1-Zero)] B --> C[生成CoT数据] C --> D[监督微调(SFT)] D --> E[强化学习(RL)] E --> F[DeepSeek-R1]
5 强化学习与监督微调对比
| 方法 | 过程 | 优势 | 劣势 |
|---|---|---|---|
| 监督微调(SFT) | 人工标注数据+模型优化 | 任务表现提升快;操作简便 | 需手动标注,成本高 |
| 强化学习(RL) | 模型自我反馈+人类评分训练 | 减少人工依赖,生成链式推理 | 训练复杂,模型输出有时偏题 |
6 应用建议
- 适合场景:企业内部部署(知识库调优、私有数据处理)。
- 推荐配置:普通电脑(Intel i5、16GB内存可运行基础模型)。
如需部署DeepSeek,请回复ollama获取下载地址。其他技术细节可查看相关文献:https://newsletter.languagemodels.co/p/the-illustrated-deepseek-r1
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载