【浙江大学】2025年DeepSeek技术溯源及前沿探索报告_50页_3mb
报告摘要
浙江大学DS系列专题总结
核心内容概述
浙江大学计算机科学与技术学院人工智能省部共建协同创新中心的朱强主讲了关于“DeepSeek技术溯源及前沿探索”的专题内容,涵盖了语言模型、Transformer架构、ChatGPT、DeepSeek以及新一代智能体的发展历程和技术细节。该总结将从技术演进、模型特性、工程创新及应用影响等方面进行分析。
主要观点
1. 语言模型的发展
- 语言模型的核心任务是计算词序列的概率,通过不断优化模型结构与训练方法,语言模型的能力逐步提升。
- N-gram模型(1970年后)是早期语言模型,基于统计方法,但存在局限。
- LSTM/GRU模型(2000年后)引入神经网络,提升了语言建模的准确性。
- Transformer模型(2017年后)通过自注意力机制、多头注意力等创新,成为当前主流架构,显著提升了模型的并行计算和全局理解能力。
2. 大型语言模型(LLM)的演进
- 大型语言模型的演进经历了从BERT、GPT-1/2/3到ChatGPT、GPT-4o等阶段。
- GPT-3是语言模型的转折点,参数量达到1750亿,展现出强大的“涌现”能力,如语言生成、世界知识和上下文学习。
- ChatGPT基于GPT-3.5,引入强化学习和人类反馈机制,提升推理与逻辑能力,被称作“人工智能的iPhone时刻”。
- GPT-4o具备多模态输入输出能力,推理能力进一步增强,甚至可以处理数学和编程任务。
3. DeepSeek的技术创新
- DeepSeek是浙江大学在大语言模型领域的重要成果,强调系统级协同工程创新,而非颠覆性理论创新。
- DeepSeek-V3对标GPT-4o,具有6710亿参数,但通过多头潜在注意力机制(MLA)和FP8混合精度,显著降低显存占用,提升训练效率。
- DeepSeek-R1通过强化学习(GRPO)和规则奖励机制,增强推理能力,使其具备“系统2”式的分析与逻辑处理能力。
- DeepSeek-R1-Distill通过知识蒸馏技术,将大模型的知识压缩到小模型中,实现模型瘦身,使得低参数模型也能具备高性能。
4. 模型与应用的分类
- 通用LLM如ChatGPT、LLaMA、Vicuna等,适用于广泛领域。
- 垂类LLM如Code Llama、MathGLM、LawBench等,专注于特定任务(如编程、数学、法律等)。
- 基于LLM的Agent如HuggingGPT、AutoGPT、JARVIS等,利用LLM进行任务规划、工具使用和记忆管理,实现自主化服务。
5. 大模型的生态与工具
- 大模型开发工具如LangChain、LlamaIndex等,为模型的应用和开发提供了支持。
- 垂类应用如LLM VSCode、DB GPT-Hub等,将LLM集成到具体行业场景中。
- Agent开发平台如GPTs、Coze、Agent Builder等,推动智能体的构建与部署。
关键信息
1. 数据、模型与算力的关系
- 数据是燃料,DeepSeek训练中使用了45TB数据和近1万亿个单词。
- 模型是引擎,参数量从亿级到万亿级,逐步提升模型的复杂性和能力。
- 算力是加速器,ChatGPT的训练门槛为1万张英伟达V100芯片,成本高昂。
2. 模型的性能指标
- DeepSeek-V3参数量达6710亿,但显存占用仅为其他模型的5%-13%,极大提升了模型的部署与运行效率。
- DeepSeek-R1通过强化学习和规则奖励机制,显著增强推理能力,甚至具备“越狱”抵抗力。
- GPT-4o具备全模态能力,包括文本、图像、音频等,并提升了数学推理和编程能力。
3. 模型与应用场景
- 垂直应用:DeepSeek在教育、医疗、法律、制造等领域有广泛应用。
- 通用应用:如智能客服、OA类系统、数据经营分析等。
- 智能体系统:基于LLM的Agent系统具备任务规划、工具调用和记忆管理能力,实现自主化服务。
4. 技术趋势
- 大模型时代遵循“摩尔定律”,参数量、数据量和算力持续增长。
- 开源与闭源并存,如Meta的LLaMA系列为学术界提供了普惠性模型,而像GPT系列则保持闭源。
- 系统1与系统2:语言模型从“系统1”(快速、直觉)发展为“系统2”(缓慢、分析),实现从生成到推理的转变。
DeepSeek技术全景
- DeepSeek-V3:采用混合专家模型(MoE)架构,仅激活部分专家模型,减少计算资源消耗。
- 动态路由机制:提升模型在推理任务中的效率和准确性。
- 强化学习(GRPO):通过奖励模型和规则引导,增强模型的推理与逻辑能力。
- 知识蒸馏:将大模型的知识迁移到小模型中,实现模型轻量化与高性能的结合。
总结
浙江大学的DeepSeek系列模型在大语言模型领域展现了强大的工程优化能力,不仅提升了推理性能,还降低了资源消耗,为受限环境下的AI应用提供了新思路。其技术演进路径从基础语言模型到多模态、全栈推理模型,反映了AI技术从生成到推理的转变趋势。同时,DeepSeek的开源策略也为学术界和工业界提供了更多可能性,推动了大模型生态的发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载