计算机行业:大模型深度复盘,科技变革加速-20230522-华泰证券-39页_5mb
报告摘要
大模型深度复盘,科技变革加速
核心内容
大语言模型(LLM)作为人工智能的重要分支,正在引领通用人工智能(AGI)的新纪元。自2017年Transformer架构提出以来,LLM在多个领域展现出了强大的潜力,特别是在自然语言处理(NLP)任务上。GPT系列模型作为LLM的代表,从GPT-1到GPT-4,经历了从无监督预训练到多模态输入的演进,其技术路径和能力不断突破。
主要观点
- Transformer架构:2017年提出的Transformer架构成为LLM发展的基础,其自注意力机制显著提升了模型的训练效率和对长距离依赖关系的捕捉能力。
- GPT系列发展:GPT-1确立了预训练+微调的基本路线;GPT-2通过多任务学习和大容量模型,提升了模型的泛化能力;GPT-3通过增加参数量和使用few-shot学习,进一步提升了模型的性能;GPT-4则支持多模态输入,展现出了在专业和学术基准上的卓越表现。
- 模型演进路线:解码器架构在LLM中占据主导地位,而编码器和编解码器架构则相对落寞。GPT系列模型持续发展,逐步实现了从“专才”到“通才”的转变。
- 技术趋势:大模型的发展呈现出三大趋势:垂直落地、工程实现、模态丰富。这些趋势推动了模型在不同行业和应用场景中的落地。
- 国内大模型成长:国内企业在大模型领域加速布局,如百度文心、商汤日日新、科大讯飞星火、智源悟道等,逐步构建起大模型生态系统。
关键信息
GPT系列模型发展
| 模型 | 发布时间 | 特点 |
|---|---|---|
| GPT-1 | 2018年 | 无监督训练+有监督微调,初步验证预训练+微调模式 |
| GPT-2 | 2019年 | 多任务学习+大模型容量,取消微调层,提升泛化能力 |
| GPT-3 | 2020年 | 参数量达1750亿,few-shot学习,提升任务解决能力 |
| GPT-4 | 2023年 | 多模态输入,支持图像与文本交互,强化模型安全性 |
大模型训练方式演进
- 模型微调:早期的GPT模型依赖大量微调数据集,提升特定任务表现。
- 提示学习:GPT-3引入few-shot学习,减少对微调的依赖。
- 指示学习:InstructGPT和ChatGPT引入人类反馈强化学习(RLHF),实现模型与人类需求的对齐。
大模型应用场景
- 垂直落地:如BloombergGPT,专注于金融领域。
- 工程实现:如AutoGPT,展示大模型在人机交互中的潜力。
- 模态丰富:如SAM模型,拓展大模型在计算机视觉(CV)领域的应用。
国内大模型代表
- 百度:文心一言基于ERNIE系列模型,逐步转向解码器路线。
- 商汤科技:日日新大模型加速迈向AGI时代。
- 科大讯飞:星火大模型在AGI核心能力上表现突出。
- 智源研究院:基于GLM模型,构建大模型生态体系。
海外大模型代表
- BloombergGPT:作为金融垂直领域的代表性模型,提供行业定制化解决方案。
- AutoGPT:展现大模型在工程实现和人机交互方面的潜力。
- SAM模型:实现大模型在CV领域的拓展。
产业链相关公司
- 算力:寒武纪、景嘉微、海光信息、浪潮信息、中科曙光、工业富联等。
- 模型:百度、三六零、科大讯飞、昆仑万维、商汤科技等。
- 应用:
- 2C简单:金山办公、科大讯飞、同花顺、万兴科技、东方财富、汉仪股份、汉王科技、萤石网络等。
- 2B简单:泛微网络、致远互联、上海钢联、彩讯股份等。
- 2C复杂:中望软件、索辰科技、广联达等。
- 2B复杂:恒生电子、石基信息、科大讯飞、汉王科技、金桥信息等。
风险提示
- 宏观经济波动:可能影响大模型技术发展和应用。
- 技术迭代不及预期:大模型技术发展迅速,若迭代速度放缓可能影响竞争力。
- 本报告内容:基于客观资料整理,不构成投资建议。
正文目录摘要
- 大模型时代已来,AGI新纪元开启
- 溯源:从经典神经网络到Transformer架构
- 发展:从GPT-1到GPT-4,开启大模型新纪元
- 延伸:国内大模型快速成长,海外大模型多维拓展
- 产业链相关公司梳理
- 风险提示
技术原理与模型结构
- 深度学习:基于神经网络,通过多层特征抽象和预测实现复杂任务。
- CNN:通过卷积层、汇聚层、全连接层实现图像特征提取。
- RNN:具有短期记忆能力,适合序列数据处理。
- LSTM:引入门控机制,解决RNN的长程依赖问题。
- Transformer:基于自注意力机制,提升模型并行处理能力和长距离依赖捕捉能力。
模型训练与优化
- 无监督训练:基于大数据集,如BooksCorpus和CommonCrawl。
- 有监督微调:通过任务特定数据集优化模型性能。
- RLHF:引入人类反馈强化学习,提升模型的“3H”特性(Helpful, Honest, Harmless)。
- few-shot学习:减少微调需求,提升模型泛化能力。
总结
大模型技术正在迅速发展,从Transformer架构的提出到GPT系列模型的演进,展示了从单一任务到多任务、从纯文本到多模态的跨越。国内企业如百度、商汤、科大讯飞、智源研究院等也在大模型领域取得显著进展。海外模型如BloombergGPT、AutoGPT、SAM等则在垂直落地、工程实现和模态丰富方面展现出多样化的发展趋势。随着大模型技术的成熟,其在算力、模型和应用三个环节的产业链正在不断完善,成为推动人工智能技术变革的重要力量。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载