人工智能行业专题:AIGC投资框架-西南证券-2023.5.21-66页_3mb
报告摘要
人工智能专题研究总结
核心内容
本研究围绕大语言模型(LLM)和生成式AI(AIGC)展开,重点分析了ChatGPT及其后续版本GPT-4的技术发展、应用场景、行业影响及国内大模型的现状与挑战。
主要观点
- 自然语言模型是大语言模型的核心:自然语言模型的发展经历了从基于规则、基于统计到基于神经网络的阶段,Transformer架构的出现为大语言模型的诞生奠定了基础。
- ChatGPT开启了AI到AGI的转变:ChatGPT结合自回归语言模型与zero shot prompting,实现了AI范式的突破,改变了人机交互方式。
- GPT系列模型持续突破:从GPT-1到GPT-4,模型在推理能力、多模态理解、数据处理等方面不断提升,GPT-4具备图像理解能力,同时在多个任务中表现优于GPT-3.5。
- 多行业应用广泛:ChatGPT以其强大的生成能力,被应用于游戏、视频、生物医药等多个领域,提升了效率并推动了技术变革。
- 国内大模型发展迅速:如阿里通义M6、腾讯混元、百度文心一言等,具备千亿参数规模,且在中文语言处理方面表现出色。
- 国内大模型面临挑战:包括算力不足、数据质量不一、算法人才短缺和飞轮效应的缺失。
关键信息
1. 大语言模型简介
- 大语言模型(LLM)是基于深度学习的模型,能够处理和生成自然语言。
- 自然语言模型的发展经历了三个阶段:基于规则、基于统计、基于神经网络。
- Transformer架构的出现极大提升了模型的性能,成为LLM的主流技术。
2. 大语言模型的分类
- Encoder-only模型(如BERT):适用于语义理解任务。
- Decoder-only模型(如GPT):适用于文本生成任务。
- Encoder-decoder模型(如T5):适用于生成式任务,如总结、翻译等。
3. 大语言模型的学习、存储与修正
- 学习方式:模型从海量文本中学习语言和世界知识,其中世界知识主要储存在中高层。
- 存储方式:知识存储在Transformer参数中,FFN结构是主要的存储器。
- 修正方式:主要有三种,其中直接修改FFN节点是最具潜力的方法。
4. 未来大模型发展的前提要素
- 网络架构:CNN、LSTM、Transformer是三种主要架构,其中Transformer表现最优。
- 模型容量参数:是模型性能的关键因素,参数量越大,模型能力越强。
- 训练时间:训练时间越长,模型遇到的令牌越多,性能越好。
- 数据质量:高质量数据对模型表现至关重要,尤其是在后期阶段。
5. 大语言模型规模扩张的影响
- 第一类任务:表现随模型规模提升而提高,如知识密集型任务。
- 第二类任务:存在涌现能力,模型参数达到一定规模后表现显著提升。
- 第三类任务:表现呈U形,初期下降,后期提升。
6. ChatGPT简介
- ChatGPT是OpenAI于2022年底发布的大型对话式NLP模型,拥有文本生成、聊天、翻译等七大功能。
- ChatGPT具备自我修正、质疑用户假设和拒绝不当请求的能力。
- ChatGPT是AIGC的重要分支,专注于文本生成。
7. ChatGPT的演进
- GPT-1:2018年发布,提升语言理解能力。
- GPT-2:2019年发布,可生成与人类语言相似的文本。
- GPT-3:2020年发布,使用few shot prompting,提升准确率。
- GPT-3.5:2022年发布,引入RLHF,提升推理能力。
- GPT-4:2023年发布,支持图像输入,具备更强的推理和多语言能力。
8. ChatGPT与ChatBOT的对比
- ChatGPT基于大规模语言模型,具备更好的相关性和自然度。
- ChatBOT依赖检索,相关性和自然度较差。
9. ChatGPT的伦理学讨论
- ChatGPT具备语言理解能力,但缺乏人类的创造力和思维力。
- 对于是否算作新的生命形式,存在不同观点。
10. ChatGPT的三大护城河
- 数据标注:成本低,效率高。
- 算力支撑:OpenAI依托微软强大的算力支持。
- 先发优势:通过用户反馈不断优化模型。
11. ChatGPT的飞轮效应
- B端:积累垂类数据,形成小飞轮效应。
- C端:上亿用户使用,形成大飞轮效应,促进模型迭代和用户增长。
12. ChatGPT的范式突破
- 从“鹦鹉学舌”到“乌鸦理解”,强调理解和推理能力。
- 提升了模型的推理和生成能力,具备更强的复杂任务处理能力。
13. GPT-4技术升级
- 图像理解能力:支持图像输入,能进行分类、分析和理解。
- 多语种能力:尤其在小语种方面表现优异。
- 改善了幻觉和安全问题:准确率提升40%,回应不允许内容的可能性下降82%。
- 更长的上下文处理:支持32K上下文长度,处理复杂任务更高效。
14. GPT-4的发展趋势
- 闭源趋势:模型逐渐封闭,成为技术门槛。
- SelfInstruct模式:使用中小模型+大模型生成指令数据,降低成本。
15. 国内大模型发展现状
- 国内大模型如阿里通义M6、腾讯混元、百度文心一言等,具备千亿参数。
- 国内大模型在中文处理上表现优异,但尚未有直接对标ChatGPT的产品。
16. 国内大模型发展难点
- 高效率的算法框架:需解决GPU调度和反向传播问题。
- 追赶GPT-3:需提升代码生成能力,使用更大模型。
- 缩小飞轮效应影响:需寻找替代的prompt来源。
- 越过精调的坑:需采用SFT+RLHF精调方式。
17. 国内大模型产品架构
- 模型层:负责基础模型开发,如垂类大模型。
- 中间层:处理模型输出,进行配置和微调。
- 应用层:直接面向用户,提供如聊天机器人、智能客服等应用。
18. GPT对国内企业的冲击
- 对模型层企业冲击最大,因其能力超越垂类服务。
- 对中间层和应用层企业影响较小,反而有助于降低成本和提升效率。
19. 国内主要大模型
| 模型名称 | 具体企业 | 大模型 | 参数 | 数据量 | 算力 |
|---|---|---|---|---|---|
| 多模态预训练模型 | 清华大学等(学术类) | “八卦炉”(脑级AI模型) | 174万亿 | 中文多模态数据集M6-Corpus | “海洋之光”超级计算机 |
| 通义M6大模型 | 阿里(科技大厂) | 多模态 | 10万亿 | 1.9TB图像、292GB文本 | 512块GPU |
| 混元 | 腾讯(科技大厂) | 多模态 | 万亿级 | 五大跨模态视频检索数据集 | 腾讯太极机器学习平台 |
| 盘古系列大模型 | 华为(科技大厂) | 多模态 | 千亿级 | 40TB训练数据 | 鹏城云脑II、全场景AI计算框架MindSpore、2048块GPU |
| 孟子 | 澜舟(垂类公司) | 多模态 | 10亿 | 数百G级别多领域高质量语料 | - |
风险提示
- AI技术更新迭代缓慢。
- 专业领域落地效果不及预期。
- 版权纠纷。
- 伦理问题。
- 算力建设缓慢。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载