计算机行业:大语言模型的前世、今生与未来-20230831-财通证券-20页_2mb
报告摘要
大语言模型的前世、今生与未来总结
核心内容
本报告全面分析了大语言模型(LLM)的技术发展、应用创新及投资机会,总结了其从NLP技术的突破到当前生成式AI浪潮的演变过程。报告强调了大语言模型在技术层面的“涌现”能力,以及其在商业应用中的潜力,同时提出了针对C端和B端的应用方向和投资建议。
主要观点
1. 大语言模型:NLP技术的奇点时刻
- 大语言模型通过预训练+提示的方式,实现了从传统NLP范式的转变,具备解决复杂问题的通用能力。
- 深度学习技术的发展,特别是Transformer模型的出现,推动了NLP从统计模型到深度模型的跃迁。
- “涌现”现象的出现,使得大模型具备更强的推理、数学、代码、多模态等能力,被认为是通向AGI的可行路径。
2. OpenAI与GPT:算法、工程、商业的融合
- GPT系列模型的发展历程展示了从参数量扩大到模型能力的突破。
- GPT-4通过与Azure深度合作,实现了算力效率的优化,并在多模态和可靠性方面取得进步。
- 模型训练分为预训练(“智商”)和指令微调(“情商”)两个阶段,后者通过人类反馈强化学习,提升了模型与用户的交互能力。
3. 大模型应用:数据感知与代理(Agent)能力
- 大模型在垂直领域商业化落地的关键在于如何融合外部数据与模型的通用能力。
- 三种主流方法:方案①(从头训练)、方案②(指令微调)、方案③(上下文学习),各具优劣,适用于不同场景。
- 代理能力的引入,使大模型能够自主理解、规划和执行任务,例如插件(Plugins)和代码解释器(Code Interpreter)。
- 机器人控制与思维链推理结合的RT-2,展示了大模型与物理世界交互的潜力。
4. 应用分析框架:通用能力与外部能力的组合
- 大模型应用边界由通用能力与外部能力的组合决定。
- 通用能力增强方向包括:上下文长度、复杂推理、数学、代码、多模态等。
- 外部能力扩展方向包括:处理非结构化数据、使用复杂工具、与物理世界的交互等。
关键信息
技术演进
- Word2Vec:早期NLP范式,通过神经网络学习语义和语法关系。
- BERT:基于Transformer的双向编码器,开启了预训练+微调的范式。
- GPT:基于Transformer的单向解码器,通过扩大参数和数据规模,实现“涌现”能力。
- GPT-4:多模态与可靠性增强,具备强大的语言理解和执行能力。
应用创新
- 数据感知:通过外挂向量数据库实现外部数据的接入与处理。
- 代理能力:引入插件、代码解释器、机器人控制等,使模型具备与环境互动的能力。
- 上下文长度:拓展上下文长度有助于提升模型的推理能力,是应用创新的关键。
- 模型小型化:通过参数剪枝、量化、低秩分解等方式,降低推理成本。
投资建议
- C端标准化工具类产品:金山办公、万兴科技、同花顺、科大讯飞、福昕软件等。
- B端垂直领域应用:恒生电子、拓尔思、税友股份等具备行业数据与客户资源的企业。
- 算力相关厂商:AI服务器厂商(浪潮信息、中科曙光、优刻得、紫光股份、海光信息)及国产AI芯片厂商(寒武纪、拓维信息、神州数码)。
- 向量数据库与垂直大模型:星环科技等具备相关技术优势的企业。
风险提示
- AI技术迭代不及预期:若技术进展缓慢,可能影响大模型发展和商业化进程。
- 商业化落地不及预期:ChatGPT等模型的盈利模式尚在探索阶段,落地速度存在不确定性。
- 政策支持不及预期:AI技术发展依赖政策推动,若政策滞后可能影响行业成长。
- 全球宏观经济风险:经济波动可能对AI相关企业的业绩产生影响。
结论
大语言模型作为NLP技术的奇点时刻,正推动新一轮生成式AI浪潮,其“涌现”能力为多领域应用提供了可能性。随着技术不断演进,模型小型化和上下文长度的提升将进一步推动其商业化落地。在投资层面,建议关注具备技术优势、行业资源和算力支持的企业,同时警惕技术、商业和政策方面的潜在风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载