科技:Llama2:升级迭代效果显著,有望加速应用端落地_16页_1mb
报告摘要
Llama 2 详细总结
核心内容
Llama 2 是 Meta 在 2023 年 7 月 19 日发布的开源预训练大模型,是 Llama 1 的升级版本。该模型在多个方面实现了显著提升,包括参数规模、上下文长度、训练数据量和模型性能,特别是在对话和应用落地方面表现突出。
主要观点
- Llama 2 提供了 7B、13B、34B 和 70B 四种参数规模版本,其中 70B 版本在多个任务中表现优异,接近 GPT-3.5 和 PaLM-540B 的水平。
- Llama 2-Chat 是基于 Llama 2 的对话模型,通过监督微调(SFT)和基于人类反馈的强化学习(RLHF)进行优化,提升了模型的有用性和安全性。
- 在多项基准测试中,Llama 2 70B 表现优于所有开源模型,部分任务上甚至接近闭源模型 GPT-4 的表现。
关键信息
模型结构对比
| 模型名称 | 参数规模 | 内容长度 | GQA | 训练 Tokens | Learning Rate |
|---|---|---|---|---|---|
| Llama1 | 7B | 2k | x | 1万亿 | 3.0 E-4 |
| Llama1 | 13B | 2k | x | 1万亿 | 3.0 E-4 |
| Llama1 | 33B | 2k | x | 1.4万亿 | 1.5E-4 |
| Llama1 | 65B | 2k | x | 1.4万亿 | 1.5E-4 |
| Llama2 | 7B | 4k | x | 2万亿 | 3.0E-4 |
| Llama2 | 13B | 4k | x | 2万亿 | 3.0E-4 |
| Llama2 | 34B | 4k | √ | 2万亿 | 1.5E-4 |
| Llama2 | 70B | 4k | √ | 2万亿 | 1.5E-4 |
预训练数据与算力消耗
- 预训练数据总量为 2 万亿 tokens,其中英语占 90%,代码占 8.4%,其他语言占约 1.6%。
- 训练耗时约 330 万 GPU 小时,Llama 2 的训练数据量是 Llama 1 的两倍。
人工评估结果
- Helpfulness:Llama 2-Chat 70B 与 GPT-3.5 相媲美,胜率 36%,平局率 31.5%。
- Safety:Llama 2-Chat 在安全性方面优于所有开源模型,甚至优于 GPT-3.5。
模型评估指标
| 模型 | 任务 | 评估指标 |
|---|---|---|
| Llama 2-Chat | Helpfulness | 60%+ 胜率优于 MPT-7B-chat |
| Llama 2-Chat | Safety | 优于所有开源模型 |
| Llama 2 | 编程能力 | HumanEval 和 MBPP 优于 Llama 1、MPT 和 Falcon |
| Llama 2 | 常识推理 | HellaSwag、WinoGrande、Commonsense QA 等任务上优于 Llama 1、MPT 和 Falcon |
| Llama 2 | 算术推理 | GSM8K 和 MATH 表现突出 |
| Llama 2 | 世界知识 | NaturalQuestion 和 TriviaQA 优于其他开源模型 |
| Llama 2 | 综合表现 | MMLU 和 AGIEval 表现优异,优于 Llama 1 |
与闭源模型对比
| 任务 | Llama 2 70B | GPT-3.5 | GPT-4 | PaLM | PaLM-2-L |
|---|---|---|---|---|---|
| MMLU (5-shot) | 68.9 | 70 | 86.4 | 69.3 | 78.3 |
| TriviaQA (1-shot) | 85 | - | - | 81.4 | 86.1 |
| Natural Questions (1-shot) | 33 | - | - | 29.3 | 37.5 |
| GSM8K (8-shot) | 56.8 | 57.1 | 92 | 56.5 | 80.7 |
| HumanEval (0-shot) | 29.9 | 48.1 | 67 | 26.2 | - |
| BBH (3-shot) | 51.2 | - | - | 52.3 | 65.7 |
应用与投资建议
应用端厂商
- 建议关注具备模型精调能力的厂商,如科大讯飞、三六零、格灵深瞳、云天励飞、云从科技等。
- 应用场景应优先考虑与 AIGC 技术相关度高、内容丰富、工具生产力强的领域,如办公软件、设计工具等,建议关注金山办公、广联达、万兴科技、中望软件、彩讯股份等。
基础算力层厂商
- 建议关注服务器和算力相关企业,如浪潮信息、中科曙光、工业富联、宝信软件等。
安全厂商
- 随着各国对生成式 AI 的监管加强,建议关注 AI 安全相关厂商,如深信服、安恒信息、启明星辰、三未信安、天融信、安博通、迪普科技、奇安信、亚信安全、中孚信息、绿盟科技、山石网科、永信至诚等。
风险提示
- 技术落地不及预期
- 行业竞争加剧
- 数据质量与模型性能之间的关系仍是关键
- 模型安全性和合规性将成为关注重点
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载