20260804-东吴证券-_汽车_黄细里_AI系列深度11期_大模型如何进行模仿与强化学习_4页_884kb
报告摘要
大模型模仿与强化学习分析总结
核心内容
本文围绕大模型在智能体学习中的两种主要路径——模仿学习和强化学习,探讨其在AI发展中的应用与演进,并分析其在智能驾驶和具身智能等物理世界场景中的潜力与挑战。
主要观点
1. 模仿学习与强化学习的协同作用
- 模仿学习:从专家示范中学习状态到动作的映射,适用于训练快、稳定性高的场景,如自动驾驶早期的ALVINN、机器人示教和VLA预训练。
- 强化学习:依赖环境交互和奖励信号优化策略,适用于需要突破示范上限、进行策略优化的场景,如AlphaGo、ChatGPT、机器人VLA等。
- 组合范式:工程实践中常采用“模仿学习 + 强化学习”的组合方式,先通过模仿学习形成初始策略,再通过强化学习进行优化。
2. 强化学习的核心挑战与演进
- 核心难点:功劳分配、探索与利用、奖励稀疏、样本效率低。
- 理论基础:源于行为主义心理学和贝尔曼MDP,由Sutton与Barto体系化。
- 应用场景:强化学习已从补充性优化工具演变为后训练、偏好对齐和可验证推理的重要方法,如RLHF、RLVR等。
3. 模仿学习的局限与改进
- 局限性:面临分布漂移和示范者上限问题,模型在未覆盖状态时容易错误累积。
- 改进方法:逆强化学习、DAgger、GAIL等方法用于缓解分布漂移和示范者上限问题。
4. 大模型在物理世界的应用趋势
- 物理世界约束:试错成本高,示范数据多来自平均人类表现,长尾和危险场景稀缺。
- 发展趋势:采用模仿学习获取初始策略,再通过仿真、世界模型和强化学习补足长尾。
- “蛋糕论”观点:杨立昆认为自监督是理解世界的主体,强化学习样本效率低;但在偏好对齐和策略优化方面,强化学习的重要性正逐步上升。
5. 智能驾驶作为物理AI的代表场景
- 闭环实现:智能驾驶是当前最先实现物理世界闭环的场景。
- 发展方向:应重点关注物理AI的发展路径,其在AI当前阶段具有更大的增量价值。
关键信息
- 模仿学习:通过监督学习方式学习状态到动作的映射,适用于快速、稳定训练。
- 强化学习:依赖奖励反馈优化策略,适用于复杂、动态环境,但存在样本效率低、探索难等问题。
- 组合范式:模仿学习用于构建初始策略,强化学习用于优化和对齐偏好。
- 物理AI前景:智能驾驶作为物理AI的代表,具有更高的研究与应用价值。
- 风险提示:
- 技术迭代不及预期
- 大模型厂商ARR增速放缓
- 云服务商资本开支不及预期
- 智能驾驶及机器人商业化落地不及预期
最新金股组合
| 代码 | 简称 | 行业 | 总市值 (亿元) | 27EPS (元) | 28EPS (元) | 27PE | 28PE |
|---|---|---|---|---|---|---|---|
| 600176.SH | 中国巨石 | 建筑建材 | 2,917 | 1.49 | 1.66 | 49 | 44 |
| 300751.SZ | 迈为股份 | 机械 | 788 | 4.04 | 5.79 | 70 | 49 |
| 002371.SZ | 北方华创 | 机械 | 6,419 | 12.53 | 16.47 | 71 | 54 |
| 300604.SZ | 长川科技 | 机械 | 2,166 | 4.80 | 6.55 | 71 | 52 |
| 688630.SH | 芯碁微装 | 电子 | 782 | 7.32 | 9.75 | 75 | 56 |
| 688141.SH | 杰华特 | 电子 | 691 | 1.38 | 4.75 | 111 | 32 |
| 1801.HK | 信达生物 | 医药 | 1,384 | 2.04 | 2.79 | 34 | 25 |
| 688235.SH | 百济神州 | 医药 | 2,413 | 6.28 | 7.38 | 41 | 35 |
| 002428.SZ | 云南锗业 | 计算机 | 785 | 1.71 | 2.57 | 70 | 47 |
| MU.O | 美光科技 | 传媒互联网&海外 | 13,036 | 151.43 | 165.15 | 8 | 7 |
注:所对应市值、PE截至2026/6/30,港股市值对应港币,美光科技数据对应美元,其余为人民币,HKDCNY汇率为0.87,盈利预测来自东吴证券研究所。
法律声明
- 本公众号为东吴证券研究所依法设立、独立运营的官方订阅号。
- 所有内容均来自东吴证券研究所已正式发布的研究报告。
- 本内容不构成投资建议,东吴证券对使用本内容所导致的损失不承担责任。
- 未经授权,禁止复制、转载或引用本内容。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载