深度报告-20260807-东吴证券-汽车行业深度报告_AI系列深度25期_从模仿学习到强化学习的范式跃迁_13页_841kb
报告摘要
汽车行业深度报告总结
核心内容概述
本报告聚焦于人工智能在自动驾驶领域的发展路径,重点分析了从模仿学习到强化学习的范式跃迁趋势,以及世界模型与强化学习在物理闭环任务中的协同作用。报告指出,随着自动驾驶技术向L4级别演进,强化学习正从辅助工具转变为关键环节,成为突破模仿学习局限、提升系统安全与性能的核心手段。
主要观点
1. 模仿学习与强化学习的角色分化
- 数字 AI(如大语言模型)以互联网级语料为基础,模仿学习能覆盖多领域知识,形成高能力底座,强化学习则用于偏好对齐与推理增强。
- 物理 AI(如自动驾驶)以人类驾驶轨迹为模仿对象,能力上限受限于数据质量和覆盖范围,难以自发超越人类安全水平。因此,强化学习成为突破模仿上限、筛选安全行为的关键。
2. 强化学习在物理闭环任务中的关键地位
- 强化学习在自动驾驶中不仅用于事后增强,更成为突破能力上限的核心环节。
- 它通过设置奖励机制,引导模型学习安全、高效、舒适的行为,避免不良驾驶行为。
3. 世界模型与强化学习的双向共生
- 世界模型提供高保真闭环试错环境,支持强化学习的训练、验证与优化。
- 真实数据反向校准世界模型,形成“强化学习 → 世界模型 → 真实数据”的闭环循环。
- 当前主流工程方向为生成式与重建式世界模型的结合,以兼顾泛化能力与物理约束。
关键信息
模仿学习的局限性
- 协变量漂移:模仿学习在训练分布外表现不稳定,误差会随时间累积。
- 长尾场景缺失:危险、异常场景难以通过真实道路采集,限制模型泛化能力。
- 人类驾驶不完美:复杂低频场景样本稀缺,模仿学习难以覆盖。
强化学习的突破作用
- 强化学习用于提升驾驶行为的安全性与可靠性,尤其在L4级别自动驾驶中,需远超人类表现。
- 强化学习在自动驾驶中的作用包括:行为筛选、策略优化、闭环训练。
世界模型的作用
- 世界模型是强化学习训练的基础,提供可控、可重置、可注入危险事件的仿真环境。
- 世界模型分为重建式(基于真实数据)和生成式(泛化能力强),两者结合是当前主流趋势。
产业实践分析
技术路线分化
| 厂商 | 技术路线 | 强化学习角色 | 世界模型/仿真环境 | 落地状态 |
|---|---|---|---|---|
| 特斯拉 | 端到端神经网络 + FSD V12→V14 | V14 引入更激进 RL,优化安全关键结果 | 学习型世界模拟器,可合成多路画面、注入对抗事件 | FSD V14 已推送,Robotaxi 试点 |
| 小鹏 | 云端训练大模型 → 蒸馏部署至车端 | 云端后训练含 RL,再蒸馏上车 | 重建+生成世界模型,用于大规模闭环 RL | XVLA 量产路线 |
| 理想 | MindVLA/MindVLA-o1 | 重建+生成统一世界模型,MindSim | 重建+生成世界模型,用于大规模 RL训练 | MindVLA 规划量产 |
| Momenta | 一段式端到端 → R6 飞轮 → R7 世界模型 | R6 量产端到端 + RL,R7 世界模型中做 RL | R7 三层世界模型 | R6 首搭别克至境 L7 |
| 地平线 | HSD 一段式端到端 + 强化学习 | 交互式博弈强化学习,仿真平台训练 | 端到端世界模型 + 交互博弈 | HSD 首搭星途星纪元 E05 |
| 千里科技 | 千里智驾 RLM + 千里浩瀚 G-ASD | 预训练+特训+RL三段 | 仿真世界模型;G-ASD 世界行为模型 | 千里浩瀚多车型 |
| 华为乾崑 | WEWA 架构(世界引擎+世界行为模型) | 以仿真环境中 RL 探索为核心 | 云端世界引擎生成高密度难例 | ADS4 已推送 |
| 卓驭 | 端到端 + 强化学习 | 把系统从 80 分提升至 95 分 | 公开披露有限 | 多车型量产合作 |
| 元戎启行 | 车端 VLA | 公开侧重 VLA,RL 细节有限 | 探索车外具身场景 | VLA 方案推进量产 |
| Waymo | L4 Robotaxi | 基础模型 + 大规模仿真 | EMMA 基于 Gemini,大规模仿真环境 | Robotaxi 已商业化 |
| 小马智行 | L4 Robotaxi | PonyWorld 基于 RL 范式 | 生成场景、高保真仿真、行为评估 | 第七代量产、车队扩张 |
| 文远知行 | L4 Robotaxi/通用 | 端到端 + 博弈论 + 飞轮效应 | 大规模云端仿真 | Robotaxi 多城运营 |
共性与分歧
- 共性:多数厂商围绕“端到端+世界模型+强化学习”构建技术链路,强化学习普遍用于闭环训练。
- 分歧:
- 是否以语言为中介(如小鹏、理想、元戎、千里浩瀚 G-ASD 偏向 VLA,华为、地平线、Momenta 弱化语言中介);
- 强化学习的披露程度(部分厂商对 RL 技术细节公开有限);
- 落地形态:量产辅助驾驶强调成本与部署,L4 Robotaxi 强调安全冗余与性能超越。
结论
强化学习正从可选增强转变为高物理闭环任务中的关键环节,尤其在自动驾驶领域,其作用在于突破模仿学习的天花板,提升系统在复杂、危险场景中的表现。随着世界模型与强化学习的双向共生,行业正在向高保真仿真环境与闭环训练机制演进,未来技术路线将更趋收敛,但语言中介、数据规模与算力投入仍是关键变量。
风险提示
- 技术迭代不及预期:数字 AI、物理 AI 技术进展低于预期,任务或应用场景拓宽速度低于预期。
- 大模型厂商 ARR 增速放缓:若客户增长、续费率或客单价不及预期,可能影响 ARR 增速。
- 云服务商资本开支不及预期:若 AI 算力需求及投资回报低于预期,云服务商可能下调资本开支。
- 智能驾驶及机器人商业化落地不及预期:产品可靠性、成本下降或用户需求低于预期,可能影响商业化进程。
免责声明
本报告仅供东吴证券客户参考,不构成投资建议。报告内容基于公开信息整理,分析师力求准确但不保证其完整性。报告版权归东吴证券所有,未经书面许可,不得翻版、复制和发布。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载