汽车行业深度报告-AI系列深度12期-从模块化到端到端_13页_827kb
报告摘要
汽车行业深度报告总结
核心内容
本报告聚焦于端到端技术在智能驾驶和机器人领域的应用演进,分析其技术原理、产业实践及未来趋势。
主要观点
- 端到端是一种从原始传感器输入直接映射为规划或控制输出的训练方法,强调整体可微、全局优化,是理解智能驾驶和机器人技术路径的关键工程范式。
- 端到端系统并非完全取消人工规则,而是替代人工规则在主决策回路中的主导地位,规则仍用于安全兜底、形式化校验和冗余备份。
- 一段式与二段式之争反映了端到端在工程可控性与数据驱动上限之间的权衡。一段式更强调数据驱动能力,二段式则更注重透明度和可调试性。
- **VLA(视觉-语言-动作)**是端到端在多模态理解与动作生成方向的延伸,强化了推理与泛化能力,而非对端到端的否定。
- 世界模型专注于环境状态预测和场景生成,可作为云端数据引擎、仿真训练场或车端模型组件,与端到端形成互补关系。
关键信息
1. 端到端的技术原理与优势
- 端到端系统通过全局可微训练,使模型直接围绕最终任务进行优化。
- 与模块化流水线相比,端到端系统在信息传递上更完整、延迟更低,但可解释性、安全验证难度更高。
- 量产车队数据闭环是端到端技术在产业侧复兴的重要基础。
2. 端到端的发展路径
- 学术奠基:1988年ALVINN、2004年DAVE项目、2005年LeCun等提出端到端学习概念。
- 产品催化:2016年NVIDIA DAVE-2、2017年Wayve成立、2023年UniAD获CVPR最佳论文。
- 产业跟进:2023年特斯拉FSD v12推动端到端量产,2024年中国厂商集中跟进,2025年进一步向VLA和世界模型演进。
3. 一段式与二段式对比
| 维度 | 两段式端到端 | 一段式端到端 |
|---|---|---|
| 信息处理环节 | 感知→中间表征,中间表征→轨迹/控制 | 传感器输入直接输出轨迹 |
| 中间显式输出 | 保留,如语义地图、轨迹点等 | 不保留,联合训练 |
| 可解释性/调试 | 模块化,易诊断与定位 | 可解释性较弱,调试与验证较难 |
| 代表阵营 | 华为、百度Apollo、小鹏、卓驭、极氪 | 特斯拉、商汤、Momenta |
4. 端到端与VLA的关系
- VLA是端到端在多模态理解与动作生成方向的演进与包含,并非替代关系。
- VLA通过预训练VLM和动作输出头的结构,增强了知识注入、语义推理和跨场景泛化能力。
- 理想汽车将VLA视为端到端的下一阶段,而元戎启行将其称为端到端2.0。
5. 端到端与世界模型的关系
- 端到端负责动作生成,世界模型负责环境预测与场景生成。
- 两者可以组合使用,例如蔚来NWM2.0将世界模型作为车端驾驶决策的一部分。
- 世界模型也可作为对纯模仿学习的补充,弥补空间认知、时间推演和分布外场景的不足。
技术演进时间线
| 时间 | 事件 | 出处 |
|---|---|---|
| 1981/1984 | Saltzer等提出端到端论证 | ACM TOCS |
| 1988 | ALVINN:三层BP网络从图像输出方向 | NIPS 1988 |
| 2004—2005 | DAVE项目首次标题级使用“端到端学习” | Net-Scale报告;NIPS 2005 |
| 2016 | NVIDIA DAVE-2推动端到端再受关注 | arXiv:1604.07316 |
| 2023.6 | UniAD获CVPR最佳论文 | CVPR官方 |
| 2023.8 | 特斯拉FSD v12发布,提出“光子进、控制出” | 特斯拉直播及官方说明 |
| 2024.5 | 小鹏宣布国内首个量产端到端大模型 | 小鹏官网 |
| 2025 | 理想VLA、小鹏二代VLA、华为WEWA等发布 | 各公司官方发布 |
风险提示
- 技术迭代不及预期的风险;
- 大模型厂商ARR增速放缓的风险;
- 云服务商资本开支不及预期的风险;
- 智能驾驶及机器人商业化落地不及预期的风险。
投资建议
- 端到端是智能驾驶和机器人领域的重要技术方向,未来将向VLA和世界模型演进;
- VLA是端到端在多模态推理与动作生成方向的升级,适用于复杂场景;
- 世界模型与端到端形成互补关系,可用于环境预测和仿真训练;
- 风险提示表明,需关注技术落地速度和商业化进程。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载