深度报告-20260804-东吴证券-汽车行业深度报告_AI系列深度12期_从模块化到端到端_13页_827kb
报告摘要
汽车行业深度报告总结
核心内容
本报告围绕“端到端”技术在智能驾驶与机器人领域的应用与发展展开,分析其技术原理、演进路径及产业影响,并探讨其与VLA(视觉-语言-动作)和世界模型的关系。
主要观点
- 端到端技术是一种以原始传感器输入直接映射为规划或控制输出的整体训练方法,强调全局优化和整体可微性,与传统模块化流水线相比,信息传递更完整,但可解释性和安全验证难度更高。
- 端到端并非完全取消规则,而是以数据驱动模型替代人工规则在主决策回路中的主导地位,规则仍用于安全兜底、形式化校验等场景。
- 一段式与二段式是端到端的两种主要实现方式,一段式强调数据驱动上限,二段式强调工程可控性,两者在信息处理环节、可解释性、调试难度等方面存在显著差异。
- VLA是端到端在多模态理解与动作生成方向上的延伸,通过知识注入和语义推理提升泛化能力;世界模型则关注环境状态预测与场景生成,两者并非替代关系,而是互补或组合使用。
- 自动驾驶是端到端技术最先实现量产的领域,特斯拉FSD v12成为关键推动者,中国厂商在2024年集中跟进,2025年进一步向VLA和世界模型演进。
- 机器人领域自RT-2起即采用VLA形态的端到端技术,谷歌、特斯拉、中国厂商等均在推进相关技术。
- 数字AI中,端到端已成为默认范式,不再单独作为技术标签。
关键信息
端到端技术属性
- 训练方法:整体可微、全局优化。
- 系统架构:以单一或级联神经网络替代传统模块化流水线。
- 技术思想:让数据驱动模型学习中间表征,而非依赖人工定义。
端到端发展路径
| 时间 | 事件 | 出处 |
|---|---|---|
| 1981/1984 | Saltzer等提出端到端论证 | ACM TOCS |
| 1988 | ALVINN: 三层BP网络直接输出行驶方向 | NIPS 1988 |
| 2004—2005 | “端到端学习”首次用于驾驶任务 | DARPA DAVE项目报告; NIPS 2005 |
| 2016 | NVIDIA DAVE-2推动端到端重新受关注 | NVIDIA官方博客 |
| 2023.6 | UniAD获CVPR 2023最佳论文奖 | CVPR官方 |
| 2023.8 | 特斯拉FSD v12实现端到端控制栈替代C++规则 | 特斯拉官方版本说明 |
| 2024.5 | 小鹏发布国内首个量产端到端大模型 | 小鹏汽车官网 |
| 2025 | 理想、小鹏、华为等发布VLA方案 | 各公司官方发布 |
一段式与二段式对比
| 维度 | 两段式端到端 | 一段式端到端 |
|---|---|---|
| 信息处理环节 | 感知→中间表征→轨迹/控制 | 传感器输入→轨迹/控制 |
| 中间显式输出 | 保留(如语义地图、轨迹点) | 不保留,联合训练 |
| 信息传递 | 有一定信息损失 | 更接近信息无损 |
| 可解释性/调试 | 模块化,易诊断与定位 | 可解释性较弱,调试与安全验证较难 |
| 代表阵营(2024末) | 华为、百度Apollo、小鹏、卓驭、极氪 | 特斯拉、商汤、Momenta |
| 特点概括 | 工程下限稳,透明度高 | 上限高、下限低,可学“未定义物体” |
端到端应用领域
- 自动驾驶:特斯拉率先量产,中国厂商2024年集中跟进,2025年转向VLA和世界模型。
- 机器人:RT-2起采用VLA形态,如谷歌、特斯拉、中国厂商等。
- 数字AI:端到端成为默认范式,不再单独标注。
VLA与世界模型关系
- VLA:视觉、语言、动作统一建模,提升推理与泛化能力,是端到端的延伸。
- 世界模型:预测环境状态与场景生成,可作为云端数据引擎或车端模型组件,与端到端形成互补。
风险提示
- 技术迭代不及预期;
- 大模型厂商ARR增速放缓;
- 云服务商资本开支不及预期;
- 智能驾驶及机器人商业化落地不及预期。
总结
端到端技术正在成为智能驾驶与机器人领域的重要范式,其核心在于整体训练、全局优化与数据驱动。尽管其在主决策回路中替代了大量人工规则,但规则仍用于安全兜底等场景。中国厂商在2024年集中跟进,2025年进一步向VLA与世界模型演进。VLA和世界模型并非对端到端的否定,而是其在不同维度的延伸与组合。随着技术的不断成熟,端到端与VLA、世界模型的融合将成为产业发展的趋势。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载