20260731-东吴证券-汽车行业深度报告_AI系列深度09期_从LLM到VLM再到VLA意味着什么_11页_602kb
报告摘要
汽车行业深度报告总结:从LLM到VLA的技术演进与产业影响
核心内容概述
本报告聚焦于人工智能技术在汽车行业的演进路径,从语言模型(LLM)到视觉语言模型(VLM),再到视觉-语言-动作模型(VLA),分析了技术发展脉络、核心机制、应用场景及代表性模型。报告指出,LLM、VLM、VLA代表了AI能力从数字世界向物理世界延伸的三个阶段,技术难度逐级提升,应用场景也由虚拟扩展到现实操作。随着技术演进,VLA成为最具潜力的增量方向,尤其在智能驾驶和机器人领域。
主要观点
- LLM 是以文本为核心的语言基础模型,具备语言理解、生成和推理能力,广泛应用于对话助手、编程、搜索等领域。
- VLM 在LLM基础上加入视觉模态,实现图文对齐与多模态交互,应用场景扩展至图像理解、视觉推理、GUI操作等。
- VLA 是当前AI技术发展的前沿方向,将动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中执行任务。其核心机制包括动作离散化、连续生成及双系统分工。
- 技术演进路径:LLM → VLM → VLA,代表了AI能力从语言处理到视觉理解再到物理控制的递进。
- 产业布局:海外厂商如OpenAI、Google、Meta主导LLM/VLM,Google、NVIDIA、Physical Intelligence等布局VLA;国内厂商如DeepSeek、阿里、字节、百度、腾讯等聚焦LLM/VLM,智元、银河通用等则专注于VLA与机器人本体。
- 未来趋势:物理AI将成为AI发展的新增长点,智能驾驶作为最先实现闭环的场景,值得重点关注。
关键信息
技术演进与能力边界
| 层次 | 输入 | 输出 | 核心能力 | 应用场景 |
|---|---|---|---|---|
| LLM | 文本 | 文本 | 语言理解、生成、推理 | 对话助手、编程辅助、搜索、智能体 |
| VLM | 图像 + 文本 | 文本 | 图像理解、视觉推理、图文问答 | 多模态助手、文档解析、GUI操作 |
| VLA | 图像 + 语言指令 + 本体状态 | 机器人动作 | 泛化操作、具身智能、物理闭环 | 自动驾驶、人形机器人、工业机械臂 |
技术机制对比
| 模型类型 | 核心机制 | 输出方式 | 代表模型 |
|---|---|---|---|
| LLM | 自回归预训练、Transformer | 文本生成 | GPT-3、DeepSeek-R1、通义千问 |
| VLM | 视觉编码 + 模态对齐 + 语言推理 | 文本生成 | CLIP、GPT-4V、Qwen-VL |
| VLA | 动作token化、流匹配、双系统分工 | 离散/连续动作 | RT-2、π0、GR00T N1 |
产业布局与竞争格局
- LLM/VLM:由OpenAI、Google、Meta、DeepSeek、阿里、字节、百度、腾讯、智谱等主导。
- VLA:Google DeepMind、NVIDIA、Physical Intelligence、智元、银河通用等布局。
- 国内厂商:智元、银河通用等聚焦VLA与机器人;字节、阿里、腾讯等通过基座能力向下延伸或通过投资布局。
技术路线分化
- 动作token化:适用于离散动作预测,如RT-2。
- 连续动作生成:通过扩散策略或流匹配生成连续轨迹,如π0。
- 双系统分工:高层VLM负责意图理解,低层动作模型负责执行,如NVIDIA GR00T N1。
风险提示
- 技术迭代不及预期:数字AI与物理AI进展可能低于预期。
- ARR增速放缓:大模型厂商收入增长可能受限。
- 云服务商资本开支不及预期:算力需求或投资回报不及预期。
- 商业化落地不及预期:智能驾驶与机器人产品可能因可靠性、成本或需求不足而延迟。
未来展望
随着技术从数字世界向物理世界扩展,VLA将成为AI发展的重要方向。其在智能驾驶和机器人领域的应用前景广阔,但面临数据采集、系统接口设计、实时控制等挑战。未来竞争将不仅限于模型能力,还涉及数据、硬件、动作控制与场景闭环等多方面。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载