20260803-东吴证券-_汽车_黄细里_AI系列深度09期_从LLM到VLM再到VLA意味着什么_4页_884kb
报告摘要
【汽车*黄细里】AI系列深度09期:从LLM到VLM再到VLA意味着什么?
核心内容
本报告探讨了AI大模型从LLM(语言大模型)到VLM(视觉语言模型)再到VLA(视觉语言动作模型)的发展路径,分析了它们在技术架构、数据需求、应用场景及产业布局上的演进与差异。
主要观点
- 技术演进:LLM、VLM、VLA 是同一技术脉络下的不同阶段,分别专注于语言、视觉与动作的处理。
- LLM:以文本为输入输出,主要解决语言理解、生成和推理任务,依赖海量文本和自监督训练。
- VLM:在语言模型基础上加入视觉理解,实现图像与文字的语义对齐,适用于图像理解、图文问答、视觉检索等任务。
- VLA:进一步将动作作为输出模态,实现对物理世界的交互与控制,适用于机器人、自动驾驶等具身智能场景。
- 应用场景:LLM 主要应用于知识、代码、对话等软件任务;VLM 扩展至图像理解与多模态交互;VLA 则进入物理世界,需处理实时性、安全性和物理反馈。
- 技术路线:VLA 内部存在多种实现路径,如动作离散化生成、扩散策略、流匹配等。
- 产业布局:海外以 OpenAI、Google、Meta 等为主导 LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure 等布局 VLA 和机器人;国内则以 DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax 等聚焦 LLM/VLM,智元、银河通用等则专注于 VLA 与机器人本体。
- 投资方向:当前 AI 技术发展路径已逐渐清晰,但物理闭环建模仍具挑战,VLA 作为物理世界 AI 解决方案,将是未来更具增量价值的方向,智能驾驶作为最先跑通闭环的代表场景,值得关注。
关键信息
- 技术演进:LLM → VLM → VLA,逐步扩展至多模态与物理交互。
- 数据与表征:LLM 依赖文本数据,VLM 引入图文对与视觉编码,VLA 需要机器人示教、轨迹、反馈和真实环境数据。
- 动作生成方式:VLA 可通过自回归生成、扩散策略或流匹配生成连续动作轨迹。
- 应用边界:LLM 适用于软件任务,VLM 扩展至图像与多模态交互,VLA 则进入物理世界,如自动驾驶与机器人控制。
- 风险提示:
- 技术迭代不及预期
- 大模型厂商 ARR 增速放缓
- 云服务商资本开支不及预期
- 智能驾驶及机器人商业化落地不及预期
最新金股组合
| 代码 | 简称 | 行业 | 总市值(亿元) | 27EPS(元) | 28EPS(元) | 27PE | 28PE |
|---|---|---|---|---|---|---|---|
| 600176.SH | 中国巨石 | 建筑建材 | 2,917 | 1.49 | 1.66 | 49 | 44 |
| 300751.SZ | 迈为股份 | 机械 | 788 | 4.04 | 5.79 | 70 | 49 |
| 002371.SZ | 北方华创 | 机械 | 6,419 | 12.53 | 16.47 | 71 | 54 |
| 300604.SZ | 长川科技 | 机械 | 2,166 | 4.80 | 6.55 | 71 | 52 |
| 688630.SH | 芯碁微装 | 电子 | 782 | 7.32 | 9.75 | 75 | 56 |
| 688141.SH | 杰华特 | 电子 | 691 | 1.38 | 4.75 | 111 | 32 |
| 1801.HK | 信达生物 | 医药 | 1,384 | 2.04 | 2.79 | 34 | 25 |
| 688235.SH | 百济神州 | 医药 | 2,413 | 6.28 | 7.38 | 41 | 35 |
| 002428.SZ | 云南锗业 | 计算机 | 785 | 1.71 | 2.57 | 70 | 47 |
| MU.O | 美光科技 | 传媒互联网&海外 | 13,036 | 151.43 | 165.15 | 8 | 7 |
数据说明:所列市值、PE 均截至2026年6月30日,港股市值以港币计,美光科技数据以美元计,其余以人民币计;HKDCNY 汇率按 2026年6月30日的 0.87 计算;盈利预测来自东吴证券研究所。
法律声明
本公众号为东吴证券研究所依法设立、独立运营的官方订阅号,内容均来自于已发布研究报告,不构成投资建议。未经授权,禁止复制、转载。如需了解详细研究报告,请参见东吴证券研究所发布的完整报告。
联系方式
如需获取更多资讯或研究报告,请关注“东吴研究所”公众号,或通过以下联系方式与我们联系:
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载
