20260807-东吴证券-汽车行业深度报告_AI系列深度19期_多模态如何从模型拼接走向统一_15页_948kb
报告摘要
汽车行业深度报告总结
核心内容
本报告聚焦于多模态智能的发展历程,分析其从“外挂式/组合式”阶段到“原生多模态”阶段,再到“全模态Omni”阶段的技术演进路径。报告指出,多模态智能的本质是将文本、图像、音频、视频等不同模态映射至统一表示,并在此基础上完成理解、推理与交互。多模态的发展体现了AI2.0“架构、任务、模态三重收敛”的趋势,尤其是模态维度的统一。
主要观点
-
多模态发展三阶段:
- 外挂式/组合式阶段(2021—2023):图像通过视觉编码器压缩为token,再接入语言模型,存在转换损耗,但工程效率高。
- 原生多模态阶段(2023—2024):多模态能力从接口层前移到预训练阶段,模型从训练早期就联合处理多种模态,提升泛化能力。
- 全模态Omni阶段(2024至今):模型实现文本、视觉、音频、视频的实时统一交互,补齐听、看、说的互动性,降低延迟,提升用户体验。
-
Omni阶段的核心突破:
- 语音直接理解,保留非文本信息(语气、节奏、情绪等);
- 视觉实时参与,支持连续对话;
- 低延迟交互,更接近人类交流方式;
- 多模态共同推理,提升复杂任务处理能力。
-
未来发展方向:
- 理解与生成统一:探索纯自回归、扩散及二者融合等范式,解决高层语义与空间结构之间的表征冲突;
- 多模态深度推理:从语言思维链向视觉工具增强、视觉—语言交错推理、多模态潜空间推理、闭环推理演进。
关键信息
-
技术路线演进:
- 外挂式阶段:使用CLIP、Flamingo、BLIP-2、LLaVA等模型,通过连接模块实现多模态拼接;
- 原生多模态阶段:Gemini等模型实现从预训练阶段开始的多模态联合建模;
- Omni阶段:GPT-4o、Qwen2.5-Omni等模型实现文本、视觉、音频、视频的实时统一交互。
-
技术瓶颈与挑战:
- 理解与生成在表征上的冲突;
- 离散与连续模态生成范式的统一;
- 多模态推理仍以语言思维链为主,尚未形成统一的推理机制。
-
行业展望:
- 多模态技术逐步收敛于Transformer架构;
- 深度推理能力成为下一阶段竞争焦点;
- 物理AI方向在AI发展进程中更具增量潜力,智能驾驶作为代表场景值得关注。
风险提示
- 技术迭代不及预期;
- 大模型厂商ARR增速放缓;
- 云服务商资本开支不及预期;
- 智能驾驶及机器人商业化落地不及预期。
技术演进趋势
- 统一表示:多模态能力的统一核心在于将不同模态映射到同一语义空间,减少转换损耗;
- 架构统一:Transformer成为统一多模态的基石,其自注意力机制支持多模态token的联合处理;
- 交互升级:从“看图说话”向“听、看、说、实时交互”演进,提升交互自然度与实时性;
- 推理深化:多模态推理从语言思维链向视觉工具增强、潜空间推理、闭环推理等方向发展,提升模型在真实复杂场景中的表现。
行业投资建议
- 投资评级:增持(维持)
- 投资逻辑:多模态技术逐步统一,Omni路线成为新趋势,深度推理能力提升将是未来增长点;
- 关注重点:智能驾驶、物理AI、多模态原生推理等方向,尤其是具备全模态交互与深度推理能力的模型与应用。
结论
多模态智能正从“拼接”走向“统一”,未来将更注重理解与生成的协同、多模态推理的深化。深度推理能力将成为区分模型性能的关键变量,而Omni路线则标志着多模态交互的全面升级。行业应重点关注具备全模态处理与推理能力的技术路径及应用场景。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载