深度报告-20240403-华创证券-传媒行业深度研究报告_多模态AI的五重奏_国产大模型的探索序章_25页_2mb
报告摘要
多模态AI技术分析总结
大模型的多模态迭代将直接影响企业发展的三种模式:大模型+原有业务、开源大模型+AI产品、垂类模型+行业数据。这三种模式适合不同规模的企业,没有优劣之分,随着多模态AI的迭代,将持续碰撞出新的应用火花。
多模态技术发展
-
文本
国产大模型在中文语义、长文本方面表现突出,代表企业如Kimi、冒泡鸭/MoE。长文本的“无损上下文窗口”成为差异化优势,支持百万字级别的文档处理。下一阶段竞争将围绕用户定制化展开,基于用户数据形成产品护城河。 -
视频
国内厂商如爱诗科技、MorphAI等在视频生成领域表现亮眼,采用DiT架构,支持图文生视频、视频风格转换等复杂功能。Sora尚未公测,但国内产品已在技术上实现追赶,商业化需求旺盛,尤其是高质量视频语料库拥有者具备竞争优势。 -
音频
TTS技术已较为成熟,魔音工坊、ElevenLabs等产品在语音合成、配音方面表现优异。AI音乐领域Suno V3大幅提升音乐质量,或改写音乐创作格局。SVC技术成本高,但结合AI视频可能带来远期价值。
图片与3D技术
- 图片:AI生成图片已进入商业化阶段,头部平台如Midjourney、Adobe Firefly成熟度高。风格和角色一致性逐步提升,场景一致性未解但有望带来商业化突破。
- 3D:仍处于萌芽期,受限于数据稀缺,技术路径尚未统一。尽管效果精度不足,但长期可应用于游戏、电影、元宇宙等领域,降低内容制作成本。
投资建议
- 上游:关注AI文本/视频语料库相关公司(如中文在线、华数传媒),数据稀缺性形成壁垒。
- 下游:B端/C端应用场景如游戏(恺英网络、昆仑万维)、广告(易点天下)、影视(光线传媒、博纳影业)等,具备商业化落地潜力。
风险提示
- 技术发展不及预期、竞争格局恶化、法律监管趋严、地缘政治风险等可能影响多模态AI进程。
专家观点
报告强调2024年AI多模态技术发展加速,中国厂商进入追赶期,建议重点关注文本、视频、音频三大方向,结合语料库与下游应用场景挖掘投资机会。风险控制仍是关键,需警惕技术与监管的不确定性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载