计算机行业专题:视频大模型奇点时刻加速到来-240820_26页_1mb
报告摘要
视频大模型奇点时刻加速到来总结
核心内容
视频大模型正迎来快速发展阶段,国内外已有十余家公司发布或更新视频生成模型。Sora的发布带动了行业创新,促使模型在视频时长、分辨率、帧率等基础功能上快速追赶,同时在动作幅度、物理还原度等复杂任务上也取得显著进展。视频大模型具备商用潜力,正在多个领域积累应用案例,未来有望成为重要的生产力工具。
主要观点
- 技术发展:国内外视频生成模型在基础功能上差距缩小,部分国内模型在生成时长、分辨率、帧率等方面已达到国际领先水平。
- 算法演进:视频生成模型主要采用基于SD逐帧生成和基于时空Patches两种范式。前者训练成本低但视频一致性较差;后者训练成本高但能生成更长且一致的视频。
- 算力需求:视频生成模型的训练与推理算力需求远高于文本模型。Sora训练算力需求是GPT-4的4.5倍,推理算力需求是GPT-4的390.5倍。
- 数据质量:高质量数据是视频生成模型性能的关键。用户数量的增长将推动数据飞轮效应,加速模型迭代与优化。
- 商业化前景:视频大模型在办公、广告、电影、游戏等领域展现出广阔的商用前景,已有实际应用案例验证其潜力。
关键信息
视频生成模型发展现状
- 生成类型:主流模型具备文生视频和图生视频功能,部分模型具备视频生视频能力。
- 生成时长:多数模型可生成5-10秒视频,部分如Vidu、Pixverse V2、可灵等可生成30-120秒视频。
- 分辨率:主流模型以720p和1080p为主,部分模型如Etna和智象大模型2.0可生成4K画质视频。
- 帧率:部分模型帧率可达60fps,优于早期产品。
- 功能多样性:包括镜头运动、风格切换、画面比例切换、配乐支持等。
- 价格模式:多数模型采用免费或订阅制,通过付费功能增强用户粘性。
国内外模型对比
| 模型名称 | 所属公司 | 生成时长 | 分辨率 | 帧率 | 其他功能 | 是否可用 |
|---|---|---|---|---|---|---|
| Sora | Open AI | 60s | 1920*1080 | - | 比例切换、时长延展、镜头运动、物理模拟 | 否 |
| Gen-3 | Runway | 5/10s | 1280*720 | - | 镜头运动、比例切换、风格选择、导演模式 | 是 |
| Dream Machine | Luma AI | 5s | 1360*752 | 24fps | 视频延展 | 是 |
| Haiper v1.5 | Haiper AI | 2/4/8s | 1280*720 | 24fps | 比例切换、视频延展、画质增强 | 是 |
| Etna | 七火山科技 | 8-15s | 最高3840*2160 | 60fps | - | 否 |
| Vidu | 生数科技 | 4/8s(理论32s) | 1920*1080 | - | 风格切换、配乐支持 | 是 |
| 即梦 | 字节跳动 | 3/6/9/12s | 1280*720 | 8fps | 镜头移动、比例切换、视频延展、补帧、对口型、画质增强、运动速度 | 是 |
| 可灵 | 快手 | 5/10s(理论120s) | 1280*720 | 30fps | 比例切换 | 是 |
| Pixverse V2 | 爱诗科技 | 5/8s(可延展5倍) | 1920*1080 | - | 视频延展、镜头运动 | 是 |
| 清影 | 智谱AI | 6s | 1440*960 | - | 镜头移动、风格选择、配乐支持、情感氛围选择 | 是 |
文生视频测评结果
| 指标 | Sora | Gen-3 | Dream Machine | Haiper v1.5 | Vidu | 可灵 | Pixverse V2 | 清影 |
|---|---|---|---|---|---|---|---|---|
| 生成时间 | - | 1m54s | 26m | 3m37s | 30s | 5m14s | 6m | 1m25s |
| 分辨率 | 高 | 高 | 中 | 高 | 高 | 高 | 中 | 高 |
| 动作幅度 | 高 | 低 | 高 | 低 | 高 | 低 | 高 | 中 |
| 语义理解 | 高 | 中 | 高 | 中 | 高 | 中 | 中 | 高 |
| 一致性 | 高 | 中 | 中 | 低 | 高 | 中 | 中 | 高 |
| 稳定性 | 高 | 高 | 低 | 低 | 高 | 中 | 低 | 高 |
| 流畅度 | 高 | 低 | 高 | 低 | 高 | 低 | 低 | 高 |
| 物理还原度 | 高 | 高 | 低 | 低 | 高 | 中 | 中 | 中 |
| 综合评价 | 整体对语义及物理现实还原度高,视频在较大幅度变化依然可以保持画面一致性与流畅性。 | 生成速度较快、画质较高,然而整体动作幅度和流畅度较低。 | 整体动作幅度较大、流畅度较高,然而生成时间较长,并且存在画面变形、非物理现实现象出现。 | 整体动作幅度较小,且存在一些创新性画面。 | 动作幅度虽然大,但是内容较为单调。 |
图生视频测评结果
| 指标 | Sora | Gen-3 | Dream Machine | Haiper v1.5 | Vidu | 可灵 | Pixverse V2 | 清影 |
|---|---|---|---|---|---|---|---|---|
| 生成时间 | - | 1m54s | 1h+ | 3m28s | 30s | 4m17s | 5m40s | 12m53s |
| 分辨率 | 高 | 高 | 高 | 高 | 高 | 高 | 高 | 高 |
| 动作幅度 | 高 | 中 | 低 | 低 | 高 | 低 | 中 | 高 |
| 语义/图意理解 | 中 | 高 | 高 | 中 | 高 | 中 | 高 | 高 |
| 一致性 | 高 | 高 | 低 | 低 | 高 | 中 | 高 | 高 |
| 稳定性 | 高 | 高 | 中 | 低 | 高 | 中 | 高 | 高 |
| 流畅度 | 高 | 高 | 低 | 中 | 高 | 中 | 中 | 高 |
| 物理还原度 | 高 | 高 | 低 | 低 | 高 | 中 | 中 | 中 |
| 综合评价 | 未能很好呈现“交流”语义理解,其他方面整体较好。部分形象动作幅度较小,整体不够连贯,存在变形等异常现象。 | 整体动作幅度较小,且存在一些创新性画面。动作幅度、流畅度等方面存在提升空间。 | 动作幅度虽然大,但是内容较为单调。 | 生成时间较长,且存在一些创新性画面。动作幅度、流畅度等方面存在提升空间。 |
投资建议
- 视频大模型厂商:科大讯飞、商汤、云从科技、格灵深瞳、拓尔思、昆仑万维等。
- 算力提供商:海光信息、寒武纪、景嘉微、中科曙光、浪潮信息、工业富联、神州数码、拓维信息、四川长虹等。
- 接入大模型的应用标的:金山办公、万兴科技、福昕软件、虹软科技、彩讯股份、焦点科技、润达医疗、金证股份、泛微网络、金蝶国际等。
风险提示
- 商业化落地不及预期:视频大模型发展仍处于早期,商业模式尚未完全成熟。
- 算力限制:国内在缺乏先进GPU的情况下,大模型迭代速度可能放缓。
- 技术路线分歧:国内厂商采取差异化技术路线,可能不利于技术统一发展。
信息披露
- 分析师:陈涵泊,德邦证券计算机行业首席分析师,具备丰富的行业研究经验。
- 研究助理:王思,德邦证券计算机行业研究助理,覆盖AI大模型、工业软件、网安等领域。
法律声明
本报告仅作为参考,不构成投资建议。德邦证券及其关联机构可能持有报告中提到的公司证券并进行交易,未对报告内容的准确性或完整性做任何保证。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载