20260903-光大证券-李飞飞推出首个多模态世界模型_AI迎来里程碑_AI下游场景加速构建_2页_135kb
报告摘要
李飞飞推出首个多模态世界模型,AI迎来里程碑
核心内容概述
2026年9月2日,由“AI教母”李飞飞联合创立的World Labs公司发布了全球首个多模态世界模型Atlas,标志着AI技术在世界建模领域迈出了重要一步。与此同时,谷歌也推出了两款新模型Gemini 3.8 Flash及Flash Cyber,进一步推动大模型的发展。随着技术进步和Token成本下降,AI下游应用场景正加速构建,成为市场关注的热点。
Atlas世界模型的核心能力
Atlas是首个从零完成预训练的全模态世界模型(Omni World Model),能够处理文本、图片、视频、3D深度等多模态信息。其采用多模态自回归扩散Transformer架构,具备以下四大核心能力:
-
相机控制生成(Camera-Controlled Generation)
- 输入相机内外参数,生成符合物理逻辑的视频。
- 支持从图像生成视频,视频长度可达1分钟,分辨率达1440P。
-
空间重建(Spatial Reconstruction)
- 基于输入图像重建真实世界场景。
- 性能已超越专门用于3D重建的先进模型。
-
时空模拟(Spacetime Simulation)
- 通过输入视频对空间与时间进行建模。
- 为机器人提供“真实世界到仿真工作流”的能力。
-
图像生成(Image Generation)
- 支持文生图像及360度全景图生成。
- 可处理复杂提示词,渲染多样视觉风格。
Atlas通过构建空间上下文(Spatial Context),将图像锚定在3D空间中,从而实现更精准的创意控制与生成。
谷歌Gemini 3.8 Flash模型亮点
谷歌在大模型领域持续发力,三周内推出Gemini 3.8 Flash及Flash Cyber两款新模型,显示出其快速迭代的能力。
- Gemini 3.8 Flash是当前最强的推理与编程大模型。
- 具备长时间运行智能体的能力,完成复杂任务。
- 根据Artificial Analysis测评,Gemini 3.8智能指数达59分,输出速度达305 Token/秒。
Token成本下降与AI应用扩展
随着大模型技术的成熟和国产开源模型的发展,AI的Token成本持续下降:
- LLM Token支出指数本周初跌破1美元,较今年5月下跌超50%。
- 国产开源模型如GLM-5.3-Flash(320B-A18B)和DeepSeek-V4-Pro-0813,显著提升了模型性能与效率。
- GLM-5.3-Flash综合智能指数达57分,编程能力媲美Claude Opus 4.8。
- DeepSeek-V4-Pro-0813在多项智能体测试中表现优异,甚至在部分项目中超越Claude Fable 5。
AI下游应用场景的崛起
AI技术正加速渗透到多个下游应用场景,成为行业热点:
- 影视制作:AI长剧《后西游记》作为国内首部深度使用AIGC技术的长剧,采用边制作、边审、边上线模式,首播五集《花果山篇》引发关注。
- 消费电子:多家科技巨头推动AI PC、AI手机等产品发展,为资本市场带来新机遇。
总结
Atlas的发布和Gemini 3.8 Flash的推出,标志着AI在多模态世界建模和智能体应用方面取得重要突破。同时,Token成本的下降与国产开源模型的崛起,为AI技术的广泛应用铺平了道路。未来,AI在内容创作、智能设备、工业自动化等领域的应用将进一步拓展,推动行业变革与创新。
试读结束,高清完整版pdf/doc/ppt,请点下载