李飞飞团队发布Atlas世界模型:重新定义AI对三维空间的理解
2026-09-02 15:14:42未知 作者:徽声在线
编辑|徽声在线科技频道
今日,人工智能领域迎来重磅消息:李飞飞创立的初创公司World Labs正式发布新一代世界模型Atlas。该模型演示视频中,李飞飞在办公室叠衣服的场景以惊人真实度呈现,引发科技圈热议。据官方视频链接显示,模型不仅还原了人物动作细节,连衣物褶皱和光影变化都达到以假乱真程度。
李飞飞在社交平台转发时幽默表示:「我们办公室确实在叠衣服,不过这次是AI帮我们完成的!」这条推文引发网友对技术原理的热烈讨论。
<技术解析:全模态模型的革命性突破
Atlas被定义为omni model(全模态模型),其核心优势在于从零开始预训练,原生支持文本、图像、视频、3D空间四种数据模态的统一处理。World Labs官方技术文档强调,这是「全球首个实现像素级相机控制、图像视频生成与3D重建的多模态世界模型」。
四大核心能力矩阵
- 相机可控生成:支持1-6张参考图输入,用户可指定任意机位角度生成新视角视频,最高输出1440p分辨率、时长1分钟的动态画面。在测试中,模型成功完成从地面视角到航拍视角的无缝转换。
- 空间智能重建:通过1-50张输入图即可重建真实场景,输出包含点云数据、3D高斯泼溅等显式空间结构。在斯坦福校园重建测试中,仅用25张地面照片就生成了完整的航拍飞行路径。
- 时空动态模拟:突破传统视频处理框架,实现空间与时间的联合建模。该技术已应用于机器人训练场景,通过模拟不同光照条件下的环境变化,提升AI代理的适应能力。
- 全场景图像生成:支持文本生成图像、360度全景图生成等任务。在花园场景测试中,单张地面照片即可生成包含建筑结构的航拍视图,添加第二张小屋照片后自动修正场景布局。
空间上下文:三维世界的「记忆宫殿」
Atlas的创新性体现在其空间上下文(spatial context)架构设计。该模型采用多模态自回归扩散Transformer结构,将每张输入图像锚定在三维空间坐标系中,携带相机位姿信息直接参与上下文构建。这种设计彻底改变了传统视频模型的运作方式:
- 过去:通过文字描述控制相机运动(如「向左平移」),模型理解存在不确定性
- 现在:相机几何参数作为原生输入,实现精确的轨迹控制。测试显示,当输入复杂运镜指令时,Atlas对MiniMax H3的胜率达75%,对字节Seedance 2.5的胜率高达94%
更令人惊叹的是上下文编排能力。当输入两张无关图片并指定空间关系时,模型可自动补全中间场景。例如将站点图片与地面图片组合后,Atlas生成了包含门廊、走廊的完整过渡空间,展现出强大的空间推理能力。
技术架构与性能基准
Atlas采用混合架构设计,融合了LLM与视频模型的双重优势:
- 多模态输入:原生处理文本、图像、相机位姿、深度图,视频数据被分解为图像序列处理
- 自回归生成:通过逐元素生成机制,统一处理不同模态的序列数据
- 扩散模型:采用rectified flow技术,通过逐步去噪实现高质量生成
- Transformer骨干:优化对现代GPU架构的适配,支持千亿参数规模训练
在性能评测方面:
- 3D重建任务:在稀疏视角重建测试中,AbsRel误差指标达25.3×10⁻³,优于Pi3X(28.7)、π³(34.7)等开源模型
- 规模扩展性:训练过程中逐步增加模型规模,每提升一档算力即解锁新能力,但官方尚未公布具体参数量和训练数据规模
应用场景:从内容创作到工业仿真
Atlas展现出广泛的应用潜力:
- 影视制作:实现「子弹时间」特效的平民化制作。测试显示,用3-5台普通相机拍摄的素材,即可生成专业级的多角度回放画面
- 机器人训练:通过统一的世界模型,同步生成环境观测数据与机器人传感器数据。在仓库导航测试中,模型成功模拟不同形态机器人的运动轨迹
- 工业设计:支持物体交互模拟,可批量生成不同光照、背景条件下的产品展示方案
回顾World Labs的发展轨迹:2024年9月完成2.3亿美元融资,2025年推出Marble平台,2026年先后完成10亿美元融资(估值达50亿美元)并收购仿真公司SceniX。此次Atlas的发布,标志着公司从「视觉内容生成」向「物理世界建模」的战略转型。
正如李飞飞在技术白皮书中所言:「当世界模型不仅能创造美丽画面,还能构建可操作的物理环境时,AI将真正获得理解三维空间的能力。」Atlas的诞生,或许正是这个转折点的开始。
更多技术细节与演示案例,请访问World Labs官方博客




