9月2日,李飞飞创立的World Labs公司发布全球首个多模态世界模型Atlas。该模型基于多模态自回归扩散Transformer架构,以空间上下文替代文本上下文,将输入图像与视频锚定于三维空间精确位置,并附带相机位姿与深度信息。
Atlas具备像素级相机控制能力,仅需1至6张图片即可生成最长1分钟、分辨率达1440p的视频,并支持用户自定义相机运动轨迹。在稀疏视角重建任务中表现突出,在DTU公开数据集上重建误差为25.3‰,优于多个专用模型;曾仅用2至25张地面照片完成斯坦福大学主方庭三维重建并生成高空俯瞰飞行路径。
模型可处理普通手机拍摄视频,构建多视角系统实现‘子弹时间’特效;亦支持依据文本生成图像及360°全景图,兼顾指令遵循精度与视觉风格多样性。World Labs称其为从头预训练的多模态模型,能将多源输入转化为3D视图。
Atlas被定位为通往具身智能的关键基础设施,重点应用于机器人预训练:通过少量真实照片生成逼真三维仿真环境及对应RGB与深度传感器数据,缓解真实数据匮乏问题,提升仿真到现实迁移效率。其他应用包括视觉特效创作——降低复杂运镜与特效制作门槛;以及3D内容生成——改变传统依赖专业扫描设备的建模流程,赋能游戏、AR/VR等领域。
技术局限方面,Atlas当前擅长几何连贯的静态空间建模,但对物体碰撞、复杂动力学等通用物理模拟尚未验证;在未拍摄区域依赖先验知识补全画面,存在局部几何漂移或纹理闪烁风险,长路径生成稳定性有待提升。目前模型处于早期访问阶段,仅向部分合作伙伴开放,后续将用于驱动World Labs旗下Marble等产品。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



