Workflow
多视角合成
icon
搜索文档
刚刚,李飞飞掀桌
投资界· 2026-09-03 09:06
核心观点 - 李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,旨在通过空间智能解决具身智能与机器人训练的痛点,推动AI从数字世界走向现实世界 [4][29][47] 模型定义与能力 - Atlas是一款面向空间智能的omniworld model,从零开始预训练,原生处理文本、图像、视频、相机位姿与3D深度信息,完成世界生成、空间重建和时空模拟 [4] - 技术底座为Multimodal Autoregressive Diffusion Transformer,融合自回归预测、扩散去噪与Transformer架构,适配现有大规模算力集群 [36][37] - 模型展现出类似大语言模型的涌现能力,随着参数量和计算力成倍上翻,暴力Scaling依然是版本答案 [42][43][44] 相机控制生成 - 将相机位姿参数作为底层原生输入,用户可直接给定坐标控制角度、轨迹和速度 [6][7] - 输入1到6张普通照片,定好运镜轨迹后,可生成最长1分钟、1440p分辨率的大片,画面空间几何丝滑一致 [7][8] - 在针对镜头运动控制的真人Blind Test中,Atlas胜率极高:面对MiniMax H3胜率75%,面对Gemini Omni Flash胜率81%,面对FLUX 3胜率93%,面对Seedance 2.5胜率94% [39] 空间脑补与多视角合成 - 输入单张照片可脑补出未拍摄区域,如机器人正面照可补出背影,泳池边角照可补出草坪和远山 [10] - 核心能力基于多视角合成,将不同角度、机位的图片和视频塞入同一三维空间,判断相对位置后补足未拍区域并生成新视角 [15][17] - 输入视角越多,越像带空间约束的多视角融合,可将两张不相关的照片强行脑补出走廊、大门和房间,无缝焊接两个场景 [17] - 镜头进入原图未拍区域时,仍依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁越易暴露 [11][12] 空间重建 - 传统3D高斯泼溅或点云扫描需专业设备拍几百上千张照片,Atlas仅需2到25张游客视角地面平拍照片即可还原场景细节 [18][20] - 在DTU、ETH3D、ScanNet等公开数据集上,稀疏视角重建误差(AbsRel×10⁻³)Atlas得分为25.3,优于Pi3X的28.7、Depth Anything 3的39.3和MapAnything的47.7 [22][23] - 输出直接对接点云和3D Gaussian Splatting,可无缝接入World Labs自家Marble平台,实现高帧率即时渲染 [25] - 支持“子弹时间”式Reframing Video,用三五个普通手机或运动相机拍摄日常打闹,即可在虚拟空间随意切换视角 [26][27] 具身智能与机器人应用 - Atlas的终极目标是解决具身智能最大痛点:虚拟训练场不够用 [29][30] - 传统机器人训练数据采集速度慢、成本高,业内估算完全依靠传统方式收集足够规模数据成本可达100万亿美元量级 [30][31] - Atlas的Real to Sim路线省掉大量人工搭建仿真世界的工作,用手机拍两段24帧工厂或房间视频,即可生成高精度3D物理空间供机器人“跑图”试错 [32] - 机器人走到哪,Atlas当场渲染机载摄像头应看到的RGB图和深度图 [33] - 机械臂碰刚性箱子、拉铰链柜门、捏软体海绵,Atlas均能模拟受力反馈 [34] - 录一段真实现场,可衍生出千万种光照、摆放和障碍物条件 [35] 图像生成与全景图 - Atlas具备不错的图像生成能力,可处理复杂Prompt、文字渲染及写实、电影感、油画、漫画等多种风格 [41] - 能直接根据文字或图片生成360°全景图,处理前后左右空间连续性,对模型空间理解要求更高 [41] 开放与未来 - Atlas已向部分合作伙伴开放Early Access,未来将成为Marble和World Labs其他产品的底层模型 [45]