1到6张照片,生成最长1分钟、1440p的视频,镜头角度和运动路线可以直接控制;2到25张游客随手拍的照片,重建出一个完整的3D场景。这是9月2日,李飞飞创办的World Labs为新模型Atlas公布的能力清单。(来源:量子位、凤凰网科技,2026年9月2日报道)
World Labs官方称Atlas为"全球首个多模态世界模型"。李飞飞本人把它置顶在个人主页上,称作团队的"里程碑式"成果。
世界模型,和"生成视频"差在哪
过去两年大家熟悉的AI视频生成,本质是"一帧一帧画出来"——画面可以很惊艳,但模型并不真正理解画面里的空间关系:镜头一转,桌子可能长腿跑了。
Atlas走的是另一条路。官方介绍,它从头开始预训练,原生理解相机位姿、3D深度和空间关系。输入几张照片加一条运镜轨迹,它生成的每一帧都和输入图像的内容、几何形状对得上,甚至能"脑补"出原图里没拍到的区域。(来源:凤凰网科技)
具体能力分四块(来源:量子位、凤凰网科技):
- 相机控制生成:一张或多张图片,生成像素级相机控制的图像和视频,最长1分钟、1440p;
- 空间重建:1张到数十张输入图像重建真实场景,可输出显式3D模型,效果超过专门的3D重建模型;
- 时空模拟:对输入视频同时建模空间和时间,自由切换视角,实现电影里的"子弹时间",还支持机器人的真实到模拟工作流;
- 图像生成:文本生成图像和360°全景。
李飞飞说:"Atlas为从视觉特效到机器人的众多应用场景打开了大门。"她的学生、英伟达机器人主管Jim Fan也评价:这是机器人领域Real-to-Sim的一大步。(来源:量子位)
对普通人意味着什么
一句话概括:AI正在从"给你生成一张画面",走向"给你生成一个能进入、能操控的世界"。
这意味着一些今天还挺费劲的事,以后可能只需要"拍几张照片":电商商品展示不用搭影棚、老房子的装修效果提前预览、一段旅行视频换个视角重剪一遍。门槛在往"会拍照、会描述"这边靠,而不是往"会建模、会剪辑"那边靠。
不过现在还不是上手的时候——官方表示,部分合作伙伴已获得Atlas抢先体验资格,将在未来几周内开放早期访问。(来源:凤凰网科技)也就是说,公众入口还没开。
等开放的这几周,可以先做三件事
第一,练"描述场景"的表达能力。 世界模型和图像生成吃的是同一套基本功:你把场景、光线、机位描述得越准,AI输出越稳定。今天就可以拿任何文生图工具练手,不花一分钱。
第二,体验现成的"照片变内容"工具。 比如AI家园里的老照片修复(spark1.cn/ai-photo-restore),上传一张模糊、褪色的老照片,10到30秒完成画质修复和黑白上色,下载高清版;或者用AI画室(spark1.cn/ai-image)直接文字生成图片。这些都是"输入→生成"逻辑的日常版,先用熟,等世界模型开放时上手更快。
第三,开始有意识地积累素材。 世界模型时代的玩法是"几张照片重建场景"。平时对同一个场景多角度拍几张——家里的客厅、常去的公园、店铺的门面——将来都是能直接"喂"给模型的原料。
写在最后
技术的节奏确实在加快,但不必追着焦虑。从生成一张图到生成一个世界,工具越来越强,而决定它价值的,始终是你想用它表达什么、解决什么。从容一点,边用边学,该上手的时候自然会上手。
💬 评论