李飞飞Atlas模型:3D重建与子弹时间视频生成
允许用户生成具有精确控制的图像和视频帧,实现类似“子弹时间”的拍摄效果。模型,超越了顶级开源重建模型。会根据你指定的任意摄像机位置和角度生成一个或多个参考图像。能够执行涵盖世界生成、重建和模拟的广泛任务:抢先体验资格,将在未来几周内开放早期访问。
这是一回促使 AI 切实领会三维世界的突破, 李飞飞团队所发布的 Atlas 不再被限定于生成平面图像, 而是能够构筑出可进行自由观察的 3D 场景, 这表明往后的视频制作以及视觉设计或许会迎来具有革命性的变化。
发布会背后的重磅意义
9月2日, World Labs正式发布了Atlas多模态世界模型, 这是一款重磅产品, 它是AI教母李飞飞离开谷歌后创办的公司所研发的, 此产品吸引了业界的广泛关注, 该模型宣称自己能够以像素级的精度去控制相机视角, 进而生成高质量的图像以及视频帧, 并且还能在三维空间之中完成重建。
被官方定位为“全球首个多模态世界模型”的这款产品, 标志着AI从二维图像生成朝着三维空间理解的跨越式发展, 传统AI工具仅仅能够模仿画面内容, 然而Atlas开始具备理解以及重建真实世界空间关系的能力。
Atlas的核心功能解析
Atlas能够支持从单张或者多张输入图像去输出确切的3D模型, 其精度超过当下顶级的开源重建方案。用户可以凭借指定任意摄像机位置以及角度, 来生成对应视角的参考图像, 这些图像不但能够保持与输入一样的几何结构, 而且还能自行补充画面以外的场景细节。
更值得予以关注的是, “子弹时间”效果得以外现。用户能够仿若电影里那般, 于虚拟空间之内获取自由移动, 进而对观察的角度予以调整,能够看见同一场景致内的不一样视角, 这对于影视创作、游戏进程设计以及产品的外观塑造,均具备着重大的价值体现。这种能力可以让寻常用户也能够创编出专业水平级别的三维视觉呈现效果。
多模态输入的处理方式
World Labs着重表明说, Atlas是从起始点开始进行预训练的, 并不是基于现有的模型来加以改造的。这就意味着该模型 inherently 就具备去处置多种输入信息的能力, 其中涵盖拍照设备移动印迹, 观景视角变动等等空间方面的上下文数据。使用者能够针对不同的输入视图在模型的空间坐标系统里进行定位, 由Atlas去完成整个的三维场景重建。
由于多模态输入, Atlas得以理解真实世界里头复杂的运动规律以及空间关系, 它不但晓得物体长成啥模样, 而且明白物体于空间里的位置、方向以及跟其他物体的相对关系, 这般便为生成更为真实可信的三维场景奠定了基础。
与同类产品的对比优势

于当下AI图像生成范畴之中, Midjourney、Stable Diffusion等产物已然颇为成熟, 然而它们的输出一直皆是二维平面图像。Atlas的突破之处在于把生成内容径直映射至三维空间, 用户能够获取具备深度与体积感的世界, 而非仅仅限于是一张漂亮的图片。
相较于现有的3D重建工具, Atlas的优势体现于生成的质量, 以及对复杂场景的理解能力方面。通常情况下, 普通的3D重建经常需要依赖专业设备, 以及大量的照片。然而, Atlas仅用少量的输入图像, 便可实现高质量的重建, 如此一来, 便极大程度地降低了三维内容创作的技术门槛。

实际应用场景展望

在影视和游戏行业方面, Atlas能够极大程度地缩减三维场景的制作时间长度。只须要导演以及设计师给出几张参考用的图片, 系统便能够生成完整的三维情境设定, 供艺术家在里头自如地探寻各个不同的视角, 进而挑选出最为理想的构图方式以及镜头运动的方案。
从事设计工作的人员以及建筑师同样能够从中得到益处, 他们能够迅速把概念草图转变成存在交互性的三维空间, 在此种情况下客户能够于虚拟环境里“步入”设计方案之中, 直接地去感受空间的布局情况以及光影所产生的效果, 这相较于传统的平面图或者静态渲染图而言更具备说服力。
市场前景与用户期待
世界实验室透露, 部分合作伙伴已具备抢先体验资格, 早期访问会在未来几周内逐个开放。这表明普通用户距离正式投入使用还有一段不算长的时间, 然而对于留意人工智能发展的行业人士而言, 这是一件值得紧密追踪的具有里程碑意义的事件。
而Atlas宣布发布事项当中, 也体现了李飞飞那支队伍所拟定钻研方向, 也就是要助力使AI切实洞悉物理之境运作法则, 并非仅是原样照搬人类创建产出之物。要是在一定时间段之后, 此设想变成生活当中的现实, 那在后续日子里我们就极有可能目睹更多具备“对世界理解能力”要素, 而非单纯只有“内容生成特性”的AI类工具得以问世。
试问, 你认为Atlas所举办的发布会, 究竟会给人工智能图像以及视频生成这个行业带去何等程度的冲击呢? 欢迎于评论区域分享你自身的看法。