一个把相机参数当成原生输入类型、而不是事后提示词的世界模型:它把文本、图像、深度与相机位姿压进同一个”空间上下文”,在同一套自回归扩散 Transformer 里既生成新视角画面、又直接吐出能渲染的 3D 高斯点云——生成、重建、模拟这三件原本各归各家的事,第一次被塞进一个模型里。
⚠️ 关于宣传口径的辨析(准确性提示): 本条目涉及若干被广泛传播的营销表述,先看清楚再说结论—— ①”全球首个多模态世界模型”:这一说法出自 World Labs 的对外 / 社交平台口径(多家媒体据此转述),World Labs 官方技术博客并未使用该词,其原文表述是 “next-generation world model” 与 “omni model”。这是厂商自我定位,没有任何第三方机构或同行评议认证,本站按”厂商自述”记录,不作为事实结论。 ②”AI 教母”:媒体对李飞飞(Fei-Fei Li)的昵称,既非职务也非奖项,本站正文不使用该称呼。 ③”相机控制胜率 94%”:部分自媒体转述的数字,本站未能在官方博客原文中找到对应数值——官方仅公布了两张相对对比图(第三方人工评审偏好率),未标注具体分数,故本条目不采用该数字。 ④官方 benchmark 为厂商自测,且对比条件对 Atlas 有利:官方明确说明,参与对比的视频模型不接受相机作为原生输入,只能用文本描述运镜;官方自己也承认”更精细的提示词工程可能改善其他模型的相机跟随”。这一自述很诚实,但也意味着该对比不等同于公平条件下的第三方评测。 ⑤开放状态:Atlas 处于 Early Access,仅向”部分合作伙伴”开放、需申请排队,尚未公开可用。截至本条目撰写日(2026-09-05),没有任何公开署名的院线长片、剧集或商业项目使用 Atlas。
Atlas 是 World Labs 于 2026 年 9 月 1 日发布的”omni(通吃型)世界模型”。它的技术主张可以浓缩成一句话:把相机几何做成一门”母语”——不是先生成画面再猜相机,也不是先用 SfM 解算出位姿再喂给重建管线,而是让相机位姿与文本、图像、深度图一起成为模型的原生输入类型,每一张图和每一张深度图都绑定一个显式相机位姿。在这个前提下,同一个模型既能”给你一段按指定机位飞行的 1440p 视频”,也能”把这几张照片变成可渲染的 3D 高斯场景”,还能”把一段多机位素材重新取景成子弹时间”。
在 Anianima 的资料库里,本条目归入世界模型 / 空间智能这一类:它不是 DCC 插件,不坐进任何既有管线,而是试图一次性吃掉三件原本分属不同环节的事——生成(此前由视频生成模型承担)、重建(此前由摄影测量 / SfM / 辐射场方法承担)、模拟(此前由物理仿真器承担)。它进得了动画技术史,靠的不是”又一个 AI 视频模型”,而是它把 3D Gaussian Splatting 这种 2023 年才出现的新表示,正式推成了生成模型的输出格式。
基础信息(Metadata)
- 软件名称:Atlas(World Labs Atlas)
- 首次发布:2026 年 9 月 1 日(官方博客《Atlas: A World Model for Spatial Intelligence》发布,同日开放 Early Access 申请)
- 主要开发者 / 机构:World Labs(由 李飞飞 Fei-Fei Li 与 Justin Johnson、Ben Mildenhall、Christoph Lassner 共同创立)
- 软件类别:世界模型 / 空间智能(按本站分类体系归入资产制作为主——3D 世界生成与重建;创作与设计、实时交互与引擎为次)
- 运行平台:云端(模型推理在云端;输出的 3D 高斯场景可”在设备端以高分辨率与高帧率渲染”——官方表述,未给出具体数值)
- 授权模式:商业闭源;Early Access 申请制,仅面向部分合作伙伴,尚未公开定价、无公开可用版本
- 官方网站:🚀 https://www.worldlabs.ai/blog/atlas | 产品页:https://marble.worldlabs.ai
- 当前状态:⚠️ Early Access(2026-09-01 起),官方称”Atlas 将驱动未来版本的 Marble”——即它本身还不是 Marble 的现役底座
👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!
软件诞生的历史背景(Historical Context & Development)
Atlas 不是一次孤立发布,而是 World Labs 两年技术路线的第三级台阶。要看懂它,得先看清这家公司是谁、以及它前面两步踩在哪。
World Labs 由李飞飞(Fei-Fei Li,斯坦福大学计算机科学教授、ImageNet** 创建者)于 2024 年与 Justin Johnson、Ben Mildenhall、Christoph Lassner 共同创立**(具体成立月份官方未公布,《金融时报》报道为 2024 年 4 月)。官方 About 页把四人的背景概括为”机器学习、生成式 AI、计算机视觉与图形学领域的领军者”——其中 Ben Mildenhall 是 NeRF 的共同作者,这几乎是整条技术路线的基因说明:World Labs 从第一天起就站在”用神经网络表示三维场景”这一脉上,而不是从语言模型半路拐进 3D。
2024 年 9 月,公司走出隐身模式:据《金融时报》报道以约 2.3 亿美元融资、约 10 亿美元估值亮相(金额与估值 World Labs 官方博客未复述,本站按媒体报道记录);同期官方发布视频《A New Frontier》。2024 年 12 月 2 日,官方博客《Generating Worlds》展示了”可在浏览器里探索的、持久的 3D 世界”——这是他们最早的产品形态宣言。
2025 年是产品化的一年。 9 月 16 日《Generating Bigger and Better Worlds》扩大场景规模;10 月 16 日发布研究预览 RTFM(A Real-Time Frame Model,实时帧模型)——一个”边交互边实时生成视频”的生成式世界模型;11 月 10 日,李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》,把”空间智能”立为公司的理论旗帜;11 月 12 日,首款商用产品 Marble 正式向所有人开放(官方原文:”available to everyone starting today”),用户可从图像、视频、文本生成空间一致、高保真、可持久的 3D 世界。
2026 年是铺管线的一年。 1 月 21 日发布 World API(把 Marble 的世界建模能力开放给外部应用);2 月 18 日宣布新一轮 10 亿美元融资,投资方包括 AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea 等——值得记一笔的是 Autodesk 与 NVIDIA 这两家动画 / 图形工业的既得利益者同时入局,信号意义大于金额本身;3 月《3D as code》、4 月 Spark 2.0(3D 高斯的网页流式 LOD 系统)、6 月《A Functional Taxonomy of World Models》(提出渲染器 / 模拟器 / 规划器的世界模型分类法)、7 月 21 日收购 SceniX(机器人仿真)、7 月 28 日《Building Worlds That Train Robots》。
2026 年 9 月 1 日,Atlas 发布。 官方把它定位为”下一代世界模型”,并明确它将驱动未来版本的 Marble 与其他产品。
核心功能与技术特征(Core Features & Technical Character)
Atlas 的自我定义是一个从零预训练的 omni model(通吃模型):在单一统一架构里处理多种任务、多种输入输出,且”把空间控制放在模型的正中心”。它的架构全称是 multimodal autoregressive diffusion transformer(多模态自回归扩散 Transformer)——四个词各司其职:多模态决定它能吃什么,自回归决定它怎么组织序列,扩散决定它怎么生成,Transformer 决定它靠什么算。
📅 本部分基于官方博客《Atlas: A World Model for Spatial Intelligence》(2026-09-01)撰写。
技术要点:
- 相机位姿是原生输入类型(最核心的差异点): 官方原话是 Atlas “uses precise camera geometry as a native input type”——每一张图像与每一张深度图都绑定一个显式相机位姿。这不是”用提示词写’镜头向左平移'”,而是把几何量直接喂进模型。所有输入被放进一个共享的空间上下文(spatial context),模型基于这个上下文生成”下一部分”,并与此前见过的一切保持 3D 一致。
- 自回归 + 扩散的混合:把 LLM 与视频模型两边的家底一起吃了。 官方明确说这是”现代 LLM 与视频模型思想的混合”:因为它是自回归 Transformer,所以能直接吃 LLM 的服务与加速成果(KV-cache、cache-aware routing、disaggregated serving 等);因为它是潜空间扩散(rectified flow)模型,所以能吃扩散蒸馏、classifier-free guidance、shifted noise schedule、VAE 设计等图像 / 视频模型的算法红利。它还能像扩散模型那样,用去噪步数灵活换速度与质量。
- 能力一 · 相机控制生成(Camera-Controlled Generation): 从一张或多张图像出发,以”像素级精确的相机控制”生成图像与视频,最长 1 分钟、最高 1440p(官方示例为 1–6 张输入图 + 手工设计的相机路径)。可指定任意机位与角度生成新视图,并自主”想象”输入中看不到的部分。
- 能力二 · 空间重建(Spatial Reconstruction): 从一张到数十张输入图重建真实场景,同时输出新视角图像帧与显式 3D 结果——点云(point clouds)与 3D 高斯 splats。官方称两三张图即可忠实重建,空间上下文可容纳上百张输入图(博客示例:某场景用 30 张输入图重建,斯坦福主 quadrangle 用 2–25 张地面照片)。Atlas 会先补完点云、再转换成完整的高斯场景——这与 Marble 使用的是同一套表示。
- 能力三 · 时空模拟(Space-Time Simulation): 从输入视频建模空间与时间。一方面是 Reframing:官方称”少至三台普通手机”拍的素材即可重建场景并任意重新取景——原话是这等于”把几台普通相机变成一套子弹时间多机位棚”;另一方面是机器人 Real-to-Sim:用手机视频(示例为两个大型环境各 24 帧)重建场景,并随模拟机器人在空间中移动,一并生成其机身相机会看到的 RGB 与深度数据。
- 能力四 · 图像生成(Image Generation): 从文本生成图像与 360° 全景,能跟随复杂提示词、渲染文字、覆盖多种视觉风格。官方坦承”图像生成不是它的主要焦点”——原话是”The primary focus of Atlas is world modeling, and every image is a window to a possible world“(每一张图像都是通往一个可能世界的窗口)。
- 可预测的 Scaling: 官方称在研发过程中训练了一系列规模与算力递增的模型,”每上一个算力台阶就解锁新能力”,并给出”性能随训练算力持续提升”的判断——这是愿景与趋势外推,不是已兑现的保证。
- 输出即资产:3D 高斯 splats。 官方解释得很实在:点云只能估计几何,”而 3D 高斯 splats 才让它可用”——Atlas 补完剩余空缺、把点云转成完整 splat 场景,可在设备端高分辨率高帧率渲染。这一步是它能接进创作管线的真正接口。
代表性应用案例(Representative Uses)
⚠️ 必须先说清楚:Atlas 目前没有任何公开的署名商业案例。 它处于 Early Access,仅向部分合作伙伴开放。以下为官方博客展示的能力场景,不是已落地的生产案例;本站不做”某部电影用了 Atlas”式的想象性叙述。
- 单图 / 少图 → 可探索 3D 世界(官方示例): 从一张地面照片生成该场景的俯视视角,并进一步生成新视图与 3D 几何、转成高斯 splats;官方称同一输入可生成多条不同的相机轨迹而场景保持一致。
- 可控运镜的视频生成(官方示例): 以少量参考图生成 1 分钟、1440p 的视频,相机路径由用户手工指定——这是它区别于”按提示词碰运气运镜”的视频模型的卖点。
- 多机位重新取景(官方示例): 用三到五部架在三脚架与夹具上的普通手机拍摄素材,重建后可任意重新构图、做出”冻结时间”的效果。官方强调整套设备能塞进一个背包。
- 机器人仿真数据生成(官方示例): 用随手拍的手机视频重建大型环境,再让模拟机器人穿行其中,生成沿途的 RGB 与深度观测——服务于 Real-to-Sim 的导航与操作训练。这条线在 2026 年 7 月收购 SceniX 后进一步坐实。
- 前代产品 Marble 的处境: Marble 是 World Labs 目前唯一公开可用的产品(2025-11-12 起向所有人开放,2026-01 起提供 World API),Atlas 官方称将”驱动未来版本的 Marble”——也就是说,Atlas 的能力今天还不能通过 Marble 直接用到。
版本迭代中的关键技术更新(Milestone Versions + Legacy)
👾 版本清单由AI整理生成,请谨慎参考
Atlas 本身还没有版本史,但它所属的产品线有清晰的一手时间线(以下日期全部取自 World Labs 官方博客索引):
《Generating Worlds》(2024-12-02)
- 首次公开”可在浏览器中探索的、持久可导航 3D 世界”,是 World Labs 的产品形态宣言。
《Generating Bigger and Better Worlds》(2025-09-16)
- 扩大可生成环境的规模与细节保真度。
RTFM(A Real-Time Frame Model)(2025-10-16)
- 以研究预览形式发布的实时生成式世界模型,可在用户交互过程中实时生成视频。这是 Marble 面世前的技术底噪。
《From Words to Worlds》(2025-11-10,李飞飞署名)
- 宣言性长文,系统阐述”什么是空间智能、它为何重要”,为整条产品线立理论旗帜。两天后 Marble 发布。
Marble(2025-11-12)
- 首款商用产品,”从今天起面向所有人开放”:可从图像、视频、文本生成空间一致、高保真、可持久的 3D 世界。其场景表示即 3D 高斯 splats——这正是后来 Atlas 与之对接的接口。
World API(2026-01-21)
- 开放公共 API,把 Marble 的世界建模能力接入外部应用,从”产品”走向”平台”。
新一轮 10 亿美元融资(2026-02-18)
- 投资方含 AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea。对动画技术史而言,Autodesk 与 NVIDIA 的同时入局,是”世界模型被图形工业正统接纳”的一个可记录信号。
Spark 2.0:网页端 3DGS 流式加载(2026-04-14)
- 3D 高斯 splatting 的可流式、LOD 化网页传输系统——解决”生成出来的世界怎么在浏览器里跑起来”。
收购 SceniX(2026-07-21)
- 面向机器人的空间智能能力整合,与 Atlas 的”时空模拟 / Real-to-Sim”能力直接呼应。
Atlas(2026-09-01)
- 发布 omni 世界模型,从零预训练的多模态自回归扩散 Transformer;相机位姿成为原生输入类型;四项能力(相机控制生成 / 空间重建 / 时空模拟 / 图像生成);输出点云与 3D 高斯 splats。
- 进入 Early Access,仅向部分合作伙伴开放,需申请;官方称将驱动未来版本的 Marble。
技术脉络与行业坐标
把 Atlas 放进坐标系,它站的位置相当特殊:
- 它与世界模型谱系的关系: 在”世界模型”这条新兴赛道上,Atlas 属于空间优先的一支——它把 3D 一致性当作架构前提(输入即绑定相机位姿),而非生成后的补救。World Labs 官方在 2026 年 6 月的《A Functional Taxonomy of World Models》里自行提出过一套分类法(渲染器 / 模拟器 / 规划器及其闭环),可视为他们对这条赛道的定义尝试——注意这同样是厂商提出的框架,非学界共识。
- 与视频生成模型的关系: 视频生成模型追求”看起来像”,Atlas 追求”几何站得住”——它生成画面时,相机路径是给定的输入而非碰运气的结果。二者同处”生成模型”这一环节,是目标不同的两条路线,不是上下游关系。官方 benchmark 也只在这两项上做了对比,且如前所述,对比条件对己方有利。
- 技术血缘: 创始人 Ben Mildenhall 是 NeRF 的共同作者,World Labs 的整条路线承接的是”用神经网络表示 3D 场景”这一脉;而 Atlas 选择 3D 高斯 splats 作为输出表示,则把 2023 年才问世的实时辐射场表示,正式推成了生成模型的产物格式——这是它对动画 / 图形技术史最实在的一笔。
- 与既有生产管线的关系: 目前还没有。Atlas 不接 DCC、不进渲染农场,其唯一可对接的现实接口是 Marble 与 World API;它今天在动画工业里的位置是”值得盯着的候选”,而不是”已在用的工具”。把它写进本站,是因为它定义了”生成 → 可用 3D 资产”这条链路的一种可能解法,而非因为它已改变生产。
结语
Atlas 的技术野心说得直白:让相机几何成为模型的一门母语,从而在同一个架构里同时完成生成、重建与模拟三件事——从几张照片变出可渲染的高斯场景,从一段手机视频变出可重新取景的子弹时间,从随手记录变出机器人可用的仿真数据。它把”像素级精确的相机控制”从提示词工程问题,改成了模型输入问题,这是它真正原创的地方。
但它今天仍是一个 Early Access 的模型,不是一件生产工具:没有公开署名的商业案例,没有公开定价,连”全球首个多模态世界模型”这个流传最广的说法都只出现在对外口径而非官方技术博客里。把它写进动画技术史,是因为它接上了从辐射场到实时高斯的那一脉技术血缘,并第一次让”生成的世界”以工业可用的 3D 表示落地——至于这究竟是一条新管线的开端,还是又一次漂亮的演示,得等它真正坐进某条制作流水线才算数。
