Tag

商业闭源

Atlas | 把”相机位姿”写进模型输入层的多模态世界模型(2026–至今) 3D建模与资产数字绘画与视觉开发生成式AI
2026年9月20日

Atlas | 把”相机位姿”写进模型输入层的多模态世界模型(2026–至今)

一个把相机参数当成原生输入类型、而不是事后提示词的世界模型:它把文本、图像、深度与相机位姿压进同一个"空间上下文",在同一套自回归扩散 Transformer 里既生成新视角画面、又直接吐出能渲染的 3D 高斯点云——生成、重建、模拟这三件…
DALL·E / GPT Image | OpenAI 文生图模型家族与文本生成图像的主流化(2021-2026-) 数字绘画与视觉开发生成式AI
2026年9月20日

DALL·E / GPT Image | OpenAI 文生图模型家族与文本生成图像的主流化(2021-2026-)

从零样本演示到原生多模态——文本生成图像的主流化引爆点与品牌退场DALL·E 是 OpenAI 自 2021 年起推出的一系列文本生成图像(Text-to-Image)模型,也是现代文生图真正破圈的引爆事件:它第一次让公众直观看到"一段文字…
Sora | OpenAI 文本生成视频模型与“世界模拟器”叙事(2024–2026) 特效与模拟生成式AI
2026年9月20日

Sora | OpenAI 文本生成视频模型与“世界模拟器”叙事(2024–2026)

从点燃品类到战略退场——AI 视频生成的引爆事件及其余波 Sora 是 OpenAI 于 2024 年 2 月公开的文本生成视频模型,也是现代 AI 视频生成真正的引爆事件:它第一次让公众与资本直观看到"一段文字 → 一分钟、物理可信的视频…