Skip to main content

DALL·E / GPT Image | OpenAI 文生图模型家族与文本生成图像的主流化(2021-2026-)

从零样本演示到原生多模态——文本生成图像的主流化引爆点与品牌退场

DALL·E 是 OpenAI 自 2021 年起推出的一系列文本生成图像(Text-to-Image)模型,也是现代文生图真正破圈的引爆事件:第一次让公众直观看到”一段文字 → 一张可辨识、甚至富有创意的图像”已近在眼前。它在 2023 年 9 月进化为 DALL·E 3(深度接入 ChatGPT、把提示词工程门槛压到最低),又在 2025–2026 年随原生多模态路线演进为 GPT-4o 原生图像生成与 GPT Image 2,最终在 2026 年主动弃用”DALL·E”品牌——成为前沿实验室里第一个把文生图能力彻底融进通用助手、而非作为独立产品维护的案例。在 Anianima 的软件资料库里,本条目与 🔗Sora 同属 OpenAI 的”文本到 X”战线:Sora 点燃的是视频,DALL·E 点燃的是图像,二者最终都走向了原生多模态生成。

基础信息(Metadata)

  • 软件名称:DALL·E 1 / DALL·E 2 / DALL·E 3(2021–2023);GPT Image 2(gpt-image-2,2026 年起接替)
  • 首次发布:2021 年 1 月 5 日(DALL·E 1 研究预览);2026 年 4 月 21 日(GPT Image 2)
  • 主要开发者 / 机构:OpenAI
  • 软件类别:创作与设计
  • 运行平台:云端(内嵌于 ChatGPT Plus / Pro 与 OpenAI API;DALL·E 1 仅研究预览,未开放 API)
  • 授权模式:商业闭源;订阅制(ChatGPT Plus 20 美元/月、Pro 200 美元/月)与按量 API 计费;无公开权重、不可本地部署
  • 官方网站:无独立长期产品站,内嵌于 ChatGPT 与 OpenAI API(openai.com)
  • 当前状态:⚠️ DALL·E 2 与 DALL·E 3 已于 2026 年 5 月停用,由 GPT Image 2 接替;DALL·E 1 自始仅为研究预览

👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!

历史背景与发展历程(Historical Context & Development)

DALL·E 的故事是一条完整的”引爆 → 接管”弧线:它用一次研究演示改写了行业的想象边界,又用一个品牌退场给所有后来者立了一道”文生图终将消融进通用模型”的预示。

OpenAI 在 2021 年 1 月 5 日发布 DALL·E 1,同期发布 CLIP(Contrastive Language-Image Pre-training,用对比学习把文本与图像对齐到同一表征空间)。DALL·E 1 是一个基于 GPT-3 改造的 120 亿参数自回归模型:先用离散变分自编码器(dVAE)把 256×256 图像压成 32×32 的”图像词元”(每个位置可取 8192 种离散值),再像生成文字一样逐词元生成图像。论文《Zero-Shot Text-to-Image Generation》点明核心主张:不针对特定概念专门训练,仅凭文本-图像对齐的预训练,就能泛化出训练数据里未必直接出现过的组合(例如”牛油果形状的扶手椅”)。这一演示把”文生图”从概念变成了可讨论的工程目标。名称取自艺术家萨尔瓦多·达利(Salvador Dalí)皮克斯角色 WALL-E,暗示“会画画的机器人”

2022 年 4 月 6 日,OpenAI 发布 DALL·E 2,改用”unCLIP”路线——先由先验网络(prior)从文本生成 CLIP 图像嵌入,再由扩散解码器(decoder)把它还原为图像,分辨率较一代提升约 4 倍,并首次带来 inpainting(局部重绘)、outpainting(延展画布)与图像变体(variations)等可控编辑能力;公开 API 于 2022 年下半年逐步开放。需要记下的对照是:DALL·E 2 的公众声量被同年 8 月开源的 Stable Diffusion 部分分流——后者以开放权重降低了文生图的参与门槛,与 OpenAI 的闭源托管路线形成对照。

2023 年 9 月,OpenAI 发布 DALL·E 3,关键不在画质本身,而在”理解提示词”:用模型自己重写的合成描述(re-captioning)重新训练,并让 DALL·E 3 直接接入 ChatGPT——用户用大白话描述,ChatGPT 负责把意图扩写、拆解成更符合模型习惯的提示词。这显著降低了”提示词工程”门槛,也让文生图第一次成为对话式工作流的一环;同期它成为 Bing Image Creator(后更名 Microsoft Designer)的底层模型。

2025 年 3 月 25 日,OpenAI 在 GPT-4o 中直接加入图像生成能力(即后续 API 中的 gpt-image-1 能力)。与以往”文本编码器 + 独立扩散模型”的两段式流水线不同,图像理解与生成开始共享同一套语言模型的表征空间;这一能力因 2025 年流行的”吉卜力风格”图像改造而广为人知,也暴露了原生多模态路线在文字渲染、手部结构与一致性上的新短板,以及新的版权争议。

2026 年 4 月 21 日,OpenAI 发布 GPT Image 2(gpt-image-2),定位为第二代理原生多模态图像模型,宣布接替 DALL·E 系列。需要厘清的是:GPT Image 2 不是”DALL·E 4″——OpenAI 主动弃用了自 2021 年沿用至今的 DALL·E 之名,改用与 GPT 家族一致的”GPT Image”命名,以反映架构已从”独立的扩散文生图模型”转变为”与语言模型同源的原生多模态能力”;且 DALL·E 1 自始至终只是研究预览,从未公开发布权重或开放 API,”DALL·E 系列开源可用”的说法并不成立。OpenAI 同期宣布停用 DALL·E 2 与 DALL·E 3(多家媒体引述的停用时间为 2026 年 5 月 12 日,具体日期来自二级报道,建议以来源原文核对)。至此,”DALL·E”作为产品名正式退出,文生图能力被纳入”GPT Image”体系。


核心功能与技术特征(Core Features & Technical Character)

DALL·E 的核心身份是以 CLIP / 扩散为底座、把”文本 → 可辨识图像”首次工程化落地的生成模型GPT Image 2 进一步把”与语言模型同源的原生多模态生成”变成底座。

📅 本部分基于 DALL·E 3(2023)与 GPT Image 2(2026-04)撰写;带”约”字者为发布方或第三方评测口径。

技术要点:

  • 文本到图像生成(Prompt Following): 从自然语言描述生成图像。DALL·E 3 起,提示词理解依赖 ChatGPT 的扩写与拆解;GPT Image 2 进一步把语义遵循作为核心指标。
    对话式、多轮迭代: DALL·E 3 起,生成不是一次性调用,而是可在 ChatGPT 中基于上一轮结果持续修改、追加约束的往返过程。
  • 图像编辑: inpainting(局部重绘)、outpainting(画布延展)自 DALL·E 2 引入,GPT Image 2 在原生架构下延续并强化了这类编辑器内的可控修改。
  • 文字渲染: 早期文生图模型长期受困于画面中的错字、乱码;GPT Image 2 发布方称其文字渲染准确率约 99%(发布方口径),是这一代最被强调的改进之一。
  • 原生多模态表征: GPT Image 2 与语言模型共享同一套表征空间,图像生成与语言理解不再经由”翻译提示词再送扩散模型”的两段式中转。
  • 分辨率与速度(发布方口径): GPT Image 2 最大输出约 3840px,单张生成约 3 秒;这些数字来自发布与评测资料,属发布时口径。
  • 命名与谱系(需辩证看待): “GPT Image”是 DALL·E 的接替者而非第四代;OpenAI 用更名标记了从”独立图像模型”到”通用多模态能力”的范式转变,阅读时不应把 GPT Image 2 的进展误植回 DALL·E 3。

代表性应用案例(Representative Uses)

DALL·E / GPT Image 在其 2021–2026 的存续与演进中,是创作者手上最被关注的文生图工具之一:

  • 概念探索与分镜草稿: 动画与影视前期常用其快速把文字创意可视化为风格参考、角色设定或镜头构图草图,再交由人工细化——它解决的是”想得快、看得快”,而非替代成片绘制。
  • 编辑插画与社媒视觉: 媒体、运营与营销团队用它生产配图、海报与活动视觉,缩短从选题到素材的周期。
  • 产品与场景 mockup: 电商、室内与工业设计领域用它快速预览材质、配色与摆放方案。
  • 文化现象级传播: 2025 年 GPT-4o 原生图像生成催生的”吉卜力风格”图像改造,是文生图首次成为大规模大众娱乐事件,也把”风格模仿的版权边界”推到公共讨论中心。

说明:以上为该类工具的典型用途归纳,未断言具体影片或工作室以 DALL·E 完成成片制作;涉及单一生产的具体使用请以官方披露为准。


版本迭代中的关键技术更新(Milestone Versions + Legacy)

👾 版本清单由AI整理生成,请谨慎参考

DALL·E 的版本线不算最长,却每一步都带着文生图史的范式信号:

DALL·E 1(2021-01-05 研究预览)
  • dVAE + 120 亿参数自回归 Transformer;零样本文生图,论文《Zero-Shot Text-to-Image Generation》。
  • 仅研究预览,无公开权重、未开放 API;以”牛油果形状的扶手椅”等组合演示点燃文生图想象。
DALL·E 2(2022-04-06)
  • unCLIP(先验 + 扩散解码器),分辨率较一代约 4× 提升;引入 inpainting / outpainting / variations。
  • 2022 年下半年开放 API;同年被开源的 Stable Diffusion 在”可及性”上分流声量。
DALL·E 3(2023-09)
  • 与 ChatGPT 深度整合;re-captioning 重训,提示词遵循大增,提示词工程门槛被压到最低。
  • 同期驱动 Bing Image Creator(后 Microsoft Designer)。
GPT-4o 原生图像生成(2025-03-25)
  • 图像生成嵌入 GPT-4o(即后续 API 的 gpt-image-1 能力);原生多模态,结束”独立扩散模型”路线。
  • 因”吉卜力风格”改造 viral,也暴露文字渲染与版权短板。
GPT Image 2(2026-04-21)
  • 第二代理原生多模态图像模型,接替 DALL·E 系列;文字渲染约 99%(发布方口径),最大约 3840px。
  • 标志着”DALL·E”品牌退场,文生图能力并入 GPT Image 体系。
DALL·E 2 / 3 停用(2026-05)
  • OpenAI 宣布停用 DALL·E 2 与 DALL·E 3(媒体引述 2026-05-12,二级报道,以来源原文为准);研发能力未必消失,”退出独立产品线”是战略选择,而非技术消亡。

版本代际与技术脉络

把 DALL·E 放进 AI 文生图的演进脉络,它扮演的是图像一侧的坐标系设定者,而非单纯的竞争者:

  • 引爆期(2021 DALL·E 1): 把”文本 → 可辨识图像”从想象变成门槛。DALL·E 第一次把这件事钉进行业共识,让后来者必须回答”你能不能也做到”——Stable Diffusion 的开源、Midjourney 的美学探索,都在这之后加速。
  • 能力抬升期(2022–2023 DALL·E 2/3): 把”可控编辑”与”听得懂话”变成预期。当 DALL·E 2 带来 in/outpainting、DALL·E 3 证明对话式提示词可行,后续模型(Flux 的 Kontext 多轮编辑、各家的文字渲染)都把这类能力当作基本功。
  • 范式转折期(2025–2026 GPT-4o / GPT Image 2): 给”独立图像模型”时代画句号。当图像生成与语言模型共用一套表征,文生图不再是单独训练的扩散模型,而是通用多模态助手默认携带的能力——DALL·E 之名也随之退场。

需要厘清的是:DALL·E 不是文生图赛道最早的玩家(更早的研究如 VQGAN-CLIP、Latent Diffusion 同期并行),它是把整片森林照亮的那道闪电;而它的”退场”,又恰好为 GPT Image 在 2026 年接管文生图叙事腾出了空间。读本站其余文生图条目时,请始终带着这个坐标系。

结语

DALL·E 的意义在于:它是现代文生图的主流化引爆事件与坐标系——用一次研究演示把”文本 → 可辨识图像”变成行业共识,用”接入 ChatGPT”定义了随后对话式生图的话语,又用 2026 年的主动更名退场,给所有追逐”独立图像模型”的玩家立下了一道范式警示线:视觉生成终将消融进通用多模态模型,而非作为单独产品长存。它不在赛道最早,却是把整片森林照亮的那道闪电。

它与 🔗Sora 共享同一段叙事:DALL·E(图像)与 Sora(视频)曾是 OpenAI 押注的两条”文本到 X”独立战线,二者早期都建立在扩散架构之上,也都曾被包裹进”世界模拟器”式的想象。而到 2025–2026 年,图像一侧率先完成了向原生多模态的转身(GPT-4o → GPT Image 2),视频一侧也在同期探索类似的统一生成路径。这意味着,以 DALL·E 为起点的这一段历史,终点不是又一个更强的”图像模型”,而是”图像模型”作为独立物种的退场——视觉生成从此成为通用多模态助手默认携带的能力之一。