从闭源演示到开放权重——文生图生态的奠基者与”人人可本地部署”的范式
Stable Diffusion(SD) 是 CompVis(慕尼黑大学 LMU,Robin Rombach 等)、Stability AI 与 Runway 于 2022 年 8 月联合公开发布的开源文本生成图像模型,也是现代文生图真正的”开源引爆事件”:它第一次把高质量文生图的权重交到任何人手里——可下载、可本地部署、可微调、可在许可范围内商用,与同期仅经 API 调用的闭源模型(如 DALL·E)形成根本分野。它不是一个单独的产品,而是一整套潜扩散(Latent Diffusion)架构 + 开放权重 + 前端/微调生态的组合;此后 Automatic1111、ComfyUI、LoRA、ControlNet 等围绕它生长出的工具链,定义了”创作者自托管生图”的范式。在 Anianima 的软件资料库里,本条目与 🔗 Runway 同源于潜在扩散范式,又与 🔗Sora、DALL·E 共同构成”闭源 API ↔ 开放权重”两条路线的对照。
基础信息(Metadata)
- 软件名称:Stable Diffusion(SD 1.x / SDXL / SD 3.5 系列,含 SVD 等分支)
- 首次发布:2022 年 8 月(SD 1.0 开源权重)
- 主要开发者 / 机构:CompVis(慕尼黑大学 LMU,Robin Rombach 等)/ Stability AI / Runway(三方合作)
- 软件类别:创作与设计(主)/ 资产制作
- 运行平台:本地 / 私有部署 + 云端托管(开放权重可下载,经 Automatic1111、ComfyUI 等前端在消费级 GPU 运行;亦经 Stability AI 的 DreamStudio 等托管服务)
- 授权模式:开放权重;CreativeML OpenRAIL-M(SD 1.x / 2.x / SDXL 1.0,含使用限制条款);SDXL Turbo 等改用非商业研究许可——”开放权重”不等于”无限制开源”
- 官方网站:stability.ai(模型与 DreamStudio);GitHub 开源权重仓库
- 当前状态:⚠️ 开源权重与生态独立存续;Stability AI 于 2024 年经历领导层更迭(创始人 Emad Mostaque 离任 CEO),主线由社区 forks 与企业发行版延续
👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!
历史背景与发展历程(Historical Context & Development)
Stable Diffusion 的故事是一条”开放即引爆”的弧线:它用一次开源权重释出,把文生图从”实验室/API 围栏里的能力”变成”任何人 GPU 上的工具”,也由此把滥用的责任与治理的难题一并交给了用户与社区。
其方法根源是 潜扩散模型(Latent Diffusion Models,LDM)——Rombach、Blattmann、Esser、Ommer 的论文《High-Resolution Image Synthesis with Latent Diffusion Models》(CVPR 2022)提出:先把图像压缩进低维潜空间,再在潜空间里做扩散去噪,从而把算力需求压到消费级硬件可承受的量级。这是 SD 有别于同期直接在高维像素空间扩散模型的关键工程贡献。
2022 年 8 月,Stability AI、CompVis 与 Runway 三方合作公开发布 SD 1.0 权重。分工上:CompVis(LMU)提供潜扩散架构与论文;Stability AI(创始人 Emad Mostaque)提供算力与资金;Runway 参与合作,其研究员 Patrick Esser 正是 LDM 论文的合作者之一。SD 1.0 的意义不在单张画质,而在”可下载、可本地跑”:它第一次让个人在自家显卡上运行高质量文生图成为常态。
2022 年 10 月,SD 1.4 / 1.5 释出,其中 1.5 成为生态事实基座——此后绝大多数社区 checkpoint(模型快照)与 LoRA 都 fork 自 1.5,奠定了”开源权重 + 社区微调”的范式。2022 年 11 月的 SD 2.0 换用 OpenCLIP 文本编码器并加强 NSFW 过滤,却因质量与兼容性争议导致大量用户回流 1.5,成为“开放发布 vs 内容安全”博弈的早期公开案例。
2023 年 7 月,Stability AI 发布 SDXL 1.0:更大 U-Net、双文本编码器、1024px 输出并引入 refiner,质量跃升为第二代生态基座,仍采用 CreativeML OpenRAIL-M 开放权重许可。2023 年 11 月的 SDXL Turbo 用蒸馏实现少步实时生成,却改用非商业研究许可(不可商用),标志着”开放”内部开始出现商业/非商业的分层。同年,SD 还衍生出 Stable Video Diffusion(SVD,文生视频) 与 Stable Zero123(3D 多视角) 等分支,直接接入本站文生视频与 3D 脉络。
2024 年,SD 3.0 引入 MM-DiT(多模态 Transformer) 主干、转向 Transformer 统一架构;因质量与授权争议,由 SD 3.5(Large / Large Turbo / Medium)整合收束,标记”潜扩散 U-Net”时代的谢幕,与同期 Flux、GPT Image 的 Transformer 路线汇流。
核心功能与技术特征(Core Features & Technical Character)
SD 的核心身份是以潜扩散为底座、把”文本 → 图像”首次工程化开放给个人的生成模型;其真正的护城河不在某一代权重,而在开放后长出的工具链。
📅 本部分基于 Stable Diffusion 1.5 / SDXL 1.0 / SD 3.5(2022–2024)撰写;许可与生态说明以各版本模型卡为准。
技术要点:
- 潜在扩散(Latent Diffusion): 先经自编码器把图像压进低维潜空间,再在潜空间扩散去噪——这是 SD 能在消费级 GPU 运行的根本原因,也是相对像素空间扩散模型的核心工程贡献。
- 文本编码器与 U-Net 主干(SD 1.x / 2.x / SDXL): 早期用 CLIP(SD 1.x)或 OpenCLIP(SD 2.x)做文本编码、U-Net 做去噪;SDXL 升级为双文本编码器、更大 U-Net 并配 refiner。
- 走向 Transformer(SD 3 / 3.5): SD 3 起改用 MM-DiT 多模态 Transformer 主干,与 Flux、GPT Image 的架构方向汇流,U-Net 时代逐步退场。
- 本地与私有部署: 权重可下载,在本地或私有服务器运行,不依赖厂商 API——这是与 DALL·E / Midjourney 等闭源路线最本质的分野。
- 生态能力(非模型本身): LoRA / DreamBooth(角色与风格微调)、ControlNet(姿态/线稿/深度等可控约束)、海量社区 checkpoint——这些是围绕开放权重生长的工具与资产,不应算作某一个 SD 版本的”内置功能”。
- 许可边界(需辩证看待): “开放权重”不等于”无限制开源”:SD 1.x / 2.x / SDXL 1.0 采用 CreativeML OpenRAIL-M,附带使用限制条款(禁止特定有害用途、要求下游同样约束);SDXL Turbo 等更是非商业研究许可。阅读时勿把”开源”与”无约束”画等号。
代表性应用案例(Representative Uses)
SD 在其 2022–2024 的主线与生态扩张中,是创作者自托管生图的首选底座:
- 概念与分镜草稿: 可本地、可离线、可反复微调,适合动画与影视前期快速把文字创意可视化为风格参考、角色设定与镜头构图,再交由人工细化。
- 二次元 / 插画社区爆发: SD 的开源催生了庞大的同人插画生成与模型共享社区(如 Civitai),风格 LoRA 海量涌现,重塑了”个人画师 + 自训模型”的创作链路。
- 游戏 / 动画资产与原画: 角色设定、贴图、背景草图、材质预览均可由其生成草图,再进入正式管线。
- 可控生成工作流: ControlNet(姿态 / 线稿 / 深度约束)与 LoRA(角色 / 风格一致性)让”可控、可复现”成为动画预可视化的现实工具,而非一次性抽卡。
- 边界与争议: 开放权重也带来深伪、NSFW 与版权争议;SD 2.0 试图加强过滤反而引发社区回流 1.5,是”开放 vs 安全”博弈的早期公开案例。
说明:以上为该类工具的典型用途归纳,社区具体生产使用请以官方与创作者披露为准;本站不主张特定影片以 SD 完成成片制作。
版本迭代中的关键技术更新(Milestone Versions + Legacy)
👾 版本清单由AI整理生成,请谨慎参考
SD 的版本线不长,却完整演示了”开放权重 → 生态爆发 → 架构换代”的全过程:
-
Stable Diffusion 1.0(2022-08 开源权重)
- 基于 LDM(Rombach et al., CVPR 2022);首个大规模公开下载的文生图权重,可在消费级 GPU 运行。
- 三方合作释出:CompVis(架构与论文)、Stability AI(算力与资金)、Runway(合作,Patrick Esser 为 LDM 论文合作者)。
-
SD 1.4 / 1.5(2022-10)
- 1.5 成为生态事实基座——此后绝大多数社区 checkpoint 与 LoRA 都 fork 自 1.5。
- 奠定”开源权重 + 社区微调”范式。
-
SD 2.0 / 2.1(2022-11 / 2022-12)
- 换用 OpenCLIP 文本编码器、加强 NSFW 过滤;质量与兼容性争议导致大量用户留守 1.5。
- “开放发布 vs 内容安全”博弈的早期公开案例。
-
SDXL 1.0(2023-07)
- 更大 U-Net、双文本编码器、1024px、引入 refiner;质量跃升为新基线,成为第二代生态基座。
- 仍采 CreativeML OpenRAIL-M 开放权重许可。
-
SDXL Turbo(2023-11)
- 蒸馏至多步实时生成;改用 Stability AI 非商业研究许可(不可商用),开放内部出现商业 / 非商业分层。
-
SD 3.0 / 3.5(2024)
- SD 3 引入 MM-DiT(多模态 Transformer)主干,转向 Transformer 统一架构;3.0 因质量与授权争议,由 3.5(Large / Large Turbo / Medium)整合收束。
- 标记”潜扩散 U-Net”时代谢幕,与 Flux、GPT Image 的 Transformer 路线汇流。
-
分支:Stable Video Diffusion / Zero123(2023)
- 由 SD 衍生文生视频(SVD)与 3D 多视角生成,直接接入本站文生视频与 3D 技术脉络。
版本代际与技术脉络
把 SD 放进 AI 文生图的演进脉络,它扮演的是”开放权重”路线的坐标系设定者:
- 架构代际: 潜扩散(LDM,U-Net 主干)→ 更大 U-Net + 双编码器(SDXL)→ Transformer(MM-DiT,SD 3.5)→ 与 Flux / GPT Image 汇流。SD 用四年走完了从”扩散 U-Net”到”Transformer 统一”的转身。
- 生态代际: 权重开放 → 前端(Automatic1111 / ComfyUI)→ 微调范式(LoRA / DreamBooth / ControlNet)→ 社区市场(Civitai)→ 企业发行版。真正改变行业的,往往是这一层而非单一代权重。
- 路线对照: 与 DALL·E(闭源 API)、Midjourney(闭源产品)相对,SD 证明”把模型交给用户”能爆发更大生态;代价是把滥用、版权与内容治理的责任一并转移给用户与社区——这是开放路线自带、且至今未解的命题。
需要厘清的是:SD 不是文生图赛道画质最强的那一个,它是把”可下载、可本地部署、可微调”变成行业默认选项的那个。阅读本站其余文生图条目(Flux、GPT Image 等)时,请始终带着”开放权重 vs 闭源 API”这个坐标系。
结语
Stable Diffusion 的意义在于:它是开源文生图的奠基者与生态引爆点——用一次开放权重释出,把生成式视觉的能力从实验室与 API 围栏里释放到个人 GPU 上,催生了 Automatic1111、ComfyUI、LoRA、ControlNet 这一整条创作者自托管工具链。它不在赛道画得最好,却是把”模型属于用户”这一范式钉进行业共识的那道闪电。
它与 🔗Runway 共享潜在扩散的方法论源头,又与 🔗Sora、DALL·E 构成”闭源 API ↔ 开放权重”的路线对照。而到 2024–2026 年,开放权重一侧的接力棒交到了 Flux(原 SD 核心团队 Black Forest Labs)与持续演进的 SD 3.5 手中,Transformer 架构则让”扩散”与”原生多模态”的边界日益模糊。这意味着,以 SD 为起点的这一段历史,真正留下来的不是某一个 checkpoint,而是”把生成能力交还给创作者”这一至今仍在塑造动画与视觉生产的工作方式。
