从通义的图像生成,到 Apache 2.0 开源的视频主力
通义万相(Wan) 是 阿里巴巴 通义实验室 / 阿里云 的视觉生成模型家族,覆盖图像与视频两路。它最早以通义旗下的图像生成能力问世(2023 年),真正写进历史的是 2025 年 2 月把视频生成模型 Wan2.1 以 Apache 2.0 协议全面开源——正如 Stable Diffusion 当年对图像做的事,Wan 把高质量视频生成的权重交到了全球开发者手里,成为开源视频生成事实上的主力之一。在 Anianima 的软件资料库里,本条目的历史分量在视频一侧(尽管它也做图像),与 Stable Diffusion(开源图像)形成”开放权重”的呼应,并与闭源的 Seedance、可灵、Veo 等构成”开源 ↔ 闭源”的对照。
基础信息(Metadata)
- 软件名称:通义万相 Wan(图像 + 视频生成模型家族;含 Wan2.1-VACE、Wan2.2-Animate 等)
- 首次发布:2023 年 7 月(通义万相,初为图像生成);2025 年 2 月(Wan2.1 开源,视频生成出圈)
- 主要开发者 / 机构:阿里巴巴 通义实验室 / 阿里云
- 软件类别:特效与模拟(主)/ 创作与设计
- 运行平台:通义万相官网 / 千问 App + 阿里云百炼 API;开源权重可本地下载(GitHub / HuggingFace / 魔搭 ModelScope)
- 授权模式:开源权重(Apache 2.0,Wan2.1 / 2.2 等)+ 云端 API(阿里云百炼)并行
- 官方网站:tongyi.aliyun.com/wanxiang / wanxiang.aliyun.com
- 当前状态:⚠️ 活跃;当前主线为 Wan3.0(2026-08-06 开启公测,30 秒单段 + 原生 4K + 音画同步)
👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!
历史背景与发展历程(Historical Context & Development)
通义万相的故事,是一条”从图像起家、靠开源视频出圈”的弧线。
2023 年 7 月,通义万相正式发布,最初是阿里通义生态里的图像生成能力(文生图、图生图、图像编辑)。真正让它进入全球视野的是视频:2025 年 2 月 25 日,阿里把视频生成模型 Wan2.1 以最宽松的 Apache 2.0 协议全面开源,14B 与 1.3B 两个参数规格的推理代码与权重全部开放,支持文生视频与图生视频;其在权威评测集 VBench 上以总分约 86.22% 登顶(官方口径,超越同期 Sora、Luma、Pika 等)。这一步,把”高质量视频生成”从少数闭源旗舰手里解放出来,塞进开源生态。
此后开源节奏不断:Wan2.1-VACE(2025 年 5 月)以单一模型同时支持文生视频、图参考视频、视频重绘、局部编辑等,成为”功能最全”的开源视频生成与编辑模型;Wan2.2(2025 年 7 月)首创”电影美学控制系统”,并把计算资源消耗降低约 50%(官方口径);Wan2.2-Animate(2025 年 9 月)实现”输入一张角色图 + 一段参考视频”即可迁移动作表情、或把视频角色替换为图中角色,面向动漫、舞蹈模板与短视频。到 2025 年 9 月,通义万相累计开源 20 余款模型、下载量超 3000 万(官方口径)。
2026 年 8 月 6 日,Wan3.0 开启公测:单段视频生成上限提升至30 秒(追平当时行业最高单段档位)、支持原生 4K、多镜头模式与音画同步,并首次支持把 doc / xls / ppt / pdf / md 等文档直接转成视频;720P 的 API 价格约 0.6 元/秒(媒体口径,约为同期主流模型六折)——把”长视频”与”性价比”两面旗一起插下。从 Wan1.0 到 Wan3.0,万相家族共迭代八个版本。
⚠️ 两点澄清(易混淆处):其一,通义万相 Wan 与 HappyHorse(欢乐马)是阿里旗下两条不同产品线、不同团队——Wan 属通义实验室 / 阿里云,走”开源权重 + 平台化 + 工程落地”;HappyHorse 属 ATH 创新事业部,走闭源托管 API。二者不是同一模型,也并非”同源”,请勿混为一谈。其二,Wan 同时覆盖图像与视频,但其历史分量主要在开源视频一侧;本站据此将其归入”特效与模拟(主)/ 创作与设计”,而非单纯图像类。
核心功能与技术特征(Core Features & Technical Character)
通义万相的核心身份是”开源权重 + 平台化”的视觉生成基座;它对行业的最大贡献,是把高质量视频生成变成可下载、可自托管、可二次开发的能力。
📅 本部分基于 Wan2.1 / 2.2 / 3.0(2025–2026)撰写;分辨率、时长、份额、价格等以官方与第三方口径为准。
技术要点:
- 开源权重(Apache 2.0): Wan2.1 起核心模型权重与代码开放,可在 GitHub / HuggingFace / 魔搭下载并本地部署、自由微调——这是它与闭源旗舰最本质的分野。
- 文生视频 / 图生视频: 从文本或参考图生成视频,Wan3.0 单段可达 30 秒、原生 4K。
- 电影美学控制(Wan2.2 起): 提供对镜头、光影、色调等”电影感”维度的显式控制。
- VACE 一体化编辑: 单一模型完成文生视频、视频重绘、局部编辑、参考生成等多任务。
- 动作迁移 / 角色替换(Wan2.2-Animate): 让静态角色”动起来”,或替换视频中角色,服务动漫与短视频。
- 音画同步与文档转视频(Wan3.0): 生成自带音轨,并支持 doc / ppt / pdf 等文档一键成片。
- 本地与生态: 开放权重版本可经 ComfyUI 等前端在本地 / 私有环境运行,催生大量微调与工具链。
代表性应用案例(Representative Uses)
通义万相自 2025 年开源视频出圈以来,典型落点包括:
- 开源自托管视频管线: 经 ComfyUI 等把 Wan 接进本地 / 私有管线,满足数据与可控性要求——这是它区别于闭源模型的核心场景。
- AI 短剧 / 短视频生产: 长时长 + 性价比 + 角色一致性,支撑批量的短剧、漫剧、营销视频。
- 动漫与角色动画: Wan2.2-Animate 的动作迁移 / 角色替换,服务二次元与虚拟形象创作。
- 内容创作与编辑: VACE 的重绘 / 局部编辑用于改稿与二创。
- 文档一键成片: Wan3.0 把办公文档直接转为带音轨的视频,面向知识科普与营销。
说明:以上为该类工具的典型用途归纳,未断言具体作品以 Wan 完成成片制作;涉及单一生产请以官方与创作者披露为准。
版本迭代中的关键技术更新(Milestone Versions + Legacy)
👾 版本清单由AI整理生成,请谨慎参考
万相的版本线以”图像起家 → 开源视频出圈 → 电影感与一体化 → 长视频 + 性价比”推进:
通义万相(2023-07)
- 阿里通义生态的图像生成能力(文生图 / 图生图 / 图像编辑)。
Wan2.1(2025-02-25,开源)
- Apache 2.0 全面开源(14B + 1.3B);文生 / 图生视频;VBench 登顶(官方口径约 86.22%),开源视频出圈起点。
Wan2.1-VACE(2025-05)
- 单一模型集成文生视频、图参考、重绘、局部编辑等,”功能最全”的开源视频生成与编辑模型。
Wan2.2(2025-07)
- 首创电影美学控制系统;计算资源消耗降低约 50%(官方口径)。
Wan2.2-Animate(2025-09)
- 动作 / 表情迁移与视频角色替换;面向动漫、舞蹈模板、短视频。
Wan3.0(2026-08-06,公测)
- 单段 30 秒、原生 4K、多镜头、音画同步;文档直接转视频;720P API 约 0.6 元/秒(媒体口径)。
版本代际与技术脉络
把通义万相放进 AI 视频生成的演进脉络,它扮演的是”开源权重路线”在视频一侧的设定者:
- 开源民主化(类比 SD 之于图像): Wan2.1 用 Apache 2.0 把高质量视频生成开放给所有人,催生出围绕它的 ComfyUI 工作流与海量微调——就像 Stable Diffusion 当年对图像做的那样。这是它最核心的历史位置。
- 开源 ↔ 闭源的对照样本: 与闭源的 Seedance、可灵、Veo、Sora 不同,Wan 用”开放权重 + 云端 API + 性价比”三线并行,是观察”开源视频能否持续对抗闭源旗舰”的关键样本(与开放权重的 MiniMax H3 同属这一极)。
- 平台化与性价比: Wan3.0 的 30 秒 + 0.6 元/秒,显示阿里把竞争重心压向”长、便宜、能进办公/生产流程”,而非单纯拼画质。
需要厘清的是:Wan 不是阿里唯一的视频模型(HappyHorse 是另一条闭源线),它是阿里把”开放权重”旗帜插进视频生成的那个。读本站其余视频模型条目时,请带着”开源 ↔ 闭源、单点画质 ↔ 生态与性价比”这组坐标。
结语
通义万相的意义在于:它把 Stable Diffusion 当年对图像做的事,在视频上重做了一遍——用 Apache 2.0 的开源权重,把高质量视频生成从闭源旗舰手里交到全球开发者与创作者手中,催生出围绕它的自托管管线与微调生态。它不靠单点惊艳,而靠”开放 + 平台 + 性价比”三路并进,成为开源视频生成的主力基座。
它与 Stable Diffusion 在”开放权重”精神上同源,与同门的 HappyHorse 则分走开源 / 闭源两条路;与 Seedance、可灵、Veo、MiniMax H3 等一道,把 2025–2026 的视频生成推向”长、稳、可控、且越来越便宜”。当开源与闭源在视频赛道持续角力,Wan 正是”开放”这一极最有分量的注脚之一。
