Skip to main content

从 Gen-1 结构性视频到”世界模型”——Runway 如何把 AI 视频带进创作流水线

Runway 是 2018 年成立于美国纽约的 AI 创意工具公司,由 Cristóbal Valenzuela、Anastasis Germanidis、Alejandro Matamala-Ortiz 三位纽约大学(Tisch 艺术学院 ITP 项目)毕业生联合创立。它是 AI 视频生成领域的开创者之一:从 2023 年的 Gen-1 / Gen-2 把”文本 / 图像生成视频”带向大众,到参与初代 Stable Diffusion(潜在扩散模型)的研发,再到 2025 年的 Gen-4「世界一致性」与 Gen-4.5 登顶评测,Runway 始终走在”把生成式 AI 变成创作者工具”的前线。其官方定位已超越”视频模型厂”,转向”构建能理解、模拟并在世界中行动的真实世界智能(Real-World Intelligence)”。

基础信息(Metadata)

  • 软件名称:Runway(Runway ML / Runway AI)
  • 首次发布:2018 年(公司成立);首个公开可用的视频生成产品 Gen-1 于 2023 年 2 月推出
  • 主要开发者 / 机构:Runway(美国,纽约;联合创始人 Cristóbal Valenzuela / CEO、Anastasis Germanidis / CTO、Alejandro Matamala-Ortiz / CDO)
  • 软件类别:特效与模拟(主) / 创作与设计
  • 运行平台:云端 Web 应用(runwayml.com)+ API
  • 授权模式:商业闭源(未开放模型权重);订阅制(免费试用 + 付费档)+ 企业 API
  • 官方网站:🚀 https://runwayml.com/

👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!

历史背景与发展历程(Historical Context & Development)

Runway 的故事,是 AI 视频从”实验室研究”走向”创作者手里工具”的奠基叙事——它既是生成式视频最早的产品化推手,也是把扩散模型带进图像与视频的关键参与者。

三位创始人的交集在纽约大学 Tisch 艺术学院的 ITP(Interactive Telecommunications Program)项目。Valenzuela 有艺术与软件工程背景,Matamala 与 Germanidis 分别来自设计与工程领域;三人于 2018 年在布鲁克林创立 Runway,初衷是“让 AI 成为讲故事的必备工具”。2024 年,Valenzuela 公开表示 Runway 不是一家 AI 公司,而是一家媒体与娱乐公司。

Stable Diffusion 的共同研发是 Runway 早期最重要的技术注脚:公司与 CompVis、慕尼黑大学(LMU Munich)等共同参与了初代 Stable Diffusion(潜在扩散模型 / Latent Diffusion) 的研发,这套把扩散模型压缩进潜空间的方法,后来成为文生图乃至文生视频的底层范式之一。

2023 年 2 月,Gen-1 发布——主打”结构性视频生成 / 视频到视频”:基于文本提示或现有图像,对已有视频做风格迁移与结构性改写,是首个真正面向用户可用的视频合成产品。2023 年 6 月,Gen-2 公测并正式上线,支持文本 / 图像直接生成视频,被视为最早被广泛可用的文本生成视频工具之一,让电影人与内容创作者开始把 AI 视频用于实际项目。

电影工业的敲门砖:Runway 的 AI 工具被用在 2023 年斩获 7 项奥斯卡的影片 《瞬息全宇宙》(Everything Everywhere All at Once) 的视觉特效中——据公开报道,其 VFX 团队仅 5 人,借助 Runway 等工具完成了大量特效镜头。这是 AI 视频工具首次深度嵌入一部奥斯卡级长片的制作流程。

2024 年 6 月 17 日,Runway 宣布 Gen-3 Alpha;7 月初向所有付费用户开放,月底上线图生视频,将单次生成时长提升到约 5–10 秒,并在一致性、连贯性上显著优于 Gen-2。2024 年 10 月,推出 Act-One:用智能手机视频捕捉真人面部表情,迁移到 AI 生成的角色上,把”表演”引入生成流程。

2025 年 3 月底 / 4 月 1 日,Gen-4 发布,主打”世界一致性(World Consistency)”——在不同镜头、场景中保持角色、地点、物体的高度一致,被官方定位为”媒体生成与世界一致性”的模型。2025 年 4 月 8 日推出更快更省的 Gen-4 Turbo。

2025 年 12 月 2 日,Gen-4.5 发布,在 Artificial Analysis 文生视频基准测试中取得 1247 Elo 的 SOTA 成绩;同月推出通用世界模型 GWM-1(General World Model),把”世界模型”从口号推进到产品。2026 年 2 月 11 日,Runway 完成 3.15 亿美元 E 轮融资(投资方含英伟达、AMD 等);2026 年 5 月,升级 Aleph 2.0 与 Agent 产品,向”生成媒体编排与推理调度中枢”演进。

在动画与游戏技术史上,Runway 的意义在于:它把”AI 视频”从论文 Demo 变成了可商用、可上片的创作工具,并持续定义着”世界一致性””世界模型”等下一代视频生成的核心命题——作为这一品类的开创者,它铺设了后来者(包括 MiniMax H3、Seedance、HappyHorse)所沿用的”文本 / 图像生成视频”范式与创作工具化路径。


核心功能与技术特征(Core Features & Technical Character)

Runway 的核心身份是以 Gen 系列为底座的”生成式创意工具平台”——它不只做视频生成,而是把生成、编辑、表演捕捉放进同一工作流,目标是”真实世界智能”。

📅 本部分基于 Gen-4.5(2025-12)与 Gen-4 系列 撰写。

技术要点:

  • Gen 系列视频生成模型: 统一支持文本 / 图像生成视频(t2v / i2v),并逐步叠加参考生视频与视频编辑;从 Gen-2 的”能生视频”,演进到 Gen-4 的”世界一致性”——跨镜头保持角色、物体、风格与场景的连贯。
  • 世界一致性(World Consistency): Gen-4 起的核心能力,解决 AI 视频长期痛点——同一角色 / 物体在多镜头、多场景中保持一致,让”分镜成片”而非”单条炫技”成为可能。
  • Act-One(表演迁移): 2024 年 10 月推出,用一段手机视频捕捉面部表情与表演,迁移到 AI 生成角色,把”真人表演”接入生成管线,降低角色动画的表演门槛。
  • Frames(图像生成)与编辑套件: 平台还提供图像生成(Frames)、视频编辑、修补(Inpainting)、运动笔刷(Motion Brush)等工具,形成”生成 + 精修”的闭环。
  • “真实世界智能 / 世界模型”愿景: 官方定位已从”视频模型厂”转向构建能”理解、模拟并在世界中行动”的基础智能;GWM-1 与 Aleph 2.0 是该方向的产品化尝试。
  • 基准表现(阶段性): Gen-4.5 发布时在 Artificial Analysis 文生视频基准取得 1247 Elo 的 SOTA。该结论为发布时点评测结果,随模型迭代会变化,按”彼时事实”记录。

代表性应用案例(Representative Uses)

Runway 是云端工具平台,经 Web 应用与 API 调用,不直接本地部署。典型用法:

  • 电影 / 长片特效: 最广为人知的是用于 《瞬息全宇宙》(2023,7 项奥斯卡) 的 VFX 流程,由小型团队借助生成工具完成大量特效镜头。
  • 广告 / 概念片: 用 Gen 系列快速产出分镜、概念视频与带表演的角色片段,缩短传统预可视化周期。
  • 创作者工作流: 独立创作者用 Act-One 做角色表演、用 Motion Brush 控制局部运动,把”想法 → 成片”压缩到几步。
  • 企业批量生产: 经 API 接入自研系统,面向影视公司、MCN、品牌方做规模化视频生成。

需明确:成片质量上限取决于 Runway 自身的模型能力(商业闭源、未见公开权重,你无法像开源模型那样换权重或本地微调);它让”把想法变成一段能用的视频”变得极快,但分镜审美、叙事与表演判断仍来自创作者。


版本迭代中的关键技术更新(Milestone Versions + Legacy)

👾 版本清单由AI整理生成,请谨慎参考

Runway 以”Gen”系列命名其视频模型,并配套 Act-One、Frames、编辑等工具,以下按时间梳理:

Gen-1(2023-02)

  • 首个公开可用的视频合成产品;主打”视频到视频 / 结构性生成”,基于文本或图像对已有视频做风格迁移与改写。

Gen-2(2023-06)

  • 公测并正式上线,支持文本 / 图像直接生成视频,被视为最早被广泛可用的文本生成视频工具之一,开启 AI 视频的创作普及。

Gen-3 Alpha(2024-06 宣布 / 07 开放)

  • 7 月初向付费用户开放,月底上线图生视频;单次生成约 5–10 秒,一致性、连贯性显著优于 Gen-2。后续推出更快的 Gen-3 Alpha Turbo。

Act-One(2024-10)

  • 表演迁移工具:用手机视频捕捉面部表情,迁移到 AI 生成角色,把真人表演引入生成管线。

Gen-4 / Gen-4 Turbo(2025-03 底 / 04-01;Turbo 04-08)

  • Gen-4 主打”世界一致性”,跨镜头保持角色 / 物体 / 风格一致;Turbo 在速度与成本上优化。

Gen-4.5 / GWM-1(2025-12)

  • Gen-4.5 于 12 月 2 日发布,Artificial Analysis 文生视频基准 1247 Elo 取得 SOTA;同月推出通用世界模型 GWM-1。

Aleph 2.0(2026-05,待持续跟踪)

  • 视频编辑 / 变换模型升级,配合 Agent 产品,向”生成媒体编排与推理调度中枢”演进。

版本代际与技术脉络

把 Runway 放进 AI 视频生成模型的演进脉络:

  • 开创期(Gen-1 / Gen-2,2023):把 AI 视频带出实验室。 Gen-1 做结构性视频改写,Gen-2 做”文本 / 图像直接生视频”,定义了大众可用的文本生成视频范式。
  • 一致性期(Gen-3,2024):时长与一致性跃升。 把单次生成推到 5–10 秒,并引入 Act-One 表演迁移,让”角色”而非”单帧”成为主角。
  • 世界一致性期(Gen-4,2025):跨镜头连贯。 以”世界一致性”解决多镜头角色 / 物体一致问题,把可用性推向分镜成片。
  • 世界模型期(Gen-4.5 / GWM-1,2025 末):从视频模型到世界智能。 SOTA 登顶 + 通用世界模型,标志 Runway 从”生成视频”转向”模拟世界”。

从开放路线看,Runway 走商业闭源 + 订阅 / API 路线,是这一品类的开创者与范式定义者;MiniMax H3(开放权重)、Seedance(闭源旗舰)、HappyHorse(大厂托管)则是 2025–2026 年沿着 Runway 开辟的路径各自分化的后来者。它们的”开放程度与产品形态”各不相同,但都站在 Runway 从 2023 年 Gen-2 起定义的文本生成视频地基之上。

结语

Runway 的意义在于:它是 AI 视频生成最早的产品化推手与创作工具平台——从 Gen-1 / Gen-2 把文本生成视频带向大众、参与奠定 Stable Diffusion 范式,到 Gen-4 的”世界一致性”与 Gen-4.5 登顶评测,再到 GWM-1 的”世界模型”转向,它持续定义着生成式视频的能力边界,并真正嵌入了《瞬息全宇宙》这样的奥斯卡级制作流程。

但边界必须讲清:Runway 是一家商业闭源公司(未开放模型权重),经 Web 应用与 API 分发,它的能力只留在 Runway 自己的云端,你无法像 MiniMax H3 那样下载权重自行部署或微调;”世界模型 / SOTA 登顶”是其官方定位与阶段性评测结果,非永恒结论;公众记忆里那句”Gen-2″只是它漫长脉络中的一站,而非全貌。对创作者最务实的用法,是用 Web 应用快速出片、用 API 做批量生产——把它当作管线里高可用的视频生成与编辑引擎,而不是把营销话术当作既定事实。