从闭源 API 到开放权重——视频生成赛道的开源拐点
MiniMax H3(简称 H3)是 MiniMax 于 2026 年 7 月 31 日发布、2026 年 8 月 3 日正式开放权重的通用全模态生成模型。它把文本、图像、视频、音频当作同一件事统一理解与生成,能输出最长 15 秒、2K 分辨率、原生立体声的短视频。与其前身”海螺(Hailuo)”系列不同,H3 首次以开放权重形式发布——开发者可免费下载 H3-Base 权重,在本地或国产算力上部署、微调与二次开发。它标志着视频生成从”顶级效果必须闭源”走向”开源也能旗舰级”的拐点。需要明确的是:H3 是一个模型(开放权重),而非开箱即用的桌面软件;它经 API、本地推理框架或第三方平台(ComfyUI、RunningHub 等)使用。
基础信息(Metadata)
- 软件名称:MiniMax H3(MiniMax-H3)
- 首次发布:2026 年 7 月 31 日(正式发布);2026 年 8 月 3 日(开放模型权重 / 开源)
- 主要开发者 / 机构:MiniMax(稀宇科技),总部位于上海的人工智能公司;以”海螺(Hailuo)”视频模型、语音合成与多模态大模型闻名
- 软件类别:特效与模拟(主) / 创作与设计
- 形态 / 运行平台:开放权重模型。本地部署支持 SGLang / vLLM / diffusers / ComfyUI;云端 API 为 platform.minimax.io(全球)/ platform.minimaxi.com(中国);在线 App 为 hailuoai.video 等
- 授权模式:开放权重,采用 MiniMax H3 Community License Agreement(MiniMax H3 社区许可证,自定义协议,非标准 OSI 开源许可证)。H3-Base 权重免费下载;但 H3-Context-IR(理解预处理)与 H3-Regenerate-2K(2K 重生成)两个模块未开源,仅经官方 API 提供。商用边界以许可证原文为准
- 官方网站:🚀 https://www.minimax.io | 模型卡:https://huggingface.co/MiniMaxAI/MiniMax-H3
↑ MiniMax H3一键整合包 BY:comfyui秋葉
👾 本节部分内容由AI整理生成,人工复检紧张排期中,请谨慎参考,极度欢迎专业人士加入纠错团队!
历史背景与发展历程(Historical Context & Development)
H3 的故事,是视频生成从”闭源 API 垄断顶级画质”走向”开放权重也能旗舰级”的关键转折。
MiniMax(稀宇科技)是一家总部位于上海的 AI 公司,长期以”海螺(Hailuo)”系列的闭源视频生成 API、语音合成与多模态大模型见长。在 H3 之前,其视频模型(如 Hailuo 02、Hailuo 2.3)走的是典型的”闭源 API”路线——画质顶尖,但权重不开放,开发者无法在本地微调或私有化部署。
2026 年 7 月 31 日,MiniMax 发布 H3,定位为”通用全模态生成模型”:它不再以图片、视频、声音的单一任务为边界,而是在一个多模态上下文中统一理解创作意图,并输出原生带立体声的视频。发布同时,MiniMax 宣布将在”符合相关法律法规的前提下”开放模型权重。
2026 年 8 月 3 日,H3 权重正式在 Hugging Face 与魔搭(ModelScope)开放下载。随后,华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞、AMD、Intel 等国内外芯片厂商,以及 HuggingFace、魔搭、ComfyUI、RunningHub、fal、OpenRouter、Leonardo.Ai 等社区与云平台,vLLM-Omni、SGLang 等推理框架,均完成或宣布适配。
- ⚠️ 关于”首款开源视频模型”的澄清(准确性提示): 多家媒体称 H3 为”首款开源视频模型 / 首个开源全能全模态模型”。严格来说,在 H3 之前业界已有多个开放权重的视频生成模型(如腾讯 HunyuanVideo、阿里 Wan 等)。H3 真正的突破在于把“旗舰级画质 + 全模态统一理解 + 原生音频输出”三者以开放权重形式组合在一起,并把 2K 旗舰视频的 API 价格压到主流产品的约三分之一。请勿将营销表述当作”史上第一个开源视频模型”的事实。
在动画与游戏技术史上,H3 值得被记录,不是因为它”做了动画”,而是因为它把视频生成的开放权重路线从语言/图像延伸到了带原生音频的旗舰级视频——对需要大量短视频素材(概念片、提案样片、社媒物料)的创作者而言,这意味着顶级视频生成第一次真正可本地化、可微调、可合规私有部署。
核心功能与技术特征(Core Features & Technical Character)
H3 的核心身份是全模态统一理解与生成的视频基础模型——它把”理解意图”和”生成画面+声音”放进同一个模型与同一套上下文里,而非多个专用模型接力。
📅 本部分基于 MiniMax H3(2026 年 8 月开放权重版) 撰写。
技术要点:
- 全模态统一上下文(Omni-modal): H3 可在同一个上下文中接收文本、图像、视频、音频,并输出视频 + 原生立体声音频。参考模式下最多可混合输入 12 个文件(图≤9、视频≤3 段、音频≤3 段),使”多张参考图保角色一致 + 参考视频保运动 + 参考音频保音色”能一次完成。
- 三模块系统(仅 H3-Base 开源): 完整 H3 由三部分组成——
- H3-Context-IR(理解预处理,未开源,仅 API):解析指令、跨模态关联、时序理解与逻辑推理,输出结构化表示(Context IR);
- H3-Base(开源,可本地部署):核心生成模型,编码多模态序列并联合预测视频与音频 latent;
- H3-Regenerate-2K(2K 重生成,未开源,仅 API):将 H3-Base 的 768p 结果与上下文喂回,重生成 2K 画质。
这意味着:本地开源部署得到的是 768p 视频;要拿到官方 2K 结果,仍需调用官方 API(Context-IR 与 Regenerate-2K 两模块未开放权重)。
- 33B 稠密单流 Transformer(H3-Omni-Transformer): 总参数约 330 亿(33B)稠密单流 Transformer;其中约 13B 参数位于 AdaLN 相关分支(推理部署时可预计算并缓存,无需每次加载)。它使用 3D MM-RoPE(t, h, w) 捕捉时空关系,没有模态专属的注意力 / FFN——模态差异只体现在输入/输出层与 AdaLN 分支,这是它能”统一”多模态的关键设计。
- 编码器与 VAE: 文本/视觉编码器 H3-Encoder 复用 Qwen3-VL-32B 的全预训练权重(取第 50 层隐状态)并新增特殊 token;H3-VisualVAE 为时空因果 VAE(空间压缩 16×、时间压缩 4×);H3-AudioVAE 左右声道独立编解码,将 32kHz 音频压至 40Hz latent 序列,支持原生立体声。
- 任务模式: FL2VA(首/末帧生视频,输入 0/1/2 张图:无图=文生视频,1 图=首或末帧,2 图=首末帧);Ref2VA(参考图/视频/音频生视频);对外输出能力记为 T2VA / FL2VA / Ref2VA。
- 输出规格: 时长 4–15 秒;默认短边 768px(2K 经 API 模块);24 fps;多宽高比(21:9、16:9、4:3、1:1、3:4、9:16 等);原生立体声 32kHz。
- 部署框架: 官方推荐 SGLang(提供 cookbook)、vLLM(提供 recipes)、diffusers(ModularPipeline 自动加载)、ComfyUI(提供 R2V / T2V 模板)。初始开源版为全注意力推理,稀疏注意力训练/推理将后续更新。
代表性应用案例(Representative Uses)
H3 不是动画制作全流程工具,而是”从创意/素材直接生成带声音的视频片段”的生成器。典型用法:
- 广告与电商短视频: 上传商品图,直接生成带原生配音的展示视频,省去”生成画面→单独配音→对口型”的多工具接力。
- 游戏与动画相关: 概念片、提案样片、游戏 UI / 宣传物料的动画化;用参考模式锁定角色、LOGO 与画风一致性(多参考图/视频混合输入),快速产出社媒物料或内部评审样片。
- 创作者内容: 社交媒体短视频、带同步声音的素材片段,适合需要批量生产的团队以低成本试错。
- 企业本地部署: 在自有服务器运行 H3-Base(768p),结合私有数据与品牌风格微调,满足安全合规要求;2K 成品再经官方 API 的 Regenerate-2K 模块提升画质。
需明确:上述每一条,H3 都在”生成带声音的视频片段”这一层加速你;它不替代分镜设计、镜头语言、表演与剪辑等专业判断。它让”把想法变成一段能用的视频”变得极快,但成片质量仍取决于创作者的意图与审美。
版本迭代中的关键技术更新(Milestone Versions + Legacy)
👾 版本清单由AI整理生成,请谨慎参考
H3 作为 2026 年新发布模型,以下按”海螺系列 → H3 开放权重”的脉络梳理:
闭源 API 视频模型时期(海螺系列)
- Hailuo 02 / Hailuo 2.3:MiniMax 闭源视频生成 API,支持文生视频 / 图生视频,1080p / 768p,6–10 秒,24fps,以”指令遵循”与物理表现见长;权重不开放。
H3 发布与开源(2026)
- 2026 年 7 月 31 日 — MiniMax H3 发布: 通用全模态生成模型,最高 15 秒、2K、原生立体声;宣布将在合规前提下开放权重。
- 2026 年 8 月 3 日 — H3-Base 权重开源: 在 Hugging Face / 魔搭开放下载(FL2VA 与 Ref2VA 检查点、tokenizer、VAE、Encoder);华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞、AMD、Intel 等芯片厂商,以及 ComfyUI、RunningHub、fal、OpenRouter、Leonardo.Ai 等平台完成/宣布适配。
- 定价档(API 云端): 2K 约 0.8 元/秒(官方旗舰价,约主流同类 1/3);768p 低至 0.23 元/秒;按年度 Pro 会员额度折算 2K 约 0.4 元/秒。开源权重本地部署仅产生算力/电费成本。
- 待开源模块: H3-Context-IR 与 H3-Regenerate-2K 经官方 Open Platform API 提供,官方表示就绪后发布(模型卡讨论区持续更新)。
版本代际与技术脉络
把 H3 放进视频生成模型的演进脉络,位置很清楚:
- 第一代 — 闭源 API 视频模型(海螺系列及同期商业模型): 顶级画质但权重不开放,开发者只能调用云端 API,无法本地微调或私有化。”顶级效果 = 必须闭源”是行业默认规则。
- 第二代 — 开放权重视频模型(H3 开启): 旗舰级画质 + 全模态统一理解 + 原生音频,权重开放可本地部署与微调;2K 与理解预处理模块仍经 API。H3 把”开放权重路线”从语言/图像真正延伸到了带原生音频的旗舰级视频。
对动画与游戏技术史而言,H3 的意义在于:它第一次让”顶级视频生成”变得可本地化、可合规、可低成本批量试错——这正是开放权重对创作生态最实在的价值。
结语
H3 的意义不在”又多了一个能生视频的工具”,而在于它把视频生成”顶级效果必须闭源”的铁律打破了。对动画与游戏技术史,它值得被记录为视频生成走向开放权重的拐点。
但边界必须讲清:H3 是开放权重的模型,不是开箱即用的桌面软件;所谓”开源免费”,准确含义是——H3-Base 权重在自定义《MiniMax H3 社区许可证》下可免费下载,而理解预处理(Context-IR)与 2K 重生成(Regenerate-2K)两个模块仍仅经 API 提供,且商用边界需阅读许可证原文。把它等同于”完全无限制的开源”是误解。
对创作者最务实的用法是:用 API 快速试错、拿 2K 成品;用开源权重做本地合规部署与品牌风格微调——让开放生态放大创作,而不是神话”开源 = 无所不能”。
用户评价
欢迎提供!
