Model & Benchmarks

MiniMax H3 是什么——开放的全模态视频模型

MiniMax H3 是开放权重的全模态(Omni-Modal)视频模型:一个系统读入文本、图片、视频与音频作为同一段上下文,一次前向即产出带同步立体声的成片,支持最高 2K、15 秒、24 FPS 输出。本文讲清 FL2VA 与 Ref2VA 两个检查点、价格、开放权重边界,以及与 Seedance 2.0、Kling 3.0 的对比。

Jade3 min read
MiniMax H3 是什么——开放的全模态视频模型

TL;DR

  • MiniMax H3 是全模态视频生成模型——一个把文本、图片、视频和音频当作同一段上下文来读的开放权重系统,一次前向就返回一段带同步立体声的成片,2026 年发布在 Hugging Face 上。

  • 它最高生成 2K 分辨率、15 秒、24 FPS 的视频,32 kHz 立体声由同一个 diffusion transformer 原生产出,而不是后期配音。

  • 发布两个检查点:FL2VA(文本 / 首帧 / 尾帧转视频)和 Ref2VA(参考转视频,单次请求最多 9 张图、3 段视频、3 个音频)。

  • 官方 MiniMax 定价页,价格从 2K 每秒 $0.13768p 每秒 $0.08 起。

  • 开放权重只覆盖 H3-Base:H3-Context-IR 预处理模块与 2K 重生成模块目前仍仅限 API。

1. 为什么通用视频模型会改写游戏规则

视频生成这两年一直在向细分工具碎裂。文生视频用一个模型,图生视频用另一个,剪辑现有片段用第三个,动作迁移用第四个,人声、音效和音乐还得单独一条管线、最后在后期里合成。每个工具只理解你意图的一小片,于是真正的制作工作意味着把五家服务缝在一起,还要祈祷它们对「主体长什么样、镜头怎么运动、场景该是什么氛围」有一致的理解。

MiniMax H3 是想把这一整套栈压扁的一次尝试。它在 2026 年 7 月 31 日发布,基础模型权重于 8 月 3 日上架 Hugging Face——这是对视频生成界长期闭源姿态的一次刻意反叛。这个模型最具分量的主张不是它产出最照片级真实的画面(多位评测者说它并不是),而是一个模型能在同一段上下文里装下文本、参考图、参考片段和音频,并从这一切里一致地生成一个视听结果。从「任务专属模型」到「通用多模态系统」的这个转变,才是值得理解的部分——因为它改变了你能自动化哪些工作流,以及一个小团队需要维护多少种工具。

这个套路对见证过 LLM 品类整合的人来说很眼熟:前沿实验室先抢跑定义品类,然后开放权重登场,生态系统——推理框架、硬件厂商、社区工作流——几天之内就跟了上来。视频生成如今正处在同一个拐点,而 H3 是第一个认真把手权重交出来、而不是锁在 API 后面的全模态模型。Kimi K3 开放前沿模型权重时我们写过类似的拆解;H3 就是那个故事的视频版。

2. MiniMax H3 定义

2.1 核心定义

MiniMax H3 是一个通用、全模态的生成系统。它接受由文本、图片、视频和音频组成的多模态上下文,理解这些输入之间的关系,一次前向就生成带原生立体声的视频。这里的「全模态(Omni-Modal)」不是时髦词——它意味着同一个 transformer 同时预测视觉潜变量和音频潜变量,所以音轨是与画面联合生成的,而不是事后补的。

2.2 输出规格

规格

数值

输出时长

4–15 秒

输出分辨率

默认短边 768p;经重生成模块可达 2K

帧率

24 FPS

音频

32 kHz 立体声,随视频一同生成

宽高比

21:9、16:9、4:3、1:1、3:4、9:16 等

支持语言

11 种稳定支持:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语

2.3 H3 不是什么

H3 不是分辨率冠军。它的上限是 2K,而 Kling 3.0、Veo 3.1 这些对手已经原生提供 4K,所以需要影院级交付物的制作公司会另寻他处。它也不是 Sora 或 Seedance 那种纯文生视频模型:它最具辨识度的模式 Ref2VA 最多吃进十二个混合资产——图片、片段和音频——把它们织成一段连贯输出。如果你习惯用「服务什么细分任务」来定义视频模型,H3 更适合理解成它自成一类:一个通用的生成兼编辑系统,它的输入更像一份制作简报,而不是一句画面说明。

3. MiniMax H3 怎么工作

完整的 H3 系统由三个模块组成。H3-Context-IR 是托管的预处理与编排层:解读一份自由形式的多模态简报——解析指令、厘清图片与音频之间的关联、建立时间理解——并把自己的理解序列化成生成器能消费的结构化中间表示。H3-Base 是开放权重生成器:吃进这份表示,产出 768p 的视听结果。H3-Regenerate-2K 把 768p 输出连同原始上下文一起再喂回 H3-Base 自身,借助模型自己的生成能力恢复细部(小字、logo、纹理)——这些细节换作传统超分只能靠猜。

底层来看,H3-Base 是一个 330 亿参数的稠密单流 transformer,其中约 130 亿参数在自适应层归一化(AdaLN)分支里——这些分支在推理时可以预计算并缓存,Hugging Face 模型卡里有记载。文本由构建在 Qwen3-VL-32B 完整预训练权重之上的 H3-Encoder 编码;视觉经过时间因果的 H3-VisualVAE(16× 空间、4× 时间压缩,24 个潜通道);音频经过 H3-AudioVAE,把 32 kHz 音频压成 40 Hz 的 token 流,每个立体声通道分别编码解码。transformer 用三维多模态旋转位置编码(MM-RoPE)表示时间、高度、宽度三个维度的位置,并原生支持长序列的稀疏注意力——不过当前开放版本跑的是全注意力,稀疏注意力的实现承诺在后续更新中推出。

一个值得留意的设计决策是:注意力层和前馈层里没有任何模态专属的结构,所有模态专门化都在输入/输出层和 AdaLN 分支里。这就是为什么单个模型能在文生视频、首尾帧生成和十二资产参考生成之间无缝切换、无需架构级大改——也是为什么 MiniMax 能把整个东西蒸馏成任务专属检查点,每个都自带处理器、tokenizer、文本编码器、视觉 VAE 和音频 VAE。

4. MiniMax H3 vs Seedance 2.0 vs Kling 3.0

自然的对比组是字节的 Seedance 2.0、快手的 Kling 3.0 和 Google 的 Veo 3.1——社区测试里 H3 最常被拿来与这几款较量。下表是简化的:分辨率和价格可以跨产品直接比,但音频质量、剪辑保真度和指令遵从性很难压进一个单元格,所以这几行只作方向性参考。

维度

MiniMax H3

Seedance 2.0

Kling 3.0

最高分辨率

2K(重生成)

2K 级输出

原生 4K

原生音频

有,立体声、联合生成

部分模式可用

可用(Kling 3.0 Turbo)

开放权重

有(H3-Base)

每秒价格

2K 每秒 $0.13

720p 约每秒 $0.24

1080p 带音频约每秒 $1.0

参考输入

最多 12 个混合资产

参考支持有限

运动控制 / 参考视频

视频剪辑

基于指令,名列前茅

电影感画质强

运动控制领先

价格是 H3 真正有颠覆性的地方,也是这次发布最实在的标题:MiniMax 给 2K 输出定价每秒 $0.13、768p 每秒 $0.08(官方目录价,链接见上),而 Seedance 2.0 的 720p 输出接近每秒 $0.24(2026 年 7 月的第三方估算)。说得直白些:比起大多数人原本在用的模型,H3 用更低的单价给了你更高的分辨率。一段 15 秒的 2K 片段,H3 上大约 $1.95;Seedance 上 720p 则要约 $3.60——而如果把「Seedance 还得另接一条音频管线、H3 却同一次请求就带上声音」也计入,差距会更大。

公平地说,H3 并非每个维度都赢。Seedance 2.0 在电影张力和高冲击力动作场面上仍是更强的选择——多位把两者并排测过的中文评测者都认为 H3 的高张力镜头偏弱,这与 H3 刻意用稳定性换视觉奇观的设计取舍一致。Kling 3.0 在高级运动控制上仍占优,并原生提供 4K——这对广播电视级交付很重要。Veo 3.1 虽未入表,仍在多项盲测里领跑纯画面写实度。这场对比的重点不是 H3 全面碾压——而是 H3 在大多数维度能与第一梯队竞争,同时开放权重、价格还低一大截。

5. 「开放权重」到底开放了什么

视频生成领域的开放权重发布有信誉问题,因为过去的承诺常常最后变成「一篇博客 + 一个等候名单」。H3 的发布是真的,但是部分的——这个区别对打算本地部署的人很重要。MiniMaxAI/MiniMax-H3 仓库里可下载的是 H3-Base 模块,分发为两个任务专属检查点(FL2VA 和 Ref2VA),各自自包含处理器、tokenizer、文本编码器、视觉 VAE 和音频 VAE。模型经由 SGLang、vLLM、diffusers 和 ComfyUI 提供服务,推荐四卡 GPU 配置;硬件兼容性从一开始就被列为设计优先项,覆盖华为昇腾、AMD、Intel 等主要芯片厂商,Hugging Face、ModelScope、ComfyUI 等推理平台也在发布当天就绪——见 vLLM 的 H3 recipes 页

不开源的是系统的其余部分。H3-Context-IR 是一个托管的多阶段工作流,依赖多个 MiniMax 服务,所以留在 API 后面;H3-Regenerate-2K 同样尚未发布,只提供了一个 API 用于验证官方 2K 结果。已发布检查点跑全注意力;让长上下文推理变便宜的稀疏注意力实现安排在后续更新。落到实践上:开发者可以在本地部署 H3-Base、复现 768p 结果,也可以把本地生成与 Context-IR API 组合起来逼近完整的 2K 工作流——但端到端的完整体验仍然部分受制于 MiniMax 的服务器。

许可协议是「开放」的另一半。H3 采用 MiniMax H3 社区许可发布:年营收 2,000 万美元以下的组织可免费商用,需署名;非商业使用免费——详见官方 MiniMax H3 许可文本。这个门槛覆盖了大多数独立工作室和自由职业者,但对已融资团队是实打实的约束,所以在它之上做产品之前先读许可文本。任何开放权重模型都一样:「可下载」和「商用不受限」是两个问题。

6. H3 的短板在哪

发布以来社区反馈正面但犀利,批评集中在三个值得认真对待的方向。第一是分辨率:没有 4K 路径,对客户要影院或广电级交付物的团队来说,2K 是天花板而不是卖点。第二是电影张力:多位并排测过 H3 与 Seedance 2.0 的评测者指出,需要极致视觉冲击的镜头在 H3 上更弱——这是它稳定优先设计付出的代价。第三是细部渲染:虽然文字和 logo 渲染比上一代进步巨大,但极小的文字和极其繁复的细节有时仍会崩坏——任何单次生成都别不经过 QA 就当成可交付。

还有一个更微妙的局限,恰恰来自 H3 最大的优点。它的指令遵从非常激进——评测者一致说「你说什么,它做什么」——这对需要精确文字控制的视觉包装工作堪称完美,但也意味着模型偏向忠实执行、而不是发挥性诠释。如果你的创作流程指望模型自己添上电影化的诠释,H3 会让你觉得它太「字面」。另外,对今天就想本地部署的人,Context-IR 模块的缺席是实际瓶颈:你能生成,但要复现托管工作流的完整质量,就得留着一条 API 依赖。

7. 谁该用 MiniMax H3

H3 最明显的适配是那些「一致性 + 迭代速度比剧场奇观更重要」的商业内容创作。广告与品牌团队能把静态海报变成带动态 logo 花字的动效广告;电商团队能生成标签清晰、纹理细节到位的产品视频——这里 2K 输出真有帮助;UI/UX 团队能得到大多数视频模型都会搞砸的可读屏上文字。参考系统——最多十二个资产,组合图片、片段与音频——让它在跨镜头角色一致性上格外强,这也是时尚与美妆 campaign、首尾帧过渡成为流传 demo 案例的原因。

对单人创业者和小型工作室来说,开放权重加上价格,组合成一条三个月前还不存在的工作流:晚上迭代简报,用一杯咖啡的钱生成一段带同步音频的 2K 片段,只有选择自托管时才为 GPU 算力付费。主要的注意事项前面都讲过了——没有 4K、高张力镜头偏弱、开放栈不完整——所以核心业务是电影感的团队,应该让 Seedance 或 Kling 留在轮换里,而不是整体迁移。

8. 结语

MiniMax H3 之所以重要,不是因为它在分辨率竞赛里赢了,而是因为它是视频生成碎片化问题第一个可信的答案。一个开放权重模型,把文本、图片、视频和音频装进同一段上下文,返回带原生声音的连贯 2K 片段——这是真正不同的工具形态,而且价格还压过了闭源对手。取舍是真实的——没有 4K、电影张力偏软、系统只开放一半——但那是第一代通才型产品的取舍,不是一个没交付出来的失败品。

对小团队来说,务实的做法是在决定 API 或自托管之前先跑一段 5 秒测试片:按顺序检查主体一致性、镜头运动和音频,然后再加参考。如果你对更大的图景感兴趣——前沿开放权重进入主流创作工作流——我们对 Kimi K3 开放前沿模型和 vibe-coding 一条提示词游戏两篇的拆解,覆盖了这条弧线的另外两端。在 Agent 那一侧,「一个系统、统一上下文」的同一套哲学正是 agentic calendar 的驱动力——无论输出是一段视频还是一个工作周,你的上下文就是运行时。

常见问题

MiniMax H3 可以免费商用吗?
不可以——非商业使用免费;商用只允许年营收 2,000 万美元以下的组织使用,且需署名。超过该门槛的已融资团队,在交付商业作品前需要审阅 MiniMax H3 社区许可。
MiniMax H3 会生成音频吗?
会。H3 在与视频同一次前向中原生生成 32 kHz 立体声,由预测视觉潜变量的同一个 transformer 驱动。参考音频也可以复用,但音频不能作为唯一输入——它必须伴随至少一张图片或一段视频参考。
我能在本地跑 MiniMax H3 吗?
能用 SGLang、vLLM、diffusers 或 ComfyUI 在本地跑 H3-Base,推荐四卡 GPU 配置。开放发布覆盖全注意力下的 768p 生成;H3-Context-IR 预处理模块与 2K 重生成仍仅限 API,稀疏注意力安排在后续版本。
MiniMax H3 和 Seedance 2.0 比怎么样?
H3 在价格上低于 Seedance(2K 每秒 $0.13,对比 Seedance 720p 约每秒 $0.24 的第三方估算),自带原生立体声,而且开放权重。Seedance 在电影张力与高冲击动作场面上保持优势;需要 4K 的团队应改看 Kling 3.0 或 Veo 3.1。
FL2VA 和 Ref2VA 两个检查点有什么区别?
FL2VA 覆盖文本转音视频,以及首/尾帧转视频(零、一或两张输入图)。Ref2VA 负责带混合输入的参考转视频——单次请求最多 9 张图、3 段视频、3 个音频文件,总量上限 12 个文件。
MiniMax H3 的主要局限有哪些?
没有 4K 路径——2K 是天花板,对要影院或广电级交付的团队是硬约束。高张力、高冲击镜头弱于 Seedance,这是它稳定优先设计的代价。极小文字与极繁复细节仍可能崩坏,任何单次生成都要过一遍 QA。它的指令遵从激进、偏「字面」,忠实执行多于发挥性诠释;而且要在本地复现托管工作流的完整 2K 质量,仍依赖 Context-IR 的 API。

https://floatboat.ai/zh/blog/what-is-minimax-h3