模型介绍
MiniMax H3,让画面、声音与运动统一生成
了解 MiniMax 开放式通用视频模型的多模态导演、原生立体声音频与最高 2K 输出能力。
MiniMax H3 把文本、图片、视频与音频理解为同一个创作上下文。它不再把画面生成和声音设计拆成两套流程,而是根据混合参考素材生成音画同步的结果,让人物、动作、镜头语言、对白、环境声与节奏在一次创作中协同完成。
- 4–15 秒
- 单次输出时长
- 最高 2K
- 最大输出分辨率
- 24 FPS
- 视频帧率
- 32 kHz
- 原生立体声音频
- 12 份
- 混合参考素材上限
- 11 种
- 稳定支持的对白语言
从混合参考素材到完整音画场景
H3-Context-IR
把文本、图片、视频与音频理解为同一组创作指令。
H3-Base
生成音画同步的 768p 视频序列。
H3-Regenerate-2K
重新结合原始上下文,把选中结果再生成至最高 2K。
MiniMax H3 能做什么
用多种媒介共同指导创作
把文本指令与图片、视频、音频参考组合使用。H3 可以理解其中的人物、环境、动作、运镜、视觉风格、声音、音效与剪辑节奏。
同步生成画面与声音
生成 4 至 15 秒、24 FPS 的视频,并原生输出 32 kHz 立体声音频。对白、环境声、音效与画面在同一次生成中保持同步,无需分开制作后再拼接。
控制镜头的起点与终点
可以提供首帧、尾帧或同时提供两者,明确镜头如何开始和结束。这让图生视频的构图更可控,也有助于稳定完成画面之间的过渡。
组合丰富的参考素材
全模态参考版本最多支持 9 张图片、3 段视频和 3 段音频,混合素材总数不超过 12 份。不同素材可以分别承担人物身份、动作、构图、运镜、风格、声音与节奏等职责,不必让一份参考承载所有要求。
适配不同画幅与清晰度
支持常见横屏、方形与竖屏画幅,默认以短边 768 像素生成;还可通过 H3-Regenerate-2K 获得最高 2K 的高分辨率结果。
生成多语言对白
H3 可稳定支持 11 种对白语言,包括中文、英文、日文与韩文,适合面向不同市场制作音画内容。
选择 API 或本地部署
可以通过 MiniMax API 使用完整托管流程,也可以部署已开放的 BF16 H3-Base 权重,在本地完成 768p 的文生音视频、首尾帧生成与多模态参考生成。
模型介绍
H3 系统如何工作
把所有素材组织成统一上下文
H3 使用对应的编码器或 VAE 处理文本、视觉素材与音频,再把它们组织成统一的多模态序列。空间与时间关系会一同进入单流 H3-Omni-Transformer,让模型把“画面里出现什么、如何运动、应该听到什么”理解为同一场景中相互关联的部分。
Context-IR 把参考素材转化为导演指令
H3-Context-IR 是托管的理解与编排层。它会解析指令、建立跨媒介关联、理解时间顺序、推理不同参考素材之间的关系,再把结果转化为生成模型可接收的结构化表示。在不偏离原始意图的前提下,它也会补足描述中缺失或不明确的语义,特别适合处理多份、不同用途的参考素材。
H3-Base 同步生成画面和立体声
H3-Base 负责生成 768p 的音画序列。视觉与音频使用不同的潜空间,但在同一个系统中联合生成:具有时间因果性的 VisualVAE 表达画面细节与运动,AudioVAE 分别处理左右声道,最后重新组合成原生立体声输出。
2K 不是简单放大,而是带上下文再生成
H3-Regenerate-2K 不采用传统的单纯超分辨率方式,而是把 768p 结果连同最初的创作上下文再次交给 H3,以更高分辨率重新生成。模型能够重新查看原始指令与参考素材,因此有机会恢复比像素放大更准确的人物、材质和环境细节。
两套权重对应不同创作方式
H3-Base-FL2VA 支持文生视频,以及可选的首帧、尾帧或首尾帧控制。H3-Base-Ref2VA 面向多模态参考,最多接收 9 张图片、3 段视频与 3 段音频。视频和音频参考每段需为 2 至 15 秒,每类素材总时长不超过 15 秒,且音频不能作为唯一参考类型。
当前开放范围要分清
MiniMax 已开放完整的 H3-Base 模型权重,包括 FL2VA 与 Ref2VA 两套 checkpoint,可用于本地部署、研究与进一步微调。初始开放版本暂不包含托管的 H3-Context-IR 编排系统、H3-Regenerate-2K 与原生稀疏注意力实现,因此要复现官方完整 2K 流程,仍需要配合 MiniMax 服务。
适合怎样的实际创作
H3 可以用于电影感镜头、产品短片、多语言人物场景、音乐驱动画面、广告多版本适配、分镜动态预演与参考驱动变体。它的价值不只是增加一个文生视频入口,而是允许创作者把不同素材分别指定为人物、动作、镜头、声音或节奏依据,再把它们收束成一段完整的音画场景。
导演一个完整的音画场景
- 按顺序写清主体、动作、运镜、环境与时间节奏。
- 为每份参考素材指定明确用途,例如人物、动作、风格、声音或剪辑节奏。
- 当镜头开头或结尾的构图很重要时,使用首尾帧控制。
- 把对白、环境声与音效和画面一起描述,让它们服务于同一个叙事节点。
- 视频与音频参考需保持在 2 至 15 秒;音频必须与图片或视频参考配合使用。
- 先用 768p 快速迭代,再把选中的结果送入 2K 再生成流程。
- 上传参考素材或生成肖像、声音、品牌标识和版权内容前,确认拥有相应权利。
- 先从一个聚焦的场景开始,再逐步增加人物、参考素材与转场。