模型介紹

MiniMax H3,讓畫面、聲音與動作統一生成

了解 MiniMax 開放式通用影片模型的多模態導演、原生立體聲音訊與最高 2K 輸出能力。

MiniMax H3 把文字、圖片、影片與音訊理解為同一個創作脈絡。它不再把畫面生成和聲音設計拆成兩套流程,而是根據混合參考素材生成影音同步的結果,讓人物、動作、鏡頭語言、對白、環境聲與節奏在一次創作中協同完成。

4–15 秒
單次輸出時長
最高 2K
最大輸出解析度
24 FPS
影片幀率
32 kHz
原生立體聲音訊
12 份
混合參考素材上限
11 種
穩定支援的對白語言

從混合參考素材到完整影音場景

01 · 理解

H3-Context-IR

把文字、圖片、影片與音訊理解為同一組創作指令。

02 · 生成

H3-Base

生成影音同步的 768p 影片序列。

03 · 精煉

H3-Regenerate-2K

重新結合原始脈絡,把選中結果再生成至最高 2K。

MiniMax H3 能做什麼

01

用多種媒介共同指導創作

把文字指令與圖片、影片、音訊參考組合使用。H3 可以理解其中的人物、環境、動作、運鏡、視覺風格、聲音、音效與剪輯節奏。

02

同步生成畫面與聲音

生成 4 至 15 秒、24 FPS 的影片,並原生輸出 32 kHz 立體聲音訊。對白、環境聲、音效與畫面在同一次生成中保持同步,不必分開製作後再拼接。

03

控制鏡頭的起點與終點

可以提供首幀、尾幀或同時提供兩者,明確鏡頭如何開始和結束。這讓圖生影片的構圖更可控,也有助於穩定完成畫面之間的過渡。

04

組合豐富的參考素材

全模態參考版本最多支援 9 張圖片、3 段影片和 3 段音訊,混合素材總數不超過 12 份。不同素材可以分別承擔人物、動作、構圖、運鏡、風格、聲音與節奏等用途。

05

適配不同畫幅與清晰度

支援常見橫向、方形與直向畫幅,預設以短邊 768 像素生成;還可透過 H3-Regenerate-2K 獲得最高 2K 的高解析度結果。

06

生成多語言對白

H3 可穩定支援 11 種對白語言,包括中文、英文、日文與韓文,適合面向不同市場製作影音內容。

07

選擇 API 或本機部署

可以透過 MiniMax API 使用完整託管流程,也可以部署已開放的 BF16 H3-Base 權重,在本機完成 768p 的文字生成影音、首尾幀生成與多模態參考生成。

模型介紹

H3 系統如何運作

01

把所有素材組織成統一脈絡

H3 使用對應的編碼器或 VAE 處理文字、視覺素材與音訊,再把它們組織成統一的多模態序列。空間與時間關係會一同進入單流 H3-Omni-Transformer,讓模型把畫面內容、動作與聲音理解為同一場景中彼此關聯的部分。

02

Context-IR 把參考素材轉化為導演指令

H3-Context-IR 是託管的理解與編排層。它會解析指令、建立跨媒介關聯、理解時間順序、推理不同參考素材之間的關係,再轉化為生成模型可接收的結構化表示;在不偏離原始意圖的前提下,也能補足不明確的語義。

03

H3-Base 同步生成畫面和立體聲

H3-Base 負責生成 768p 影音序列。視覺與音訊使用不同的潛空間,但在同一套系統中聯合生成:VisualVAE 表達畫面細節與動作,AudioVAE 分別處理左右聲道,最後重新組合成原生立體聲輸出。

04

2K 是帶著原始脈絡再次生成

H3-Regenerate-2K 並非單純放大像素,而是把 768p 結果連同最初的創作脈絡再次交給 H3,以更高解析度重新生成。模型可以重新查看原始指令與參考素材,恢復更準確的人物、材質和環境細節。

05

兩套權重對應不同創作方式

H3-Base-FL2VA 支援文字生成影片,以及首幀、尾幀或首尾幀控制。H3-Base-Ref2VA 面向多模態參考,最多接收 9 張圖片、3 段影片與 3 段音訊。影片和音訊每段需為 2 至 15 秒,每類總時長不超過 15 秒,且音訊不能是唯一參考類型。

06

目前開放範圍要分清

MiniMax 已開放完整 H3-Base 模型權重,包括 FL2VA 與 Ref2VA checkpoint,可供本機部署與進一步微調。初始版本暫不包含 H3-Context-IR、H3-Regenerate-2K 與原生稀疏注意力實作,因此完整官方 2K 流程仍需配合 MiniMax 服務。

07

適合怎樣的實際創作

H3 適合電影感鏡頭、產品短片、多語言人物場景、音樂驅動畫面、廣告多版本、分鏡動態預演與參考驅動變體。創作者可把不同素材分別指定為人物、動作、鏡頭、聲音或節奏依據,再收束成完整的影音場景。

導演一個完整的影音場景

  • 依序寫清楚主體、動作、運鏡、環境與時間節奏。
  • 為每份參考素材指定明確用途,例如人物、動作、風格、聲音或剪輯節奏。
  • 當鏡頭開頭或結尾的構圖很重要時,使用首尾幀控制。
  • 把對白、環境聲與音效和畫面一起描述,讓它們服務於同一個敘事節點。
  • 影片與音訊參考需保持在 2 至 15 秒;音訊必須與圖片或影片參考配合使用。
  • 先用 768p 快速迭代,再把選中的結果送入 2K 再生成流程。
  • 上傳參考素材或生成肖像、聲音、品牌標誌和版權內容前,確認擁有相應權利。
  • 先從一個聚焦的場景開始,再逐步增加人物、參考素材與轉場。