모델 소개

MiniMax H3, 영상과 소리, 움직임을 하나의 생성으로

MiniMax의 개방형 범용 영상 모델이 제공하는 멀티모달 연출, 네이티브 스테레오 오디오, 최대 2K 출력을 살펴보세요.

MiniMax H3는 텍스트, 이미지, 영상, 오디오를 하나의 창작 맥락으로 이해합니다. 영상 생성과 사운드 디자인을 분리하지 않고 혼합된 레퍼런스를 해석해 동기화된 시청각 결과를 만듭니다. 인물, 움직임, 카메라 언어, 목소리, 환경음, 리듬을 하나의 흐름에서 연출할 수 있습니다.

4~15초
출력 길이
최대 2K
최대 출력 해상도
24 FPS
영상 프레임 레이트
32 kHz
네이티브 스테레오 오디오
12개
혼합 레퍼런스 파일 한도
11개
안정적으로 지원하는 대사 언어

혼합 레퍼런스에서 하나의 완성 장면까지

01 · 이해

H3-Context-IR

텍스트, 이미지, 영상, 오디오를 하나의 연출 맥락으로 읽습니다.

02 · 생성

H3-Base

영상과 소리가 동기화된 768p 시퀀스를 생성합니다.

03 · 정교화

H3-Regenerate-2K

원래 맥락을 다시 참고해 선택한 결과를 최대 2K로 재생성합니다.

MiniMax H3의 핵심 기능

01

여러 미디어로 함께 연출

텍스트 지시에 이미지, 영상, 오디오 레퍼런스를 결합하세요. H3는 인물, 환경, 움직임, 카메라, 비주얼 스타일, 목소리, 효과음, 편집 리듬을 이해할 수 있습니다.

02

영상과 소리를 동시에 생성

4~15초, 24 FPS 영상과 네이티브 32 kHz 스테레오 오디오를 생성합니다. 대사, 환경음, 효과음, 영상을 따로 만든 뒤 조립하지 않고 하나의 동기화된 결과로 출력합니다.

03

시작과 끝 프레임 제어

첫 프레임, 마지막 프레임 또는 둘 다 사용해 숏이 어떻게 시작하고 끝날지 고정할 수 있습니다. 이미지 투 비디오의 구도와 전환을 더 의도적으로 설계할 수 있습니다.

04

풍부한 레퍼런스 조합

옴니 레퍼런스 모델은 이미지 9장, 영상 3개, 오디오 3개, 총 12개 파일까지 받을 수 있습니다. 각 소재에 인물, 움직임, 구도, 카메라, 스타일, 목소리, 리듬처럼 서로 다른 역할을 지정할 수 있습니다.

05

다양한 화면비와 해상도 지원

일반적인 가로, 정사각형, 세로 화면비를 지원하며 기본적으로 짧은 변 768픽셀로 생성합니다. H3-Regenerate-2K를 통해 최대 2K 고해상도 결과도 만들 수 있습니다.

06

다국어 대사 생성

한국어, 중국어, 영어, 일본어를 포함한 11개 언어의 대사를 안정적으로 지원해 여러 시장을 위한 시청각 콘텐츠 제작에 활용할 수 있습니다.

07

API 또는 로컬 배포 선택

MiniMax API로 전체 호스팅 워크플로를 사용하거나 공개된 BF16 H3-Base 체크포인트를 배포해 768p 텍스트·오디오·영상 생성, 시작·종료 프레임 생성, 멀티모달 레퍼런스 생성을 실행할 수 있습니다.

모델 소개

H3 시스템의 작동 방식

01

모든 소재를 하나의 맥락으로 통합

H3는 텍스트, 시각 자료, 오디오를 각각의 인코더나 VAE로 처리한 뒤 하나의 멀티모달 시퀀스로 구성합니다. 공간과 시간 관계를 단일 스트림 H3-Omni-Transformer에 전달해 화면에 무엇이 나타나고, 어떻게 움직이며, 무엇이 들려야 하는지를 같은 장면의 연결된 요소로 이해합니다.

02

Context-IR가 레퍼런스를 연출 지시로 변환

H3-Context-IR는 호스팅되는 이해 및 오케스트레이션 계층입니다. 지시를 분석하고 미디어 간 관계와 시간 순서를 파악하며 레퍼런스 사이의 논리를 추론한 뒤 생성용 구조화 표현으로 변환합니다. 원래 의도를 유지하면서 불충분한 의미 정보를 보완할 수도 있습니다.

03

H3-Base가 영상과 스테레오를 동기 생성

H3-Base는 768p 시청각 시퀀스를 만듭니다. 영상과 오디오는 서로 다른 잠재 공간을 사용하지만 같은 시스템에서 함께 생성됩니다. VisualVAE가 영상 디테일과 움직임을 표현하고 AudioVAE가 좌우 채널을 각각 처리한 뒤 네이티브 스테레오 출력으로 결합합니다.

04

2K는 단순 확대가 아닌 재생성

H3-Regenerate-2K는 768p 결과와 원래의 창작 맥락을 H3에 다시 넣어 더 높은 해상도로 시퀀스를 재생성합니다. 원본 지시와 레퍼런스를 다시 참고하므로 픽셀 기반 업스케일링보다 인물, 재질, 환경의 세부 표현을 더 정확하게 복원할 수 있습니다.

05

두 체크포인트의 역할

H3-Base-FL2VA는 텍스트 생성과 첫 프레임, 마지막 프레임 또는 양쪽 프레임 제어를 지원합니다. H3-Base-Ref2VA는 이미지 9장, 영상 3개, 오디오 3개까지 지원합니다. 영상과 오디오는 각각 2~15초, 유형별 총 길이는 15초 이하여야 하며 오디오만 단독 레퍼런스로 쓸 수 없습니다.

06

현재 공개된 범위

MiniMax는 FL2VA와 Ref2VA를 포함한 H3-Base 전체 모델 가중치를 공개해 로컬 배포와 파인튜닝을 지원합니다. H3-Context-IR, H3-Regenerate-2K, 네이티브 희소 어텐션 구현은 초기 공개 버전에 포함되지 않아 공식 전체 2K 흐름에는 MiniMax 서비스가 필요합니다.

07

실제 제작에서의 활용

시네마틱 숏, 제품 영상, 다국어 인물 장면, 음악 중심 비주얼, 광고 버전 제작, 스토리보드 모션 테스트, 레퍼런스 기반 변형에 적합합니다. 서로 다른 소재에 인물, 동작, 카메라, 사운드, 리듬의 역할을 나눠 주고 하나의 일관된 시청각 장면으로 통합할 수 있습니다.

하나의 일관된 시청각 장면 연출하기

  • 대상, 동작, 카메라 움직임, 환경, 시간 흐름을 명확한 순서로 작성하세요.
  • 각 레퍼런스에 인물, 움직임, 스타일, 목소리, 편집 리듬 같은 구체적인 역할을 부여하세요.
  • 숏의 시작이나 끝 구도가 중요하면 첫 프레임과 마지막 프레임 제어를 사용하세요.
  • 대사, 환경음, 효과음을 영상과 함께 설명해 같은 극적 순간을 향하도록 만드세요.
  • 영상과 오디오 레퍼런스는 2~15초로 준비하고 오디오는 이미지나 영상 레퍼런스와 함께 사용하세요.
  • 768p로 빠르게 반복한 뒤 선택한 결과를 2K 재생성 워크플로로 보내세요.
  • 레퍼런스, 초상, 목소리, 로고, 저작물을 사용하기 전에 필요한 권리를 확인하세요.
  • 하나의 집중된 장면부터 시작하고 인물, 레퍼런스, 전환을 단계적으로 늘리세요.