AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

MiniMax H3 – 오픈 가중치 옴니모달 비디오·오디오 생성 모델

MiniMax H3는 MiniMax가 공개한 오픈 가중치 비디오 생성 모델이다. 텍스트, 이미지, 오디오, 비디오를 입력으로 받아 영상과 32kHz 스테레오 오디오를 함께 생성하며, 로컬 실행과 LoRA 파인튜닝이 가능한 공개 비디오 모델 흐름을 대표한다.

핵심 구조

MiniMax H3는 33B 파라미터 확산 트랜스포머(diffusion transformer) 계열 모델이며, Qwen3-VL-32B를 인코더로 사용한다. Oxen.ai 가이드 기준으로 로컬 실행에는 최소 24GB VRAM을 권장하고, 고정밀 가중치와 긴 생성을 안정적으로 다루려면 50-60GB VRAM 구성이 현실적이다. NF4 양자화와 오프로딩을 쓰면 8GB VRAM 환경까지 낮춘 커뮤니티 경로도 있다.

seedance-2와 비슷하게 H3는 멀티모달 소재를 한 번에 다루는 쪽으로 설계됐다. 차이는 접근성이다. Seedance 2.0은 주로 API 모델로 소비되는 반면, H3는 공개 가중치와 커뮤니티 실행 스택이 빠르게 늘고 있다.

두 가지 생성 모드

모드입력 방식용도
FL2VA첫 프레임·마지막 프레임 이미지 0-2장을 기반으로 비디오와 오디오 생성이미지 한두 장에서 짧은 장면을 만들거나 중간 움직임 보간
Ref2VA참조 이미지 최대 9장, 참조 비디오 최대 3개, 오디오 클립 최대 3개, 총 12개 소재 입력캐릭터·스타일·음성·동작 참조를 유지하는 복합 영상 생성

API 서비스는 보통 사용자 프롬프트 향상, base generation, 업스케일링을 묶은 파이프라인으로 제공한다. 공개 모델을 로컬에서 바로 실행하면 이 중 base generation만 쓰는 경우가 많으므로, API 결과와 비슷한 품질을 내려면 프롬프트 재작성과 업스케일링 단계를 별도로 구성해야 한다.

프롬프트 작성 포인트

H3는 단순 문장도 처리하지만, 안정적인 영상·대사·음향 제어에는 구조화된 장면 명세가 필요하다.

integrated_multimodal_description:
[Shot 1] 장면, 인물, 카메라, 동작, 대사...
[Shot 2] At 00:05.100, 다음 샷...

overall_soundscape:
배경음, 환경음, 효과음...

non_diegetic_music:
음악 사용 여부와 분위기...

실무에서는 다음 규칙이 중요하다.

  • [Shot 1], [Shot 2]처럼 샷을 명시한다.
  • 대사는 <d>[Korean] ...</d>처럼 언어와 함께 감싼다.
  • 컷 전환이 중요하면 At 00:03.500처럼 타임스탬프를 쓴다.
  • 배경음과 비음악적 환경음을 overall_soundscape에 따로 둔다.
  • 로컬 실행에서는 공식 prompt writing guide를 프롬프트 리라이터나 에이전트에 읽혀 구조화하게 하는 편이 낫다.

로컬 실행 생태계

H3 공개 이후 커뮤니티 최적화가 빠르게 붙고 있다.

경로설명
DiffSynth Studio NF48GB VRAM 수준으로 낮춘 양자화 실행 경로
h3.cApple Metal 기반 커맨드라인 도구와 C 라이브러리
MLX 포트Apple Silicon에서 실행하는 커뮤니티 실험
ComfyUI 워크플로음악 박자, 샷 시퀀스, 오디오 싱크를 조합하는 노드 기반 워크플로
Turbo LoRA샘플링 스텝을 줄여 생성 속도를 높이는 LoRA 실험

어디에 적합한가

  • 공개 가중치 기반 영상 생성 모델을 자체 인프라에서 실행하려는 팀
  • 특정 캐릭터, 브랜드 룩, 제품 샷을 LoRA로 학습하려는 크리에이터
  • ComfyUI나 자체 파이프라인에서 오디오 포함 영상 생성을 실험하는 개발자
  • API 모델과 로컬 비디오 모델의 비용·품질·제어권을 비교하려는 연구자

다만 H3는 저사양 로컬 앱에 바로 넣기 쉬운 모델은 아니다. 영상 생성 모델 특성상 GPU 메모리, 디스크, 실행 시간이 모두 크고, API 품질과 로컬 base generation 품질 사이에는 파이프라인 차이가 있다. 제품 적용 전에는 입력 소재 정책, 저작권 리스크, 음성·인물 재현 정책도 함께 검토해야 한다.

관련 문서

  • minimax-m2 — MiniMax의 오픈 MoE 언어 모델 시리즈
  • seedance-2 — ByteDance의 멀티모달 비디오 생성 모델
  • dramaclaw — 대본에서 완성 영상까지 잇는 AIGC 비디오 제작 엔진
  • ai-toolkit — 소비자 GPU에서 이미지·영상 확산 모델을 파인튜닝하는 도구

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)