MiniMax H3는 MiniMax가 공개한 오픈 가중치 비디오 생성 모델이다. 텍스트, 이미지, 오디오, 비디오를 입력으로 받아 영상과 32kHz 스테레오 오디오를 함께 생성하며, 로컬 실행과 LoRA 파인튜닝이 가능한 공개 비디오 모델 흐름을 대표한다.
핵심 구조
MiniMax H3는 33B 파라미터 확산 트랜스포머(diffusion transformer) 계열 모델이며, Qwen3-VL-32B를 인코더로 사용한다. Oxen.ai 가이드 기준으로 로컬 실행에는 최소 24GB VRAM을 권장하고, 고정밀 가중치와 긴 생성을 안정적으로 다루려면 50-60GB VRAM 구성이 현실적이다. NF4 양자화와 오프로딩을 쓰면 8GB VRAM 환경까지 낮춘 커뮤니티 경로도 있다.
seedance-2와 비슷하게 H3는 멀티모달 소재를 한 번에 다루는 쪽으로 설계됐다. 차이는 접근성이다. Seedance 2.0은 주로 API 모델로 소비되는 반면, H3는 공개 가중치와 커뮤니티 실행 스택이 빠르게 늘고 있다.
두 가지 생성 모드
| 모드 | 입력 방식 | 용도 |
|---|---|---|
| FL2VA | 첫 프레임·마지막 프레임 이미지 0-2장을 기반으로 비디오와 오디오 생성 | 이미지 한두 장에서 짧은 장면을 만들거나 중간 움직임 보간 |
| Ref2VA | 참조 이미지 최대 9장, 참조 비디오 최대 3개, 오디오 클립 최대 3개, 총 12개 소재 입력 | 캐릭터·스타일·음성·동작 참조를 유지하는 복합 영상 생성 |
API 서비스는 보통 사용자 프롬프트 향상, base generation, 업스케일링을 묶은 파이프라인으로 제공한다. 공개 모델을 로컬에서 바로 실행하면 이 중 base generation만 쓰는 경우가 많으므로, API 결과와 비슷한 품질을 내려면 프롬프트 재작성과 업스케일링 단계를 별도로 구성해야 한다.
프롬프트 작성 포인트
H3는 단순 문장도 처리하지만, 안정적인 영상·대사·음향 제어에는 구조화된 장면 명세가 필요하다.
integrated_multimodal_description:
[Shot 1] 장면, 인물, 카메라, 동작, 대사...
[Shot 2] At 00:05.100, 다음 샷...
overall_soundscape:
배경음, 환경음, 효과음...
non_diegetic_music:
음악 사용 여부와 분위기...실무에서는 다음 규칙이 중요하다.
[Shot 1],[Shot 2]처럼 샷을 명시한다.- 대사는
<d>[Korean] ...</d>처럼 언어와 함께 감싼다. - 컷 전환이 중요하면
At 00:03.500처럼 타임스탬프를 쓴다. - 배경음과 비음악적 환경음을
overall_soundscape에 따로 둔다. - 로컬 실행에서는 공식 prompt writing guide를 프롬프트 리라이터나 에이전트에 읽혀 구조화하게 하는 편이 낫다.
로컬 실행 생태계
H3 공개 이후 커뮤니티 최적화가 빠르게 붙고 있다.
| 경로 | 설명 |
|---|---|
| DiffSynth Studio NF4 | 8GB VRAM 수준으로 낮춘 양자화 실행 경로 |
| h3.c | Apple Metal 기반 커맨드라인 도구와 C 라이브러리 |
| MLX 포트 | Apple Silicon에서 실행하는 커뮤니티 실험 |
| ComfyUI 워크플로 | 음악 박자, 샷 시퀀스, 오디오 싱크를 조합하는 노드 기반 워크플로 |
| Turbo LoRA | 샘플링 스텝을 줄여 생성 속도를 높이는 LoRA 실험 |
어디에 적합한가
- 공개 가중치 기반 영상 생성 모델을 자체 인프라에서 실행하려는 팀
- 특정 캐릭터, 브랜드 룩, 제품 샷을 LoRA로 학습하려는 크리에이터
- ComfyUI나 자체 파이프라인에서 오디오 포함 영상 생성을 실험하는 개발자
- API 모델과 로컬 비디오 모델의 비용·품질·제어권을 비교하려는 연구자
다만 H3는 저사양 로컬 앱에 바로 넣기 쉬운 모델은 아니다. 영상 생성 모델 특성상 GPU 메모리, 디스크, 실행 시간이 모두 크고, API 품질과 로컬 base generation 품질 사이에는 파이프라인 차이가 있다. 제품 적용 전에는 입력 소재 정책, 저작권 리스크, 음성·인물 재현 정책도 함께 검토해야 한다.
관련 문서
- minimax-m2 — MiniMax의 오픈 MoE 언어 모델 시리즈
- seedance-2 — ByteDance의 멀티모달 비디오 생성 모델
- dramaclaw — 대본에서 완성 영상까지 잇는 AIGC 비디오 제작 엔진
- ai-toolkit — 소비자 GPU에서 이미지·영상 확산 모델을 파인튜닝하는 도구
참고 자료
- MiniMax H3: Open Weights & Prompting Techniques Complete Guide — Oxen.ai (2026-08-11)
- MiniMaxAI/MiniMax-H3 prompt writing guide — Hugging Face
- DiffSynth-Studio/MiniMax-H3-NF4 — Hugging Face