MiniMax H3 포즈·깊이 제어: 기능, 작동 원리, 활용 시점
Vincent9분 읽기 ·

MiniMax H3 포즈·깊이 제어는 Fun ControlNet으로 움직임과 공간 구조를 더 정밀하게 제어합니다. Pose는 신체 자세와 움직임을 제약하고, Depth는 장면 기하 구조, 피사체 위치, 카메라 기준 상대 구조를 제약합니다. 따라서 정체성, 움직임, 기하 구조, 창작 방향을 분리해 H3가 참조 하나로 모든 것을 추론하지 않아도 됩니다.
문제는 참조를 이해하는 것과 정확히 재현하는 것은 다르다는 점입니다. 캐릭터 교체, 춤 전이, 모션 리타기팅에서 타이밍, 신체 위치, 크기, 카메라 거리의 작은 오차가 이탈과 반복 생성을 유발할 수 있습니다.
Pose와 Depth는 입력마다 역할을 명확히 해 H3를 더 쉽게 지휘할 수 있게 합니다. Reference는 외형과 정체성을 제어하고, Pose는 움직임, Depth는 공간 기하 구조, 프롬프트는 창작 방향을 제어합니다. 참조를 시각적으로 관리하려는 팀을 위해 Virse는 AI 에이전트, 연결된 자산, 프로젝트 맥락을 무한 캔버스에 모아, 매번 생성을 고립된 프롬프트로 취급하지 않고 제어형 H3 워크플로를 쉽게 정리하고 반복 개선하도록 돕습니다. MiniMax H3, Seedance 2.5와 Seedance 2.0는 이제 Virse에서 사용할 수 있어, 같은 창작 워크플로에서 여러 주요 영상 모델을 탐색하고 비교할 수 있습니다.

MiniMax H3 포즈·깊이 제어란?
MiniMax H3 Pose Control은 신체 자세와 움직임을, Depth Control은 공간 기하 구조와 카메라 기준 상대 구조를 제약합니다. 이 기능은 H3 최초 출시 기능이 아니라 MiniMax-H3-Fun-Controlnet-Union에서 제공됩니다.
Fun ControlNet 체크포인트는 약 6.8 GB이며, H3의 Transformer 블록 50개 중 5개에 제어 분기를 추가합니다. 하나의 통합 체크포인트로 여러 구조 조건을 지원할 수 있습니다.
제어 | 적합한 용도 | 주요 제약 |
Pose | 춤, 액션, 캐릭터 교체 | 신체 움직임 |
Depth | 장면 구도, 카메라 거리 | 3D 기하 구조 |
Canny | 스케치 기반 애니메이션 | 윤곽과 배치 |
HED | 더 부드러운 구조 안내 | 물체 경계 |
MLSD | 건축, 제품 | 직선 |
중요한 설계 변화는 창작자가 구조적으로 고정할 부분과 H3가 창의적으로 재해석할 부분을 결정할 수 있다는 점입니다.
MiniMax H3 Reference Video와 Pose Control의 차이는?
가장 명확한 차이는 다음과 같습니다.
Reference Video는 의미적 안내를 제공하고, Pose와 Depth는 구조적 제약을 제공합니다.
H3의 참조 시스템은 여러 이미지·영상·오디오 입력을 다뤄 캐릭터 외형, 행동, 장면, 표정, 카메라 동작을 잘 이해합니다.
H3 Reference Video만으로 충분한 경우
Reference Video는 전체 연기나 시각적 의도를 옮기면서 H3가 결과를 재해석할 자유를 일부 남길 때 유용합니다.
기록된 H3 워크플로를 검토한 결과 반복되는 한계가 드러났습니다. 동작을 이해하는 것과 타이밍·신체 위치를 정확히 재현하는 것은 다릅니다.
이는 창의적 탐색에서는 흔히 허용할 수 있지만, 안무나 피사체 배치가 엄격한 요구 사항이면 허용하기 어려워집니다.
H3 Pose Control이 더 나은 경우
Pose는 다음처럼 움직임 자체가 일관돼야 할 때 더 유용합니다.
- 춤 전이;
- 배우 교체;
- 걷기 또는 달리기 주기;
- 애니메이션 블로킹;
- 모션 리타기팅.
다음과 같이 이해하면 도움이 됩니다.
Reference는 피사체가 누구인지, Pose는 무엇을 하는지, Depth는 공간 어디에 있는지를 제어합니다.
MiniMax H3 Pose와 Depth: 무엇을 사용해야 할까요?
Pose와 Depth는 다른 문제를 해결하며, 피사체 크기도 각 제어의 유용성에 영향을 줍니다.
한 테스트에서 작은 캐릭터에 Pose가 더 잘 작동한 이유
기록된 한 워크플로는 1280 × 704로 생성해 약 40 × 22의 잠재 공간 격자를 만들었습니다. 캐릭터는 약 세로 잠재 위치 22개 중 3개만 차지했습니다.
이 경우 Depth에서는 인물이 카메라 쪽으로 이동하며 커지는 현상이 남았지만, Pose는 피사체 위치를 더 안정적으로 유지했습니다.
이를 ‘Pose가 항상 Depth보다 낫다’고 일반화하면 안 됩니다. 작은 피사체는 다운샘플링 후 상대적으로 약한 깊이 정보만 제공할 수 있다는 뜻입니다.
Depth가 더 나은 선택인 경우
Depth는 다음에 더 적합합니다.
- 전경과 배경의 관계;
- 카메라에 다가가거나 멀어지는 움직임;
- 방과 환경;
- 큰 제품;
- 사람이 아닌 물체;
- 장면 기하 구조.
따라서 올바른 질문은 ‘Pose인가 Depth인가?’가 아니라 ‘관절 움직임을 고정할 것인가, 공간 기하 구조를 고정할 것인가?’입니다.
Pose Control이 H3 캐릭터 교체와 모션 리타기팅을 바꾸는 방식
캐릭터 교체는 특히 효과적인 용도입니다. Fun ControlNet이 외형 전이와 동작 전이를 분리하도록 돕기 때문입니다.
반복되는 사용자 질문을 검토해 세 가지 흔한 문제를 확인했습니다.
- 교체된 캐릭터가 원본 연기를 충분히 충실하게 따르지 않습니다.
- 복잡한 움직임에서 정체성이 불안정해집니다.
- 원래 연기자의 시각적 특징이 새 캐릭터에 섞입니다.
Pose만으로 정체성을 해결하지는 못합니다. 대신 각 입력의 역할을 명확히 합니다.
목표 캐릭터 → Reference
원본 연기 → Pose
장면 기하 구조 → 필요 시 Depth
창작 스타일 → 프롬프트
이는 전문적인 설계 시스템에 더 가깝습니다. 움직임이 틀리면 움직임을, 외형이 틀리면 참조를 조정합니다. 모든 변수를 한꺼번에 바꿀 필요가 없습니다.
과도한 제어 없이 H3 Pose와 Depth를 조정하는 방법
조건을 더 많이 준다고 제어가 자동으로 좋아지지는 않습니다.
Pose와 Depth를 공유 제어 예산으로 취급하기
한 다중 제어 워크플로에서 Pose 강도 1.0과 Depth 강도 1.0의 조합은 눈에 띄는 포화를 일으켰습니다. 단일 제어를 약 1.6으로 올려도 구조 문제는 해결되지 않고 시각적 품질이 낮아졌습니다.
더 안전한 방법은 가장 중요한 제어를 먼저 선택하고 보조 제어를 점진적으로 추가하는 것입니다.
제어 시점은 강도만큼 중요합니다
확산 후반에도 제어가 너무 강하면 구조 제어가 역효과를 낼 수 있습니다.
기록된 한 테스트에서는 약 샘플링 일정의 60%에서 제어를 끝내면 중요한 구조를 보존하면서 후반 단계가 질감과 표면 세부를 회복할 자유를 얻었습니다.
실무 원칙은 간단합니다.
초반 단계에서 구조를 확립하고, 후반 단계에는 이미지를 완성할 충분한 자유를 줍니다.
아직 보편적인 강도나 종료 비율을 권할 만큼 표준화된 테스트가 충분하지 않습니다.

MiniMax H3 VRAM 요구 사항과 참조 영상 메모리
H3는 소비자용 GPU에서도 실행되지만, 최소 VRAM과 쾌적한 제작에 필요한 VRAM은 다릅니다.
GPU | 작업 부하 | 관측 시간 |
RTX 3060 12GB | 480p, 5초, 20단계 | 9분 미만 |
RTX 4070 Ti 12GB | 0.4MP, 15초 | 약 18분 |
RTX 4070 Ti 12GB | 0.2MP, 15초 | 7분 미만 |
RTX 3060 12GB | 약 2MP, 5초 이미지→영상 | 약 25분 |
조사에서는 실행 가능한 8GB 및 6GB 워크플로도 찾았지만, 양자화, 오프로딩, 단계별 로딩, 시스템 RAM에 더 크게 의존합니다.

참조 길이가 숨은 VRAM 병목이 될 수 있습니다
특히 유용한 12GB 사례는 다음과 같았습니다.
- 20초 참조 → 0.4–0.5MP에서 약 5초 출력
- 5초 참조 → 0.4MP에서 약 15초 출력
긴 참조는 워크플로를 반복해서 메모리 부족(OOM)에 가깝게 몰았습니다.
중요한 교훈은 조건부 제어 미디어도 메모리 예산에 포함된다는 것입니다. H3의 VRAM이 부족하면 최종 출력 품질을 낮추기 전에 참조를 줄이세요.

MiniMax H3 GPU 성능과 RunPod 비용
비교 가능한 워크플로 데이터는 VRAM 증가가 H3 생성 속도 향상으로 선형적으로 이어지지 않는다는 점도 보여줍니다.
GPU | VRAM | 약 5초 영상 생성 시간 |
로컬 RTX 3090 | 24GB | 14분 36초 |
클라우드 RTX 3090 | 24GB | 16분 05초 |
클라우드 RTX 4090 | 24GB | 6분 47초 |
클라우드 RTX 5090 | 32GB | 4분 59초 |
RTX PRO 6000 | 96GB | 3분 36초 |
이 사례에서 VRAM 용량이 같아도 4090은 3090보다 두 배 넘게 빨랐습니다.
최적화된 RTX 4090 H3 워크플로에서 INT8, SageAttention, Turbo LoRA, 8단계, 약 0.9MP, 10초 출력을 사용했을 때 약 9–10분이 걸렸고, 해당 클라우드 구성에서 추정 연산 비용은 약 생성 1회당 $0.12였습니다.
이는 보편적인 H3 가격이 아닙니다. 더 유용한 지표는 사용 가능한 클립당 비용입니다.
메모리 최적화와 속도 최적화도 구분해야 합니다. 기록된 한 5090 워크플로는 모델 구성요소 최적화로 공유 GPU 메모리를 약 14GB줄였지만 순수 생성 속도는 거의 바뀌지 않았습니다. 양자화, CUDA/Triton 변경, 어텐션 최적화를 결합한 다른 4090 구성에서는 약 2.6배의 전체 속도 향상이 보고됐습니다.

가장 좋은 저비용 H3 워크플로는?
가장 확실한 비용 최적화는 대개 최종 샷을 렌더링하기 전 미리보기입니다.
- 먼저 1–2초 저해상도 미리보기를 생성합니다.
- 프레이밍과 피사체 크기를 확인합니다.
- Pose가 의도한 움직임을 실제로 따르는지 확인합니다.
- Depth가 도움이 되는지, 샷을 지나치게 제약하는지 평가합니다.
- 정체성과 전체 시각적 방향을 확인합니다.
- 구조가 안정된 뒤에만 길이와 해상도를 높입니다.
한 12GB 워크플로에서 짧은 미리보기는 약 1분 이내에 끝났지만 전체 시퀀스에는 여러 분이 걸렸습니다.
이는 전문 디자인의 기본 원칙인 마무리에 투자하기 전 구조 검증을 따릅니다.
H3 ControlNet에서 가장 흔한 문제는?
Fun ControlNet은 정밀도를 높이지만 새로운 오류 유형도 만듭니다.
워크플로 검토에서 확인한 흔한 문제는 다음과 같습니다.
- 치수 불일치;
- 잘못된 프레임 수;
- 텐서 형태 불일치;
- 체크포인트 비호환;
- 잘못된 제어 배치;
- 어텐션 백엔드 충돌;
- 알림 없이 작동을 멈추는 제어 신호.
특히 유용한 어텐션 테스트는 동일한 90프레임, 1280 × 704워크플로를 비교했습니다.
- 표준 어텐션: 332초
- Morton 재정렬 없는 Sol-Attn: 220초
- Morton 재정렬을 적용한 Sol-Attn: 240초
마지막 구성도 그럴듯한 영상을 생성했지만, 구조 제어는 사실상 사라졌습니다. 토큰 순서가 더 이상 올바르게 정렬되지 않았기 때문입니다.
따라서 새 ControlNet 구성마다 간단한 동일 시드의 제어 켜기·끄기 A/B 테스트가 필요합니다.

Pose와 Depth 제어로도 해결할 수 없는 것
Pose와 Depth는 구조 제어를 개선하지만 다음을 자동 보장하지 않습니다.
- 완벽한 얼굴 정체성;
- 의상 일관성;
- 긴 영상의 색 안정성;
- 완벽한 손;
- 더 적은 VRAM 사용;
- 더 빠른 생성;
- 재생성 없이 끝내기.
긴 영상의 연속성은 여전히 특히 어렵습니다. 기록된 한 워크플로는 약 10초 구간을 생성한 뒤 마지막 2초, 즉 24 FPS에서 약 48프레임을 다음 구간의 참조로 재사용했습니다.
이 방식은 약 2분까지 이어졌지만 점진적 색 변화가 여전히 보였습니다.
이 구분은 중요합니다. 동작 일관성과 시각적 일관성은 관련돼 있지만 같은 문제는 아닙니다.

결론
MiniMax H3 포즈·깊이 제어가 중요한 이유는 Fun ControlNet이 H3를 더 모듈화된 영상 워크플로로 만들기 때문입니다. Reference는 정체성과 외형, Pose는 관절 움직임, Depth는 공간 기하 구조, 프롬프트는 창작 방향을 담당할 수 있습니다. 기록된 사례는 신중한 제작 관점의 판단이 여전히 필요한 이유도 보여줍니다. 다중 제어는 포화될 수 있고, 작은 피사체는 Depth에 다르게 반응하며, 긴 참조는 많은 VRAM을 사용하고, 어텐션 최적화는 조용히 제어를 깨뜨릴 수 있으며, 하드웨어 성능은 구성마다 크게 다릅니다. 따라서 진정한 개선은 단순히 ‘더 많은 제어’가 아니라 움직임·기하 구조·외형을 별도 창작 변수로 진단하고 지휘하며 반복 개선하는 능력입니다.
자주 묻는 질문
H3는 Pose와 Depth를 기본 지원하나요?
아니요. Pose와 Depth는 H3 최초 출시의 기본 기능에 포함되지 않았습니다. 이후의 Fun ControlNet 확장으로 추가되며, 이 확장은 Canny, HED, MLSD 같은 구조 제어도 지원합니다.
H3 Reference Video와 Pose Control의 차이는 무엇인가요?
Reference Video는 H3에 연기에 관한 풍부한 의미적 지침을 주고, Pose는 더 명시적인 신체 동작 제약을 제공합니다. 창의적 해석이 허용되면 Reference를, 안무나 피사체 움직임이 명확한 구조를 따라야 하면 Pose를 사용하세요.
H3 Pose로 캐릭터 정체성을 유지할 수 있나요?
단독으로는 안 됩니다. Pose는 신체 구조와 움직임을 제어할 뿐 캐릭터 정체성을 제어하지 않습니다.이때 캐릭터 교체에는 외형·정체성용 Reference와 동작용 Pose를 쓰고, 더 강한 공간 제어가 필요하면 Depth를 추가하세요.
H3는 12GB VRAM에서 실행되나요?
네. 기록된 RTX 3060 및 RTX 4070 Ti H3 워크플로는 12GB VRAM으로 H3를 실행할 수 있음을 보여줍니다. 다만 해상도, 길이, 참조 길이, 양자화, 오프로딩이 성능에 큰 영향을 줍니다. 저용량 VRAM 워크플로는 실험에 실용적이지만 고용량 제작 구성보다 더 많은 타협이 필요합니다.
Virse 블로그의 다른 글
워크플로

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026년 10월 9일 by Yifan Zhao
워크플로

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026년 10월 9일 by Yifan Zhao
워크플로

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026년 10월 9일 by Yifan Zhao