MiniMax H3 사용법: ComfyUI, 프롬프트, 참조, 오디오, 성능 완전 가이드

Yifan ZhaoYifan Zhao10분 읽기 ·

MiniMax H3 사용법: ComfyUI, 프롬프트, 참조, 오디오, 성능 완전 가이드

먼저 MiniMax H3를 효과적으로 사용하려면, 텍스트 중심 생성에는 T2V, 기존 이미지로 장면의 기준을 잡을 때는 I2V, 정체성·동작·카메라·스타일·목소리를 더 정밀하게 제어할 때는 R2V를 선택하세요. ComfyUI에서는 짧은 저해상도 테스트로 시작하고 프롬프트와 참조를 다듬은 뒤, 샷이 제대로 나온 후 품질을 높이세요. 이렇게 하면 체계적인 MiniMax H3 워크플로도 관리하기 쉽습니다. 모델의 실제 강점과 한계는 MiniMax H3 리뷰에서 더 자세히 확인할 수 있습니다.

어려운 부분은 H3가 생성하게 만드는 일이 아니라 반복 재현 가능하고 제작에 쓸 수 있는 결과를 얻는 일입니다. 잘못된 체크포인트는 참조 효과를 약화하고, 모호한 프롬프트는 다른 인물에게 대사를 배정하며, 고해상도 테스트는 실패한 시도마다 비용을 키웁니다. 좋은 MiniMax H3 프롬프트는 모호함을 줄이고, 엄격한 H3 제작 워크플로는 콘셉트, 정체성, 행동, 카메라, 오디오, 최종 품질을 각각 시험할 수 있는 결정으로 나눕니다.

Virse는 이처럼 넓은 창작 과정을 쉽게 관리하도록 돕습니다. AI 작업을 별개 채팅에 가두는 대신 무한 캔버스에서 참조, 에셋, 결정을 정리하고 여러 에이전트가 프로젝트 맥락을 공유하며 작업할 수 있습니다. 제품 설계도 팀 선호, 브랜드 기준, 이전 창작 맥락을 학습하는 데 집중해 AI 생성을 또 다른 단절된 도구가 아닌 일관된 AI 디자인 워크플로의 일부로 만들고자 합니다. 또한 AI 디자인 에이전트는 더 긴밀하게 연결된 창작 흐름을 지원할 수 있습니다.

Virse 창작 에셋 탐색 화면 스크린샷

ComfyUI에서 MiniMax H3 사용하는 방법

MiniMax H3는 옴니모달 영상 생성 시스템으로, 텍스트·이미지·영상·오디오를 이해하고 영상과 스테레오 오디오를 함께 생성합니다. ComfyUI는 공개 가중치 기반 네이티브 T2V, I2V, R2V 워크플로를 제공하며, 현재 문서는 ComfyUI 0.30.0 이상을 요구합니다. 따라서 공식 템플릿 라이브러리가 가장 간단한 시작점입니다. 처음 설정한다면 이 MiniMax H3 사용 가이드에서 전체 과정을 확인하세요.

첫 생성은 다음 순서로 진행하면 실용적입니다.

  1. ComfyUI를 업데이트합니다.
  2. Template Library(템플릿 라이브러리) → Video → MiniMax H3를 엽니다.
  3. T2V, I2V, R2V 중 하나를 선택합니다.
  4. 올바른 확산 모델과 필요한 인코더·VAE를 불러옵니다.
  5. 짧은 미리보기를 생성합니다.
  6. 정체성, 동작, 카메라 방향, 대사, 오디오를 확인합니다.
  7. 한 번에 주요 변수 하나만 바꿉니다.
  8. 샷이 안정적으로 나온 후 해상도를 높입니다.

어떤 MiniMax H3 모델이 필요한가요?

T2V, I2V, 첫·마지막 프레임 생성에는 FL2VA를, 참조 기반 R2V에는 Ref2VA를 사용합니다. 두 워크플로 모두 Qwen3-VL 텍스트 인코더와 H3 영상·오디오 VAE가 필요합니다. ComfyUI 문서에서 이 체크포인트 구분을 명시하므로, 참조가 무시되는 것처럼 보이면 먼저 확산 모델을 확인하세요.

MiniMax H3: T2V·I2V·R2V 비교

워크플로

적합한 용도

주요 제어 입력

T2V

콘셉트 탐색과 새로운 장면

텍스트

I2V

기존 구도에 움직임 부여

첫 이미지

첫·마지막 프레임

계획된 전환

시작 및 종료 프레임

R2V

정체성, 동작, 카메라, 스타일, 목소리의 일관성

멀티모달 참조

선택 기준은 탐색이 중요하면 T2V, 구도가 중요하면 I2V, 일관성이 중요하면 R2V입니다. R2V를 단순히 더 강한 I2V로 보는 것은 흔한 실수입니다. 모델 가중치가 다르고 더 명확한 참조 전략이 필요하기 때문입니다.

더 좋은 MiniMax H3 프롬프트 작성법

좋은 MiniMax H3 프롬프트는 이미지 생성 지시보다 시청각 제작 기획서에 가깝습니다. MiniMax 공식 가이드는 멀티모달 샷 설명, 전체 사운드스케이프, 극중 세계 밖에서 더하는 음악을 중심으로 생성 구조를 잡습니다. 따라서 시각 연출과 오디오를 함께 계획해야 합니다. MiniMax H3 프롬프트 가이드는 이러한 지시를 더 체계적으로 구성하는 데 도움이 됩니다.

MiniMax H3 프롬프트는 샷 단위로 작성하세요

장면과 초기 구도를 먼저 정하고, 이후 시간에 따라 관찰할 수 있는 행동과 카메라 움직임을 설명하세요. 여러 샷의 영상에서는 공식 가이드가 타임스탬프 없는 Shot 1을 사용하고 이후 샷에는 명시적 컷 시간을 붙입니다. 시간 구간은 스토리보드 계획에 유용하지만 문서에 규정된 최종 형식은 아닙니다.

다음 순서로 계획하면 유용합니다.

참조 역할 → 샷 → 피사체 → 행동 → 카메라 → 대사 → 효과음 → 사운드스케이프 → 음악

단순히 ‘영화 같은 제품 공개’를 요청하지 말고 변화를 구체화하세요. 카메라가 제품으로 천천히 다가가고, 피사체가 제품을 빛 쪽으로 돌리며, 기계적인 클릭음이 들린 뒤 다음 샷이 세부 클로즈업으로 전환되는 식입니다.

MiniMax H3 대사와 오디오 제어

H3는 영상과 함께 대사, 환경음, 효과음, 음악을 생성합니다. MiniMax는 샷 사이에 화자 정체성을 안정적으로 유지할 것을 권장하며, 두 명 이상이 등장할 때 특히 중요합니다.

실제 사용자 질문을 검토한 결과, 잘못된 화자의 대사와 의도하지 않은 입술 움직임이 반복적으로 나타났습니다. 각 화자의 정체성, 행동, 대사를 밀접하게 연결하세요. 내레이션은 화면 밖 목소리라고 명시하고 화면에 보이는 인물은 말하지 않아야 한다고 분명히 지정하세요.

MiniMax H3 R2V 참조로 일관성을 높이는 방법

MiniMax H3 R2V는 최대 참조 이미지 9개, 참조 영상 3개, 참조 오디오 3개를 지원하며, 전체 참조 집합의 합계는 최대 12개 파일입니다. 모델 문서에서 이 제한을 확인할 수 있지만, 수량을 모두 채우는 것이 목표일 필요는 거의 없습니다.

MiniMax H3 R2V 참조 수 제한


더 좋은 원칙은 각 참조에 주요 책임 하나를 부여하는 것입니다.

예를 들면 다음과 같습니다.

  • 이미지 1은 인물 정체성을 제어합니다.
  • 이미지 2는 환경이나 시각 스타일을 제어합니다.
  • 영상 1은 움직임과 카메라를 제어합니다.
  • 오디오 1은 목소리를 제어합니다.

MiniMax의 전체 참조 가이드는 피사체, 이미지 기준점, 영상 구조, 오디오 신호를 구분합니다. 이는 참조 관계를 암시하는 대신 명시해야 한다는 원칙을 뒷받침합니다.

MiniMax H3 R2V 참조 용량


MiniMax H3 ref_image_size: match와 max

ComfyUI는 두 가지 실용적인 참조 이미지 전략을 제공합니다. match는 속도를 우선하며 참조 이미지를 생성 해상도에 가깝게 조정합니다. 반면 max는 짧은 변을 최대 2048픽셀까지 유지하여 정체성 재현도를 높이지만 처리 비용이 증가합니다.

얼굴, 제품, 세밀한 캐릭터 에셋에는 반복 속도가 느려져도 max가 가치 있을 수 있습니다. 환경이나 전반적인 스타일 참조는 보통 match에서 시작하는 편이 효율적입니다.

MiniMax H3 해상도: 로컬 768p와 2K 출력

‘MiniMax H3는 2K를 지원한다’는 표현에는 맥락이 필요합니다.

로컬 MiniMax H3는 어떤 해상도로 생성하나요?

공개 H3-Base 워크플로는 768p급 출력을 만듭니다. ComfyUI는 짧은 변 768픽셀을 권장하며, 로컬 최대 품질 캔버스는 대략 16:9의 1344×768입니다. 미리보기를 반복할 때는 더 낮은 메가픽셀 설정이 적합합니다.

MiniMax H3는 어떻게 2K를 생성하나요?

공식 모델 카드에 따르면 전체 H3 시스템은 H3-Context-IR, H3-Base, H3-Regenerate-2K로 구성됩니다. H3-Base가 먼저 768p 결과를 만들고, H3-Regenerate-2K가 그 결과와 원래 멀티모달 맥락을 함께 사용해 고해상도 세부를 다시 생성합니다. 일반적인 초해상도 처리를 적용하는 방식과는 다릅니다.

MiniMax H3: 로컬 및 호스팅 출력


Context-IR과 Regenerate-2K는 현재 호스팅 구성 요소이며 공개 가중치 릴리스에 포함되지 않습니다. MiniMax API 워크플로는 최대 2K, 클립당 5~15초를 제공하므로 로컬 768p 생성과 호스팅 2K 출력을 같은 워크플로로 취급하면 안 됩니다.

MiniMax H3 호스팅 클립 길이

MiniMax H3에는 VRAM이 얼마나 필요한가요?

성능은 VRAM, 시스템 RAM, 해상도, 길이, 스텝 수, 양자화, 오프로딩, 어텐션 구현에 좌우되므로 하나의 최소 VRAM 수치만으로는 실질적인 판단이 어렵습니다.

문서화된 로컬 워크플로를 검토한 결과, 한 RTX 4090 Laptop 구성에서는 VRAM 16GB와 RAM 32GB로 20스텝 및 Sage Attention을 사용해 오디오가 포함된 5초 960×540 영상을 182초에 생성했습니다. 참고할 만한 실제 사례이지만 통제된 벤치마크는 아닙니다.

조사에는 적극적인 오프로딩으로 VRAM이 더 적은 환경에서 H3를 실행한 사례도 있습니다. 실무에서는 GPU가 생성을 완료할 수 있어도 편안한 창작 반복에 충분히 빠르지는 않을 수 있다는 점을 구분해야 합니다.

MiniMax H3 로컬 생성 보고 사례


Sage Attention으로 MiniMax H3 속도 높이기

H3 생성 속도를 높이려면 먼저 영상 길이와 해상도를 줄이세요. 두 설정은 생성할 영상량을 직접 줄여 프롬프트 테스트 비용을 크게 낮춥니다.

그다음으로 가장 명확하게 문서화된 최적화가 Sage Attention입니다. ComfyUI는 이를 통해 품질 손실을 최소화하면서 H3 생성 속도를 약 두 배로 높일 수 있다고 설명하지만, 정확한 개선 폭은 구성에 따라 달라집니다.

전문 제작에서는 속도 설정도 A/B 테스트해야 합니다. 같은 프롬프트와 시드로 비교하고 얼굴, 먼 피사체, 제품의 미세한 세부, 동작 연속성, 오디오 동기화를 확인한 뒤 적극적인 가속 방법을 채택하세요.

MiniMax H3의 흔한 문제와 해결 방법

문제

먼저 시도할 해결 방법

R2V가 참조를 무시함

Ref2VA가 로드됐는지 확인하고 각 참조에 명확한 역할 지정

잘못된 인물이 말함

화자 정체성을 안정화하고 대사를 해당 인물의 행동에 연결

내레이션 중 입술이 움직임

화면 밖 내레이션과 말하지 않는 화면 속 피사체를 명시

정체성이 바뀜

서로 충돌하는 참조를 줄이거나 참조 이미지 세부 수준 향상

생성이 너무 느림

길이 단축, 미리보기 해상도 축소, Sage Attention 활성화

H3 노드가 없음

ComfyUI 업데이트 후 공식 H3 템플릿 다시 불러오기

이 문제 해결 구조는 H3 사용자 질문에서 가장 자주 나온 문제를 반영합니다. 실제로는 프롬프트 지시를 더 늘리는 것보다 워크플로를 단순화하는 편이 효과적일 때가 많습니다.

제작에 가장 적합한 MiniMax H3 워크플로는 무엇인가요?

전문 영상 및 디자인 작업에는 샷 단위 반복 제작 과정을 권장합니다.

미리보기 → 프롬프트 A/B → 참조 A/B → 채택본 → 네이티브 품질 렌더 → 필요 시 2K 또는 마무리 → 편집

이 방식은 H3를 제어 가능한 창작 시스템으로 만듭니다. T2V는 아이디어를 탐색하고, I2V는 설계된 구도를 고정하며, R2V는 중요한 시각·음성 참조를 유지합니다. 짧은 미리보기는 비싼 최종 생성 전에 문제를 드러냅니다. 전용 MiniMax H3 제작 워크플로를 통해 이 순서를 정착시킬 수 있습니다.

제품 디자인 관점에서도 하나의 프롬프트에 콘셉트, 정체성, 카메라, 동작, 대사, 마무리를 동시에 맡기는 것보다 확장하기 쉽습니다. 목표는 결정을 줄이는 것이 아니라 각각의 결정 비용을 낮추고 평가하기 쉽게 만드는 것입니다. 또한 MiniMax H3의 적합한 사용처를 아는 것도 중요합니다. 모든 창작 작업에 같은 수준의 멀티모달 제어가 필요한 것은 아니기 때문입니다.

자주 묻는 질문

VRAM 12GB에서 H3를 실행할 수 있나요?

양자화 모델과 오프로딩을 사용하면 자원이 제한된 소비자용 하드웨어에서도 H3를 실행할 수 있지만, VRAM만으로 생성 속도를 예측할 수는 없습니다. 해상도, 길이, 시스템 RAM, 모델 변형, 스텝 수, 어텐션 최적화도 중요합니다. 실제로 사용할 설정에서 목표인 5초 미리보기에 얼마나 걸리는지 측정하는 것이 더 유용한 하드웨어 테스트입니다.

H3 R2V 참조가 작동하지 않는 이유는 무엇인가요?

먼저 FL2VA가 아닌 Ref2VA를 사용하는지 확인하세요. 이후 각 이미지, 영상, 오디오에 정체성, 환경, 움직임, 카메라, 목소리 같은 구체적 책임을 부여하세요. 여러 참조가 같은 속성을 서로 정의하려 한다면 프롬프트를 복잡하게 하기 전에 참조 수부터 줄이세요.

H3 프롬프트에는 Shot 1과 시간 구간 중 무엇을 써야 하나요?

스토리보드 작성에 도움이 된다면 계획 단계에서는 시간 구간을 사용해도 됩니다. 다만 MiniMax 공식 기본 프롬프트 가이드는 최종 프롬프트를 순차적인 샷으로 구성하고 이후 샷에 명시적인 컷 시간을 붙입니다. 유용한 창작 계획 기법이 모델에 문서화된 프롬프트 구조와 반드시 같은 것은 아니므로 이 차이가 중요합니다.

로컬 H3가 네이티브 2K를 생성하나요?

H3-Base만으로는 생성하지 않습니다. 공개 H3-Base 워크플로는 768p급 출력을 생성합니다. MiniMax 전체 시스템은 H3-Regenerate-2K를 사용해 원래 맥락과 함께 기본 결과를 재생성하며, 공식 API에서는 최대 2K 출력을 제공할 수 있습니다.

결론

MiniMax H3는 단일 프롬프트 영상 제작의 지름길보다 체계적인 시청각 제작 워크플로로 활용할 때 가장 효과적입니다. 창작 제약에 맞춰 T2V, I2V, R2V를 선택하고 FL2VA 또는 Ref2VA를 올바르게 사용하세요. 참조에 명확한 책임을 부여하고, 관찰 가능한 샷과 카메라 동작을 설명하며, 영상과 함께 오디오도 연출하세요. 저비용 미리보기로 아이디어를 검증한 후 해상도를 높이세요. 중요한 것은 하드웨어에서 H3가 실행되는지만이 아니라 좋은 창작 결정을 내릴 만큼 빠르게 반복할 수 있는지입니다. MiniMax H3 워크플로가 안정되면 로컬 768p 생성, 호스팅 2K 마무리, Virse를 훨씬 확장하기 쉬운 전문 AI 기반 디자인 과정에 통합할 수 있습니다.

Virse 블로그의 다른 글