MiniMax H3の使い方:ComfyUI、プロンプト、参照素材、音声、性能の完全ガイド

Yifan ZhaoYifan Zhao読了 10 分 ·

MiniMax H3の使い方:ComfyUI、プロンプト、参照素材、音声、性能の完全ガイド

まず、MiniMax H3を効果的に使うには、テキスト主導の生成にはT2V、既存画像で場面の基礎を定める場合はI2V、人物の同一性、動き、カメラ、作風、声を細かく制御したい場合はR2Vを選びます。ComfyUIでは短い低解像度テストから始め、プロンプトと参照素材を調整し、ショットが成立してから画質を上げます。これにより、体系的なMiniMax H3ワークフローも管理しやすくなります。実用面の長所と限界については、MiniMax H3レビューで詳しく紹介しています。

難しいのはH3で生成すること自体ではなく、再現性があり、制作で使える結果を得ることです。チェックポイントを間違えると参照の効果が弱まり、曖昧なプロンプトでは別の人物に台詞が割り当てられ、高解像度テストでは失敗の費用が増えます。適切なMiniMax H3プロンプトは曖昧さを減らし、規律あるH3制作ワークフローはコンセプト、同一性、動作、カメラ、音声、最終品質を個別に検証できる判断に分けます。

Virseは、こうした広い創作工程を管理しやすくします。AI作業を個別のチャットに閉じ込めず、無限キャンバス上で参照素材、アセット、判断を整理し、複数のエージェントがプロジェクトの文脈を共有できます。製品設計ではチームの好み、ブランド基準、過去の創作文脈の学習も重視し、AI生成を孤立した別のツールではなく、一貫したAIデザインワークフローの一部にすることを目指しています。また、AIデザインエージェントは創作工程の連携を支援できます。

Virseの創作素材閲覧画面のスクリーンショット

ComfyUIでMiniMax H3を使う方法

MiniMax H3は、全モダリティ対応の動画生成システムです。テキスト、画像、動画、音声を理解し、動画とステレオ音声を同時に生成します。ComfyUIにはオープンウェイトのネイティブT2V、I2V、R2Vワークフローがあり、現行ドキュメントではComfyUI 0.30.0以降が必要とされています。公式テンプレートライブラリから始めるのが最も簡単です。初めて設定する場合は、このMiniMax H3利用ガイドで全体の流れを確認できます。

初回生成は次の手順で進めると実用的です。

  1. ComfyUIを更新します。
  2. Template Library(テンプレートライブラリ)→ Video → MiniMax H3を開きます。
  3. T2V、I2V、R2Vから選びます。
  4. 正しい拡散モデルと必要なエンコーダー・VAEを読み込みます。
  5. 短いプレビューを生成します。
  6. 同一性、動き、カメラの方向、台詞、音声を確認します。
  7. 主要な変数は一度に1つだけ変更します。
  8. ショットが安定してから解像度を上げます。

どのMiniMax H3モデルが必要か

T2V、I2V、開始・終了フレームによる生成ではFL2VAを使い、参照主導のR2VではRef2VAを使います。両方ともQwen3-VLテキストエンコーダーとH3の動画・音声VAEが必要です。ComfyUIはこのチェックポイントの違いを明記しているため、参照が無視されるように見える場合は、まず拡散モデルを確認してください。

MiniMax H3:T2V・I2V・R2Vの比較

ワークフロー

向いている用途

主な制御元

T2V

コンセプトの探索と新しい場面

テキスト

I2V

既存の構図を動かす

最初の画像

開始・終了フレーム

計画した場面転換

開始画像と終了画像

R2V

同一性、動き、カメラ、作風、声の一貫性

マルチモーダル参照

選び方は、探索重視ならT2V、構図重視ならI2V、一貫性重視ならR2Vです。R2Vを単に高性能なI2Vだと考えるのはよくある誤りです。異なるモデルの重みを使い、より明確な参照戦略が必要になります。

MiniMax H3のプロンプトを改善する方法

良いMiniMax H3プロンプトは、画像生成の指示よりも視聴覚制作の仕様書に近いものです。MiniMaxの公式ガイドは、マルチモーダルなショット説明、全体の音風景、劇中世界の外から加える音楽を軸に生成を組み立てています。映像演出と音声を一緒に計画する必要があります。指示を体系的に整理したいときは、MiniMax H3プロンプトガイドが役立ちます。

MiniMax H3プロンプトはショット単位で書く

最初に場面と初期構図を定め、次に時間とともに起こる観察可能な動作とカメラの動きを記述します。複数ショットの動画では、公式ガイドは時刻を付けないShot 1から始め、後続ショットには明確なカット時刻を指定します。時間範囲は絵コンテの計画には便利ですが、文書で示された最終形式とは異なります。

計画には次の順序が役立ちます。

参照の役割 → ショット → 被写体 → 動作 → カメラ → 台詞 → 効果音 → 音風景 → 音楽

「映画のような商品紹介」とだけ頼むのではなく、変化を明示します。カメラが商品へゆっくり近づく、被写体が商品を光に向けて回す、機械的なクリック音が鳴る、次のショットで細部のクローズアップに切り替わる、といった内容です。

MiniMax H3の台詞と音声を制御する

H3は動画と同時に台詞、環境音、効果音、音楽を生成します。MiniMaxはショット間で話者の同一性を保つことを推奨しており、2人以上の人物が登場する場合は特に重要です。

実際の利用者の質問を調べると、違う人物が台詞を話すことや、意図しない口の動きが繰り返し見られました。話者の同一性、動作、台詞を密接に結び付けてください。ナレーションは画面外の声だと明示し、画面に見える人物は話さないと指定します。

MiniMax H3 R2Vの参照で一貫性を高める方法

MiniMax H3 R2Vは最大参照画像9枚、参照動画3本、参照音声3本に対応し、参照セット全体では合計12ファイルが上限です。モデルの文書でもこの制限が確認されていますが、上限まで使うことが目的になるケースは多くありません。

MiniMax H3 R2Vの参照数上限


より有効な原則は、各参照に主要な役割を1つ割り当てることです。

例えば次のようにします。

  • 画像1は人物の同一性を制御します。
  • 画像2は環境や視覚的な作風を制御します。
  • 動画1は動作とカメラを制御します。
  • 音声1は声を制御します。

MiniMaxの完全参照ガイドは、被写体、画像アンカー、動画構造、音声信号を区別しています。参照同士の関係は暗示するのではなく、明示すべきだという考え方を裏付けています。

MiniMax H3 R2Vの参照容量


MiniMax H3のref_image_size:matchとmax

ComfyUIには実用的な参照画像戦略が2つあります。matchは速度を優先し、参照画像を生成解像度に近づけます。一方、maxは短辺を最大2048ピクセルまで保持して同一性の再現度を高めますが、処理コストは増えます。

顔、商品、細部の多いキャラクター素材では、反復が遅くなってもmaxを使う価値がある場合があります。環境や大まかな作風の参照なら、通常はmatchから始めるほうが効率的です。

MiniMax H3の解像度:ローカル768pと2K出力

「MiniMax H3は2Kに対応」という表現には補足が必要です。

ローカルのMiniMax H3は何ピクセルで生成するか

公開されたH3-Baseワークフローは768pクラスの出力を生成します。ComfyUIは短辺768ピクセルを推奨し、フル品質のローカルキャンバスではおよそ16:9の1344×768を使います。プレビューを繰り返す段階では、画素数を下げた設定が適しています。

MiniMax H3はどうやって2Kを生成するか

公式モデルカードによると、完全なH3システムはH3-Context-IR、H3-Base、H3-Regenerate-2Kで構成されます。H3-Baseがまず768pを生成し、H3-Regenerate-2Kがその結果と元のマルチモーダル文脈を使って高解像度の細部を再生成します。従来の超解像を適用する方式ではありません。

MiniMax H3:ローカル出力とホスト型出力


Context-IRとRegenerate-2Kは現在ホスト型コンポーネントであり、オープンウェイト版には含まれません。MiniMaxのAPIワークフローは最大2K、1クリップ5~15秒に対応しているため、ローカル768p生成とホスト型2K出力を同じワークフローとして扱うべきではありません。

MiniMax H3ホスト型サービスのクリップ長

MiniMax H3に必要なVRAM容量

実用的な最低VRAMを1つの数値で示すことはできません。性能はVRAM、システムRAM、解像度、長さ、ステップ数、量子化、オフロード、Attention実装に左右されるためです。

文書化されたローカル事例の調査では、RTX 4090 Laptopを搭載し、VRAM 16GBとRAM 32GBの構成で、20ステップとSage Attentionを使い、音声付きの5秒・960×540動画を182秒で生成した例がありました。参考になる実例ですが、条件を統制したベンチマークではありません。

調査には、大量のオフロードによってVRAMの少ない環境でもH3を動かした報告が含まれます。実用上、GPUが生成を完了できることと、快適に創作を反復できる速度があることは別だと理解する必要があります。

MiniMax H3ローカル生成の報告事例


Sage AttentionでMiniMax H3を高速化する

H3を速くするには、まず動画の長さと解像度を下げます。生成すべき動画量が直接減り、プロンプト検証の費用も大きく下がります。

その次に、文書で最も明確に示されている最適化がSage Attentionです。ComfyUIによれば、ごく小さな品質低下でH3の生成速度をおよそ2倍にできるとされています。ただし、実際の改善幅は構成によって異なります。

専門的な制作では高速化設定もA/B比較してください。同じプロンプトとシードを使い、顔、遠くの被写体、商品の細部、動きの連続性、音声同期を確認してから、強い高速化手法を採用します。

MiniMax H3のよくある問題と対処法

問題

まず試す対処法

R2Vが参照を無視する

Ref2VAが読み込まれているか確認し、各参照に明確な役割を与える

別の人物が台詞を話す

話者の同一性を安定させ、台詞をその人物の動作に結び付ける

ナレーション中に口が動く

画面外のナレーションと、話さない可視被写体を明示する

同一性が変わる

競合する参照を減らすか、参照画像の細部を増やす

生成が遅すぎる

長さを短縮し、プレビュー解像度を下げ、Sage Attentionを有効にする

H3ノードが見つからない

ComfyUIを更新し、公式H3テンプレートを再読み込みする

この診断表は、H3利用者の質問の調査で頻繁に見られた問題を整理したものです。実際には、プロンプトの指示を増やすよりも、ワークフローを単純にしたほうが有効な場合が多くあります。

制作に適したMiniMax H3ワークフローとは

専門的な動画・デザイン制作には、ショット単位の反復工程を勧めます。

プレビュー → プロンプトA/B → 参照A/B → 採用版 → ネイティブ品質レンダリング → 必要に応じて2K化・仕上げ → 編集

この方法ならH3を制御可能な創作システムとして扱えます。T2Vはアイデアを探索し、I2Vは設計した構図を固定し、R2Vは重要な映像・音声参照を保ちます。短いプレビューは高コストな最終生成の前に問題を明らかにします。専用のMiniMax H3制作ワークフローは、この順序の定着に役立ちます。

製品デザインの観点でも、1つのプロンプトにコンセプト、同一性、カメラ、動作、台詞、仕上げを同時に解決させるより拡張しやすい方法です。目的は判断を減らすことではなく、各判断の費用を抑え、評価しやすくすることです。また、MiniMax H3をどこで使うかを理解することも重要です。すべての創作作業に同じ水準のマルチモーダル制御が必要なわけではありません。

よくある質問

VRAM 12GBでH3を動かせるか

量子化モデルとオフロードを使えば、リソースの限られた一般向け機器でもH3を実行できます。ただし、VRAMだけでは生成速度を予測できません。解像度、長さ、システムRAM、モデル種別、ステップ数、Attention最適化も影響します。予定している実際の設定で、目的の5秒プレビューにどれだけかかるかを測るほうが有用なハードウェアテストです。

H3 R2Vの参照が機能しないのはなぜか

まず、FL2VAではなくRef2VAを使っているか確認します。その後、各画像、動画、音声に同一性、環境、動作、カメラ、声などの役割を割り当てます。複数の参照が同じ属性を競って定義している場合は、プロンプトを複雑にする前に参照を減らしてください。

H3プロンプトにはShot 1と時間範囲のどちらを使うべきか

絵コンテに役立つなら、計画段階で時間範囲を使って構いません。ただし、MiniMax公式の基本プロンプトガイドでは最終プロンプトを連続するショットで構成し、後続ショットには明確なカット時刻を付けます。便利な創作計画の手法が、モデルの文書にあるプロンプト構造と同じとは限らないため、この区別は重要です。

ローカルH3はネイティブ2Kを生成するか

H3-Base単体では生成しません。公開H3-Baseワークフローは768pクラスの出力です。MiniMaxの完全なシステムはH3-Regenerate-2Kで元の文脈とともに基本結果を再生成し、公式APIでは最大2Kの出力を提供できます。

まとめ

MiniMax H3は、1回のプロンプトで動画を作る近道よりも、構造化された視聴覚制作ワークフローとして力を発揮します。制作上の制約に応じてT2V、I2V、R2Vを選び、FL2VAかRef2VAを正しく使い、参照ごとに役割を決め、観察可能なショットとカメラ動作を記述します。音声も映像と一緒に演出し、安価なプレビューで検証してから解像度を上げます。大切なのは機器でH3が動くかだけでなく、良い創作判断を下せる速さで反復できるかです。MiniMax H3ワークフローが安定すれば、ローカル768p生成、ホスト型2K仕上げ、Virseを、より拡張しやすい専門的なAI活用デザイン工程に組み込めます。

シェアX でシェアLinkedIn でシェア

Virse ブログの他の記事