MiniMax H3プロンプトガイド:よりよいH3プロンプトの書き方

Yifan ZhaoYifan Zhao読了 13 分 ·

MiniMax H3プロンプトガイド:よりよいH3プロンプトの書き方

優れたMiniMax H3プロンプトは、映画風のキーワードを長く並べるのではなく、簡潔な制作指示として機能します。よいプロンプトは、各参照素材が何を制御するか、何がどの順序で起こるか、カメラがどう動くか、何が聞こえるか、どの細部を変えずに保つかを定義します。MiniMax H3の使い方を学ぶ際、プロンプトの改善で大切なのは説明を増やすことよりも、曖昧さをなくすことです。

構成の悪いプロンプトは、キャラクターの変化、動作の省略、最初と最後のフレーム間の弱い接続、誤った台詞、商品の形状の変化につながりがちです。公開されているMiniMax H3のワークフローとユーザーのよくある質問を調べたところ、こうした失敗の原因は通常、参照素材の競合、タイムラインへの詰め込みすぎ、曖昧なカメラ表現、不明確な保持ルールにあります。より広範なMiniMax H3レビューも、どの生成作業でプロンプト構成の改善が特に役立つかを理解する助けになります。

Virseは、創作をチャット欄に限定せず、AIを無限キャンバスに取り入れることで、この工程をより視覚的で協働しやすいものにします。デザイナーは参照素材を整理し、アセットをつなぎ、プロジェクトの文脈を共有する複数のAIエージェントを実行し、反復作業の間もスタイルの好みやチームの知識を保持できます。そのため、H3のプロンプト作成が単発の実験ではなく、より大きなプロ向けAIデザインワークフローの一部になるとき、Virseが特に役立ちます。

Virseのクリエイティブ作業画面

MiniMax H3プロンプトに最適な構成とは?

信頼できるMiniMax H3プロンプトの構成は、7つの層に整理できます。参照素材の役割、タイムライン、見た目、カメラ、音、正確な文字、制限です。すべてのプロンプトに7つすべてが必要なわけではありませんが、生成結果の制御が難しくなったとき、この構成が実用的なチェックリストになります。

要素

制御する内容

ベストプラクティス

参照素材の役割

アイデンティティ、商品、スタイル、動作、声

各入力に明確な役割を1つ割り当てる

タイムライン

動作の順序と状態の変化

再生順に出来事を説明する

見た目

照明、素材、環境

目で確認できる細部を使う

カメラ

フレーミングと動き

各ショットに主となるカメラ方針を1つ使う

音

台詞、環境音、音楽

音声の各層を分ける

正確な文字

ラベル、看板、UI、ロゴ

重要な文言を正確に指定する

制限

変更してはいけないもの

範囲を絞った、作業に即した制約を使う

MiniMaxの現在のH3 APIは、768Pまたは2Kで4〜15秒の動画生成に対応しています。参照素材を使う生成では、最大で画像9枚、動画3本、音声3本を使用でき、混在する参照ファイルは合計12個までです。この柔軟性は強力ですが、役割を定義しなければ入力が増えるほど競合も増える可能性があります。

MiniMax H3 の参照入力数の上限


H3の参照素材にはどう役割を割り当てるべきか?

複数の参照素材を添付して、H3に単に「使って」と頼むだけではいけません。各素材が何を制御するのかをモデルに伝えてください。

商品キャンペーンでは、プロンプトで次のように定義できます。画像1はモデルのアイデンティティ、画像2は衣装、画像3はスタジオ環境、商品画像は正確な形状と素材、参照動画は動作のテンポを制御する。

プロのデザインワークフローでは、私は参照素材の数より、その割り当てを重視します。追加画像に価値があるのは、別の競合する視覚的方向を持ち込まず、不確実さを減らす場合だけです。この原則は、MiniMax H3 Motion Transferで特に重要になります。アイデンティティ、動作、カメラなどの属性が異なる参照素材から来ることがあるためです。

H3のPictureとSubjectはどう違う?

MiniMaxのフルリファレンス・プロンプトシステムでは、Pictureは具体的なビジュアルや構図の参照として機能し、Subjectは参照素材から抽出した再利用可能な内容を表します。たとえばキャラクター、物体、環境、服装、ポーズ、スタイルです。

同じプロジェクトに構図の参照とアイデンティティの参照がある場合、この区別が重要です。絵コンテのコマがフレーミングを、キャラクターシートがアイデンティティを制御するなら、役割を分けてください。そうしないと、H3が誤った入力から誤った特徴を保持しようとする場合があります。

MiniMax H3のタイムラインプロンプトはどう書く?

優れたMiniMax H3タイムラインプロンプトの中心となるのは、次の流れです。

現在の状態 → 観察可能な動作 → カメラの反応 → 最終状態。

MiniMaxの公式H3プロンプトガイドは、動画生成を時系列で説明しています。動画の品質はモデルが時間に伴う変化をどれだけ理解できるかに左右されるため、この方法が役立ちます。

H3プロンプトにタイムスタンプは必要?

いいえ。H3にとっては、タイムスタンプよりも明確な時間的順序が重要です。

シンプルな商品ショットなら、次のように書けます。

香水瓶は濡れた黒い石の中央に置かれたまま。右から手が入り、瓶を持ち上げ、暖かなキーライトに向けてゆっくり回し、金色のラベルにハイライトが当たったところで止まる。カメラは全編を通じて、ゆっくり小さく寄っていく。

複数のカット、同期した台詞、変身や変化、複数の重要な展開を加える場合、タイムスタンプがより役立ちます。

H3のワークフローに関する質問を調べると、繰り返し見られる傾向がありました。モデルが動作を飛ばすと、制作者はさらに指示を増やしがちです。しかし、それでは通常、タイムラインの実行がさらに難しくなります。同時に起こる動作を減らし、終了時の状態を明確にする方が効果的なことが多いです。

H3プロンプトにはいくつの動作を含めるべき?

公式に展開の数の上限はありませんが、実用的な計画の目安は次のとおりです。

  • 5秒:意味のある展開を1〜2つ
  • 10秒:展開を2〜4つ
  • 15秒:展開を3〜5つ

これはワークフロー上の経験則であり、モデルの制限ではありません。各展開は意味のある視覚的変化を表すべきです。

たとえば10秒のスニーカー広告なら、選手が靴を締め、起き上がってスタート姿勢を取り、加速してカメラの前を走り抜ける様子を示せます。同じ短いクリップに6つの動作、複数のカメラ移動、場所の変化、ロゴの登場を詰め込むよりも制御しやすくなります。

H3 動画の長さに応じた推奨アクション数


MiniMax H3で参照画像・キャラクターシート・絵コンテをどう使う?

H3の参照プロンプトは、アイデンティティ、構図、動作、スタイルをそれぞれ別の制御課題として扱うと最もよく機能します。これはキャラクターシート、商品参照、絵コンテ、動作参照を扱うデザイナーにとって特に重要です。

キャラクターシートでH3の一貫性を高められる?

はい。特にシートで顔、髪型、体の比率、服装、アクセサリー、特徴的な要素を明確にしている場合に役立ちます。

私たちが検討した公開の参照動画生成ワークフローの1つでは、その特定の構成において、Fluxで作成したキャラクターシートだけで、専用のキャラクターLoRAを使わずに制作者の目標を達成できました。これはキャラクターシートが常にLoRAの代わりになる証拠ではありませんが、よく整理したアイデンティティ参照が制作工程を簡素化できる理由を示しています。

ワークフロー全体で得られる教訓は、アイデンティティの制御とショットの計画を分けることです。

H3では絵コンテをどう使うべき?

絵コンテは、ショットの順序と構図を伝えるものであり、曖昧な多目的参照として使うべきではありません。

1枚の画像に複数のコマがある場合は、対応を明示します。

コマ1はショット1、コマ2はショット2、コマ3はショット3を導く。キャラクターのアイデンティティはキャラクター参照から保持し、絵コンテはフレーミングと順序にのみ使う。

ユーザーの質問を調べると、H3が画像を開始フレーム、キャラクターシート、ムードボード、シーケンス参照のどれとして使うかを推測しなければならないとき、絵コンテのコマが飛ばされる問題が繰り返し起きていました。

H3のカメラ・音声・最初と最後のフレームをどう制御する?

技術的には正しいプロンプトでも、カメラ、音、トランジションでは創作上の制御が失われることがよくあります。

H3のカメラプロンプトはどう書くべき?

使うべきなのは、「映画風」のような飾り言葉ではなく、具体的なカメラの動きを表す言葉です。

MiniMaxのH3ガイドは、前進、後退、パン、ティルト、横移動、追従、弧を描く移動、上下移動、手持ち、固定ショットなどに対応しています。役立つカメラ指示には、動きの種類、速度、幅、対象を記します。

たとえば:

ミディアムクローズアップ。秒針が動き始めると、カメラが文字盤に向かってゆっくり小さく前進する。

より自然な映像には、目で分かる不完全さも役立ちます。わずかな手持ちの揺れ、オートフォーカスの遅れ、露出の迷い、レンズの水滴、粒状感、ハレーション、色にじみなどです。

H3の最初と最後のフレームはどう指示する?

開始画像と終了画像だけを説明してはいけません。その間の物理的な変化を説明してください。

傘を開く場合:

キャラクターが閉じた傘を持ち上げ、スライダーを押し上げる。骨が外側に伸び、折り畳まれた生地が徐々に広がり、傘が完全に開いた最終状態になってから静止する。

最も信頼できる型は次のとおりです。

開始状態 → 中間の変化 → 段階的な移行 → 正確な終了状態。

これはパッケージの公開、商品の回転、UIの遷移、ポーズの変化、モーションデザインのシーケンスに役立ちます。

H3の音声と台詞はどう指示する?

音を3つの独立した層として扱います。

台詞:誰が何を話すか。
場面の音:足音、雨、物体の移動音、室内の環境音。
音楽:楽器編成、テンポ、リズム、強さ。

繰り返し登場する話者は、ショットをまたいでアイデンティティを統一します。音楽が不要なら、音楽なしと明記し、音声の方針を未指定にしないでください。

画面上の文字は、重要な文言を正確に指定し、追加の文字なし、字幕なし、または商品ラベルを保持といった範囲を絞った制約を使います。

実際のH3ワークフローテストから分かる反復コストとは?

プロンプトの品質は、制作効率の問題でもあります。解釈に失敗するたびに、レンダリングがもう1回増えます。

H3プロンプトをまず低解像度で試すべき理由は?

検討した公開ワークフローの1つは、0.2MP・8ステップで構図と出来事の流れを確認していました。別のRTX 5080ワークフローでは、10秒の720pレンダリングに約10分、0.2MPのプレビューには約3分かかったと報告されています。

報告された H3 のプレビューと最終レンダリングの所要時間


これらの数値は特定環境のワークフロー報告であり、MiniMaxのベンチマークではありません。実用的な価値は、最終レンダリングの前に低解像度プレビューで低コストの確認ができる点にあります。

キャラクターは認識できるままか?
シーケンスは正しい順序で進むか?
カメラは正しく動くか?
絵コンテの対応付けは機能するか?

ComfyUIユーザーには、次の実用的な進め方が示唆されます。まず構成を検証し、プロンプトへの追従が許容できる水準になってからステップ数と解像度を上げることです。

ステップ数を増やせば必ずH3の結果がよくなる?

追加の反復コストに見合うほど改善するとは限りません。

ある768×1280ワークフローでは、20ステップでおよそ5秒に2分、10秒に6分、15秒に12分かかったと報告されています。別のワークフローでは、その環境で20ステップを10に減らすと約40%の生成時間を節約できたと報告されています。

20 ステップでの動画の長さ別レンダリング時間の報告


別のRTX 5070 Tiによる参照動画生成の事例では、約サンプリング121秒、全体362秒と報告され、サンプリング自体だけがボトルネックではないことが分かります。

大切なのはハードウェアの正確な速度ではありません。曖昧な指示は総制作時間を何倍にも増やすため、単純な生成速度よりプロンプトへの追従が重要な場合があります。

サンプリング時間とワークフロー全体の所要時間


MiniMax H3がプロンプトに従わないのはなぜ?

H3の失敗の多くは、具体的な曖昧さに原因があります。

キャラクターや商品が変わり続けるのはなぜ?

考えられる原因:参照素材の競合、または保持の優先順位が不明確。

修正方法:アイデンティティまたは商品の基準となる参照を1つ選びます。顔、服装、瓶の形状、ラベル位置、素材、色など、変えてはいけないものを正確に指定してください。

H3が絵コンテのショットや動作を飛ばすのはなぜ?

考えられる原因:タイムラインへの詰め込みすぎ、またはコマの対応付けが不明確。

修正方法:展開の数を減らし、各コマを1つのショットに対応させ、各ショットに主な動作1つと主なカメラ方針1つを割り当てます。

違うキャラクターが話すのはなぜ?

考えられる原因:話者の対応付けが不完全。

修正方法:話者のアイデンティティを一定に保ち、声の参照を意図した話者に結び付け、台詞の指示を環境音や音楽から分けます。

画面上の文字が間違うのはなぜ?

考えられる原因:文字の指定が十分明確でない、または文字要素が多すぎて競合している。

修正方法:正確な文言と表示位置を指定し、不要な追加文字を禁止します。ブランドに重要なタイポグラフィやロゴについては、実制作で使う前に最終出力を必ず人の目で確認してください。

プロのデザインワークフロー向けMiniMax H3プロンプトテンプレート

多くのH3プロジェクトでは、次の順序を使います。

視覚的方向性 → 参照素材の役割 → タイムライン → カメラ → 音 → 正確な文字 → 制限

商品プロンプトの例:

高級感のある実写の商品映像。商品参照は瓶の正確な形状、ガラス素材、ラベル位置、キャップの色を制御する。瓶は濡れた黒い石の上に立ち、細く暖かな側光を受ける。手がゆっくり持ち上げて光の方へ回し、同時にカメラが少し寄る。水滴がガラスを伝って落ちる。ラベルがカメラを向いたところで止める。瓶の比率を保持する。追加の商品、余分なロゴ、字幕、カット切り替えはなし。

複雑なマルチモーダルプロジェクト向けに、MiniMaxはさらに詳しい参照構成も公開しています。被写体の定義、要約、保持の分析、詳細な説明、全体の音風景、非劇中音楽を含みます。公式ガイドは、複雑な生成作業の詳細説明部分について、約350〜500英単語を推奨しています。この詳しさが役立つのは、複数のキャラクター、参照素材、声、保持ルールを連携させる必要がある場合であり、通常のH3プロンプトすべてに必要なわけではありません。

よくある質問

H3ではすべてのプロンプトにタイムスタンプが必要?

いいえ。タイムスタンプよりも明確な再生順序が重要です。連続したショットなら、動作を時系列で説明するだけでも構いません。複数のカット、同期した台詞、変化、特定の時点で起こるべき複数の重要な展開を含む場合に、タイムスタンプが役立ちます。

H3プロンプトはどれくらいの長さにすべき?

あらゆる場合に適した理想の長さはありません。単純なショットには、重要な曖昧さをなくすために必要な情報だけを含めます。複雑なフルリファレンスのワークフローでは、はるかに長い説明が妥当な場合もあります。プロンプトの長さ自体は品質の指標ではなく、情報の優先順位と明確さの方が重要です。

H3でキャラクターシートはLoRAの代わりになる?

場合によっては可能ですが、常にではありません。専用のキャラクターLoRAなしでも、キャラクターシートで参照動画生成の一貫性が許容範囲に達したワークフローを検討しました。ただし一般的なベンチマークにはなりません。他のアイデンティティ制御を外す前に、さまざまなポーズ、フレーミング、照明、カメラ角度でキャラクターを試してください。

低解像度で見つけたシードをHDで再現できる?

低解像度の生成は、プロンプトの解釈、構図、動き、出来事の順序のテストに使ってください。ただし解像度やワークフロー設定を変えても、同じシードが同一の結果を再現するとは考えないでください。低解像度プレビューは方向性の検証ツールであり、最終レンダリングの縮小版が保証されるわけではありません。

結論

最も信頼できるMiniMax H3のプロンプト戦略は、モデルが推測しなければならないことを減らすことです。各参照に明確な役割を与え、再生順に動作を説明し、具体的なカメラの動きを表す言葉を使い、最初と最後のフレーム間の動きを説明します。台詞を場面の音や音楽から分け、範囲を絞った制約で重要な文字やデザイン要素を保護し、最終レンダリング前に低コストでシーケンスを確認します。これにより、デザイナーや制作チームにとって、MiniMax H3のプロンプト作成は試行錯誤のキーワード記述から、アイデンティティ、時間、動作、音、保持を軸とした再現可能なクリエイティブディレクションのワークフローに変わります。

シェアX でシェアLinkedIn でシェア

Virse ブログの他の記事