複雑な ComfyUI ワークフローを使わずに、MiniMax H3 で一貫した AI キャラクターを作る方法
Vincent読了 13 分 ·

MiniMax H3 では、同じキャラクター参照画像を繰り返し使い、同一性を決める特徴を固定し、ショットごとの変化と切り分けることで、複雑な ComfyUI ワークフローを管理せずに一貫した AI キャラクターを作れます。顔、髪型、衣装、体のシルエットなどの固定的な特徴は統一し、プロンプトは主に動作、場面、カメラの動き、照明、一時的な細部の制御に使います。
キャラクターの一貫性が崩れ始めるのは、通常、カメラの角度が変わる、複数の人物が同じ場面に登場する、衣装がずれる、複数のクリップを長いシーケンスにつなぐときです。プロンプトを長くするだけでは、こうした問題はほとんど解決しません。安定した同一性の基準と明確な参照画像の割り当てがなければ、H3 ではショット間に顔の混在、人物の同一性のずれ、衣装の変化、連続性の誤りが生じることがあります。
より信頼できるワークフローでは、参照画像セット、多方向のキャラクターシート、明示的な参照画像の対応付け、短い品質確認用の生成、長い動画のための前フレームの文脈を組み合わせます。大きなノードグラフを直接操作せずにこれらを使いたいチームに向けて、Virseは無限キャンバス、共有プロジェクト文脈、複数エージェントの協働、長期記憶を提供し、再利用できるキャラクター参照画像を整理し、一貫性を再現可能な制作工程にするのを支援します。MiniMax H3、Seedance 2.5、Seedance 2.0は現在、Virseで利用でき、チームは同じ制作ワークフローで複数の主要動画モデルを試し、比較できます。

MiniMax H3 は異なるショット間でキャラクターの一貫性をどう保つのでしょうか?
MiniMax H3 のキャラクターの一貫性では、人物の同一性と時間的な連続性という二つの問題を切り分けることが重要です。
同一性の基準は、そのキャラクターが誰なのかを H3 に伝えます。顔や全身、衣装の参照画像、多方向のキャラクターシート、固定した人物設定などが使えます。時間的な基準は、前のフレームやその他の連続性に関する情報を引き継ぎ、次のクリップの直前に何が起きたかを伝えます。
人物の同一性と時間的な連続性には別々の基準が必要です
この区別は長いシーケンスで重要になります。記録された 1 分超のあるワークフローでは、前のクリップの 22 フレームを、2 枚のキャラクターシートとともに再利用していました。別の継続生成ワークフローでは、最後の48 フレーム、24 fps で約 2 秒分を渡し、同じ被写体参照画像も引き続き提供していました。
実務上の教訓は明快です。参照画像はキャラクターが誰かを保ち、前のフレームは場面で何が起きていたかを保ちます。

複数人物の場面では参照画像と配置の問題も加わります
繰り返し寄せられる H3 ユーザーの質問を調べると、人物の特徴の混入、顔の混在、体の重なり、顔の引き伸ばし、参照画像の誤った割り当てが頻繁に見られました。
2 人の場面では各人物を別々に定義し、参照画像を明示的に対応付け、複雑な動作やカメラ移動を加える前にそれぞれの立ち位置を決めます。画面に複数の人物が入ると、キャラクターの一貫性は場面の配置設計の問題でもあります。
MiniMax H3 では、長いプロンプトより参照画像が重要なのはなぜですか?
H3 で役立つ原則は、参照画像が同一性を定め、プロンプトが変化を定める、というものです。
顔、髪型、衣装、体のシルエット、特徴的な装飾品は参照画像側で管理します。ショットのプロンプトでは動作、環境、カメラの向き、照明、テンポ、一時的な物体を指定します。
ショットを変える前に、同一性を決める特徴を固定します
記録されたあるキャラクター置換ワークフローでは、生成指示全体を通して髪型、目、カーディガン、装飾品などの安定した細部を繰り返し指定していました。同一性を支える方法ですが、テキストは視覚的な参照画像の代わりではなく、補強として最もよく機能します。
実際の AI 動画制作では、一度に変える変数を減らすと失敗の原因も見つけやすくなります。髪型、衣装、カメラ角度、環境、スタイル、動きを同時に変えると、何が人物のずれを引き起こしたかを特定しにくくなります。
MiniMax H3 の参照画像は何枚使えばよいですか?
H3 に検証済みの万能な参照画像枚数はありません。調査では、約4~6 枚の参照画像を使う再利用可能なキャラクター管理の仕組みもあれば、より少数の正面・側面・背面のキャラクターシートに依存するワークフローもありました。
枚数より、各画像が同一性に役立つ情報を追加しているかが重要です。
互いに補完する H3 参照画像セットを作ります
実用的なセットには、次のような画像を含められます。
- 顔のクローズアップ:顔の同一性と髪の細部を示す
- 正面または斜めの画像:よく使うポートレートの角度を示す
- 側面の画像:横顔の情報を示す
- 全身の画像:衣装、シルエット、体の比率を示す
- 背面または別角度の画像:人物が背を向ける必要がある場合に使う
ほぼ同じポートレートが 6 枚あっても、互いに補完する角度の画像3 枚より必ず優れているわけではありません。
クローズアップと全身の参照画像を使い分けます
クローズアップは顔を映すショットで同一性の強い基準になります。全身画像は衣装と体の比率を保つのに役立ちます。
この区別が重要なのは、調査で、848×1264 の全身参照画像を大きく異なる構図の生成に使った結果、似ている度合いが弱まり、明らかな同一性のずれが生じた例があったためです。
MiniMax H3 に適した参照画像のサイズと構図は何ですか?
参照画像の前処理は結果に大きく影響する場合がありますが、現時点の証拠から万能な解像度を一つ定めることはできません。
記録されたあるワークフローでは、参照画像を出力動画のネイティブ形式である864×480にリサイズすると、一貫性が改善したと報告されています。これは 864×480 が H3 に最適な参照サイズという意味ではなく、参照画像とショットの適合性が重要になり得ることを示しています。

生成したいショットに参照画像を合わせます
顔を大きく映すポートレートには、十分な顔の情報を提供します。全身の動きには、参照画像セットで衣装とシルエットが明確になっているか確認します。
髪型、衣装、体の比率、人物の年齢が矛盾する参照画像も避けます。参照画像を増やす意味があるのは、整合した情報が追加される場合だけです。
MiniMax H3 のキャラクターシートを作るべきなのはなぜですか?
キャラクターシートは、参照画像の準備を繰り返し作業から再利用可能な制作資産に変えます。
あるH3 ワークフローは、顔と衣装の入力から正面・側面・背面の参照画像を生成しました。VRAM 24GB の RTX 3090では、第 1 段階が約100~125 秒、第 2 段階が約105 秒、シート全体で約3.5 分かかりました。

キャラクターを一度作り、繰り返し使います
継続的な制作に向け、次を保存します。
- 承認済みの参照画像
- 固定した人物設定
- 衣装の定義
- 特徴的な装飾品
- 承認済みの表情
- キャラクター名または内部 ID
これにより、ワークフローは生成のたびに人物を作り直す作業から、新しいショット用に既存のキャラクターを選ぶ作業に変わります。
物語動画、広告のバリエーション、ブランドキャラクター、連続作品では、こちらの方がはるかに拡張しやすくなります。
MiniMax H3 で複数の参照画像をどう割り当てればよいですか?
複数参照のワークフローは、各参照画像の役割が明確なほど制御しやすくなります。
記録されたあるテストでは、人物、コンビニ、車、スケートボードにそれぞれ別の参照画像を使い、飲み物のカップはテキストで追加しました。RTX 5070 Ti と RAM 32GBの構成では、生成に約9 分 7 秒かかり、報告された反復 1 回あたりの時間は68.43 秒でした。
一貫している必要があるものを参照画像で指定します
別のワークフローでは、人物、スケートボード、環境、Walkman を個別に割り当てていました。
個々の例を超えて使える制作原則は、外観を安定させる必要がある資産は参照画像で示し、一時的または優先度の低い細部はテキストで記述することです。
複数の人物を扱う場合、やり取り、カメラ移動、動作を定める前に、キャラクター A とキャラクター B の参照画像を対応付けます。
H3 のキャラクターの一貫性を、より速くテストするには?
キャラクターの一貫性は反復によって改善するため、テスト速度が重要です。
あるRTX 4070 Ti 12GBのワークフローでは、15 秒の0.4MP動画の生成に約18 分かかりました。解像度を0.2MPに下げると、同じ長さでも7 分未満になり、短い1~2 秒のテストなら、その構成では約 1 分以下で完了できました。
これらの数値は個別のワークフローの結果であり、普遍的なH3 ベンチマークではありません。

下書き・プレビュー・最終出力のワークフローを使います
実用的な品質確認の手順は次のとおりです。
- 下書き:顔、参照画像の割り当て、配置を確認します。
- プレビュー:動き、構図、連続性を確認します。
- 最終出力:同一性の確認に合格してから、長さと解像度を上げます。
性能はメモリの扱いにも大きく左右されます。あるRTX 4070 12GB構成では 608×352 の出力を167 秒で生成しましたが、別の 12GB ワークフローではメモリ管理の挙動により、約18 秒だった反復 1 回あたりの時間が 400 秒超に増加しました。
教訓は、どの GPU が最速かではありません。反復の効率も、一貫性を保つワークフロー設計の一部だということです。
複数のクリップで同じ H3 キャラクターを保つには?
長尺の H3 動画では、同じ人物参照画像を使いながら、前のクリップの時間的な情報を引き継ぎます。
厳しい連続性テストでは、8 ショット、1,689 フレーム、約 70 秒を、7 回の継続生成でつなぎました。実行条件はRTX 3090、1344×768、20 ステップで、合計約3.4 時間かかりました。
人物参照画像と前のフレームを一緒に再利用します
この連続生成でも人物は識別可能なままでしたが、約4~5 回の継続生成を過ぎると背景の細部が目に見えて弱くなりました。

この結果は、人物の同一性が安定していても、環境は徐々に劣化し得るという重要な違いを示しています。
したがって長いシーケンスでは、無制限につなぎ続けるよりも、定期的な品質確認と、必要に応じたロケーション参照画像の更新が役立ちます。
最初/最後のフレームと前クリップの文脈、H3 にはどちらがよいですか?
これらのMiniMax H3 の手法は異なる問題を解決します。
最初/最後のフレームは、ショットを決められた視覚的状態に到達させたい場合に有効です。ただし最後のフレームを厳密に制約すると、終わり際の動きが不自然に遅くなることがあります。
前クリップの文脈は動きの履歴を引き継ぐため、連続した動作に向いています。
次のように整理すると便利です。
キャラクター参照画像 = 人物の同一性の連続
前のフレーム = 時間的な連続性
最初/最後のフレーム = 状態の制御
長いシーケンスでは、これらの仕組みは互いを置き換えるのではなく、補完し合えます。
複雑な ComfyUI ワークフローなしで MiniMax H3 を使うには?
目標は ComfyUI を完全に取り除くこととは限りません。よりよい目標は、制作者の操作からノードグラフの複雑さを取り除くことです。
繰り返し寄せられるユーザーの質問を調べると、カスタムノード、モデルのパス、アテンション設定、VRAM 設定を管理せず、人物を選び、参照画像を選び、ショットを説明し、品質を設定して生成できるインターフェースへの強い需要が見られます。
ComfyUI はバックエンドに残します
あるVRAM 12GBのワークフローは、ブラウザー型のフロントエンドで操作を簡略化しながら、約 14 分で 30 秒の出力を生成しました。
別の構成では、MCP を介して AI アシスタントを ComfyUI に接続しました。VRAM 10GB の RTX 3080 と RAM 32GBで、20 ステップを使用し、1 クリップあたり約 25 分かけて生成した後、2 倍にアップスケールして 1080pにしました。
製品設計の観点では、理想的な操作は次のようになります。
キャラクターを選択 → ロケーションを選択 → ショットを説明 → 品質を選択 → 生成
グラフは内部に残して構いません。制作者がノードを意識する必要はありません。
H3 のキャラクターの一貫性を、ロケーションと小道具にも広げるには?
人物が安定したら、次の課題は、周囲の視覚世界にも一貫性を保つことです。
あるロケーション制作ワークフローでは、満足できる環境を作るまでに、場合によっては 10 回を超える生成が必要でした。その後、4 方向からの画像を選び、ロケーション参照画像として再利用しました。

キャラクター・ロケーション・小道具のライブラリを作ります
再現可能な AI 動画制作のため、継続的に使う資産を次のように整理します。
- キャラクターライブラリ
- ロケーションライブラリ
- 小道具ライブラリ
繰り返し登場する車には参照画像を用意する価値があるでしょう。一度だけ映る使い捨てカップなら、不要かもしれません。
より広い原則は単純です。一貫している必要があるものは固定し、変えてよいものはプロンプトで指定します。
まとめ
MiniMax H3 で一貫した AI キャラクターを作ることは、プロンプトの書き方の裏技ではなく、制作システムの課題として考えるのが適切です。再利用できる多方向のキャラクター資産を作り、生成予定のショットに参照画像を合わせ、同一性を決める特徴を固定し、重要な参照画像を明示的に割り当て、最終レンダリング前に短いプレビューで人物を検証します。長いシーケンスでは、同じ同一性の基準に前フレームの文脈を組み合わせ、継続生成を重ねる中での劣化を監視します。最も拡張しやすい H3 ワークフローは、最終的には技術的な複雑さをバックエンドに隠し、制作者が人物を作り直したり巨大な ComfyUI グラフを管理したりせず、キャラクター、ロケーション、小道具、ショットの演出に集中できるようにします。
よくある質問
H3 のキャラクターの一貫性を保つには、参照画像は何枚必要ですか?
検証済みの万能な枚数はありません。調査では約4~6 枚の参照画像を使うワークフローもあれば、少数の多方向キャラクターシートを使うものもありました。重複画像より、互いを補完する角度を優先してください。明確な顔の参照画像、側面、全身の画像は、ほぼ同じポートレートを何枚も使うより、同一性に役立つ情報を多く提供することがあります。
H3 の参照画像はクローズアップ、全身、それとも動画と同じ解像度にすべきですか?
各参照画像に明確な役割を持たせます。クローズアップは顔の同一性を支え、全身の参照画像は衣装とシルエットを定めます。記録されたあるワークフローでは、参照画像を 864×480 にリサイズすると一貫性が改善したと報告されていますが、普遍的なルールではありません。むやみに解像度を上げるより、構図の適合性と同一性に役立つ情報が重要です。
H3 で 2 人の顔が混ざるのを防ぐには?
人物ごとに別の参照画像を用意し、それらを明示的に対応付け、人物を見た目で区別できるようにし、複雑なやり取りを加える前に位置を定めます。参照画像の割り当て、動き、カメラの向き、空間的な関係が同時に曖昧だと、人物の特徴の混入を制御しにくくなります。
ComfyUI のノードを管理せず、長い動画で同じ H3 キャラクターを保つには?
継続生成のたびに同じキャラクター参照画像を再利用し、前のクリップの短い部分を時間的な文脈として渡します。記録されたワークフローでは、前の 22 フレームまたは48 フレーム、24 fps で約 2 秒分が使われています。ComfyUI をバックエンドに残したまま、制作者は人物、場面、長さ、品質に焦点を当てた、より簡単なインターフェースで作業できます。
Virse ブログの他の記事
ワークフロー

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
ワークフロー

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
ワークフロー

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao